MEND方法实现世界模型潜在幻觉的无标签检测与修正
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对世界模型在潜在空间中因自回归反馈而产生的隐蔽且不断累积的幻觉现象,研究提出了MEND方法。该方法基于真实转移训练单一条件分数网络,无需真实误差标签即可在推理时发挥作用。其分数场的幅度用于检测幻觉,逐token场定位至特定图像块,并指明修正方向。在两项导航环境测试中,不依赖动作信息即实现最高0.80的AUROC检测值,超越单高斯密度基线;逐token定位AUPRC达0.87。修正过程能降低单步潜在误差并改善预测,但因部分误差与数据流形相切,当前重点在检测与定位。论文被DICTA 2026接收。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载世界模型的潜在幻觉问题
世界模型正成为计算机视觉的下一个重要前沿,但其鲁棒性尚未被充分探索。研究识别出潜在世界模型中存在幻觉现象:在给定状态与动作时,预测出的下一个潜在状态解码后会产生从未发生过的场景。由于这种预测在统计上看似正常,且会被模型以自回归方式反馈,导致误差既隐蔽又会不断累积,严重影响模型可靠性。
MEND方法的设计与多重功能
为应对上述问题,研究引入了掩码经验贝叶斯神经去噪(MEND)方法。该方案在缺乏真实误差标签的情况下,针对冻结的自监督世界模型,于推理阶段进行幻觉的检测、定位与修正。MEND通过在真实状态转移上进行去噪分数匹配来训练单一条件分数网络。该网络的分数场同时承担三项职责:其幅度用于检测幻觉是否存在,逐token场将幻觉定位到具体的图像块,同时该分数场还定义了推理时的修正方向。
实验表现与修正局限性
在两项导航环境的测试中,MEND在不使用动作信息的条件下,幻觉检测的AUROC最高达到0.80,优于单高斯密度基线;同时实现了高达0.87的逐token定位AUPRC,并能基于同一分数场进行修正。修正操作能可靠地降低单步潜在误差并改善预测结果。然而,研究也发现部分误差与数据流形相切,这限制了修正效果,因此当前工作更侧重于检测与定位,但也展示了修正方向的潜力。该论文已被DICTA 2026会议接收。
为什么值得看
解决世界模型自回归推理中隐蔽且累积的潜在幻觉问题,提供无需标签的推理时检测、定位与修正方案。
幻觉论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
