NeurIPS 2026论文提出回顾式世界建模新范式优化VLM智能体

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

当前视觉语言模型智能体依赖前瞻式预测来推演动作后果,但该正向范式难以校验动作与状态转移的因果一致性,易产生看似合理却违背物理的行径。新范式回顾式世界建模通过估算给定状态转移下最可能引发该转移的动作分布,实现智能体逆向推理。基于此构建自洽性奖励,衡量策略动作与逆向解释间的概率一致性,将其作为强化学习的内在密集反馈信号。多任务实验表明,相比仅含前瞻机制的基线,该方法显著提升了策略鲁棒性与泛化能力。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

前瞻预测范式局限

为视觉语言模型智能体配备世界建模能力,可应对复杂推理与长程规划,并降低策略学习对高成本真实交互的依赖。现有方法多采用前瞻式仿真来预测候选动作的后果。然而,这种仅向前的范式只关注接下来会发生什么,对校验动作是否与观察到的状态转移保持因果一致提供的约束极为有限,这往往致使智能体表现出看似合理但物理上不连贯的行为。

回顾式建模与自洽奖励

该研究挑战了将世界建模仅视作前瞻预测的观点,引入回顾式世界建模这一新学习范式。该范式使智能体通过估算回顾归因分布来逆向推理,即推断最可能导致特定状态转移的动作。基于此能力,研究构建了自洽性奖励,这是一种内在信号,用于度量策略动作与回顾性解释之间的概率一致性。将此奖励整合进强化学习中,提供了密集的转移级别反馈,引导智能体产生既有效完成任务又符合物理规律的行为。

实验验证与录用情况

在多种智能体任务上开展的广泛实验显示,相较于仅采用前瞻式世界建模的基线方法,该回顾式方法大幅提升了策略的鲁棒性与泛化能力。该论文已被NeurIPS 2026接收,论文共27页包含8幅图表,由Yongjiang Liu等六位作者合作完成。

为什么值得看

突破VLM智能体仅靠正向预测的局限,通过逆向因果推理提供密集反馈,解决物理不一致问题,提升复杂规划鲁棒性。

智能体强化学习论文

信源1 家

  1. [1]arXiv cs.AI一手信源Beyond Prediction: Steering VLM Agents with Retrospective World Modeling

关键事实

  • 提出回顾式世界建模范式,通过估算动作分布实现智能体逆向推理[1]

  • 构建自洽性奖励(SCR)衡量策略动作与逆向解释的概率一致性[1]

  • 将SCR作为内在信号融入强化学习提供密集转移级反馈[1]

  • 该论文被NeurIPS 2026接收[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。