AD-WM模型提升反事实MPC动作区分度与零样本迁移能力
论文AI 评分 68/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
传统隐空间世界模型常因仅拟合事实转移而难以区分候选动作,影响模型预测控制(MPC)效果。AD-WM引入残差隐动态与预测器级动作恢复正则化,利用逆动力学及基于条件互信息的归一化目标,促使规划转移保留动作信息,测试时移除辅助头以保持MPC不变。在OGBench-Cube中,其困难起始成功率从3.7%升至52.0%;在五项仿真环境中的四项超越基线。结合冻结的V-JEPA 2编码器与DROID后训练,AD-WM将Franka零样本抓放成功率从42.2%提至71.1%。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载动作区分度缺陷与AD-WM设计
隐空间世界模型通常针对事实转移进行训练,而模型预测控制(MPC)需在同一状态下比较不同备选动作。这导致模型即便事实预测误差低,也可能无法有效区分候选动作。为此,AD-WM提出一种动作区分性联合嵌入世界模型。该模型结合残差隐动态与预测器级动作恢复正则化,采用逆动力学及受条件互信息启发的归一化恢复目标。这两个目标促使规划转移保留动作信息,且其辅助头在测试时被丢弃,不改变原有MPC流程。
仿真环境与真实机器人实验表现
在OGBench-Cube环境中,相较于匹配的LeWM基线,AD-WM将困难起始成功率从3.7%大幅提升至52.0%,并在五项仿真环境的四项中取得平均成功率提升。规划诊断表明,事实预测误差与全库动作排序不符闭环成功顺序,而CEM对齐的精英遗憾值与成功关联更紧密。在真实机器人实验中,采用冻结的V-JEPA 2编码器并配合DROID后训练,AD-WM在Franka设置中实现零样本迁移,基础抓放成功率从42.2%增至71.1%,无需实验室特定适配。
为什么值得看
解决世界模型规划中动作区分度不足的痛点,显著提升控制成功率与真实机器人零样本迁移表现。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
