AI 圈大事记

AD-WM模型提升反事实MPC动作区分度与零样本迁移能力

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

传统隐空间世界模型常因仅拟合事实转移而难以区分候选动作,影响模型预测控制(MPC)效果。AD-WM引入残差隐动态与预测器级动作恢复正则化,利用逆动力学及基于条件互信息的归一化目标,促使规划转移保留动作信息,测试时移除辅助头以保持MPC不变。在OGBench-Cube中,其困难起始成功率从3.7%升至52.0%;在五项仿真环境中的四项超越基线。结合冻结的V-JEPA 2编码器与DROID后训练,AD-WM将Franka零样本抓放成功率从42.2%提至71.1%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

动作区分度缺陷与AD-WM设计

隐空间世界模型通常针对事实转移进行训练,而模型预测控制(MPC)需在同一状态下比较不同备选动作。这导致模型即便事实预测误差低,也可能无法有效区分候选动作。为此,AD-WM提出一种动作区分性联合嵌入世界模型。该模型结合残差隐动态与预测器级动作恢复正则化,采用逆动力学及受条件互信息启发的归一化恢复目标。这两个目标促使规划转移保留动作信息,且其辅助头在测试时被丢弃,不改变原有MPC流程。

仿真环境与真实机器人实验表现

在OGBench-Cube环境中,相较于匹配的LeWM基线,AD-WM将困难起始成功率从3.7%大幅提升至52.0%,并在五项仿真环境的四项中取得平均成功率提升。规划诊断表明,事实预测误差与全库动作排序不符闭环成功顺序,而CEM对齐的精英遗憾值与成功关联更紧密。在真实机器人实验中,采用冻结的V-JEPA 2编码器并配合DROID后训练,AD-WM在Franka设置中实现零样本迁移,基础抓放成功率从42.2%增至71.1%,无需实验室特定适配。

为什么值得看

解决世界模型规划中动作区分度不足的痛点,显著提升控制成功率与真实机器人零样本迁移表现。

信源1 家

  1. [1]arXiv cs.AI一手信源AD-WM: Action-Discriminative World Models for Counterfactual Model Predictive Control

关键事实

  • AD-WM引入残差隐动态与预测器级动作恢复正则化,解决传统世界模型难以区分候选动作的问题。[1]

  • 在OGBench-Cube测试中,AD-WM将困难起始成功率从3.7%提升至52.0%。[1]

  • 结合V-JEPA 2编码器与DROID后训练,AD-WM在Franka设置中将零样本抓放成功率从42.2%提至71.1%。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。