Long-WAM框架实现机器人长上下文实时控制

论文AI 评分 82/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

Long-WAM框架通过自回归视频预训练扩展世界-动作模型上下文,解决实时控制延迟问题。在RoboCasa GR-1上,上下文从0秒增至19.2秒,成功率由63.3%升至78.7%,双向预训练则无此收益。结合流式编码与异步执行,在RTX 5090上单步动作耗时107.4毫秒。在动态叠杯任务中达95%成功率,Pi0.5与Fast-WAM均20次全败。该框架在LIBERO-Long等基准亦居首,并可作为记忆执行器补充高层规划。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

自回归预训练保留历史结构

实时机器人控制需充足视觉历史推断运动与任务进度,但处理历史易致动作延迟。Long-WAM核心发现为获取历史不等于有效利用历史:当视频基础模型采用自回归方式预训练时,更长历史收益远大于双向预训练。该框架先在无动作标签的机器人与第一人称视频上学习因果预测,随后在世界-动作适配阶段保留此历史到未来的结构。实验显示,双向预训练初始化在扩展上下文时无净收益,而机器人领域自回归预训练进一步提升了GR-1与LIBERO-Long的峰值成功率。

流式编码与异步加速部署

为实现实时控制,Long-WAM采用流式观测编码、异步执行及硬件特定加速,使其能在RTX 5090、DGX Spark与Jetson AGX Thor上部署且不丢弃未来预测。在RTX 5090上,包含未来视频潜变量预测的每个动作块耗时107.4毫秒。该系统在Unitree G1与YAM上实现实时部署,支持动态与长程操作。在动态叠杯任务中,Long-WAM达95%成功率,而Pi0.5与Fast-WAM在20次试验中均未成功。此外,作为受记忆启发的执行器,它还能在复合任务中补充高层规划。

为什么值得看

突破机器人长时视觉历史依赖与实时性矛盾,动态长程任务成功率大幅超越已有方案。

信源1 家

  1. [1]arXiv cs.AI一手信源Long-WAM: Scaling the Context of World-Action Models

关键事实

  • 自回归预训练使长上下文收益显著,上下文从0秒增至19.2秒,GR-1成功率从63.3%升至78.7%[1]

  • RTX 5090上单步动作含未来视频潜变量预测耗时107.4毫秒,不丢弃预测[1]

  • 动态叠杯任务达95%成功率,Pi0.5与Fast-WAM在20次试验中均未成功[1]

  • 在LIBERO-Long、RoboTwin 2.0和DOMINO基准中取得对比最优结果[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。