Long-WAM框架实现机器人长上下文实时控制
论文AI 评分 82/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
Long-WAM框架通过自回归视频预训练扩展世界-动作模型上下文,解决实时控制延迟问题。在RoboCasa GR-1上,上下文从0秒增至19.2秒,成功率由63.3%升至78.7%,双向预训练则无此收益。结合流式编码与异步执行,在RTX 5090上单步动作耗时107.4毫秒。在动态叠杯任务中达95%成功率,Pi0.5与Fast-WAM均20次全败。该框架在LIBERO-Long等基准亦居首,并可作为记忆执行器补充高层规划。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载自回归预训练保留历史结构
实时机器人控制需充足视觉历史推断运动与任务进度,但处理历史易致动作延迟。Long-WAM核心发现为获取历史不等于有效利用历史:当视频基础模型采用自回归方式预训练时,更长历史收益远大于双向预训练。该框架先在无动作标签的机器人与第一人称视频上学习因果预测,随后在世界-动作适配阶段保留此历史到未来的结构。实验显示,双向预训练初始化在扩展上下文时无净收益,而机器人领域自回归预训练进一步提升了GR-1与LIBERO-Long的峰值成功率。
流式编码与异步加速部署
为实现实时控制,Long-WAM采用流式观测编码、异步执行及硬件特定加速,使其能在RTX 5090、DGX Spark与Jetson AGX Thor上部署且不丢弃未来预测。在RTX 5090上,包含未来视频潜变量预测的每个动作块耗时107.4毫秒。该系统在Unitree G1与YAM上实现实时部署,支持动态与长程操作。在动态叠杯任务中,Long-WAM达95%成功率,而Pi0.5与Fast-WAM在20次试验中均未成功。此外,作为受记忆启发的执行器,它还能在复合任务中补充高层规划。
为什么值得看
突破机器人长时视觉历史依赖与实时性矛盾,动态长程任务成功率大幅超越已有方案。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
