AI 圈大事记

Rolling-WAM提出滚动去噪机制,机器人重规划提速4.5倍

论文AI 评分 72/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对世界动作模型(WAMs)在机器人操作中因逐周期全量联合去噪导致高延迟的问题,Rolling-WAM将去噪计算分散至连续重规划周期。该方法维持滑动窗口,保留错位噪声级别的视频-动作块,每步完全去噪即将执行的动作块并部分精炼未来块,随新观测滑动窗口继续去噪。在LIBERO、RoboTwin及Unitree G1人形机器人实测中取得竞争力操作性能,稳态重规划速度较标准联合WAMs提升4.5倍。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

WAMs闭环延迟痛点

世界动作模型将动作生成与未来视觉预测相耦合,为机器人操作提供视觉-动作联合预测。然而,传统WAMs在每个重规划周期均需完成整个预测视界的联合视频-动作去噪过程。这种从零开始的全量去噪计算会产生显著延迟,导致动作更新滞后,严重限制了机器人闭环控制的响应速度与实时性。

滚动去噪与滑动窗口机制

Rolling-WAM的核心是将联合去噪过程跨周期分布执行。其维持一个包含视频-动作块的滑动窗口,这些块处于交错的噪声级别。在每个执行步骤中,滚动噪声调度会对即将执行的最近动作块进行完全去噪以供直接执行,同时对更远未来的块进行部分精炼。当窗口随新相机观测向前滑动时,保留的未来块继续其去噪过程,从而将计算开销随时间分散,并在块边界间传递演化的视觉-动作上下文。

评测表现与加速效果

研究在LIBERO、RoboTwin仿真基准以及真实世界的Unitree G1人形机器人上对Rolling-WAM进行了评估。结果显示,该方法在保持与现有方法相当的竞争性操作性能的同时,免除了从零开始对整个预测视界去噪的需求,实现了相比标准联合WAMs 4.5倍的稳态重规划加速,有效提升了闭环控制的实时响应能力。

为什么值得看

解决机器人视觉-动作联合预测的高延迟痛点,4.5倍提速显著增强闭环控制响应,对具身智能实时性极具价值。

信源1 家

  1. [1]arXiv cs.AI一手信源Rolling-WAM: World Action Models with Rolling Imagination

关键事实

  • Rolling-WAM通过滑动窗口与错位噪声级别,将联合去噪计算分散至连续重规划周期[1]

  • 稳态重规划速度较标准联合WAMs提升4.5倍[1]

  • 在LIBERO、RoboTwin及真实Unitree G1人形机器人上验证了操作性能[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。