AI 圈大事记

生数科技发布Motus2世界模型,支持机器人自进化

论文AI 评分 75/100量子位待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

生数科技发布Motus2世界模型,在单一模型中集成行动、预测与评估能力,形成闭环以实现自我进化。该模型采用Action-first信息流防止时序作弊,结合Best-of-N规划与基于模型的强化学习,使机器人能从失败数据中学习。真机测试显示,两项任务成功率从65%提升至75%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

实现自进化闭环

Motus2的核心突破在于将行动、预测与评估三种能力整合于同一模型中,构建了递归自我改进(RSI)的闭环。模型通过世界动作模型(WAM)生成动作,利用条件动作世界模型(AC-WM)预测后果,再由价值模型(VM)评估结果。评估产生的反馈信号直接用于更新策略,使机器人能从自身预测和评估中持续改进,不再单纯依赖人类示范的“完美轨迹”。

防止时序作弊

为避免模型利用未来视觉帧“反推”当前动作,Motus2在训练中引入Action-first信息流。模型必须先生成动作,再预测后果,最后评估结果。这种严格的时序约束确保了模型在真实场景中的泛化能力,解决了此前许多“视频生成+动作控制”方案因训练集作弊而失效的问题。

规划与训练结合

在推理阶段,Motus2使用Best-of-N规划,生成多个候选动作并模拟后果,择优执行。在训练阶段,候选动作的评分被转化为策略更新信号,仅更新动作相关参数,保持预测和评估模块稳定。这种机制让机器人既能优化单次动作选择,又能通过练习掌握更好的解题方法。

实测效果显著

真机实验验证了闭环机制的有效性。在手机放置和多指操作任务中,基础策略平均成功率为65%。单独加入规划后提升至67.5%,单独加入基于模型的强化学习达到72.5%。当两者结合时,成功率最终达到75%,比基础策略高出10个百分点。此外,模型还新增了触觉和记忆模态,以应对灵巧操作中视觉无法完全覆盖的接触状态判断。

为什么值得看

首次在视频-动作大模型中实现递归自我改进,提升机器人泛化能力。

强化学习

信源1

  1. [1]量子位探索RSI,生数新世界模型让机器人开始自我进化

关键事实

  • Motus2集成了行动、预测、评估三种能力,形成闭环实现自我进化。[1]

  • 采用Action-first信息流,防止模型在生成动作前“偷看”结果。[1]

  • 真机测试中,结合规划与强化学习,任务成功率从65%提升至75%。[1]

  • Motus2新增触觉与记忆模态,补全视觉缺失的信息。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。