生数科技发布Motus2世界模型,支持机器人自进化
论文AI 评分 75/100量子位待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
生数科技发布Motus2世界模型,在单一模型中集成行动、预测与评估能力,形成闭环以实现自我进化。该模型采用Action-first信息流防止时序作弊,结合Best-of-N规划与基于模型的强化学习,使机器人能从失败数据中学习。真机测试显示,两项任务成功率从65%提升至75%。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载实现自进化闭环
Motus2的核心突破在于将行动、预测与评估三种能力整合于同一模型中,构建了递归自我改进(RSI)的闭环。模型通过世界动作模型(WAM)生成动作,利用条件动作世界模型(AC-WM)预测后果,再由价值模型(VM)评估结果。评估产生的反馈信号直接用于更新策略,使机器人能从自身预测和评估中持续改进,不再单纯依赖人类示范的“完美轨迹”。
防止时序作弊
为避免模型利用未来视觉帧“反推”当前动作,Motus2在训练中引入Action-first信息流。模型必须先生成动作,再预测后果,最后评估结果。这种严格的时序约束确保了模型在真实场景中的泛化能力,解决了此前许多“视频生成+动作控制”方案因训练集作弊而失效的问题。
规划与训练结合
在推理阶段,Motus2使用Best-of-N规划,生成多个候选动作并模拟后果,择优执行。在训练阶段,候选动作的评分被转化为策略更新信号,仅更新动作相关参数,保持预测和评估模块稳定。这种机制让机器人既能优化单次动作选择,又能通过练习掌握更好的解题方法。
实测效果显著
真机实验验证了闭环机制的有效性。在手机放置和多指操作任务中,基础策略平均成功率为65%。单独加入规划后提升至67.5%,单独加入基于模型的强化学习达到72.5%。当两者结合时,成功率最终达到75%,比基础策略高出10个百分点。此外,模型还新增了触觉和记忆模态,以应对灵巧操作中视觉无法完全覆盖的接触状态判断。
为什么值得看
首次在视频-动作大模型中实现递归自我改进,提升机器人泛化能力。
强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
