AI 圈大事记

生数科技发布Motus2世界模型

模型AI 评分 75/100量子位待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

生数科技发布具身智能世界模型Motus2,集成视觉、语言、动作与触觉模态。该模型通过行动、预测、评估三种能力形成闭环,实现递归自我改进(RSI)。在手机放置和多指操作任务中,结合规划与强化学习,成功率从65%提升至75%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

实现自进化闭环

Motus2将行动、预测、评估三种能力整合于同一模型中,构建了生成动作、预测后果、评估结果并更新策略的闭环。这种设计旨在解决传统策略模型缺乏因果认知的问题,使模型能利用自身反馈持续改进策略。团队采用Action-first信息流,确保模型在生成动作时无法“偷看”未来结果,从而避免时序作弊,保证在真实场景中的有效性。

规划与训练机制

在推理阶段,Motus2利用Best-of-N规划方法,生成多个候选动作并模拟后果,由价值模型打分后择优执行。在训练阶段,候选动作的评分转化为策略更新信号,仅更新动作相关参数,保持预测和评估部分稳定。这种机制让失败轨迹也能发挥作用,帮助模型识别无效动作,不再单纯依赖“完美轨迹”进行学习。

多模态与实测表现

Motus2在前代基础上新增触觉和记忆模态,补全视觉缺失的信息,以提升灵巧操作能力。真机测试数据显示,在手机放置和多指操作任务中,基础策略平均成功率为65%。单独加入规划后成功率升至67.5%,单独加入基于模型的强化学习达到72.5%,两者结合最终达到75%,比基础策略高出10个百分点。

为什么值得看

探索机器人自我进化路径,提升多模态具身智能任务表现。

强化学习

信源1

  1. [1]量子位探索RSI,生数新世界模型让机器人开始自我进化

关键事实

  • Motus2集成视觉、语言、动作与触觉模态,具备行动、预测、评估三种能力。[1]

  • 模型采用Action-first信息流,推理阶段使用Best-of-N规划,训练阶段应用基于模型的强化学习。[1]

  • 真机实测显示,两项任务基础策略成功率65%,结合规划与强化学习后提升至75%。[1]

相关 · 模型

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。