EmbodiedRSI实现具身智能体自主进化,真实零样本成功率超七成

论文AI 评分 78/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对机器人基础模型在物体位置或指令变动时性能下降且微调数据收集昂贵的问题,EmbodiedRSI框架被提出。它采用快慢双系统架构,在假设图中维护竞争性代码与技能假设,利用信息价值选择物理实验区分假设,并依结果引导代码与技能协同进化。慢系统构建分层记忆,基于奖励的记忆学习筛选高价值记忆供快系统改进。在RoboCasa365上,其总体与复合未见任务成功率分别达77.0%与71.3%,远超最优基线的40.1%;在LIBERO-Pro上总体成功率达86.8%。此外,该框架零样本迁移至真实机器人,跨多挑战任务总体成功率达71.3%。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

问题背景与核心机制

机器人基础模型虽能提供较强的视觉运动控制能力,但在物体位置或任务指令发生变动时,性能常出现退化。若要进一步提升,往往需在大量机器人数据上进行后训练,而通过遥操作等方式收集此类数据成本高昂。现有自我进化智能体框架在决定追求何种代码与技能变更时,对机器人试错利用效率低下。EmbodiedRSI作为自我进化智能体框架,能自主决定下一步探索方向,并将物理交互结果转化为改进的代码与技能。其核心为快慢双系统架构,在假设图中维护相互竞争的代码与技能假设,利用信息价值实验选择机制挑出能区分这些假设的物理实验,实验结果进而引导代码与技能协同进化。

分层记忆与评测表现

在慢系统中,EmbodiedRSI构建了分层记忆,并通过基于奖励的记忆学习机制,依据对后续快系统改进的价值来筛选有效记忆。在RoboCasa365基准测试中,EmbodiedRSI取得了77.0%的总体成功率以及71.3%的复合未见任务成功率,而同场最优基线总体成功率仅为40.1%。在另一基准LIBERO-Pro上,该框架同样取得了86.8%的总体成功率。这些数据表明其在仿真环境下的任务执行与泛化能力较现有方法有显著提升。

真实世界零样本迁移

除基准测试性能外,EmbodiedRSI还能零样本迁移至真实世界机器人。在跨越多个具有挑战性的真实任务测试中,其总体成功率达到71.3%。这一结果表明,该框架通过自主物理探索与假设驱动的协同进化所积累的代码和技能,具备从仿真到现实的强泛化能力,无需在真实环境中进行额外数据收集或微调即可有效执行复杂操作。

为什么值得看

实现具身智能体自主探索物理交互并转化为代码技能进化,真实零样本成功率超七成,大幅降低数据收集成本。

智能体微调

信源1 家

  1. [1]arXiv cs.AI一手信源EmbodiedRSI: Active Continual Robot Learning Through Hypothesis-Guided Co-Evolution

关键事实

  • EmbodiedRSI采用快慢双系统架构与假设图,通过信息价值选择实验并引导代码与技能协同进化。[1]

  • 在RoboCasa365基准上,EmbodiedRSI总体成功率达77.0%,复合未见任务达71.3%,最优基线为40.1%。[1]

  • 在LIBERO-Pro基准上,EmbodiedRSI总体成功率达86.8%。[1]

  • EmbodiedRSI零样本迁移至真实机器人,跨多挑战任务总体成功率达71.3%。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。