具身智能RPG框架无需更新权重即可自主提升机器人技能

论文AI 评分 78/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

Yen-Jen Wang等人提出RPG(Reconstruct, Practice, Go Real)框架,让机器人在不更新模型权重下实现执行系统自主改进。该框架从离线数据集提取操作能力并在仿真中构建练习任务,利用执行反馈与仿真状态诊断失败,进而开发新符号技能、优化旧技能及系统提示。在22项操作任务保留初始化测试中,经15轮练习,成功率从28.6%升至95.0%,超越ASPIRE(75.5%)与GPT-6 Astra Pro驱动的CaP-Agent0(60.0%)。经校准与硬件适配,该冻结系统在3项任务共30次物理试验中全部成功。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

RPG框架运行机制

RPG框架旨在减少构建可靠机器人能力所需的人工干预,其核心在于不更新模型权重的前提下实现系统自主改进。框架首先从离线数据集中识别操作能力,并在仿真环境中构建对应的练习任务。在练习阶段,系统综合利用执行反馈、仿真器特权状态以及数据集视频来诊断失败原因。基于诊断结果,RPG能够开发可复用的新符号技能、优化已有技能,并修正系统提示。此外,通过跨任务评估,系统会对单项修改与合并修订进行测试,仅保留验证有效的部分供后续复用。在实际测试时,多模态大语言模型借助最终生成的系统提示与技能库来协调感知与机器人控制。

仿真与真机实验表现

在仿真评估中,RPG框架在22项操作任务的保留初始化测试上展现出显著的性能提升。经过首轮练习后,任务成功率为28.6%,而经过15轮练习后,成功率大幅攀升至95.0%。这一结果明显优于所有评估基线,包括ASPIRE的75.5%以及由GPT-6 Astra Pro驱动的CaP-Agent0的60.0%。在真实物理世界验证中,经过通用的校准与硬件适配流程后,该权重冻结的系统在3项不同任务上各进行10次试验,共计30次物理试验均取得成功,证明了该框架从仿真到现实的迁移能力与有效性。

为什么值得看

无需更新模型权重即可将机器人任务成功率大幅提升至95%,并在真实物理环境全量通过,为具身智能低成本技能迭代提供新路径。

GPT数据集

信源1 家

  1. [1]arXiv cs.AI一手信源Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents

关键事实

  • RPG框架无需更新模型权重即可实现机器人执行系统自主改进[1]

  • 22项任务测试中,15轮练习后成功率从28.6%升至95.0%[1]

  • 性能超越ASPIRE(75.5%)及GPT-6 Astra Pro驱动的CaP-Agent0(60.0%)[1]

  • 经校准与硬件适配后,冻结系统在3项任务共30次物理试验全部成功[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。