SynthDemo-RL框架突破VLA微调零奖励障碍,无需人类演示成功率近98%
论文AI 评分 82/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对视觉-语言-动作(VLA)模型微调依赖人类遥操作演示、稀疏二值奖励下强化学习探索困难的问题,提出SynthDemo-RL师生框架。自动教师将仿真器特权状态转为成功轨迹,经SFT蒸馏VLA学生模型,再用PPO与二值任务成功奖励精调。在无人类演示的LIBERO-PRO基准上,原策略有27项任务成功率为0%,同等算力直接PPO仅挽救10项,而该框架用每任务50条合成轨迹挽救全部27项,位置与任务轴平均成功率分别达97.8%和97.1%。在标准LIBERO上,该流程达96.0%,与使用同等数量人类演示训练的基线差距在1.7个百分点内。MuJoCo双胞胎训练的策略已在物理机器人开环执行验证。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载核心机制与求解痛点
视觉-语言-动作模型微调通常依赖人类遥操作演示,且在二值稀疏奖励下进行强化学习时,因难以采样到成功轨迹而面临探索挑战。SynthDemo-RL构建了师生框架解决此问题:自动教师将仿真器中的特权状态转化为成功的操作轨迹,VLA学生模型通过监督微调从这些轨迹中蒸馏出来,随后采用PPO算法结合二值任务成功奖励对学生模型进行精调。该流程完全无需新的人类演示介入。
LIBERO基准对比数据
在公开基准LIBERO-PRO上,基于原始任务微调的pi_0.5策略在57项任务中有27项成功率为0%。在同等PPO配方与强化学习算力下,直接PPO仅能挽救其中10项,17项仍为0%。SynthDemo-RL为每任务提供50条合成轨迹,将27项零成功率任务全部挽救,位置轴与任务轴平均成功率分别达97.8%和97.1%。在标准LIBERO上,无人类演示的该流程达96.0%成功率,与使用每任务50条人类演示训练的pi_0.5仅差1.7个百分点。
泛化验证与Sim2Real
研究进一步在RoboTwin 2.0上验证了该流程的有效性。为考察仿真到现实的迁移能力,作者在MuJoCo双胞胎环境中训练策略,并验证了该策略能够在物理机器人上开环执行。这表明合成轨迹驱动的VLA微调不仅限于仿真环境,具备在真实硬件部署的潜力。
为什么值得看
免人类演示即可在困难任务实现近98%成功率,大幅降低VLA模型对遥操作数据依赖与RL冷启动门槛。
微调强化学习蒸馏算力
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
