HIL-UMI 实现免实体机器人的人机协同后训练
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载免实体机器人训练
大规模视觉-语言-动作(VLA)模型为机器人操作提供了强大的先验知识,但将其适配到特定部署环境仍具挑战性。传统的监督微调(SFT)依赖于特定任务的演示数据,面临静态数据对分布外状态覆盖有限,以及标准模仿目标无法区分有效行为与无用数据的局限。交互式后训练虽能解决这些问题,但通常需要在实体机器人上反复执行策略并进行人工干预。HIL-UMI 提出了一种策略引导的通用操作接口(UMI)框架,实现了无需实体机器人的人机协同 VLA 后训练。
数据收集与优化机制
在手持 UMI 演示过程中,HIL-UMI 在不执行预测的情况下,利用相同的观测流查询当前策略。系统通过能量评分对比人类动作轨迹与策略推断结果,当两者差异表明处于分布外区域时,触发数据收集。此外,该框架包含一个独立的反馈循环,利用低在线优势预测识别关键片段,用于优化基于进度的优势估计器。更新后的估计器随后指导基于优势的行为克隆,使用基础演示和新策略数据的平衡混合体进行训练。
实验结果与性能
这种设计保留了人机协同学习的迭代性和策略感知能力,同时将数据收集与机器人部署解耦。在跨越长视距和精确操作的四项真实世界任务实验中,HIL-UMI 表现出优于监督微调的一致性提升,并从针对性收集和优势优化中获益。特别是在清理桌面任务中,HIL-UMI 的表现优于 HG-DAgger,且具有更低的单帧采集时间。这表明该方法为跨操作员和地点的 VLA 后训练提供了一条可扩展的路径。
为什么值得看
解决了 VLA 模型部署时依赖实体机器人进行交互式训练的瓶颈,降低了数据收集成本。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
