AI 圈大事记

HIL-UMI 实现免实体机器人的人机协同后训练

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

HIL-UMI 框架通过手持通用操作接口(UMI)演示,实现了无需实体机器人参与的人机协同后训练。该机制利用能量评分对比人类动作与策略推断,在检测到分布外状态时触发数据收集,并通过在线优势预测识别关键片段以优化优势估计器。在四项真实任务实验中,该方法在长视距和精确操作场景下均优于监督微调,且在清理桌面任务中表现优于 HG-DAgger,具备更低的单帧采集时间。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

免实体机器人训练

大规模视觉-语言-动作(VLA)模型为机器人操作提供了强大的先验知识,但将其适配到特定部署环境仍具挑战性。传统的监督微调(SFT)依赖于特定任务的演示数据,面临静态数据对分布外状态覆盖有限,以及标准模仿目标无法区分有效行为与无用数据的局限。交互式后训练虽能解决这些问题,但通常需要在实体机器人上反复执行策略并进行人工干预。HIL-UMI 提出了一种策略引导的通用操作接口(UMI)框架,实现了无需实体机器人的人机协同 VLA 后训练。

数据收集与优化机制

在手持 UMI 演示过程中,HIL-UMI 在不执行预测的情况下,利用相同的观测流查询当前策略。系统通过能量评分对比人类动作轨迹与策略推断结果,当两者差异表明处于分布外区域时,触发数据收集。此外,该框架包含一个独立的反馈循环,利用低在线优势预测识别关键片段,用于优化基于进度的优势估计器。更新后的估计器随后指导基于优势的行为克隆,使用基础演示和新策略数据的平衡混合体进行训练。

实验结果与性能

这种设计保留了人机协同学习的迭代性和策略感知能力,同时将数据收集与机器人部署解耦。在跨越长视距和精确操作的四项真实世界任务实验中,HIL-UMI 表现出优于监督微调的一致性提升,并从针对性收集和优势优化中获益。特别是在清理桌面任务中,HIL-UMI 的表现优于 HG-DAgger,且具有更低的单帧采集时间。这表明该方法为跨操作员和地点的 VLA 后训练提供了一条可扩展的路径。

为什么值得看

解决了 VLA 模型部署时依赖实体机器人进行交互式训练的瓶颈,降低了数据收集成本。

微调

信源1

  1. [1]arXiv cs.AI一手信源HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

关键事实

  • HIL-UMI 利用手持 UMI 演示实现免实体机器人的人机协同后训练。[1]

  • 通过能量评分对比人类轨迹与策略推断,在分布外区域触发数据收集。[1]

  • 在四项真实任务中,该方法优于监督微调,且在清理桌面任务上优于 HG-DAgger。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。