AI 圈大事记

Show-Harness框架让VLM直接控制机器人

论文AI 评分 75/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

Show-Harness框架通过紧凑语义接口连接意图与动作,使视觉语言模型能直接控制机器人。该方案将离散语义动作单元与具体机器人操作解耦,既支持闭源模型零样本控制,也允许开源模型经少量微调后低成本部署。配套的GUMI接口无需专用硬件即可收集演示数据。实验显示,该方法在任务、形态和环境间泛化能力良好,超越了典型智能体与视觉-语言-动作模型范式。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

语义接口设计

Show-Harness核心在于构建了一个紧凑的语义接口,将高层意图转化为底层动作。该接口向视觉语言模型暴露离散的语义动作单元,模型只需对这些抽象单元进行推理。具体的物理执行则由特定于具身的解释器确定性地将语义单元映射为局部机器人动作。这种设计让VLM直接负责细粒度的物理决策,而不需要增加额外的模型容量或进行昂贵的具身特定预训练。

部署与数据收集

该框架展示了两种主要应用路径:一是直接解锁闭源前沿VLM的零样本机器人控制能力;二是通过仅需数个GPU小时的微调,使小规模开源VLM适应低成本部署场景。为了解决数据收集难题,团队开发了GUMI(GUI操作接口)。该接口将相同的语义动作空间扩展到基于GUI的演示收集,人类和智能体可以在没有专业遥操作硬件的情况下“玩”机器人,从而跨越不同具身形态收集数据。

实验性能表现

通过广泛的实验验证,配备Show-Harness的VLM智能体在任务、具身形态和环境之间表现出了稳健的泛化能力。测试结果显示,其性能优于代表性的智能体范式以及视觉-语言-动作(VLA)模型范式。这表明,只要设计出合适的接口,就能从基础VLM中释放出大量的具身能力,而不必依赖更大规模的模型或针对特定硬件的预训练流程。

为什么值得看

无需额外预训练或专用硬件,显著降低了大模型控制机器人的门槛。

智能体微调开源模型GPU

信源1

  1. [1]arXiv cs.AI一手信源Show-Harness: Just a VLM Agent Can Play Robots

关键事实

  • Show-Harness通过语义接口让VLM直接负责物理决策,无需额外模型容量或特定预训练。[1]

  • 该框架支持闭源模型零样本控制,以及开源模型仅用数GPU小时微调后的低成本部署。[1]

  • GUMI接口将语义动作空间扩展至GUI演示,无需专业遥操作硬件。[1]

  • 实验表明该方法在任务、形态和环境上泛化稳健,性能优于代表性智能体和VLA范式。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。