TANGO 框架实现人形机器人全身视觉语言导航
论文AI 评分 75/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
研究人员提出 TANGO 框架,首个用于杂乱环境语言条件导航的全身视觉语言模型。该模型接收自然语言指令和第一视角 RGB 观测,直接预测 29 自由度关节空间动作。系统在仿真中通过全局路径规划、运动生成及强化学习训练,无需真实世界数据即可零样本部署至 Unitree G1 机器人,实现复杂场景下的稳健穿越。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载全身导航新范式
传统方法通常将导航建模为 2D 路径规划问题,但人形机器人在杂乱环境中穿行需要连续的几何感知全身适应。这包括协调的手臂放置、躯干调整以及步态调制,以便在复杂的 3D 空间中实现无碰撞移动。TANGO 框架正是为了解决这一需求而设计,它将自然语言指令和第一视角 RGB 观测作为输入,直接输出 29 自由度的关节空间动作,从而控制机器人的全身运动。
仿真训练管线
为了获得动态可行的动作监督,研究团队设计了一套完整的仿真训练流程。该流程利用全局路径规划、运动学全身运动生成、障碍物感知的运动编辑以及基于强化学习的跟踪技术,合成了多样化的无碰撞穿越行为。通过这种方式,TANGO 能够在仿真环境中学习到语言条件下的全身策略,而无需依赖昂贵且难以获取的真实世界导航数据。
零样本真机验证
在广泛的仿真实验中,TANGO 展示了最先进的视觉语言导航性能,并在需要障碍物协商的挑战性场景中超越了强大的模块化基线。更重要的是,研究团队将 TANGO 零样本部署到了 Unitree G1 人形机器人上。在没有任何真实世界导航数据训练的情况下,该机器人在杂乱的真实场景中表现出了稳健的语言引导穿越能力,验证了该方法的有效性和泛化性。
为什么值得看
首个全身 VLA 导航框架,零样本迁移至真机,解决复杂 3D 空间避障难题。
强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
