DuoMind框架通过语义通信实现多机器人分布式协调

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对视觉语言动作模型多局限于单体机器人的现状,DuoMind提出分布式层级架构以解决多机协作难题。该框架让各机器人配备基于VLA的动作模型负责底层执行,同时利用基于VLM的协调器进行高层推理与机间语义通信。协调器综合任务指令、本地观测及他机消息,向下输出动作指令并向同伴发送语义信息。为解决评测缺失,作者构建了RoboPoly基准,包含需分布式闭环控制的长周期操作任务。在RoboPoly与RoboTwin上的实验表明该架构提升了多机任务表现,消融实验验证了层级协调与语义通信的作用。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

多机协作架构设计

当前视觉语言模型及视觉语言动作模型在通用机器人领域进展显著,但多集中于单机场景。将其拓展至多机系统面临长周期行为协调与精细执行保持的挑战。DuoMind框架引入分布式层级设计,每台机器人均搭载VLA动作模型与VLM协调器。动作模型专职底层精准执行,协调器负责高层语义推理及多智能体间协同。该设计融合了预训练模型的双重优势,即VLM的语义推理能力与VLA的精确动作生成能力。

语义通信与评测基准

在每步规划中,各机器人的协调器会综合处理任务指令、本地观测数据及接收自他机的消息,随后生成两类输出:下达给自身动作模型的底层指令,以及发送给同伴机器人的语义消息。这种语义通信机制使得机器人间能高效同步状态与意图。此外,针对多机协作评测基准匮乏的问题,研究团队开发了RoboPoly基准,其涵盖需在分布式控制下进行协调闭环执行的长周期操作任务,为该领域提供了标准化测试手段。

实验验证与结论

研究在RoboPoly与RoboTwin两个基准上开展了实验,结果证明DuoMind有效提升了多机器人任务的整体表现。进一步的消融研究分别验证了层级协调机制与语义通信模块对最终性能的具体贡献,确认了这两项核心设计在解决多机长周期协作问题上的必要性。

为什么值得看

突破VLA单机应用局限,提供多机长周期协作的语义通信与层级推理方案,并开源相关评测基准。

信源1 家

  1. [1]arXiv cs.AI一手信源DuoMind: Enabling Distributed Multi-Robot Coordination with Semantic Communication

关键事实

  • DuoMind采用分布式层级架构,结合VLM协调器与VLA动作模型实现多机协作[1]

  • 协调器基于任务、观测和同伴消息生成底层指令及语义通信内容[1]

  • 作者开发了RoboPoly基准,用于评测分布式闭环控制下的长周期多机操作[1]

  • 实验在RoboPoly和RoboTwin上进行,消融研究证实了层级协调与语义通信的有效性[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。