AI 圈大事记

研究利用生成音视频实现零样本力感知操控

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

arXiv 论文提出一种结合生成视频与音频的机器人操控新方法。该方案利用生成接触声音的响度来塑造有界的时变期望力分布,从自然语言指令中推导出运动轨迹及对应力分布。研究在 Franka Panda 机器人上通过闭环力调节器执行轨迹,在需要接触的任务中,仅运动学基线失败而该方法成功。此外,该管道还能作为数据生成引擎,训练闭环策略。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

技术原理与架构

现有的视频生成技术虽然能让机器人学习操控轨迹,但这些轨迹仅包含运动学信息,缺乏必要的力数据,导致在接触丰富的任务中失败。该研究提出了一种管道,联合利用生成的视频和音频,从结构化的自然语言任务提示中推导出运动轨迹和相应的期望力分布。核心创新在于利用生成接触声音的响度来塑造一个有界的、随时间变化的期望力分布,从而为机器人操作提供力觉指导。

实验验证与表现

研究团队在 Franka Panda 机器人上对该管道进行了验证。机器人使用闭环力调节器来跟踪由音频塑造的力分布,并在接触过程中执行这些力感知轨迹。在多个需要建立接触的任务评估中,该方法展示了成功的操控能力。相比之下,仅依赖运动学信息的基线方法在这些任务中无法完成操作,证明了引入音频生成的力信息对于解决接触丰富任务的有效性。

数据生成与应用

除了直接用于机器人操控,该研究还展示了该管道作为数据生成引擎的潜力。通过生成的轨迹和力分布数据,可以训练出以闭环方式完成任务的各种策略。这意味着该方法不仅能解决零样本学习场景下的力感知问题,还能为强化学习等需要大量数据的训练方法提供高质量、带有力觉标注的合成数据,扩展了其在机器人学习中的应用范围。

为什么值得看

解决生成视频缺乏力信息的问题,提升接触丰富任务的成功率。

论文

信源1

  1. [1]arXiv cs.AI一手信源Dreaming the Sound of Contact: Leveraging Video and Audio Generation for Zero-Shot Force-Aware Manipulation and Data Generation

关键事实

  • 利用生成接触声音的响度塑造有界的时变期望力分布。[1]

  • 在 Franka Panda 机器人上使用闭环力调节器执行轨迹。[1]

  • 在接触丰富任务中,仅运动学基线失败而该方法成功。[1]

  • 该管道可作为数据生成引擎,训练闭环策略。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。