AI 圈大事记

DeCAL 模型统一视觉触觉提升灵巧操作

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

DeCAL 是一个基于物理的灵巧视觉-语言-动作模型,旨在解决接触丰富操作中的视觉遮挡和复杂动力学挑战。该模型采用混合专家架构,引入自适应视觉-触觉融合与潜在共想象技术,以动态调节触觉交互并联合建模视觉触觉动力学。实验显示,DeCAL 在所有任务中均达到最先进性能,平均成功率为 71%,进度成功率为 83.4%,且对未见场景具有强泛化能力。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

解决灵巧操作挑战

灵巧操作涉及与物理世界丰富接触和细粒度的交互,这对现有的视觉-语言-动作模型提出了挑战,主要源于严重的视觉遮挡和复杂的接触动力学。尽管近期工作已将触觉感知引入机器人操作,但大多数方法仍依赖同质多模态融合,缺乏自适应触觉整合和物理动力学的显式建模。DeCAL 作为一个基于物理的灵巧视觉-语言-动作模型,旨在统一理解、想象和动作生成,以解决上述问题。

架构与技术创新

DeCAL 构建在混合专家架构之上,利用专门的专家处理每种能力,同时实现它们之间的高效信息流动。为了有效利用触觉信息,研究团队引入了自适应视觉-触觉融合,通过接触感知门控策略动态调节触觉交互。此外,提出的视觉-触觉潜在共想象技术能够联合建模视觉和触觉动力学,为策略赋予隐式的物理世界知识。

性能与泛化能力

实验结果表明,DeCAL 在所有任务中始终如一地实现了最先进的性能。具体而言,该模型达到了 71% 的平均成功率和 83.4% 的进度成功率。除了在基准测试中的表现,DeCAL 还展示了对未见场景的强大泛化能力,这表明其在实际复杂环境中的应用潜力。相关论文已提交至 arXiv,并提供了项目网站链接。

为什么值得看

通过显式建模物理动力学与触觉信息,显著提升了机器人处理精细操作任务的能力。

信源1

  1. [1]arXiv cs.AI一手信源DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

关键事实

  • DeCAL 模型在所有任务中达到最先进性能,平均成功率 71%,进度成功率 83.4%。[1]

  • 采用混合专家架构,引入自适应视觉-触觉融合与潜在共想象技术。[1]

  • 该模型统一了理解、想象和动作生成,以应对视觉遮挡和复杂接触动力学。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。