DeCAL 模型统一视觉触觉提升灵巧操作
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
DeCAL 是一个基于物理的灵巧视觉-语言-动作模型,旨在解决接触丰富操作中的视觉遮挡和复杂动力学挑战。该模型采用混合专家架构,引入自适应视觉-触觉融合与潜在共想象技术,以动态调节触觉交互并联合建模视觉触觉动力学。实验显示,DeCAL 在所有任务中均达到最先进性能,平均成功率为 71%,进度成功率为 83.4%,且对未见场景具有强泛化能力。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载解决灵巧操作挑战
灵巧操作涉及与物理世界丰富接触和细粒度的交互,这对现有的视觉-语言-动作模型提出了挑战,主要源于严重的视觉遮挡和复杂的接触动力学。尽管近期工作已将触觉感知引入机器人操作,但大多数方法仍依赖同质多模态融合,缺乏自适应触觉整合和物理动力学的显式建模。DeCAL 作为一个基于物理的灵巧视觉-语言-动作模型,旨在统一理解、想象和动作生成,以解决上述问题。
架构与技术创新
DeCAL 构建在混合专家架构之上,利用专门的专家处理每种能力,同时实现它们之间的高效信息流动。为了有效利用触觉信息,研究团队引入了自适应视觉-触觉融合,通过接触感知门控策略动态调节触觉交互。此外,提出的视觉-触觉潜在共想象技术能够联合建模视觉和触觉动力学,为策略赋予隐式的物理世界知识。
性能与泛化能力
实验结果表明,DeCAL 在所有任务中始终如一地实现了最先进的性能。具体而言,该模型达到了 71% 的平均成功率和 83.4% 的进度成功率。除了在基准测试中的表现,DeCAL 还展示了对未见场景的强大泛化能力,这表明其在实际复杂环境中的应用潜力。相关论文已提交至 arXiv,并提供了项目网站链接。
为什么值得看
通过显式建模物理动力学与触觉信息,显著提升了机器人处理精细操作任务的能力。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
