DexTacWAM融合触觉预测灵巧操作,得分超基线近一倍
论文AI 评分 78/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
DexTacWAM将触觉特征注入视频扩散世界模型,实现联合视触觉世界建模。在22自由度双臂平台的六项接触丰富任务中,该模型各项均获最高分,均值70.6,最强基线仅38.0。消融实验表明,移除触觉世界建模会使四任务均值从74.7降至26.6。利用冻结的预训练视觉VAE进行4小时触觉编码器适配,无需触觉中期训练,仅用约100次演示即可@即可?2.26倍训练加速与1.29倍推理加速,视觉&触觉压缩器保留89.4%接触召回,视觉预测质量偏差在0.5 dB内。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载视触觉联合世界建模
现有世界-动作模型多依赖视觉,无法直接建模灵巧操作中的接触动力学。DexTacWAM提出视触觉世界-动作模型,对每个指尖触觉独立编码,通过感知手指与姿态的压缩器聚合特征,并将触觉隐变量注入视频扩散世界模型,实现视触觉联合预测。该模型将接触演变作为预测世界状态的一部分,而非仅作触觉条件输入。
性能表现与消融分析
在22自由度双臂平台的六项接触丰富型任务上,DexTacWAM每项均达最高分,平均70.6分,最强基线为38.0分。消融实验证实触觉世界建模的关键作用:在保留相同触觉特征与动作专家下,移除触觉世界预测会使四任务均值从74.7暴跌至26.6,证明预测接触状态远比单纯触觉条件化更重要。
高效持续学习与压缩
冻结预训练视觉VAE,仅对触觉编码器进行4小时适配,即可用每任务约100次演示将预训练视频模型扩展至触觉域,无需触觉中期训练。视觉预测质量与纯视觉模型差异保持在0.5 dB内。触觉压缩器在融合后保留89.4%的接触召回率,同时实现2.26倍训练加速与1.29倍推理加速,展现数据与计算高效性。
为什么值得看
证明预训练视频先验能以极低数据与算力高效扩展至多指触觉动力学,为灵巧操作提供新范式。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
