新框架TacEx利用触觉好奇心驱动机器人探索与VLA后训练
论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
强化学习机器人探索常因随机动作导致大量无效自由空间运动。现有基于认知不确定性的内驱方法易奖励无关转移。新框架TacEx将触觉反馈融入认知不确定性探索,把好奇心锚定触觉通道,驱动机器人发掘复杂接触动态。探索阶段无需任务奖励或专家演示即可学会抓取操作。收集的密集交互数据集支持离线学习下游抓放策略,无需额外环境交互。对无触觉预训练的视觉-语言-动作(VLA)模型进行TacEx后训练,能大幅提升下游表现且保持高样本效率。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载机器人操作探索痛点
通过强化学习掌握机器人操作技能普遍面临样本效率低下的问题。常规算法依赖随机动作采样寻找新策略,致使智能体将绝大部分训练预算耗费在远离接触面的自由空间运动上,而操作技能恰恰从接触中产生。现有基于模型分歧或认知不确定性的内驱方法虽优于各向同性噪声,却也会对功能无关的状态转移给予奖励,例如在自由空间中的无规律运动,无法有效引导机器人向有价值的接触区域探索。
TacEx触觉探索机制
针对上述问题,该研究提出TacEx框架,主张触觉反馈为探索提供天然信号。该框架将触觉融入认知不确定性驱动的探索过程,核心做法是跨感知模态分解模型不确定性,并将好奇心定向至触觉通道。通过将好奇心锚定于触觉,TacEx驱动机器人主动发现复杂的接触动力学,使其在探索阶段无需任何任务奖励或专家演示便能学会操作与抓取物体。
下游策略学习与VLA后训练
经由触觉好奇心收集的交互密集数据集,能够支持下游抓放策略的离线学习,且此过程无需额外的环境交互。此外,研究还将该触觉驱动探索用于视觉-语言-动作(VLA)模型的后训练。即便VLA模型初始预训练阶段未包含触觉反馈,采用TacEx进行后训练仍能显著提升其下游任务表现,同时维持极高的样本效率,为缺乏触觉模态的VLA模型提供了高效适配方案。
为什么值得看
解决机器人操作探索低效难题,为VLA模型提供无需专家演示的高效触觉后训练路径。
强化学习数据集
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
