新研究提出动作经验字典,提升世界动作模型跨任务技能复用
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
现有世界动作模型(WAMs)难以跨操作任务复用动作经验,且冗余背景干扰关键视觉信息提取,阻碍跨任务语义关系建模。为此,研究者开发出动作经验字典(AED),将历史物理动作轨迹编码为共享嵌入以支持技能复用。具体通过预训练分词器从AED检索嵌入,经交叉注意力视觉条件化后拼接到噪声动作令牌前,为预测提供交互上下文与意图。同时引入运动感知转换损失,监督随机时间间隔的视觉特征变化预测,以建模动作相关运动并减少无关背景依赖。仿真基准与真实跨具身设置实验均验证了AED的有效性。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载跨任务复用与背景干扰难题
世界动作模型将视觉动态预测与动作生成相耦合,但在操作任务间缺乏对动作经验的显式复用支持。此外,现有模型难以捕捉能指导目标动作预测的跨任务底层语义关系,原因在于冗余的背景元素会干扰关键视觉信息的抽取。这两大缺陷限制了模型在复杂多变操作场景下的泛化与表现。
动作经验字典与嵌入检索机制
为突破上述瓶颈,研究者构建了动作经验字典(AED)。该字典把历史物理动作轨迹编码为共享的动作嵌入,从而支撑技能复用并建模跨任务关系。在具体流程中,首先聚合历史动作以对齐视觉观测,接着利用预训练动作分词器从AED检索动作嵌入。随后,通过交叉注意力机制对池化嵌入进行视觉条件化处理,并将其前置拼接到噪声动作令牌上,为后续预测赋予交互上下文及动作意图。
运动感知损失与实验验证
为聚焦动作相关运动并削弱无关背景线索的干扰,研究引入了运动感知转换损失。该损失函数在随机时间间隔上监督视觉特征变化的预测。在仿真基准测试以及真实世界的跨具身设置实验中,AED方法的有效性均得到了验证,证明其在提升跨任务技能复用与抗背景干扰方面的优势。
为什么值得看
解决世界动作模型跨任务技能复用与背景干扰难题,对提升机器人操作泛化能力具重要价值。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
