AI 圈大事记

VLA-Dreamer提出基于世界模型优化VLA架构

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

当前视觉-语言-动作模型(VLA)依赖海量模仿学习数据且缺乏显式世界模型,控制能力受限。VLA-Dreamer概念架构在VLA视觉编码器的嵌入空间训练预测性世界模型,假设该嵌入具备动作相关性且可用于未来预测。其损失计算在嵌入空间而非像素空间,类似联合嵌入预测架构。训练后的世界模型可在推理时通过给定目标图像采样VLA动作,用于短期规划任务,旨在检验视觉嵌入丰富度并降低VLA的高数据需求。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

VLA现有局限与假设

视觉-语言-动作模型虽在机器人控制上潜力显著,但面临两大难题:一是对海量高质量模仿学习数据的高度依赖导致样本效率低下;二是缺乏显式世界模型,使其对真实世界动态的模拟能力存疑,限制了控制表现。VLA-Dreamer的核心假设是,VLA视觉编码器产生的嵌入包含与动作相关的信息,且这些嵌入足以用于基于动作的未来状态预测。若无法实现该预测,则暴露出VLA架构缺乏无损隐式世界模型来模拟现实动态的关键缺陷。

架构设计与规划应用

为验证上述假设并降低数据需求,该概念论文提出在VLA视觉编码器的嵌入空间内训练一个预测性世界模型。与传统在像素空间计算损失的世界模型动态不同,此架构的损失直接来源于嵌入空间,机制上与联合嵌入预测架构相似。在推理阶段,该训练完成的世界模型可被直接用于短期规划任务,具体方式是在给定目标图像的条件下,对VLA的动作进行采样。此举旨在探究VLA视觉嵌入的丰富程度,并通过引入具备规划生成能力的世界模型来缓解VLA对海量训练数据的依赖。

为什么值得看

针对VLA高数据依赖与缺世界模型痛点,提出嵌入空间预测架构,为提升机器人控制样本效率与规划能力提供新思路。

信源1 家

  1. [1]arXiv cs.AI一手信源Towards VLA-Dreamer: Refining VLA Behavior Using World Models

关键事实

  • VLA-Dreamer在VLA视觉编码器的嵌入空间训练预测性世界模型以解决样本效率问题[1]

  • 该架构的损失计算源于嵌入空间而非像素空间,类似联合嵌入预测架构[1]

  • 训练后的世界模型可通过给定目标图像采样VLA动作,执行短期规划任务[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。