ActionPiece 重新思考自回归 VLA 模型动作分词
论文AI 评分 65/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
ActionPiece 提出物理秩一致性指标,衡量分词后重建动作的局部物理距离保真度。该方法通过联合监督表示学习与量化,保留物理动作关系。在 Qwen3-VL-4B 策略训练设置下,ActionPiece 在 LIBERO 上达 94.8%,未见过的 LIBERO-Plus 上达 68.8%,SimplerEnv 上达 71.9%,VLA-Arena L0-L2 上达 51.5%。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载动作分词评估新指标
自回归视觉-语言-动作(VLA)模型中,动作分词器决定了策略训练的目标以及从预测 token 中恢复的可执行命令。现有评估常使用均方误差(MSE)等逐点重建指标,但微小的个体误差无法完全表征不同演示间动作调整的保真度。压缩后,相似动作可能聚集在代表性运动周围,而不同上下文所需的调整可能被削弱、扭曲甚至反转。为此,研究引入物理秩一致性(PRC)来衡量分词在重建后对局部物理距离排序的保留程度。
ActionPiece 方法设计
ActionPiece 通过表示学习和量化的联合监督来保留物理动作关系。物理秩保留监督编码器和量化特征距离的远近排序,而量化正则化将相同的排序应用于码字分配分布。这两个目标增强了重建效果,生成了离散的动作 token,用于标准的自回归策略学习,并通过冻结解码器执行。组件消融实验表明,这两个目标共同改善了 PRC 和策略成功率,证明了物理关系监督对动作分词的价值。
实验性能表现
在相同的 Qwen3-VL-4B 策略训练设置下,ActionPiece 在多个基准测试中取得了显著成绩。其在 LIBERO 数据集上达到了 94.8% 的成功率,在未见过的 LIBERO-Plus 数据集上达到了 68.8%。此外,在 SimplerEnv 上的评估达到 71.9%,在 VLA-Arena L0-L2 上的平均得分为 51.5%。这些结果验证了该方法在提升动作分词质量和策略执行能力方面的有效性。
为什么值得看
提出新指标并提升 VLA 模型动作分词保真度,多项基准测试表现优异。
Qwen量化
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
