PermVLA提出动作分块新正则化方法,提升VLA策略性能
论文AI 评分 62/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
视觉-语言-动作(VLA)策略通常采用固定的从左到右(LTR)顺序分解动作块。该论文指出分解顺序可作为正则化手段,提出因果锚定置换(CAP)方法。CAP通过可调时序前缀采样动作揭示顺序,其辅助目标训练共享策略从同一专家块的不同已知子集预测动作,无需增加演示数据即可构建多条件预测问题,避免过度依赖单一时序前缀。部署时保留确定性LTR控制。实验表明,CAP在LIBERO、LIBERO-Plus及跨数据集CALVIN评测中均稳定优于标准LTR训练,且能内化不同揭示顺序间的一致性。该思路可扩展至扩散动作生成器。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载CAP方法核心机制
现有视觉-语言-动作策略在学习动作块时,普遍采用固定的从左到右分解方式。该论文发现,同一专家轨迹分布实际上允许存在多种有效的链式法则分解。据此,研究者将分解顺序视为一种被忽视的正则化选择,提出因果锚定置换(CAP)。该方法通过可调的时序前缀来采样动作揭示顺序,其辅助目标训练单一共享策略,使其能从同一专家动作块的不同已知子集中进行预测。这种方式被称为条件集增强,它在不增加额外演示数据的前提下,从单个专家块中构建出多个条件预测问题,从而避免模型过度依赖常规教师强制所使用的单一时序前缀。在部署阶段,模型依然保留确定性的从左到右控制方式。
实验验证与扩展性
在受控实验中,CAP方法在LIBERO和LIBERO-Plus基准测试上持续优于标准的从左到右训练方式,并且在跨数据集的CALVIN评测中同样展现出一致的优势。研究还引入了一项诊断指标,通过测量动作块在两种揭示顺序下的联合对数似然期望平方差,验证了CAP训练确实内化了不同揭示顺序之间的一致性。这些发现表明,采样子集条件辅助目标可以作为构建VLA正则化器的通用配方。论文进一步展示了该思路的扩展性,将其应用于扩散动作生成器中,证明了该方法在VLA学习框架下的普适价值。
为什么值得看
无需额外数据即可缓解VLA动作块预测对单一时序的过拟合,为构建VLA正则化器提供通用方案。
论文数据集
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
