新方法SQAM提升流策略微调效率,成功率最高超基线35个百分点

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

流策略用离策略强化学习微调时,需在每步计算向量雅可比积,开销随步数与模型规模增长。作者发现预训练流策略的批量平均速度雅可比矩阵集中于对角线,据此推导出标量伴随,用流时间缩放最终动作的价值梯度,免除了逐步向量雅可比积。结合对生成动作的价值惩罚,提出SQAM算法。在OGBench四个最难关卡上,成功率较各域最强基线高出18至35个百分点。在真实双臂机器人上微调视觉语言动作策略,三项任务均优于监督微调。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

流策略微调的计算瓶颈

流策略能够表达丰富多样的动作分布,利用离策略强化学习在其基础上微调以超越演示表现正受到关注。然而,依据已学习的价值函数微调流策略存在计算困难:策略需经由多个流步骤生成动作,传统的伴随匹配方法虽能将价值信息从最终动作回传至各流步骤以更新模型,但要求在每一步计算向量与雅可比矩阵的乘积。该计算代价随流步骤数目及策略参数规模同步增长,成为微调过程的显著负担。

标量伴随与价值惩罚结合

作者观察到预训练流策略的批量平均速度雅可比矩阵呈现向对角线集中的特性。基于此,推导出闭式标量伴随,通过流时间对最终动作的价值梯度进行缩放,彻底消除了逐步的向量雅可比积运算。此外,发现在标量伴随下控制评论家在策略生成动作处的价值尤为关键。由此提出SQAM算法,将标量伴随与针对此类动作的价值惩罚相结合,在保证更新原则性的同时大幅削减计算量。

基准测试与真实机器人验证

在OGBench四个难度最高的域中,SQAM的成功率相比每个域的最强基线分别提升18至35个百分点,增益高度集中于困难任务。为检验向大型预训练策略的扩展性,在真实双臂机器人上对视觉语言动作策略进行微调。结果显示,在全部三项任务中,SQAM的表现均优于监督微调,证实了其在具身智能控制场景下的实用价值与泛化能力。

为什么值得看

大幅降低流策略离策略微调的计算开销,并在高难度基准与真实机器人上显著提升成功率。

微调强化学习

信源1 家

  1. [1]arXiv cs.AI一手信源Q-Learning with Scalar Adjoint Matching

关键事实

  • 预训练流策略的批量平均速度雅可比矩阵集中于对角线[1]

  • 推导出标量伴随,用流时间缩放最终动作的价值梯度,免除逐步向量雅可比积[1]

  • 在OGBench四个最难关卡上,成功率较各域最强基线高18至35个百分点[1]

  • 在真实双臂机器人上微调视觉语言动作策略,三项任务均优于监督微调[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。