AI 圈大事记

RetireOPD 提出自退休策略优化智能体强化学习

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

RetireOPD 是一种自退休同策略蒸馏方法,旨在解决智能体强化学习中奖励稀疏的问题。该方法先利用环境奖励优化具备技能的教师模型,再联合训练无技能的学生模型。当学生与教师的差异不再缩小且成功率达标时,学生将自动停止依赖教师,仅通过强化学习继续训练。在 Qwen2.5 系列模型上的测试显示,该方法在 ALFWorld 和 WebShop 任务中均显著优于基线,且能超越教师模型的表现。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

解决奖励稀疏问题

多轮智能体在强化学习训练中通常只获得单一的标量奖励,这导致监督信号稀疏。同策略蒸馏(OPD)试图通过引入具备特权的教师模型来提供密集的 Token 级监督,让无技能的学生模型内化这些技能。然而研究发现,在智能体任务中,仅凭特权信息并不总能保证教师的可靠性,且教师监督的收益具有阶段性依赖。

自适应退休机制

RetireOPD 提出了一种自退休同策略蒸馏方案。该方案首先利用环境奖励优化一个解耦的、基于技能条件的教师模型,随后联合训练无技能的学生模型。与预定义的蒸馏时间表不同,RetireOPD 采用自适应退休策略:当学生模型与教师模型的差异停止缩小,且学生达到了教师成功率的目标比例时,学生模型会自动放弃教师指导,后续训练仅依靠强化学习进行。

实验性能表现

在 Qwen2.5 系列模型(参数量从 1.5B 到 7B)上的实验表明,RetireOPD 表现优异。在 ALFWorld 任务中,该方法相比强化学习基线,成功率提升了 14.1% 到 18.8%。在 WebShop 任务中,准确率提升了 11.8% 到 19.0%。此外,在所有测试设置中,该方法训练出的学生模型均超越了其具备技能条件的教师模型。

为什么值得看

提出自适应蒸馏终止机制,显著提升多轮智能体任务成功率。

Qwen智能体强化学习蒸馏

信源1

  1. [1]arXiv cs.AI一手信源RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

关键事实

  • RetireOPD 采用自适应退休机制,学生模型在达标后自动停止依赖教师。[1]

  • 在 Qwen2.5 1.5B 至 7B 模型上,ALFWorld 成功率提升 14.1% 至 18.8%。[1]

  • 在 WebShop 任务中,该方法准确率提升 11.8% 至 19.0%。[1]

  • 该方法在所有设置下均超越了其具备技能的教师模型。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。