RetireOPD 提出自退休策略优化智能体强化学习
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
RetireOPD 是一种自退休同策略蒸馏方法,旨在解决智能体强化学习中奖励稀疏的问题。该方法先利用环境奖励优化具备技能的教师模型,再联合训练无技能的学生模型。当学生与教师的差异不再缩小且成功率达标时,学生将自动停止依赖教师,仅通过强化学习继续训练。在 Qwen2.5 系列模型上的测试显示,该方法在 ALFWorld 和 WebShop 任务中均显著优于基线,且能超越教师模型的表现。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载解决奖励稀疏问题
多轮智能体在强化学习训练中通常只获得单一的标量奖励,这导致监督信号稀疏。同策略蒸馏(OPD)试图通过引入具备特权的教师模型来提供密集的 Token 级监督,让无技能的学生模型内化这些技能。然而研究发现,在智能体任务中,仅凭特权信息并不总能保证教师的可靠性,且教师监督的收益具有阶段性依赖。
自适应退休机制
RetireOPD 提出了一种自退休同策略蒸馏方案。该方案首先利用环境奖励优化一个解耦的、基于技能条件的教师模型,随后联合训练无技能的学生模型。与预定义的蒸馏时间表不同,RetireOPD 采用自适应退休策略:当学生模型与教师模型的差异停止缩小,且学生达到了教师成功率的目标比例时,学生模型会自动放弃教师指导,后续训练仅依靠强化学习进行。
实验性能表现
在 Qwen2.5 系列模型(参数量从 1.5B 到 7B)上的实验表明,RetireOPD 表现优异。在 ALFWorld 任务中,该方法相比强化学习基线,成功率提升了 14.1% 到 18.8%。在 WebShop 任务中,准确率提升了 11.8% 到 19.0%。此外,在所有测试设置中,该方法训练出的学生模型均超越了其具备技能条件的教师模型。
为什么值得看
提出自适应蒸馏终止机制,显著提升多轮智能体任务成功率。
Qwen智能体强化学习蒸馏
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
