JOLT算法提出:联合同策略学习与教学优化自蒸馏

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

强化学习在长序列任务中因成功轨迹稀少面临稀疏监督难题。同策略蒸馏虽能提供密集监督,但自蒸馏中特权条件生成的教师可能走学生无法复现的捷径,导致学生性能退化。为此,研究者推导出教师局部蒸馏更新为学生奖励梯度正倍数的充要条件,指出教师需适配学生当前能力。据此提出JOLT算法,用结合结果奖励与面向学生KL正则化的目标训练特权教师,并用密集同策略蒸馏训练无特权学生。在数学推理、编程等任务上,JOLT提升了训练效率与性能,叠加学生奖励可获进一步收益。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

长序列强化学习的稀疏监督困境

基于结果奖励的强化学习在处理长序列困难任务时,生成成功轨迹的成本高昂且极为罕见,导致模型面临严重的稀疏监督问题。同策略蒸馏通过让强教师沿着学生自身的生成轨迹提供密集的词元级监督,成为一种极具吸引力的替代方案。自蒸馏方法进一步消除了对独立教师模型的需求,通过将同一策略在特权信息条件下作为自身的教师来实现训练。

特权教师走捷径导致学生退化

然而,仅靠特权条件并不能保证蒸馏更新能改善学生模型。特权信息可能引导教师通过学生无法使用的捷径来解决任务,从而产生与学生当前行为严重失配的监督信号。因此,即使教师自身表现更优,其提供的指导也可能导致学生性能下降。为解决此问题,研究者分析了特权教师的选择对学生更新的影响,推导出教师的局部蒸馏更新成为学生奖励梯度正倍数的充要条件,表明教师不仅要任务表现好,还需提供契合学生当前能力的指导。

JOLT算法机制与实验表现

基于上述理论刻画,研究提出了一种实用的教师训练替代目标,将结果奖励与面向学生的KL散度正则化相结合。在此基础上,提出了联合同策略学习与教学算法JOLT。该算法联合训练单一策略的两种角色:使用KL正则化目标的特权教师,以及使用密集同策略蒸馏的无特权学生。在数学推理、编程、工具使用和终端使用等任务上的实验表明,JOLT有效提升了训练效率与模型性能,且叠加学生奖励后能获得进一步的性能增益。

为什么值得看

解决自蒸馏中教师走捷径导致学生退化的问题,为长序列强化学习提供更高效稳定的训练方案。

强化学习蒸馏

信源1 家

  1. [1]arXiv cs.AI一手信源A Good Self-Teacher Meets the Student Where They Are: Joint On-Policy Learning and Teaching

关键事实

  • 自蒸馏中特权条件教师可能走学生无法复现的捷径,导致学生性能退化[1]

  • 推导出教师局部蒸馏更新为学生奖励梯度正倍数的充要条件[1]

  • JOLT算法使用结合结果奖励与面向学生KL正则化的目标训练特权教师[1]

  • 在数学推理、编程、工具使用等任务上,JOLT提升了训练效率与性能[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。