AI 圈大事记

研究显示顺序训练优于联合训练方法

论文AI 评分 75/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

该研究提出了一种两阶段方案OPD-then-RL,在逻辑和数学推理基准测试中,始终优于纯OPD、纯RLVR以及所有联合基线方法。研究发现OPD扩展学生对教师支持解决方案的覆盖范围,而RL则在此范围内进行优化,联合优化会导致信号冲突。研究还发现OPD验证分数是切换到RL的关键信号,OPD是比SFT更好的冷启动方法。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

两阶段方案优势

针对大语言模型的后训练推理优化,先前的研究倾向于将策略内蒸馏与可验证奖励强化学习这两种方法在单一步骤中融合。常见的融合手段包括对两种信号进行加权加法组合,或者利用教师模型对强化学习的优势函数进行重新缩放。然而,最新的研究提出了一种更为简洁的两阶段方案,即先进行策略内蒸馏,随后再进行强化学习。实验数据显示,这种顺序执行的模式在逻辑推理和数学推理等多项基准测试中,其表现均优于单纯使用蒸馏、单纯使用强化学习,以及所有将两者联合优化的基线方法。

机制与动态分析

深入探究这种两阶段方案为何有效,研究人员从通过率行为、学习动态以及参数更新等角度进行了系统性的剖析。分析结果表明,策略内蒸馏的主要作用在于扩大学生模型对教师模型所支持解的覆盖范围,而随后的强化学习则是在此基础上进一步精细化模型的表现。相比之下,如果在同一时间内联合优化这两个信号,会导致它们之间产生相互干扰。这种机制上的差异解释了为何将两个原本纠缠的信号解耦,并转化为互补的两个阶段,能够取得更优的训练效果。

实践应用策略

为了将这一发现转化为可操作的实践指南,研究团队确定了从蒸馏阶段切换到强化学习阶段的关键信号,即策略内蒸馏的验证分数。当该分数达到特定阈值时,便是启动强化学习的最佳时机。此外,对比实验还发现,相比于有监督微调,策略内蒸馏能够为强化学习提供一个更优的冷启动状态。这意味着在实际操作中,利用蒸馏作为前置步骤,可以更有效地激活后续的强化学习过程,从而提升模型整体的推理能力。

为什么值得看

为LLM后训练推理提供了一种简单而强大的方法组合方案,将纠缠信号转化为互补阶段。

基准测试

信源1

  1. [1]arXiv cs.AI一手信源Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR

关键事实

  • OPD-then-RL两阶段方案在逻辑和数学推理基准测试中表现最佳[1]

  • OPD扩展学生对教师支持解决方案的覆盖范围,RL在此范围内进行优化[1]

  • OPD验证分数是切换到RL的关键信号[1]

  • OPD是比SFT更好的RL冷启动方法[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。