RISE 提出自外推策略蒸馏方法
论文AI 评分 75/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
RISE 方法通过从模型自身的 RLVR 训练轨迹中构建合成教师,利用参数空间或输出 Logit 空间的位移外推,将稀疏的结果奖励转化为稠密的 Token 级目标。该方法无需外部模型或特权条件,将蒸馏转化为递归改进机制。在数学推理、多领域 STEM、代码生成及多轮智能体任务中,RISE 表现优于仅使用 RLVR 的训练及在线策略自蒸馏。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载解决教师质量瓶颈
现有的在线策略蒸馏(OPD)为语言模型后训练提供稠密的 Token 级监督,但其效果受限于教师质量。外部教师存在分布不匹配问题,而使用特权条件的自蒸馏则受限于上下文学习容量。RISE 方法提出了一种新思路,直接从模型自身的 RLVR 训练轨迹中构建合成教师,旨在解决上述瓶颈,不依赖任何外部模型或特权条件。
自外推与递归改进
RISE 通过外推当前检查点与滞后锚点之间的位移——无论是在参数空间还是输出 Logit 空间——将稀疏的结果诱导参数更新转化为稠密的 Token 级目标。该方法将 RLVR 和 OPD 结合在互补循环中:结果奖励将外推引导至正确推理方向,而外推出的教师则细化 Token 级决策。随着学生模型的改进,教师在每个迭代中都会刷新,使蒸馏成为递归改进机制而非一次性压缩步骤。
多任务实验验证
研究团队在多个领域进行了实验验证,包括数学推理、多领域 STEM、代码生成以及多轮智能体任务。结果显示,在所有设置中,RISE 均优于仅使用 RLVR 的训练以及在线策略自蒸馏。这表明该方法在提升模型推理能力和代码生成能力方面具有广泛的有效性。
为什么值得看
解决了自蒸馏受上下文学习容量限制的瓶颈,提升模型推理与代码能力。
智能体蒸馏代码生成
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
