新框架ExpDis将RLVR探索与优化解耦,数学推理超DAPO
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对语言模型在可验证奖励强化学习(RLVR)中引入新颖性激励易导致模型质量下降且难以恢复的问题,研究者提出Exploration-Distillation(ExpDis)框架。该框架将探索与优化解耦:先训练带新颖性奖励的探索策略,过滤其正确且高质量的轨迹,再蒸馏给不带新颖性奖励的学生策略,并交替迭代多轮。在相同计算耗时下,ExpDis在七个数学推理基准和两个模型家族上优于DAPO,且pass@k缩放表现更优,表明其能生成更多样化的正确解。
为什么值得看
解决RLVR探索新策略时模型退化难题,同等算力下数学推理超DAPO,提升解多样性。
强化学习蒸馏
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
