新框架ExpDis将RLVR探索与优化解耦,数学推理超DAPO

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对语言模型在可验证奖励强化学习(RLVR)中引入新颖性激励易导致模型质量下降且难以恢复的问题,研究者提出Exploration-Distillation(ExpDis)框架。该框架将探索与优化解耦:先训练带新颖性奖励的探索策略,过滤其正确且高质量的轨迹,再蒸馏给不带新颖性奖励的学生策略,并交替迭代多轮。在相同计算耗时下,ExpDis在七个数学推理基准和两个模型家族上优于DAPO,且pass@k缩放表现更优,表明其能生成更多样化的正确解。

为什么值得看

解决RLVR探索新策略时模型退化难题,同等算力下数学推理超DAPO,提升解多样性。

强化学习蒸馏

信源1 家

  1. [1]arXiv cs.AI一手信源Decoupling Exploration from Optimization in RLVR

关键事实

  • ExpDis框架将RLVR中的探索与优化过程解耦,避免引入新颖性激励导致模型质量退化[1]

  • 框架流程为训练带新颖性奖励的探索策略,过滤正确轨迹后蒸馏给学生策略,交替迭代[1]

  • 在相同计算耗时预算下,ExpDis在七个数学推理基准和两个模型家族上表现优于DAPO[1]

  • ExpDis改善了pass@k缩放表现,能生成更多样化的正确解决方案[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。