新方法SCAPO优化强化学习信用分配,数学推理准确率显著提升
论文AI 评分 68/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对大模型强化学习中GRPO方法将相同优势分配给所有token从而可能强化虚假依赖的问题,研究者提出SCAPO方法。该方法通过半事实干预测量token概率漂移,利用归一化稳定性分数在训练早期降低不稳定token的优势。在Qwen3-4B-Base和Qwen3-1.7B-Base上,SCAPO相较GRPO在AIME 2024-2026准确率分别提升5.63和4.17个百分点,并在多数数学基准及所有分布外测试中取得最优结果。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载GRPO信用分配缺陷
基于可验证奖励的强化学习虽提升了大语言模型的推理能力,但模型预测对任务无关的提示特征依然敏感。当前主流的GRPO方法存在局限,其将相同的结果优势分配给响应中的每一个token。这种粗粒度的分配方式不仅可能强化有用的推理,也容易同时强化对无关特征的虚假依赖,从而限制了模型推理与泛化能力的进一步提升。
SCAPO方法核心机制
为解决上述问题,研究者提出了受因果启发的SCAPO方法。该方法首先通过半事实提示干预来保留底层问题与答案,进而测量固定响应下的token概率漂移,揭示了token级别的敏感性存在显著差异。SCAPO将半事实稳定性融入信用分配,利用归一化稳定性分数在训练早期降低相对不稳定token的优势,但不会仅因稳定性而给予额外信用,从而实现更精细的信用分配。
实验效果与对比
在Qwen3-4B-Base与Qwen3-1.7B-Base两种规模的模型上,SCAPO相较于GRPO在AIME 2024-2026准确率分别提升了5.63与4.17个百分点。此外,在所对比的方法中,SCAPO在两种模型规模下均于大多数评估数学基准及所有评估的分布外基准上取得了最佳结果,表明半事实稳定性能为RLVR提供有效的训练信号。
为什么值得看
解决RLVR中token级信用分配不精细问题,以因果干预提升大模型推理与泛化能力,效果显著。
Qwen大模型强化学习
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
