OPPD方法无需搜索即可蒸馏序列级幂分布,单次生成推理精度大幅提升

论文AI 评分 68/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对语言模型因错误答案总概率高而常采样出错的问题,OPPD方法通过同策略幂蒸馏,让模型单次生成即产出经幂分布锐化后的高概率答案,免去了多候选打分开销。在MATH500与GSM8K上,单次生成准确率较未训练模型分别提升23.0与27.3个百分点,且超越64候选幂采样2.4与3.5个百分点。对比同预算GRPO,OPPD在MATH500、GSM8K及AIME高出3.8至5.4个百分点,两者结合可再增9.3个百分点。仅数学训练即可让HumanEval提升5.3个百分点。

为什么值得看

无需多候选搜索即可逼近多次采样性能,大幅降低推理成本,且与GRPO互补,为提升模型推理精度提供新路径。

蒸馏

信源1 家

  1. [1]arXiv cs.AI一手信源Sharpen Without Search: On-Policy Distillation of Sequence-Level Power Distribution

关键事实

  • OPPD单次生成在MATH500和GSM8K上较未训练模型准确率分别提升23.0和27.3个百分点。[1]

  • OPPD单次生成得分比64候选幂采样在MATH500和GSM8K上分别高2.4和3.5个百分点。[1]

  • 对比同检查点与预算的GRPO,OPPD在MATH500、GSM8K和AIME上分别高3.8、4.0和5.4个百分点。[1]

  • OPPD与GRPO互补,在GRPO后应用OPPD可额外增加最高9.3个百分点。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。