OPPD方法无需搜索即可蒸馏序列级幂分布,单次生成推理精度大幅提升
论文AI 评分 68/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对语言模型因错误答案总概率高而常采样出错的问题,OPPD方法通过同策略幂蒸馏,让模型单次生成即产出经幂分布锐化后的高概率答案,免去了多候选打分开销。在MATH500与GSM8K上,单次生成准确率较未训练模型分别提升23.0与27.3个百分点,且超越64候选幂采样2.4与3.5个百分点。对比同预算GRPO,OPPD在MATH500、GSM8K及AIME高出3.8至5.4个百分点,两者结合可再增9.3个百分点。仅数学训练即可让HumanEval提升5.3个百分点。
为什么值得看
无需多候选搜索即可逼近多次采样性能,大幅降低推理成本,且与GRPO互补,为提升模型推理精度提供新路径。
蒸馏
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
