自监督置信度微调使推理模型生成令牌减少25%
论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
arXiv新论文提出自监督置信度训练法提升推理效率。该方法仅用600个训练问题微调模型,使其在推理轨迹中间节点预测自身对答案的置信度。训练损失不包含长度或停止目标,推理时也无早停机制。在数学、科学及编码基准上,Gemma、Qwen、Nemotron和GPT-OSS模型在准确率持平下生成令牌数最多降25%,效率媲美显式优化长度的方法。分析表明该法保留了基础模型高层推理组合,暗示高效推理可作为学习元认知信号的下游结果自然涌现。
为什么值得看
无需显式长度惩罚或早停机制,仅靠极少数据微调即可大幅降低推理计算成本并保准确率。
GPTQwen推理模型微调论文
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
