AI 圈大事记

自监督置信度微调使推理模型生成令牌减少25%

论文AI 评分 72/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

arXiv新论文提出自监督置信度训练法提升推理效率。该方法仅用600个训练问题微调模型,使其在推理轨迹中间节点预测自身对答案的置信度。训练损失不包含长度或停止目标,推理时也无早停机制。在数学、科学及编码基准上,Gemma、Qwen、Nemotron和GPT-OSS模型在准确率持平下生成令牌数最多降25%,效率媲美显式优化长度的方法。分析表明该法保留了基础模型高层推理组合,暗示高效推理可作为学习元认知信号的下游结果自然涌现。

为什么值得看

无需显式长度惩罚或早停机制,仅靠极少数据微调即可大幅降低推理计算成本并保准确率。

GPTQwen推理模型微调论文

信源1 家

  1. [1]arXiv cs.AI一手信源Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency

关键事实

  • 自监督置信度微调在准确率持平下,使Gemma等四类模型生成令牌最多减少25%[1]

  • 该方法训练损失不包含推理长度、效率或停止目标,推理时也无早停机制[1]

  • 微调仅使用600个训练问题让模型预测推理中间节点的答案置信度[1]

  • 效率提升媲美显式优化短推理的方法,且保留了基础模型高层推理组合[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。