研究提出TokenProbe框架,大幅压缩推理Token消耗并超越Gemini…
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载Token价值不均等规律
大模型借助思维链推理在复杂任务上获得显著性能提升,但代价是Token消耗急剧增加。该研究针对此现象提出核心问题:推理轨迹中的每个Token是否具有同等价值?通过实证探究,作者发现CoT推理序列内的Token价值高度不均匀,而这种不均匀性能够被Token级别的对数概率信号有效刻画。归一化对数概率有助于区分两类Token:一是承载结构与决定性推理内容的核心Token,二是属于探索性、低置信度填充且对最终答案直接贡献较小的冗余Token。
TokenProbe框架与优化目标
基于上述发现,研究构建了TokenProbe框架,该框架围绕两项经验发现与一项主张展开。发现部分首先识别了Token价值不均等性,随后确立TokenProbe作为核心Token的代理机制。主张部分则引入了高效的GRPO目标,其核心观点是:对冗余Token进行选择性压缩,能够在准确率与Token效率的空间中实现帕累托改进。这意味着模型可以在不牺牲甚至提升准确率的前提下,显著降低推理过程的Token开销。
实验效果与性能对比
实验验证了所提方法的有效性。在推理质量保持不变的情况下,该方法将基线的Token使用量削减了76%,展现出极高的压缩效率。此外,在设定匹配的推理长度预算条件下,该方法的性能表现甚至超越了Gemini-3.1-Pro等强劲的旗舰级基线模型。这表明通过精准识别并压缩低价值推理Token,模型能够在有限预算内释放更多有效算力,从而获得更优的推理结果。该论文已被NeurIPS 2026接收。
为什么值得看
揭示CoT推理中Token价值不均等规律,提供大幅降低推理成本且不损性能的优化路径。
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
