AI 圈大事记

研究提出TokenProbe框架,大幅压缩推理Token消耗并超越Gemini…

论文AI 评分 68/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对大模型思维链推理中Token消耗过大的问题,该研究提出TokenProbe框架。其基于经验发现:推理序列中各Token价值不均等,归一化对数概率可有效区分承载关键结构的“核心Token”与低置信度的“冗余Token”。该框架将TokenProbe作为核心Token代理,并引入高效GRPO目标,通过选择性压缩冗余Token实现准确率与效率的帕累托改进。实验表明,该方法在保持推理质量的同时,将基线Token用量削减76%;在匹配推理长度预算下,性能甚至超越Gemini-3.1-Pro等强基线。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

Token价值不均等规律

大模型借助思维链推理在复杂任务上获得显著性能提升,但代价是Token消耗急剧增加。该研究针对此现象提出核心问题:推理轨迹中的每个Token是否具有同等价值?通过实证探究,作者发现CoT推理序列内的Token价值高度不均匀,而这种不均匀性能够被Token级别的对数概率信号有效刻画。归一化对数概率有助于区分两类Token:一是承载结构与决定性推理内容的核心Token,二是属于探索性、低置信度填充且对最终答案直接贡献较小的冗余Token。

TokenProbe框架与优化目标

基于上述发现,研究构建了TokenProbe框架,该框架围绕两项经验发现与一项主张展开。发现部分首先识别了Token价值不均等性,随后确立TokenProbe作为核心Token的代理机制。主张部分则引入了高效的GRPO目标,其核心观点是:对冗余Token进行选择性压缩,能够在准确率与Token效率的空间中实现帕累托改进。这意味着模型可以在不牺牲甚至提升准确率的前提下,显著降低推理过程的Token开销。

实验效果与性能对比

实验验证了所提方法的有效性。在推理质量保持不变的情况下,该方法将基线的Token使用量削减了76%,展现出极高的压缩效率。此外,在设定匹配的推理长度预算条件下,该方法的性能表现甚至超越了Gemini-3.1-Pro等强劲的旗舰级基线模型。这表明通过精准识别并压缩低价值推理Token,模型能够在有限预算内释放更多有效算力,从而获得更优的推理结果。该论文已被NeurIPS 2026接收。

为什么值得看

揭示CoT推理中Token价值不均等规律,提供大幅降低推理成本且不损性能的优化路径。

Gemini大模型

信源1 家

  1. [1]arXiv cs.AI一手信源On the Token Value Inequality in Efficient Reasoning

关键事实

  • 研究提出TokenProbe框架,基于Token价值不均等及归一化对数概率可区分核心与冗余Token的发现构建[1]

  • 引入高效GRPO目标,选择性压缩冗余Token以实现准确率与Token效率的帕累托改进[1]

  • 实验显示该方法保持推理质量并将基线Token用量减少76%[1]

  • 在匹配推理长度预算下,该方法性能超越Gemini-3.1-Pro强基线[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。