InfoPPO提出用信息密度替代token计数优化LLM推理
论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对RLVR中按token生成参数化时间进程导致信息流不均匀的问题,InfoPPO改用信息密度重参数化。该方法在长程推理中恢复非平凡折扣有效性,避免终端监督过度衰减,并引入依状态调整的自适应裁剪机制,实现更精准的策略更新。在Qwen3模型及五个数学推理基准测试中,其表现持续优于竞争基线,且在token-time PPO退化的折扣设置下保持准确率与响应长度稳定。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载信息时间重参数化
现有强化学习训练大语言模型的方法通常按逐个token生成来参数化马尔可夫决策过程的时间进程。然而,自回归轨迹上的信息流高度不均匀。InfoPPO提出使用信息密度而非原始token计数来重新参数化时间进程。这种重参数化为时间信用传播和策略更新引入了共同的依赖状态的结构,从而在长程推理中恢复了非平凡折扣的有效性,既保留了有效视界收缩,又避免了长token序列上终端监督的过度衰减。
自适应裁剪与理论分析
基于信息时间的策略改进分析自然导出了一种依赖状态的更新约束,作者通过自适应裁剪实现该约束。该机制将每个token位置的裁剪阈值适配至其对应状态的信息密度,使策略更新更具针对性同时保持近端控制。理论上,研究将性能差异与策略改进分析扩展至信息时间MDP,在策略变化受信息密度调节时推导出策略改进下界,并将状态信息密度与局部策略变动关联,为自适应更新机制提供了理论依据。
实验表现与稳定性
在Qwen3模型上的实验表明,InfoPPO在五个具有挑战性的竞赛风格数学推理基准测试中,相较于竞争基线取得了持续的增益。此外,在非平凡的折扣设置下,传统的token-time PPO会出现性能恶化,而InfoPPO依然能够维持稳定的准确率和响应长度,验证了其处理长序列推理任务的鲁棒性优势。
为什么值得看
解决长序列LLM推理中token时间参数化导致的信用分配与策略更新失效,提供自适应裁剪新思路。
Qwen基准测试
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
