AI 圈大事记

新方法OPD提升低比特量化模型长推理能力

论文AI 评分 72/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

低于3比特的量化会严重损害大模型的数学与代码推理能力,常导致生成长文本时陷入重复循环。量化感知蒸馏虽能恢复短问答性能,但存在量化放大的曝光偏差问题。为此,研究者提出在策略蒸馏(OPD)阶段,让量化学生模型沿自身推理路径生成,并由冻结的全精度教师模型提供逐词指导与任务验证奖励。在2.79及1.88有效比特下,OPD将四个模型在MATH-500上的BF16性能保留率从35%提至70%,HumanEval从66%提至91%,且不损短问答能力,同等预算下优于持续教师强制蒸馏。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

低比特量化的推理缺陷

对大模型进行低于3比特的极低比特量化时,虽然能大幅压缩模型体积,但会引发严重的长文本推理能力衰退。具体表现为在处理数学与代码任务时,模型生成的长序列极易退化为重复循环,耗尽解码预算却无法得出正确结果。现有的量化感知蒸馏技术虽能有效挽回短问答任务中因量化损失的性能,但在长推理任务上表现不佳,其根源在于量化放大的曝光偏差:QAD在固定的语料前缀上训练,而量化带来的偏差会在模型自回归生成时不断累积。

在策略蒸馏机制设计

为弥补训练与推理间的轨迹偏差,该研究引入在策略蒸馏阶段。该方法从QAD检查点启动,让量化学生模型完全按照部署时的量化前向路径进行生成,并将自身生成的前缀作为后续输入。此时,冻结的全精度教师模型会针对学生模型实际走过的轨迹提供监督,结合密集的词级指导与任务验证器奖励进行反馈。这种机制将教师监督精准放置于量化模型实际到达的状态空间,从而有效纠正长推理过程中的偏差。

实验效果与性能对比

在四个不同模型上,针对2.79与1.88两个有效比特级别进行的测试表明,OPD方法显著提升了长推理性能。在MATH-500基准上,平均BF16性能保留率从35%跃升至70%;在HumanEval上,该保留率从66%提升至91%。同时,该方法完整保留了短问答能力。在匹配预算的对比中,OPD带来的推理增益大幅超越持续使用教师强制QAD训练的效果。结合QAD的稳定初始化与OPD的推理恢复,构成了全面的亚3比特解决方案。

为什么值得看

解决极低比特量化导致的长文本推理退化问题,使模型在大幅压缩下仍保留强推理能力。

大模型蒸馏量化

信源1

  1. [1]arXiv cs.AI一手信源Train Where the Quantized Model Goes: On-Policy Distillation for Low-Bit Reasoning

关键事实

  • 低于3比特的量化会使大模型数学与代码推理能力严重受损,常陷入重复循环。[1]

  • 量化感知蒸馏(QAD)能恢复短问答性能,但因训练与推理路径不匹配存在曝光偏差。[1]

  • 提出的在策略蒸馏(OPD)让量化模型沿自身路径生成,由全精度教师提供逐词指导与验证奖励。[1]

  • 在2.79和1.88有效比特下,OPD将MATH-500性能保留率从35%提至70%,HumanEval从66%提至91%。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。