AI 圈大事记

LeapQuant实现线性注意力无损8比特量化,端到端推理提速1.47倍

论文AI 评分 72/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对混合架构大模型中线性注意力循环状态的读写更新瓶颈,LeapQuant提出免训练8比特量化方案。通过跨窗口量化缓解误差累积,并在窗口内用高精度缓冲计算输出;同时保留最大异常值为高精度补偿Token并平滑残差,实现近无损性能。在Qwen、Kimi和GLM模型上的测试表明,其精度与FP32基线相当,内核级加速2.05至3.70倍,在NVIDIA B200等GPU上端到端推理加速1.47倍。

为什么值得看

解决线性注意力循环状态量化误差与推理瓶颈,实现近无损8比特量化与显著加速,对长上下文模型推理优化极具实用价值。

Qwen大模型量化GPU

信源1 家

  1. [1]arXiv cs.AI一手信源LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization

关键事实

  • LeapQuant是一种针对线性注意力循环状态的免训练8比特量化方法[1]

  • 采用跨窗口量化和高精度缓冲更新来缓解误差累积[1]

  • 保留最大异常值为高精度补偿Token并平滑残差以降低单次量化误差[1]

  • 在Qwen、Kimi和GLM模型上精度与FP32基线相当,内核级加速2.05至3.70倍,端到端推理加速1.47倍[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。