AI 圈大事记

STEPQuant提出线性注意力循环状态时空量化框架

论文AI 评分 72/100arXiv cs.AI
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对线性注意力中循环状态占用内存高的问题,STEPQuant提出基于Delta-rule的时空后训练量化框架。该框架依据误差幅度与记忆存活期分配精度,并联合拟合键行与值列缩放比例。在Qwen3.8-27B等模型测试中,6位配置下精度逼近FP32,4位配置优于均匀INT8。集成至SGLang后,6位量化实现超5倍状态压缩,服务总内存降幅达68.7%。

为什么值得看

解决线性注意力并发服务内存瓶颈,以低至4位量化逼近全精度性能,大幅降低大模型部署成本。

Qwen量化

信源1 家

  1. [1]arXiv cs.AI一手信源STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization

关键事实

  • STEPQuant是一个针对Delta-rule循环状态的时空后训练量化框架[1]

  • 该框架依据误差幅度与记忆存活期分配精度,联合拟合键行与值列缩放比例[1]

  • 6位配置下精度逼近FP32,4位配置优于均匀INT8[1]

  • 集成至SGLang后,6位量化实现超5倍状态压缩,总服务内存降幅达68.7%[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。