CompKV框架优化长上下文推理,自注意力加速达6.85倍
论文AI 评分 65/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对大模型长上下文推理受KV缓存制约的问题,现有稀疏注意力方法在token选择与补偿环节解耦,未考虑遗漏token造成的补偿误差。新提出的CompKV框架将token分块,依据块注意力质量与块内logit方差优化选择,以降低块级均值补偿的残差。在RULER和LongBench-Pro测试中,该框架在评估的稀疏基线里表现最优,且相比全注意力实现最高6.85倍的自注意力加速。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载长上下文推理瓶颈与解耦缺陷
大模型在处理长上下文时,推理速度常受限于KV缓存的内存传输开销。稀疏注意力通过仅对部分选中token计算精确注意力来加速,并对未选中token的注意力尾部施加粗粒度补偿以挽回其贡献。然而,现有方法通常先基于注意力质量挑选token,随后再对未选中部分补偿。这种解耦设计忽略了选择与补偿的交互影响:选择阶段理应优先挑出那些一旦遗漏便会引发最大补偿误差的token,而非单纯看重注意力质量。
CompKV的补偿感知选择机制
为克服上述局限,CompKV框架将token划分为多个块,并针对下游补偿机制显式优化选择过程。其理论分析揭示,块级均值补偿留下的残差受块注意力质量与块内logit方差双重支配。该框架利用紧凑的块级统计量近似估算此残差,从而推导出可实际部署的token选择准则。此外,CompKV还开发了高效的异步实现方式,确保理论优化能够落地为实际推理加速。
评测表现与加速效果
在RULER与LongBench-Pro两项长上下文基准测试中,CompKV在所有受评的稀疏注意力基线方法里取得了最优效果。在保证模型表现的前提下,相比全注意力计算,CompKV的自注意力运算环节最高实现了6.85倍的加速比,显著缓解了长文本推理时的KV缓存内存传输压力。
为什么值得看
解决长上下文推理KV缓存瓶颈,提供补偿感知的稀疏注意力新思路与显著加速比。
大模型
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
