研究探讨将大模型记忆KV Cache转移至CPU
论文AI 评分 65/100量子位
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
文章探讨了大模型推理中KV Cache占用显存导致并发能力下降的问题。以Qwen3-8B为例,百万上下文缓存约需147GB,大规模请求下数据量巨大。若显存不足导致缓存被清理,系统需重新进行Prefill计算,增加首字延迟。文章提出将记忆任务交给CPU,让GPU专注于Token生成,以解决存储与算力瓶颈。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载KV Cache的显存压力
大模型推理过程中,系统会将前文计算产生的Key和Value保存为KV Cache,以避免重复计算。随着Agent任务变长,这份“记忆”会不断堆积。以Qwen3-8B为例,每个Token对应的KV数据约为147KB。若假设需要处理100万个Token的上下文,仅KV数据就需约147GB。当大量Agent并发运行时,累计的缓存规模可达PB甚至EB级别,远超GPU显存承载能力。
缓存清理带来的性能损耗
当显存空间不足时,系统可能被迫清理部分缓存。例如,Coding Agent在等待工具运行期间,其历史缓存可能被移除。一旦Agent需要继续工作,系统必须重新处理历史输入以重建缓存,这一过程称为Prefill。这不仅增加了用户等待首个Token的时间(TTFT),也浪费了GPU算力,使其无法处理新任务,降低了整体服务吞吐量。
CPU卸载的解决思路
面对存储与搬运的成本问题,文章指出破局之道在于利用CPU。GPU显存昂贵且有限,应优先用于模型权重和新Token生成。将KV Cache卸载至CPU内存或其他存储层,可以缓解显存压力。尽管这可能引入数据搬运的延迟,但通过合理的缓存管理策略,能够避免昂贵的Prefill重算,从而在长上下文场景下提升系统整体效率。
为什么值得看
揭示Agent时代长上下文推理的显存瓶颈与CPU卸载方案。
Qwen大模型算力GPU
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
