vLLM发布分离式推理指南,拆分Prefill与Decode缓解并发卡顿

工具AI 评分 75/100vLLM 官方博客(RSS)待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

本条选题由第三方线索发现;线索方提供的摘要未被采用,本页内容依据下方信源整理。线索来源:AIHOT

传统单进程vLLM同时处理Prefill、Decode及CPU解析三项互斥任务,长提示词会阻塞并发流导致输出卡顿。分离式推理将Prefill与Decode拆为独立实例,通过KV缓存传递中间状态,避免计算密集型与访存密集型阶段互相等待。同时将分词等纯CPU任务移至前端节点,释放GPU算力。该方案需vLLM v0.30.0及以上版本支持,KV缓存跨节点传输开销会直接增加首字延迟。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

单进程架构的并发瓶颈

默认的单个vLLM服务进程承担了三项互不相关的工作负载。首先是Prefill阶段,需一次性读取完整提示词,受限于算力并决定首字延迟(TTFT);其次是Decode阶段,逐个生成Token,受限于显存读取模型权重的速度,决定Token间延迟(ITL)。两者共享同一GPU时,长提示词的Prefill计算会迫使所有进行中的Decode流等待,造成并发上升时的明显卡顿。第三项是分词、模板渲染等纯CPU任务,占用了昂贵的GPU服务器算力。

分离式推理的拆分维度

分离式推理的核心是将不同阶段解耦。最关键的拆分是将Prefill与Decode作为两个独立实例运行,两者间通过传递KV缓存衔接。由于Decode必须依赖提示词对应的注意力键值才能生成,KV缓存的高效传输至关重要。以Llama-3.1-70B模型BF16精度为例,每Token存储需320 KiB,1万Token的KV缓存约3GB。在400 Gb/s网络下,仅传输耗时约65毫秒,此开销将直接叠加至首字延迟上。此外,将分词与解析移至纯CPU前端节点,可使GPU引擎仅处理Token ID,彻底释放加速器资源。

版本要求与当前局限

该分离式架构需使用vLLM v0.30.0或更新版本方可运行。官方指南详述了各拆分维度的适用场景及具体操作方法,但也指出了当前方案仍存在关键缺口与待改进之处,例如跨节点KV缓存传输的带宽开销对延迟的直接影响,以及系统在实际部署中需进一步优化的环节。

为什么值得看

解决高并发下长提示词导致生成流卡顿的痛点,为大规模LLM部署优化延迟与资源利用率。

Llama算力GPU

信源1 家

  1. [1]vLLM 官方博客(RSS)线索来自 AIHOTvLLM 分离式推理(Disaggregated Serving)实用指南

关键事实

  • 单进程vLLM同时处理Prefill、Decode和CPU解析三项任务,长提示词会阻塞其他流的输出[1]

  • 分离式推理将Prefill与Decode拆分为独立实例,通过传递KV缓存协同工作[1]

  • Llama-3.1-70B在BF16精度下每个Token的KV缓存占用320 KiB,10k Token约3GB[1]

  • 分离式推理功能需vLLM v0.30.0或更高版本运行[1]

相关 · 工具

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。