vLLM发布分离式推理指南,拆分Prefill与Decode缓解并发卡顿
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
本条选题由第三方线索发现;线索方提供的摘要未被采用,本页内容依据下方信源整理。线索来源:AIHOT
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载单进程架构的并发瓶颈
默认的单个vLLM服务进程承担了三项互不相关的工作负载。首先是Prefill阶段,需一次性读取完整提示词,受限于算力并决定首字延迟(TTFT);其次是Decode阶段,逐个生成Token,受限于显存读取模型权重的速度,决定Token间延迟(ITL)。两者共享同一GPU时,长提示词的Prefill计算会迫使所有进行中的Decode流等待,造成并发上升时的明显卡顿。第三项是分词、模板渲染等纯CPU任务,占用了昂贵的GPU服务器算力。
分离式推理的拆分维度
分离式推理的核心是将不同阶段解耦。最关键的拆分是将Prefill与Decode作为两个独立实例运行,两者间通过传递KV缓存衔接。由于Decode必须依赖提示词对应的注意力键值才能生成,KV缓存的高效传输至关重要。以Llama-3.1-70B模型BF16精度为例,每Token存储需320 KiB,1万Token的KV缓存约3GB。在400 Gb/s网络下,仅传输耗时约65毫秒,此开销将直接叠加至首字延迟上。此外,将分词与解析移至纯CPU前端节点,可使GPU引擎仅处理Token ID,彻底释放加速器资源。
版本要求与当前局限
该分离式架构需使用vLLM v0.30.0或更新版本方可运行。官方指南详述了各拆分维度的适用场景及具体操作方法,但也指出了当前方案仍存在关键缺口与待改进之处,例如跨节点KV缓存传输的带宽开销对延迟的直接影响,以及系统在实际部署中需进一步优化的环节。
为什么值得看
解决高并发下长提示词导致生成流卡顿的痛点,为大规模LLM部署优化延迟与资源利用率。
信源1 家
关键事实
相关 · 工具
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
