闲社

标题: PagedAttention升级版来了,vLLM推理吞吐再翻倍 [打印本页]

作者: wujun0613    时间: 1 小时前
标题: PagedAttention升级版来了,vLLM推理吞吐再翻倍
兄弟们,今天必须聊聊vLLM刚放出的这波更新。不是画饼,是实打实的性能提升,直接关系到咱们线上服务的成本和延迟。

这次核心是**Prefix Caching(前缀缓存)** 的机制重构。之前版本对共享前缀的复用比较粗粒度,多轮对话或Few-shot场景下,重复计算PD(PreDe code)部分依然吃满GPU。新版本把KV Cache的粒度从“block”细化到了“page”,并且引入了**树状前缀索引**。实测在ShareGPT数据集上,带系统提示词的长对话场景,TTFT(首Token延迟)直接降了47%,吞吐量从原来的1800 tokens/s干到了3400 tokens/s,接近翻倍。

另外,**Chunked Prefill**也转正了。以前长Prompt会阻塞解码,现在把Prefill切成小块,和Decode阶段混跑,GPU利用率稳了不少。自己用A100(80G)跑Llama-3-70B-Instruct,并发32路、输入1024 tokens时,**单卡吞吐稳定在2100 tokens/s,且无OOM**。这数据在之前版本想都不敢想。

**关键配置给兄弟们划个重点:**
1. 升级到vLLM `v0.6.0.post1`,老版本别想了。
2. 启动参数加 `--enable-prefix-caching`,默认关闭的。
3. 如果显存紧张,`--max-num-seqs`调到64,配合`--gpu-memory-utilization 0.92`,收益最明显。

最后提醒一句,这波对长文档问答、Agent多轮调用是史诗级增强,但短Prompt场景收益有限,别盲目升级。

有实测数据的兄弟欢迎评论区对线,一起把调参玄学变成工程科学。




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0