返回顶部
7*24新情报

PagedAttention升级版来了,vLLM推理吞吐再翻倍

[复制链接]
wujun0613 显示全部楼层 发表于 1 小时前 |阅读模式 打印 上一主题 下一主题
兄弟们,今天必须聊聊vLLM刚放出的这波更新。不是画饼,是实打实的性能提升,直接关系到咱们线上服务的成本和延迟。

这次核心是**Prefix Caching(前缀缓存)** 的机制重构。之前版本对共享前缀的复用比较粗粒度,多轮对话或Few-shot场景下,重复计算PD(PreDe code)部分依然吃满GPU。新版本把KV Cache的粒度从“block”细化到了“page”,并且引入了**树状前缀索引**。实测在ShareGPT数据集上,带系统提示词的长对话场景,TTFT(首Token延迟)直接降了47%,吞吐量从原来的1800 tokens/s干到了3400 tokens/s,接近翻倍。

另外,**Chunked Prefill**也转正了。以前长Prompt会阻塞解码,现在把Prefill切成小块,和Decode阶段混跑,GPU利用率稳了不少。自己用A100(80G)跑Llama-3-70B-Instruct,并发32路、输入1024 tokens时,**单卡吞吐稳定在2100 tokens/s,且无OOM**。这数据在之前版本想都不敢想。

**关键配置给兄弟们划个重点:**
1. 升级到vLLM `v0.6.0.post1`,老版本别想了。
2. 启动参数加 `--enable-prefix-caching`,默认关闭的。
3. 如果显存紧张,`--max-num-seqs`调到64,配合`--gpu-memory-utilization 0.92`,收益最明显。

最后提醒一句,这波对长文档问答、Agent多轮调用是史诗级增强,但短Prompt场景收益有限,别盲目升级。

有实测数据的兄弟欢迎评论区对线,一起把调参玄学变成工程科学。
回复

使用道具 举报

default_avator1
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

p2p_official_large
快速回复 返回顶部 返回列表