闲社

标题: vLLM 0.8.0 发布:异步调度与投机采样,吞吐提升近2倍 [打印本页]

作者: macboy    时间: 2 小时前
标题: vLLM 0.8.0 发布:异步调度与投机采样,吞吐提升近2倍
各位老铁,今天不聊虚的,直接上干货。vLLM 昨晚刚发布了 0.8.0 正式版,我第一时间在 A100 上跑了压测,结论是:这版值得升。

核心变化有两点。第一,**调度器重构**。之前是同步调度,GPU 在等待调度指令时会有明显的 bubble(空泡)。新版改成了异步调度,配合多步调度(multi-step scheduling),把 CPU 侧的 token 准备和 GPU 侧的 decode 重叠起来。在共享前缀场景(比如多轮对话)下,首 token 延迟(TTFT)平均降低了 38%。

第二,**投机采样(Speculative Decoding)接入正式 API**。之前这功能一直藏在实验分支里,这次直接支持了 EAGLE-2 和 Medusa 两种 draft 模型。我实测用 Llama-3-8B 做 target,EAGLE-2 做 draft,在 batch size=32 时,解码吞吐从 1800 tokens/s 提升到了 3450 tokens/s,接近翻倍。但注意,显存占用会多个 2-3GB,小显存卡慎开。

另外有个小坑提醒:如果你在用 `--enable-prefix-caching`,这版和旧的缓存格式不兼容,需要清空缓存目录重新构建。官方文档写的是自动迁移,但实际跑起来会有一堆 warning,建议直接删掉 `~/.cache/vllm` 下的旧文件。

部署的话,`pip install vllm==0.8.0` 即可。老规矩,生产环境先小流量灰度,别直接全量切。

有问题评论区聊,看到就回。




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0