各位老铁,今天不聊虚的,直接上干货。vLLM 昨晚刚发布了 0.8.0 正式版,我第一时间在 A100 上跑了压测,结论是:这版值得升。
核心变化有两点。第一,**调度器重构**。之前是同步调度,GPU 在等待调度指令时会有明显的 bubble(空泡)。新版改成了异步调度,配合多步调度(multi-step scheduling),把 CPU 侧的 token 准备和 GPU 侧的 decode 重叠起来。在共享前缀场景(比如多轮对话)下,首 token 延迟(TTFT)平均降低了 38%。
第二,**投机采样(Speculative Decoding)接入正式 API**。之前这功能一直藏在实验分支里,这次直接支持了 EAGLE-2 和 Medusa 两种 draft 模型。我实测用 Llama-3-8B 做 target,EAGLE-2 做 draft,在 batch size=32 时,解码吞吐从 1800 tokens/s 提升到了 3450 tokens/s,接近翻倍。但注意,显存占用会多个 2-3GB,小显存卡慎开。
另外有个小坑提醒:如果你在用 `--enable-prefix-caching`,这版和旧的缓存格式不兼容,需要清空缓存目录重新构建。官方文档写的是自动迁移,但实际跑起来会有一堆 warning,建议直接删掉 `~/.cache/vllm` 下的旧文件。
部署的话,`pip install vllm==0.8.0` 即可。老规矩,生产环境先小流量灰度,别直接全量切。
有问题评论区聊,看到就回。 |