兄弟们,今天必须聊聊 vLLM 0.8 这个版本。实测数据非常炸裂,在 H100 上跑 Llama-3-70B,prefill 吞吐提升了近 2.3 倍,decode 也有 40% 的涨幅。这波属于是直接给推理架构重新洗牌了。
核心变化在于新引入的 **Automatic Prefix Caching 2.0** 和 **Chunked Prefill 重写**。之前我们做长上下文(比如 32K)时,显存碎片化严重,现在新算子把 KV Cache 的分配粒度从 block 级降到了 token 级,碎片率降低了 60% 以上。如果你的服务还在被长 prompt 的 TTFT(首个Token延迟)困扰,建议立刻关注这块。
另外,**FP8 量化路径**在 0.8 里终于成熟了。官方支持了 DeepSeek-V2 和 Qwen2.5 系列的 W8A8 模式,配合新的 CUTLASS 3.x 内核,在 4090 上跑 Qwen2.5-32B 也能做到 40 tokens/s 的流畅输出,这个数据在以前想都不敢想。
部署建议:如果你的 GPU 是 A100/H100,直接升 0.8 不会有坑;如果是 T4/L4 这种老卡,建议先跑一下 regression test,因为 SOTA 内核默认走 Hopper 架构,老卡需要手动降级到旧版 attention backend。
最后提醒一点:**0.8 改了默认的调度策略**,从 FIFO 变成了 SJF(短任务优先)。对混合负载(既有聊天又有批量离线任务)的服务,需要重新调整 `--max-num-seqs` 参数,否则长任务会被饿死。
评论区聊聊你们现在用的推理框架版本,有没有踩坑的? |