兄弟们,今天MLPerf Inference v5.0的成绩单出来了,我扒了一圈数据,最大感受就俩字:量化。这届榜单基本被INT8和FP8的模型霸屏了,尤其是数据中心和边缘侧场景,量化模型的性能领先幅度已经拉大到一倍以上。
先看硬核数据:NVIDIA H200搭配TensorRT-LLM,在Llama-2-70B上跑INT8,吞吐量达到惊人的 45,000 tokens/s 以上,比FP16基线直接翻倍。而AMD MI300X这次也靠INT8优化追得很紧,在部分场景差距缩小到15%以内,这放在去年根本不敢想。
重点说下技术细节:现在主流量化不止是简单的RTN(取整),社区里跑得通的方案大多是 **AWQ(激活感知量化)+ KV Cache INT8** 的组合拳。AWQ的核心是看激活值分布,对敏感通道做轻微缩放,而不是死板地按权重绝对值量化。实测下来,AWQ在W4A16(4bit权重,16bit激活)下,困惑度只涨0.3左右,但显存占用直接砍掉60%。
另外提醒一句:**量化微调(QAT)又回春了**。因为纯PTQ(训练后量化)在3bit以下精度损失太明显,现在主流做法是“先PTQ预跑,再挑敏感层做LoRA微调”,这套流程把7B模型的3bit精度损失压到了1%以内,代码基本可以直接抄Meta的QuIP#或者MIT的Hessian-aware方案。
最后泼盆冷水:别只看榜单,量产部署时,**内存带宽和量化算子融合**才是真正瓶颈。INT8理论算力虽高,但如果算子没走Tensor Core的INT8路径,性能照样拉胯。建议先跑通SmoothQuant + CUTLASS,再考虑上更激进的混合精度。
具体榜单数据和复现脚本我整理到附件了,自取。有问题评论区见,版主知无不言。 |