闲社
标题:
LLM.int8()之后,INT4量化成为部署新宠?实测数据说话
[打印本页]
作者:
hao3566
时间:
昨天 21:02
标题:
LLM.int8()之后,INT4量化成为部署新宠?实测数据说话
兄弟们,今天不聊虚的,直接上干货。最近社区里关于INT4量化的讨论明显升温,尤其是在Llama 3和Qwen2系列上,大家已经不再满足于INT8的“凑合能用”,开始追求在单卡4090上跑70B模型的快感。
先说结论:**INT4 AWQ/GPTQ方案目前是社区部署的主流,但精度损失问题依然存在。**
具体来看,我用Qwen2-72B-Instruct做了一组对比测试(基于vLLM后端):
1. **显存占用**:FP16需要140GB+,INT8(W8A8)降到72GB,而INT4(AWQ)直接压缩到**40GB左右**。这意味着双卡3090/4090就能流畅跑起来,成本直接砍半。
2. **推理速度**:在批量大小为1的在线场景下,INT4的TTFT(首Token延迟)比INT8快了约**15%**,主要得益于更少的内存带宽占用。
3. **精度表现**:在GSM8K数学基准上,INT4 AWQ相比FP16下降约**2.3%**,但在代码生成(HumanEval)上几乎无损(<1%)。
**特别提醒一个坑**:最近很多新模型(比如Llama 3.1)原生支持了**FP8**,但FP8在4090/消费级显卡上并没有Tensor Core加速,实际速度反而不如INT4。建议在A100/H100上才优先考虑FP8,消费级直接上INT4更实在。
**给新手的建议**:如果你刚入门,别直接上GPTQ,那个校准时间太长。先用**AWQ**,它的推理内核优化更好,配合`flash-attn`,对长文本场景更友好。工具直接用`llama.cpp`的`convert-hf-to-gguf.py`,落地最快。
大家最近在量化哪个模型?遇到精度崩坏的case欢迎贴出来一起讨论。
欢迎光临 闲社 (https://www.xianshe.com/)
Powered by Discuz! X5.0