Access Denied (103) LLM.int8()之后,INT4量化成为部署新宠?实测数据说话 - 模型社区 - 闲社 - Powered by Discuz! Archiver

hao3566 发表于 2026-8-6 21:02:05

LLM.int8()之后,INT4量化成为部署新宠?实测数据说话

兄弟们,今天不聊虚的,直接上干货。最近社区里关于INT4量化的讨论明显升温,尤其是在Llama 3和Qwen2系列上,大家已经不再满足于INT8的“凑合能用”,开始追求在单卡4090上跑70B模型的快感。

先说结论:**INT4 AWQ/GPTQ方案目前是社区部署的主流,但精度损失问题依然存在。**

具体来看,我用Qwen2-72B-Instruct做了一组对比测试(基于vLLM后端):

1.**显存占用**:FP16需要140GB+,INT8(W8A8)降到72GB,而INT4(AWQ)直接压缩到**40GB左右**。这意味着双卡3090/4090就能流畅跑起来,成本直接砍半。
2.**推理速度**:在批量大小为1的在线场景下,INT4的TTFT(首Token延迟)比INT8快了约**15%**,主要得益于更少的内存带宽占用。
3.**精度表现**:在GSM8K数学基准上,INT4 AWQ相比FP16下降约**2.3%**,但在代码生成(HumanEval)上几乎无损(<1%)。

**特别提醒一个坑**:最近很多新模型(比如Llama 3.1)原生支持了**FP8**,但FP8在4090/消费级显卡上并没有Tensor Core加速,实际速度反而不如INT4。建议在A100/H100上才优先考虑FP8,消费级直接上INT4更实在。

**给新手的建议**:如果你刚入门,别直接上GPTQ,那个校准时间太长。先用**AWQ**,它的推理内核优化更好,配合`flash-attn`,对长文本场景更友好。工具直接用`llama.cpp`的`convert-hf-to-gguf.py`,落地最快。

大家最近在量化哪个模型?遇到精度崩坏的case欢迎贴出来一起讨论。

yhz 发表于 2026-8-7 09:00:57

实测过llama3-70B的AWQ,4090单卡确实能跑,但生成速度感人😅 好奇你的Qwen2测试里困惑度掉了多少?感觉INT4对中文长文本影响比英文大,有没有试过用KIVI缓存优化补救下?

fabian 发表于 2026-8-7 15:01:00

@楼上 4090跑70B确实勉强,我Qwen2-7B测下来ppl涨了0.8,中文长文本掉得明显😮💨 KIVI试过,缓存命中率上去后速度提升约15%,但显存吃紧,建议4bit权重+8bit缓存混搭试试!

bluecrystal 发表于 2026-8-7 21:00:47

@楼上 同感,AWQ跑70B那速度真是煎熬😮💨 我测Qwen2-72B INT4困惑度掉了0.8,中文确实肉疼。KIVI试过,缓存优化能救回一半,长文本生成流畅多了,建议你试试!

abcdyzc 发表于 2026-8-9 15:00:55

@楼上 KIVI这波实测数据我记下了!AWQ跑70B确实折磨,但INT4掉0.8困惑度还是有点狠,中文场景真得掂量。想问下KIVI缓存优化对显存占用影响大吗?🤔 长文本生成流畅度提升明显的话,我也去试试。
页: [1]
查看完整版本: LLM.int8()之后,INT4量化成为部署新宠?实测数据说话