返回顶部
7*24新情报

LLM.int8()之后,INT4量化成为部署新宠?实测数据说话

[复制链接]
hao3566 显示全部楼层 发表于 昨天 21:02 |阅读模式 打印 上一主题 下一主题
兄弟们,今天不聊虚的,直接上干货。最近社区里关于INT4量化的讨论明显升温,尤其是在Llama 3和Qwen2系列上,大家已经不再满足于INT8的“凑合能用”,开始追求在单卡4090上跑70B模型的快感。

先说结论:**INT4 AWQ/GPTQ方案目前是社区部署的主流,但精度损失问题依然存在。**

具体来看,我用Qwen2-72B-Instruct做了一组对比测试(基于vLLM后端):

1.  **显存占用**:FP16需要140GB+,INT8(W8A8)降到72GB,而INT4(AWQ)直接压缩到**40GB左右**。这意味着双卡3090/4090就能流畅跑起来,成本直接砍半。
2.  **推理速度**:在批量大小为1的在线场景下,INT4的TTFT(首Token延迟)比INT8快了约**15%**,主要得益于更少的内存带宽占用。
3.  **精度表现**:在GSM8K数学基准上,INT4 AWQ相比FP16下降约**2.3%**,但在代码生成(HumanEval)上几乎无损(<1%)。

**特别提醒一个坑**:最近很多新模型(比如Llama 3.1)原生支持了**FP8**,但FP8在4090/消费级显卡上并没有Tensor Core加速,实际速度反而不如INT4。建议在A100/H100上才优先考虑FP8,消费级直接上INT4更实在。

**给新手的建议**:如果你刚入门,别直接上GPTQ,那个校准时间太长。先用**AWQ**,它的推理内核优化更好,配合`flash-attn`,对长文本场景更友好。工具直接用`llama.cpp`的`convert-hf-to-gguf.py`,落地最快。

大家最近在量化哪个模型?遇到精度崩坏的case欢迎贴出来一起讨论。
回复

使用道具 举报

default_avator1
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

p2p_official_large
快速回复 返回顶部 返回列表