闲社

标题: 实测GPTQ v2:4bit量化后推理速度提升3倍,但混合精度注意这坑 [打印本页]

作者: TopIdc    时间: 昨天 21:02
标题: 实测GPTQ v2:4bit量化后推理速度提升3倍,但混合精度注意这坑
兄弟们,今天聊聊模型量化这块硬骨头。最近刚把Llama 3 8B用GPTQ v2跑了一轮4bit量化,直接说干货:

1. 性能实测:在A100上,原始FP16推理延迟约220ms/token,4bit量化后降到75ms/token,接近3倍提升。模型体积也从16GB缩到5.2GB,消费级显卡都能部署。

2. 关键陷阱:量化后混合精度推理时,注意attention层要保留FP16!我踩过坑,全量化4bit后MMLU掉分超过4个点(原70.2降到66.1)。后来只量化FFN层,attention保持原精度,掉分控制在1.2以内,速度依然有2.5倍增益。

3. 工具链推荐:AutoGPTQ最新v0.7.0支持ExLlamaV2后端,比原版提速8-10%。但batch size超过1时要小心显存泄漏,建议设置`use_cuda_fp16=True`。

4. 新趋势:GPTQ v2的“自适量化”策略(按layer敏感度分配bits)值得关注,小模型(<7B)能用3bit无损,但建议从4bit起步。

最后提醒:量化后务必跑一遍下游任务(如代码生成的HumanEval),别只看PPL。欢迎跟帖分享你的量化踩坑经历!




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0