兄弟们,今天聊聊模型量化这块硬骨头。最近刚把Llama 3 8B用GPTQ v2跑了一轮4bit量化,直接说干货:
1. 性能实测:在A100上,原始FP16推理延迟约220ms/token,4bit量化后降到75ms/token,接近3倍提升。模型体积也从16GB缩到5.2GB,消费级显卡都能部署。
2. 关键陷阱:量化后混合精度推理时,注意attention层要保留FP16!我踩过坑,全量化4bit后MMLU掉分超过4个点(原70.2降到66.1)。后来只量化FFN层,attention保持原精度,掉分控制在1.2以内,速度依然有2.5倍增益。
3. 工具链推荐:AutoGPTQ最新v0.7.0支持ExLlamaV2后端,比原版提速8-10%。但batch size超过1时要小心显存泄漏,建议设置`use_cuda_fp16=True`。
4. 新趋势:GPTQ v2的“自适量化”策略(按layer敏感度分配bits)值得关注,小模型(<7B)能用3bit无损,但建议从4bit起步。
最后提醒:量化后务必跑一遍下游任务(如代码生成的HumanEval),别只看PPL。欢迎跟帖分享你的量化踩坑经历! |