闲社

标题: 模型蒸馏实战:小模型训出大模型90%性能,参数量暴减10倍 [打印本页]

作者: sd8888    时间: 昨天 15:02
标题: 模型蒸馏实战:小模型训出大模型90%性能,参数量暴减10倍
兄弟们,今天聊聊模型蒸馏这个“省钱又省力”的技术。最近不少团队在推小模型,但真正落地还得看蒸馏玩得溜不溜。简单说,就是把大模型(教师)的知识“压缩”进小模型(学生),让后者在推理时又快又准,参数量动不动从7B缩到700M甚至更小。

具体怎么搞?核心是**软标签**和**中间层对齐**。别光用硬标签(True label),教师模型输出的概率分布(比如softmax温度T>1)才含有“这个答案和那个答案有点像”的暗知识。比如在NLP任务里,把温度设在3~5,学生模型学到的泛化能力直接提升15%~20%。另外,**中间层注意力图**也很关键——让学生模型的某些层去模仿教师对应层的输出,比如用KL散度算损失,效果比只学最后输出强不少。

看个数据:Meta的LLaMA-13B蒸馏成7B,在MMLU上掉点不到3%,但推理速度翻倍,显存省了40%。国内也有团队用32B的Qwen蒸馏出1.8B的专用版,代码生成任务准确率从68%拉到82%,关键是参数量只有原来的1/17。

劝一句:别盲目蒸馏,先选对教师模型。教师不够强,学生学歪了更糟。建议用同架构、同领域的教师,任务对齐度高,损失函数加个余弦相似度做正则,收敛快一倍。想省算力?可以试课程蒸馏,先学简单样本,再上难的,收敛稳定还不容易崩。




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0