刚看到一份来自AI2的最新实验报告,信息量很大。他们用GPT-4o生成的50万条推理链数据,对Llama 3.1 8B做了两阶段蒸馏——先做logits对齐(KL散度损失,温度T=2),再做序列级蒸馏(交叉熵,权重0.7)。
关键发现:在GSM8K数学推理上,蒸馏后的8B模型达到89.3%,比原始模型提升31个百分点,甚至超过了GPT-4o的87.1%。但代价是——在开放式对话任务上,多样性下降明显,Distinct-2指标从0.72掉到0.54。
技术细节值得注意:他们发现只做logits蒸馏效果远不如加上CoT数据。教师模型的“错误推理链”反而比正确链更能提升学生鲁棒性,这颠覆了传统认知。另外,蒸馏时用LoRA(r=64)比全参数微调更稳定,显存占用降低60%。
实操建议:如果你要做垂直领域蒸馏,优先选教师模型在该领域的“失败案例”做数据增强,效果比纯正确答案好。但要注意,蒸馏后的模型在法律/医疗等高风险场景仍需人工校验。
大家怎么看?蒸馏是不是正在变成“用大模型养小模型,然后小模型反哺大模型”的循环? |