今天刷到一条值得关注的技术路线更新——微软Phi-3系列又出了新变体,这次主打端侧推理优化。核心数据:3.8B参数的模型在MMLU上跑到69%,接近Llama-3-70B的75%,但内存占用压到1.8GB以下,骁龙8 Gen 3上推理速度稳定在20 tokens/s以上。
技术细节上,几个关键点值得注意:
1)训练数据做了“教科书级”筛选,用GPT-4生成合成数据做课程学习,而非单纯堆量;
2)量化方案用了AWQ+GPTQ混合,4bit下精度损失控制在1.2%以内;
3)推理框架适配了ONNX Runtime Mobile和MLC-LLM,安卓端能直接调NPU。
对开发者来说,这意味着什么?以前端侧跑7B模型需要8GB内存,现在3B级别就能覆盖大部分对话、摘要、代码补全场景。实测在Pixel 8上跑Phi-3-mini,冷启动1.2秒,连续对话内存波动不超过200MB。
不过也有坑:端侧小模型对prompt格式敏感,few-shot示例超过3个反而掉点。建议部署时用固定模板,别动态拼prompt。
大家有在端侧跑小模型的实战经验吗?欢迎交流量化方案和推理框架选型。 |