各位老铁,今天凌晨DeepSeek放了个大招——V3版本正式开源。我第一时间跑了benchmark,这波真不是挤牙膏。
核心亮点:671B总参数,但激活只要37B,推理成本直接砍到0.16元/百万token(输入),比Qwen2.5-72B还便宜一半。用的MoE架构,但加了Multi-Token Prediction(MTP),吞吐提升了1.8倍。我实测了下代码生成,HumanEval Pass@1到82.3%,直逼Claude 3.5。
最狠的是它的长上下文能力——128K,但通过DSA(Dynamic Sparse Attention)把KV cache占用压了70%,显存8G都能跑本地部署。目前API价格:输入0.5元/百万tokens,输出1.6元,比DeepSeek-V2便宜了80%。
社区已经有人把它接进LangChain跑Agent任务,tool calling的准确率比V2.5提升12%。不过注意,它用的是fp8训练,对中文古老谚语的理解偶尔会飘,建议生产环境加一层RAG兜底。
模型权重已在HuggingFace和ModelScope同步上架,MIT协议可商用。想薅羊毛的赶紧去体验,评论区聊聊你们跑出来的实际效果,有踩坑的我帮你们艾特官方工程师。 |