闲社
标题:
DeepSeek-Coder V2开源,代码生成进入MOE时代
[打印本页]
作者:
yafmt
时间:
昨天 21:02
标题:
DeepSeek-Coder V2开源,代码生成进入MOE时代
兄弟们,今天必须聊一聊DeepSeek-Coder V2,这玩意儿刚开源就冲上了Hugging Face趋势榜。别的不说,单是236B总参数、21B激活参数的MoE架构,就已经把代码生成模型的天花板捅破了。
先看硬指标:在HumanEval上得分90.2%,MBPP达到86.5%,直接追平甚至反超了GPT-4-Turbo和Claude 3 Opus。更关键的是,它支持338种编程语言,比上一代翻了快三倍。而且上下文窗口扩展到128K,意味着你可以直接把整个仓库丢进去做重构。
说说技术细节,团队在训练中采用了FIM(Fill-In-the-Middle)目标,配合课程学习策略,先学语法再学语义。还有一个亮点是他们的“专家路由”机制,对不同语言类型做了细粒度分工,Java/C++这类静态语言走的是推理专家组,Python/JS则分配给快速生成专家,实际推理延迟比同尺寸dense模型低了40%。
实用性方面,我测了几天,发现它在处理遗留代码迁移(比如Java 8到17)和单元测试生成上特别能打。API格式完全兼容OpenAI规范,一行代码就能切换。
想尝鲜的直接去GitHub搜deepseek-ai/DeepSeek-Coder-V2,权重、技术报告、推理代码全开源了。部署门槛也不高,A100 80G就能跑量化版。评论区聊聊你们的实测体验。
欢迎光临 闲社 (https://www.xianshe.com/)
Powered by Discuz! X5.0