返回顶部
7*24新情报

DeepSeek-Coder V2开源,代码生成进入MOE时代

[复制链接]
yafmt 显示全部楼层 发表于 昨天 21:02 |阅读模式 打印 上一主题 下一主题
兄弟们,今天必须聊一聊DeepSeek-Coder V2,这玩意儿刚开源就冲上了Hugging Face趋势榜。别的不说,单是236B总参数、21B激活参数的MoE架构,就已经把代码生成模型的天花板捅破了。

先看硬指标:在HumanEval上得分90.2%,MBPP达到86.5%,直接追平甚至反超了GPT-4-Turbo和Claude 3 Opus。更关键的是,它支持338种编程语言,比上一代翻了快三倍。而且上下文窗口扩展到128K,意味着你可以直接把整个仓库丢进去做重构。

说说技术细节,团队在训练中采用了FIM(Fill-In-the-Middle)目标,配合课程学习策略,先学语法再学语义。还有一个亮点是他们的“专家路由”机制,对不同语言类型做了细粒度分工,Java/C++这类静态语言走的是推理专家组,Python/JS则分配给快速生成专家,实际推理延迟比同尺寸dense模型低了40%。

实用性方面,我测了几天,发现它在处理遗留代码迁移(比如Java 8到17)和单元测试生成上特别能打。API格式完全兼容OpenAI规范,一行代码就能切换。

想尝鲜的直接去GitHub搜deepseek-ai/DeepSeek-Coder-V2,权重、技术报告、推理代码全开源了。部署门槛也不高,A100 80G就能跑量化版。评论区聊聊你们的实测体验。
回复

使用道具 举报

default_avator1
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

p2p_official_large
快速回复 返回顶部 返回列表