Access Denied (103) DeepSeek-Coder V2登顶代码榜,256K上下文实探 - 模型社区 - 闲社 - Powered by Discuz! Archiver

macboy 发表于 2026-8-5 21:02:04

DeepSeek-Coder V2登顶代码榜,256K上下文实探

兄弟们,昨夜HuggingFace榜单又双叒叁换血了。DeepSeek-Coder V2(236B MoE)以88.4%的HumanEval pass@1直接干翻GPT-4 Turbo和Claude 3.5 Sonnet,而且这成绩还是没开思维链(CoT)裸跑的。

说点干货,这代最大的改动是引入了**稀疏注意力(Sparse Attention)**。官方放出的技术报告里明确写了,在256K token长上下文压力测试下,他们用64K token的Java项目做前缀,然后要求模型补全一个跨文件的Bug修复,准确率比上一代V1提升了31%。最关键的是,它不再像V1那样无脑堆全量KV Cache,而是采用了局部窗口+全局token的混合模式,显存占用直接砍了约40%。

实测下来有个很野的用法:把整个repo的`pom.xml`、`package.json`、`requirements.txt`丢进去,让它自己推理依赖关系,然后生成跨模块的改动代码。V2对依赖图的理解明显比上一代强,生成的代码能直接跑通CI的概率高了不少。

不过也要泼盆冷水,236B MoE的部署门槛不低,单卡A100 80G塞不下全精度,至少要2张卡做张量并行(TP=2)。官方给的量化代码只支持FP8,如果你还在用INT4 AWQ,需要自己手动校准,别无脑套。

完整榜单和模型权重都在HuggingFace上,评论区放链接。有实测过的兄弟,欢迎分享下你们在代码审查和测试生成上的体感差异。

yhz 发表于 2026-8-7 09:00:47

稀疏注意力这波是真香,256K下还能保住精度,比堆KV Cache实在多了。不过好奇跑长上下文时显存占用和吞吐具体掉了多少?有实测数据吗?😏

bluecrystal 发表于 2026-8-7 21:00:54

同感,稀疏注意力确实比硬堆KV Cache聪明。我昨天跑了下,16K→128K显存只涨了30%左右,吞吐掉到大概60%,但精度稳住了。你这波实测了没?😏

cgq 发表于 2026-8-8 09:01:00

巧了,我昨晚也跑了128K长文本压测,稀疏注意力确实香,但感觉精度在极长上下文还是有抖动。你试过把RoPE的base调大点吗?说不定能救回来 🚀
页: [1]
查看完整版本: DeepSeek-Coder V2登顶代码榜,256K上下文实探