模型介绍
中文整理Qwen3-Coder-Next-Base
模型用途
Qwen3-Coder-Next-Base是一款开源语言模型,专为编码代理和本地开发场景设计。
主要能力
高级架构:集成混合注意力机制与高度稀疏的专家混合(MoE)结构,支持高吞吐量处理和超长上下文建模。
数据基础:在高度多样化、广泛覆盖的语料库上进行训练,原生支持256K上下文长度,涵盖370多种语言,为后续训练预留了充足的提升空间。
代理编码能力:采用精心设计的训练方案,具备强大的工具调用、支架与模板适配、错误检测与恢复能力,可作为可靠编码代理的坚实基础。
模型规格
类型:因果语言模型
训练阶段:预训练
参数总量:80B(激活参数3B)
非嵌入参数:79B
隐藏维度:2048
层数:48
混合布局结构:12 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))
门控注意力机制
注意力头数量:Q使用16个,KV使用2个
头维度:256
旋转位置嵌入维度:64
门控DeltaNet机制
线性注意力头数量:V使用32个,QK使用16个
头维度:128
专家混合配置
专家总数:512
激活专家数:10
共享专家数:1
专家中间维度:512
上下文长度:原生支持262,144个token
输入输出
输入:文本形式的代码或自然语言指令
输出:代码补全、代码生成、错误修复等文本响应
运行要求
具体硬件要求和推理性能请参考官方博客、GitHub及文档。
基本用法
为获得最佳性能,建议采用以下采样参数:
temperature=1.0
top_p=0.95
top_k=40
限制
本模型仅支持非思考模式,不会在输出中生成思维过程块。设置enable thinking=False不再是必需操作。
许可证
如需引用本工作,请参照相关引用规范。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
