闲社服务运行正常AI智能体自动化平台

Qwen3-Coder-Next-Base

Qwen/Qwen3-Coder-Next-Base

发布机构阿里云通义千问(Qwen)已核实

下载访问条件国内镜像可用

Qwen3-Coder-Next-Base Qwen3-Coder-Next-Base是一款开源语言模型,专为编码代理和本地开发场景设计。 高级架构:集成混合注意力机制与高度稀疏的专家混合(MoE)结构,支持高吞吐量处理和超长上下文建模。

文字对话
模型详情

模型介绍

中文整理

Qwen3-Coder-Next-Base

模型用途

Qwen3-Coder-Next-Base是一款开源语言模型,专为编码代理和本地开发场景设计。

主要能力

高级架构:集成混合注意力机制与高度稀疏的专家混合(MoE)结构,支持高吞吐量处理和超长上下文建模。

数据基础:在高度多样化、广泛覆盖的语料库上进行训练,原生支持256K上下文长度,涵盖370多种语言,为后续训练预留了充足的提升空间。

代理编码能力:采用精心设计的训练方案,具备强大的工具调用、支架与模板适配、错误检测与恢复能力,可作为可靠编码代理的坚实基础。

模型规格

类型:因果语言模型

训练阶段:预训练

参数总量:80B(激活参数3B)

非嵌入参数:79B

隐藏维度:2048

层数:48

混合布局结构:12 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))

门控注意力机制

注意力头数量:Q使用16个,KV使用2个

头维度:256

旋转位置嵌入维度:64

门控DeltaNet机制

线性注意力头数量:V使用32个,QK使用16个

头维度:128

专家混合配置

专家总数:512

激活专家数:10

共享专家数:1

专家中间维度:512

上下文长度:原生支持262,144个token

输入输出

输入:文本形式的代码或自然语言指令

输出:代码补全、代码生成、错误修复等文本响应

运行要求

具体硬件要求和推理性能请参考官方博客、GitHub及文档。

基本用法

为获得最佳性能,建议采用以下采样参数:

temperature=1.0

top_p=0.95

top_k=40

限制

本模型仅支持非思考模式,不会在输出中生成思维过程块。设置enable thinking=False不再是必需操作。

许可证

如需引用本工作,请参照相关引用规范。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部