模型介绍
中文整理# DeepSeek-V3.1 模型卡片
模型概述
DeepSeek-V3.1 是一个混合模型,同时支持思考模式和非思考模式。与前一版本相比,此次升级在多个方面带来改进:
- *混合思考模式**:通过更改聊天模板,一个模型即可支持思考模式和非思考模式。
- *更智能的工具调用**:通过后训练优化,模型在工具使用和智能体任务方面的性能显著提升。
- *更高的思考效率**:DeepSeek-V3.1-Think 实现了与 DeepSeek-R1-0528 相当的答案质量,同时响应更快。
## 技术架构
DeepSeek-V3.1 基于 DeepSeek-V3.1-Base 进行后训练。DeepSeek-V3.1-Base 是在原始 V3 基线检查点基础上,通过两阶段长上下文扩展方法构建,遵循原始 DeepSeek-V3 报告中的方法论。数据集已扩展,收集了额外的长文档并大幅扩展了两个训练阶段。32K 扩展阶段增加 10 倍至 630B tokens,128K 扩展阶段扩展 3.3 倍至 209B tokens。
此外,DeepSeek-V3.1 在模型权重和激活上均使用 **UE8M0 FP8 scale 数据格式**进行训练,以确保与微缩放数据格式的兼容性。
## 参数规格
- 总参数:671B
- 激活参数:37B
- 上下文长度:128K
## 主要能力
- 混合思考模式与非思考模式
- 工具调用能力
- 代码智能体支持
- 搜索智能体支持
- 长上下文处理(128K)
## 输入输出格式
模型支持非思考模式和思考模式两种聊天模板:
- *非思考模式**:使用 `<|begin_of_text|>`、`<|end_of_text|>` 和 `<|reserved_200105|>` token
- *思考模式**:前缀格式与 DeepSeek-R1 类似
- *工具调用**:支持非思考模式下的工具调用格式
- *搜索智能体**:在思考模式下支持搜索工具调用,用于处理需要访问外部或最新信息的复杂问题
运行要求
- **mlp.gate.e score correction bias 参数必须以 FP32 精度加载和计算**
- **确保 FP8 模型权重和激活使用 UE8M0 scale 格式**
许可证
本仓库及模型权重采用 MIT 许可证。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
