闲社服务运行正常AI智能体自动化平台

DeepSeek-V3.1

deepseek-ai/DeepSeek-V3.1

发布机构深度求索(DeepSeek)已核实

下载访问条件国内镜像可用

DeepSeek-V3.1 是一个混合模型,同时支持思考模式和非思考模式。与前一版本相比,此次升级在多个方面带来改进: 混合思考模式:通过更改聊天模板,一个模型即可支持思考模式和非思考模式。 更智能的工具调用:通过后训练优化,模型在工具使用和智能体任务方面的性能显著提升。

文字对话
模型详情

模型介绍

中文整理

# DeepSeek-V3.1 模型卡片

模型概述

DeepSeek-V3.1 是一个混合模型,同时支持思考模式和非思考模式。与前一版本相比,此次升级在多个方面带来改进:

  • *混合思考模式**:通过更改聊天模板,一个模型即可支持思考模式和非思考模式。
  • *更智能的工具调用**:通过后训练优化,模型在工具使用和智能体任务方面的性能显著提升。
  • *更高的思考效率**:DeepSeek-V3.1-Think 实现了与 DeepSeek-R1-0528 相当的答案质量,同时响应更快。

## 技术架构

DeepSeek-V3.1 基于 DeepSeek-V3.1-Base 进行后训练。DeepSeek-V3.1-Base 是在原始 V3 基线检查点基础上,通过两阶段长上下文扩展方法构建,遵循原始 DeepSeek-V3 报告中的方法论。数据集已扩展,收集了额外的长文档并大幅扩展了两个训练阶段。32K 扩展阶段增加 10 倍至 630B tokens,128K 扩展阶段扩展 3.3 倍至 209B tokens。

此外,DeepSeek-V3.1 在模型权重和激活上均使用 **UE8M0 FP8 scale 数据格式**进行训练,以确保与微缩放数据格式的兼容性。

## 参数规格

  • 总参数:671B
  • 激活参数:37B
  • 上下文长度:128K

## 主要能力

  • 混合思考模式与非思考模式
  • 工具调用能力
  • 代码智能体支持
  • 搜索智能体支持
  • 长上下文处理(128K)

## 输入输出格式

模型支持非思考模式和思考模式两种聊天模板:

  • *非思考模式**:使用 `<|begin_of_text|>`、`<|end_of_text|>` 和 `<|reserved_200105|>` token
  • *思考模式**:前缀格式与 DeepSeek-R1 类似
  • *工具调用**:支持非思考模式下的工具调用格式
  • *搜索智能体**:在思考模式下支持搜索工具调用,用于处理需要访问外部或最新信息的复杂问题

运行要求

  • **mlp.gate.e score correction bias 参数必须以 FP32 精度加载和计算**
  • **确保 FP8 模型权重和激活使用 UE8M0 scale 格式**

许可证

本仓库及模型权重采用 MIT 许可证。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部