闲社服务运行正常AI智能体自动化平台

DeepSeek-R1-0528

deepseek-ai/DeepSeek-R1-0528

发布机构深度求索(DeepSeek)已核实

下载访问条件国内镜像可用

DeepSeek-R1-0528是DeepSeek R1模型的次版本升级。通过在后训练阶段利用更多计算资源并引入算法优化机制,模型的深度推理和推理能力得到显著提升。该模型在数学、编程和一般逻辑等各类基准评估中表现出色,整体性能已接近O3和Gemini 2.5 Pro等领先模型。 相比前一版本,升级后的模型在处理复杂推理任务方面有显著改进。在AIME 2025测试中,模型准确率从前一版本的70%提升至87.5%。这一进步源于推理过程中思考深度的增强:在AIME测试集中,前一版本

文字对话推理思考编程开发
模型详情

模型介绍

中文整理

# DeepSeek-R1-0528 模型卡片

模型概述

DeepSeek-R1-0528是DeepSeek R1模型的次版本升级。通过在后训练阶段利用更多计算资源并引入算法优化机制,模型的深度推理和推理能力得到显著提升。该模型在数学、编程和一般逻辑等各类基准评估中表现出色,整体性能已接近O3和Gemini 2.5 Pro等领先模型。

## 主要能力

  • *推理能力提升**

相比前一版本,升级后的模型在处理复杂推理任务方面有显著改进。在AIME 2025测试中,模型准确率从前一版本的70%提升至87.5%。这一进步源于推理过程中思考深度的增强:在AIME测试集中,前一版本平均每个问题使用12K tokens,而新版本平均使用23K tokens。

  • *其他改进**

该版本还实现了更低的幻觉率、增强的函数调用支持,以及更好的vibe coding体验。

## 基准评估结果

  • *DeepSeek-R1-0528**

| 类别 | 基准测试 | 指标 | DeepSeek R1 | DeepSeek R1 0528 |

|------|----------|------|-------------|------------------|

| 通用 | MMLU-Redux | EM | 92.9 | 93.4 |

| 通用 | MMLU-Pro | EM | 84.0 | 85.0 |

| 通用 | GPQA-Diamond | Pass@1 | 71.5 | 81.0 |

| 通用 | SimpleQA | Correct | 30.1 | 27.8 |

| 通用 | FRAMES | Acc. | 82.5 | 83.0 |

| 通用 | Humanity's Last Exam | Pass@1 | 8.5 | 17.7 |

| 代码 | LiveCodeBench | Pass@1 | 63.5 | 73.3 |

| 代码 | Codeforces-Div1 | Rating | 1530 | 1930 |

| 代码 | SWE Verified | Resolved | 49.2 | 57.6 |

| 代码 | Aider-Polyglot | Acc. | 53.3 | 71.6 |

| 数学 | AIME 2024 | Pass@1 | 79.8 | 91.4 |

| 数学 | AIME 2025 | Pass@1 | 70.0 | 87.5 |

| 数学 | HMMT 2025 | Pass@1 | 41.7 | 79.4 |

| 数学 | CNMO 2024 | Pass@1 | 78.8 | 86.9 |

| 工具 | BFCL v3 MultiTurn | Acc | - | 37.0 |

| 工具 | Tau-Bench | Pass@1 | - | 53.5(航空)/63.9(零售) |

  • *DeepSeek-R1-0528-Qwen3-8B**

该模型通过将DeepSeek-R1-0528的思维链蒸馏到Qwen3 8B Base后训练得到。在开源模型中,该版本在AIME 2024上实现了最优性能,比Qwen3 8B提升10.0%,与Qwen3-235B-thinking性能相当。

| 模型 | AIME 24 | AIME 25 | HMMT Feb 25 | GPQA Diamond | LiveCodeBench |

|------|---------|---------|-------------|--------------|---------------|

| DeepSeek-R1-0528-Qwen3-8B | 86.0 | 76.3 | 61.5 | 61.1 | 60.5 |

## 输入输出

  • *输出长度**

所有模型的最大生成长度设置为64K tokens。

  • *采样参数**

对于需要采样的基准测试,使用温度0.6、top-p值0.95,每个查询生成16个响应以估算pass@1。

运行要求

  • *本地运行**

如需在本地运行DeepSeek-R1-0528,请访问DeepSeek-R1仓库获取详细信息。

  • *蒸馏版本运行**

DeepSeek-R1-0528-Qwen3-8B的模型架构与Qwen3-8B相同,但与DeepSeek-R1-0528共享相同的分词器配置。该模型可以采用与Qwen3-8B相同的方式运行。

基本用法

  • *在线使用**

可以通过DeepSeek官网与DeepSeek-R1进行对话,并开启"DeepThink"按钮。

也可以通过DeepSeek平台使用OpenAI兼容的API。

  • *系统提示词**

当前版本支持系统提示词。在DeepSeek官方网页和应用中,使用包含特定日期的系统提示词。

  • *温度参数**

在网页和应用环境中,温度参数设置为0.6。

许可证

本代码仓库采用MIT许可证。DeepSeek-R1模型的使用同样遵循MIT许可证。DeepSeek-R1系列(包括Base和Chat版本)支持商业使用和模型蒸馏。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部