模型介绍
中文整理# DeepSeek-R1-0528 模型卡片
模型概述
DeepSeek-R1-0528是DeepSeek R1模型的次版本升级。通过在后训练阶段利用更多计算资源并引入算法优化机制,模型的深度推理和推理能力得到显著提升。该模型在数学、编程和一般逻辑等各类基准评估中表现出色,整体性能已接近O3和Gemini 2.5 Pro等领先模型。
## 主要能力
- *推理能力提升**
相比前一版本,升级后的模型在处理复杂推理任务方面有显著改进。在AIME 2025测试中,模型准确率从前一版本的70%提升至87.5%。这一进步源于推理过程中思考深度的增强:在AIME测试集中,前一版本平均每个问题使用12K tokens,而新版本平均使用23K tokens。
- *其他改进**
该版本还实现了更低的幻觉率、增强的函数调用支持,以及更好的vibe coding体验。
## 基准评估结果
- *DeepSeek-R1-0528**
| 类别 | 基准测试 | 指标 | DeepSeek R1 | DeepSeek R1 0528 |
|------|----------|------|-------------|------------------|
| 通用 | MMLU-Redux | EM | 92.9 | 93.4 |
| 通用 | MMLU-Pro | EM | 84.0 | 85.0 |
| 通用 | GPQA-Diamond | Pass@1 | 71.5 | 81.0 |
| 通用 | SimpleQA | Correct | 30.1 | 27.8 |
| 通用 | FRAMES | Acc. | 82.5 | 83.0 |
| 通用 | Humanity's Last Exam | Pass@1 | 8.5 | 17.7 |
| 代码 | LiveCodeBench | Pass@1 | 63.5 | 73.3 |
| 代码 | Codeforces-Div1 | Rating | 1530 | 1930 |
| 代码 | SWE Verified | Resolved | 49.2 | 57.6 |
| 代码 | Aider-Polyglot | Acc. | 53.3 | 71.6 |
| 数学 | AIME 2024 | Pass@1 | 79.8 | 91.4 |
| 数学 | AIME 2025 | Pass@1 | 70.0 | 87.5 |
| 数学 | HMMT 2025 | Pass@1 | 41.7 | 79.4 |
| 数学 | CNMO 2024 | Pass@1 | 78.8 | 86.9 |
| 工具 | BFCL v3 MultiTurn | Acc | - | 37.0 |
| 工具 | Tau-Bench | Pass@1 | - | 53.5(航空)/63.9(零售) |
- *DeepSeek-R1-0528-Qwen3-8B**
该模型通过将DeepSeek-R1-0528的思维链蒸馏到Qwen3 8B Base后训练得到。在开源模型中,该版本在AIME 2024上实现了最优性能,比Qwen3 8B提升10.0%,与Qwen3-235B-thinking性能相当。
| 模型 | AIME 24 | AIME 25 | HMMT Feb 25 | GPQA Diamond | LiveCodeBench |
|------|---------|---------|-------------|--------------|---------------|
| DeepSeek-R1-0528-Qwen3-8B | 86.0 | 76.3 | 61.5 | 61.1 | 60.5 |
## 输入输出
- *输出长度**
所有模型的最大生成长度设置为64K tokens。
- *采样参数**
对于需要采样的基准测试,使用温度0.6、top-p值0.95,每个查询生成16个响应以估算pass@1。
运行要求
- *本地运行**
如需在本地运行DeepSeek-R1-0528,请访问DeepSeek-R1仓库获取详细信息。
- *蒸馏版本运行**
DeepSeek-R1-0528-Qwen3-8B的模型架构与Qwen3-8B相同,但与DeepSeek-R1-0528共享相同的分词器配置。该模型可以采用与Qwen3-8B相同的方式运行。
基本用法
- *在线使用**
可以通过DeepSeek官网与DeepSeek-R1进行对话,并开启"DeepThink"按钮。
也可以通过DeepSeek平台使用OpenAI兼容的API。
- *系统提示词**
当前版本支持系统提示词。在DeepSeek官方网页和应用中,使用包含特定日期的系统提示词。
- *温度参数**
在网页和应用环境中,温度参数设置为0.6。
许可证
本代码仓库采用MIT许可证。DeepSeek-R1模型的使用同样遵循MIT许可证。DeepSeek-R1系列(包括Base和Chat版本)支持商业使用和模型蒸馏。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
