模型介绍
中文整理DeepSeek-R1-0528 模型卡片
模型概述
DeepSeek-R1-0528是DeepSeek R1模型的次版本升级。在最新更新中,DeepSeek R1通过利用更多计算资源并在后训练中引入算法优化机制,显著提升了深度推理和推理能力。该模型在数学、编程和一般逻辑等各类基准评估中表现出色,整体性能已接近O3和Gemini 2.5 Pro等领先模型。
主要能力
深度推理能力:在处理复杂推理任务方面有显著提升。在AIME 2025测试中,准确率从此前的70%提升至87.5%。推理过程思考深度增强:在AIME测试集中,旧版本平均每题使用12K tokens,新版本平均使用23K tokens。
幻觉率降低:相比旧版本,幻觉率有所降低。
函数调用支持:增强了函数调用功能。
编程体验:提供更好的vibe coding体验。
基准测试表现
数学基准:AIME 2024 Pass@1达91.4%,AIME 2025 Pass@1达87.5%,HMMT 2025 Pass@1达79.4%,CNMO 2024 Pass@1达86.9%。
编程基准:LiveCodeBench Pass@1达73.3%,Codeforces-Div1 Rating达1930,SWE VerifiedResolved达57.6%,Aider-Polyglot Acc.达71.6%。
通用基准:MMLU-Redux EM达93.4,MMLU-Pro EM达85.0,GPQA-Diamond Pass@1达81.0,Humanity's Last Exam Pass@1达17.7。
蒸馏版本DeepSeek-R1-0528-Qwen3-8B
该模型从DeepSeek-R1-0528蒸馏链式思考到Qwen3 8B Base,在开源模型中于AIME 2024达到最先进性能,比Qwen3 8B提升10.0%,与Qwen3-235B-thinking性能相当。
输入输出格式
最大生成长度为64K tokens。基准测试采样使用温度0.6,top-p值0.95,每次查询生成16个响应以估算pass@1。
运行要求
如需本地运行,请访问DeepSeek-R1仓库获取详细信息。DeepSeek-R1-0528-Qwen3-8B模型架构与Qwen3-8B相同,但使用与DeepSeek-R1-0528相同的tokenizer配置。该模型可按与Qwen3-8B相同方式运行,但必须确保所有配置文件来自DeepSeek仓库而非Qwen3项目。
基本用法
在线使用:可通过DeepSeek官网chat.deepseek.com与DeepSeek-R1对话,并开启"DeepThink"按钮。
API服务:DeepSeek平台提供OpenAI兼容API,地址为platform.deepseek.com。
系统提示词:支持系统提示词。在DeepSeek网页和应用中,使用包含特定日期的系统提示词。
温度参数:在网页和应用环境中,温度参数设置为0.6。
许可证
本代码仓库采用MIT许可证。DeepSeek-R1模型的使用同样遵循MIT许可证。DeepSeek-R1系列(包括Base和Chat)支持商业使用和蒸馏。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
