模型介绍
中文整理DeepSeek-R1 模型卡片
模型用途
DeepSeek-R1 是深度求索公司推出的第一代推理模型,包含 DeepSeek-R1-Zero 和 DeepSeek-R1 两个版本。该系列模型专注于数学、代码和推理任务,通过大规模强化学习训练,在推理能力上达到与 OpenAI-o1 相当的水平。
主要能力
模型具备自我验证、反思和生成长链式思考(Chain-of-Thought)的能力。DeepSeek-R1-Zero 是首个通过纯强化学习而非监督微调验证大语言模型推理能力的研究成果。蒸馏后的较小模型在各项基准测试中也表现出色。
输入输出
输入为文本形式的用户指令或问题,输出为包含推理过程的文本回答。最大生成长度为 32,768 个词元,上下文长度支持 128K。
运行要求
DeepSeek-R1 和 DeepSeek-R1-Zero 均为混合专家模型,总参数 671B,激活参数 37B。蒸馏模型提供 1.5B、7B、8B、14B、32B、70B 等多个版本,分别基于 Qwen2.5 和 Llama3 系列微调而成。
基本用法
建议将温度参数设置在 0.5 至 0.7 之间,0.6 为推荐值,以避免无限重复或输出混乱。不要添加系统提示,所有指令应放在用户提示中。对于数学问题,建议在提示中加入“请逐步推理,并将最终答案放在 \boxed{} 中”。评估模型性能时,建议多次测试取平均值。为确保模型进行充分推理,建议在输出开头强制要求模型以“\ \n”开始思考过程。
限制
DeepSeek-R1-Zero 存在无限重复、可读性差和语言混合等问题。模型在某些查询下可能会跳过思考模式(即输出“\ \n\n\ ”),影响推理表现。
许可证
代码仓库和模型权重采用 MIT 许可证。DeepSeek-R1 系列支持商业使用,允许任何修改和衍生工作,包括用于训练其他大语言模型的蒸馏操作。其中 DeepSeek-R1-Distill-Qwen 系列基于 Qwen-2.5 系列(Apache 2.0 许可证),DeepSeek-R1-Distill-Llama-8B 基于 Llama3.1-8B-Base(Llama3.1 许可证),DeepSeek-R1-Distill-Llama-70B 基于 Llama3.3-70B-Instruct(Llama3.3 许可证)。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
