模型详情
模型介绍
中文整理DeepSeek LLM 模型介绍
模型用途
DeepSeek LLM是一个高级语言模型,包含70亿参数。该模型从零开始训练,使用了包含英文和中文的2万亿token数据集。为促进研究工作,DeepSeek团队已将DeepSeek LLM 7B/67B Base和DeepSeek LLM 7B/67B Chat开源供研究社区使用。
主要能力
deepseek-llm-7b-base是一个70亿参数模型,采用多头注意力机制,在2万亿token数据上从零开始训练完成。
输入输出
模型支持文本补全功能。
运行要求
未提供具体的硬件要求信息。
基本用法
模型可用于文本补全任务。
限制和许可证
该代码仓库采用MIT许可证。DeepSeek LLM模型的使用受模型许可证约束,支持商业用途。详细许可证信息请参阅LICENSE-MODEL文件。
联系方式
如有问题,请提交issue或发送邮件至service@deepseek.com。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行环境运行模型需要的设备、工具与依赖,以原作者说明为准。
授权范围是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。