模型介绍
中文整理# Ling-3.0-tiny 模型卡片
模型概述
Ling-3.0-tiny 是一款轻量级混合推理 MoE 模型,总参数 7.9B,每个 token 激活参数仅 1.3B。模型设计目标是在低推理成本下提供强大的推理和代理能力,使先进模型能力更易于在本地和资源受限环境中部署使用。
## 主要能力
- *高效混合线性架构**:采用 3:1 交替堆叠的 KDA(Kimi Delta Attention)和 MLA(Multi-Head Latent Attention)结构,每 4 层块包含 3 个 KDA 层和 1 个 MLA 层。稀疏 MoE FFN 包含 128 个路由专家,每个 token 激活 8 个路由专家和 1 个共享专家,在长上下文建模能力、参数效率和计算成本之间取得平衡。
- *原生混合推理**:支持快速响应和多步推理两种模式,思考模式可通过请求配置开关。模型在通用代理任务、编码、数学和科学推理、指令遵循等方面表现均衡。
- *本地和边缘部署**:已在 NVIDIA DGX Spark、Apple Silicon MacBook 和 Mac mini 上验证运行,无需数据中心级 GPU 即可完成推理和代理任务。
## 性能指标
在 Artificial Analysis 测试中,模型在 Intelligence Index v4.1.1 得分 25,Agentic Index 得分 16。输出速度超过 160 tokens/s,500 token 响应端到端延迟约 18 秒。
## 输入输出
支持文本输入,可配置思考模式开关。默认启用思考模式,可通过 chat template 参数 {"enable thinking": false} 禁用。支持最长 256K 上下文(通过 YaRN 扩展)。
运行要求
- *硬件支持**:NVIDIA DGX Spark、Apple Silicon MacBook、Mac mini,以及 141GB 级 GPU(如 H20-3e)或单 GPU Blackwell 节点。
- *内存需求**:8K 上下文长度下峰值内存约 8.34 GiB。
- *推荐采样参数**:temperature=1.0,top_p=0.95,top_k=20。
- *推理框架**:支持 SGLang、vLLM 和 Ollama(仅支持 Apple Silicon MLX 后端)。
基本用法
模型权重提供 BF16、FP8 和 INT4 三种格式,适用于不同硬件和部署场景。思考模式默认由 chat template 和 ling3 reasoning parser 启用,可按请求禁用。
许可证
训练内容摘要文档已公开发布,涵盖模型版本、训练内容范围、摘要版本和更新日期。具体许可条款请参阅训练内容摘要文档。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
