模型介绍
中文整理# Ling-3.0-flash 模型卡片
模型概述
Ling-3.0-flash 是下一代原生混合推理模型,总参数124B,激活参数5.1B。
## 主要能力
- **混合线性架构**:采用原生混合线性注意力架构,5:1交替堆叠Kimi Delta Attention(KDA)和门控MLA,配备细粒度对角门控和1/64稀疏MoE
- **高效推理**:每个token仅激活5.1B参数,提供出色的推理、指令遵循和长上下文能力
- **Agent任务**:在Coding、General和Deep Research Agent任务上表现优异,支持10,000+交互训练环境
- **长上下文**:支持256K上下文窗口,集成SGLang HiCache + Mooncake分层缓存架构,长输入场景下TTFT减少60%至80%以上
## 架构参数
- 参数规模:总参数124B,激活参数5.1B
- Transformer层:35层KDA + 7层门控MLA(5:1比例)
- 密集层:2层
- 路由专家:512个
- 共享专家:1个
- 激活专家:8个
- 注意力头:32
- 隐藏层大小:2560
- 词表大小:157184
- 上下文训练进度:8K → 32K → 256K
## 输入输出
- **输入**:文本提示,支持最长256K上下文
- **输出**:文本响应
- **默认参数**:temperature=0.6, top p=0.95, top k=20
- **思考模式**:默认启用
运行要求
- **推荐硬件**:4× 141GB GPU(如H20-3e)或4-GPU Blackwell节点
- **备选硬件**:80GB卡(如H100/H800)需使用--tp 8
- **推理框架**:支持SGLang和vLLM
基本用法
使用SGLang启动服务(低延迟推荐配置):
使用vLLM启动服务:
客户端请求建议参数:temperature=0.6, top p=0.95, top k=20,并启用enable thinking以获得更好性能。
## 评估表现
模型在以下基准测试中表现强劲:
- SWE-Bench系列(SWEBench Pro、SWE-Bench Multilingual)
- Tau3-banking-AA
- MCP-Atlas
- SkillsBench
- MiniAppBench
- AntSWEBench
- GDPval v2-AA
- Terminal-Bench 2.1
- Search-agent系列(WideSearch、Draco、BrowseComp)
同时在通用知识、数学推理、指令遵循和长上下文理解方面表现优异。
许可证
训练内容摘要文档已发布,请参阅官方训练内容文档了解具体的模型版本、训练内容范围和更新日期。该摘要仅涉及训练内容披露,不替代模型技术文档、使用条款或许可证。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
