闲社服务运行正常AI智能体自动化平台

Ling-3.0-flash

inclusionAI/Ling-3.0-flash

发布机构inclusionAI

下载访问条件魔搭来源

Ling-3.0-flash 是下一代原生混合推理模型,总参数124B,激活参数5.1B。 混合线性架构:采用原生混合线性注意力架构,5:1交替堆叠Kimi Delta Attention(KDA)和门控MLA,配备细粒度对角门控和1/64稀疏MoE 高效推理:每个token仅激活5.1B参数,提供出色的推理、指令遵循和长上下文能力

文字对话推理思考
模型详情

模型介绍

中文整理

# Ling-3.0-flash 模型卡片

模型概述

Ling-3.0-flash 是下一代原生混合推理模型,总参数124B,激活参数5.1B。

## 主要能力

  • **混合线性架构**:采用原生混合线性注意力架构,5:1交替堆叠Kimi Delta Attention(KDA)和门控MLA,配备细粒度对角门控和1/64稀疏MoE
  • **高效推理**:每个token仅激活5.1B参数,提供出色的推理、指令遵循和长上下文能力
  • **Agent任务**:在Coding、General和Deep Research Agent任务上表现优异,支持10,000+交互训练环境
  • **长上下文**:支持256K上下文窗口,集成SGLang HiCache + Mooncake分层缓存架构,长输入场景下TTFT减少60%至80%以上

## 架构参数

  • 参数规模:总参数124B,激活参数5.1B
  • Transformer层:35层KDA + 7层门控MLA(5:1比例)
  • 密集层:2层
  • 路由专家:512个
  • 共享专家:1个
  • 激活专家:8个
  • 注意力头:32
  • 隐藏层大小:2560
  • 词表大小:157184
  • 上下文训练进度:8K → 32K → 256K

## 输入输出

  • **输入**:文本提示,支持最长256K上下文
  • **输出**:文本响应
  • **默认参数**:temperature=0.6, top p=0.95, top k=20
  • **思考模式**:默认启用

运行要求

  • **推荐硬件**:4× 141GB GPU(如H20-3e)或4-GPU Blackwell节点
  • **备选硬件**:80GB卡(如H100/H800)需使用--tp 8
  • **推理框架**:支持SGLang和vLLM

基本用法

使用SGLang启动服务(低延迟推荐配置):

使用vLLM启动服务:

客户端请求建议参数:temperature=0.6, top p=0.95, top k=20,并启用enable thinking以获得更好性能。

## 评估表现

模型在以下基准测试中表现强劲:

  • SWE-Bench系列(SWEBench Pro、SWE-Bench Multilingual)
  • Tau3-banking-AA
  • MCP-Atlas
  • SkillsBench
  • MiniAppBench
  • AntSWEBench
  • GDPval v2-AA
  • Terminal-Bench 2.1
  • Search-agent系列(WideSearch、Draco、BrowseComp)

同时在通用知识、数学推理、指令遵循和长上下文理解方面表现优异。

许可证

训练内容摘要文档已发布,请参阅官方训练内容文档了解具体的模型版本、训练内容范围和更新日期。该摘要仅涉及训练内容披露,不替代模型技术文档、使用条款或许可证。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部