模型介绍
中文整理# Solar Open 2
模型用途
Solar Open 2是Upstage推出的250B-A15B开源权重大型语言模型,专为代理用例设计,包括办公效率提升、文档密集型工作和编程任务。
## 主要能力
代理专家:专为代理工作流程构建,支持工具调用、多步推理和端到端任务执行。在代理基准测试中与最强的开源权重模型竞争。
极低推理成本:250B参数的MoE模型,每个token仅激活15B参数。构建在混合注意力堆栈上,交替使用三个线性注意力层和一个softmax注意力层,以小模型的推理成本获得大模型的容量。
100万token上下文:线性注意力层在递归状态中内在编码token顺序,完全移除位置编码(NoPE),突破了RoPE外推限制。48层中仅12层保留KV缓存,将长上下文内存需求降低到同规模全softmax模型的约四分之一。
高效低成本训练:通过从Solar Open 1(102B)选择性权重迁移初始化——仅2.3%的权重在架构变更后保留,其余随机初始化——这提高了起点并加速了250B规模的早期收敛。
多语言支持:英语、韩语和日语。
## 架构规格
架构:混合注意力MoE(softmax + 线性注意力)
总参数:250B(250,287,794,944)
激活参数:15B(每token)
层数:48
隐藏层大小:4096
注意力模式:[Softmax, 线性×3] × 12
位置编码:NoPE(无旋转位置编码)
注意力头数量:Softmax注意力64个查询头/8个KV头,线性注意力64个查询头
专家数量:321(320个路由专家 + 1个共享专家)
激活专家数:8个路由专家(top-8)+ 1个共享专家
词表大小:196,608
上下文长度:100万token
预训练token数:约12万亿
支持语言:英语、韩语、日语
运行要求
最低配置:4块H200 GPU
推荐配置:8块H200 GPU
每块GPU需至少141GB显存(实际显存需求取决于上下文长度和服务设置)
基本用法
推理模式:使用reasoning effort="high"进行推理,使用reasoning effort="none"直接响应。推荐配置将推理块限制在131,072个token。max tokens限制完整响应(包括推理和最终答案),需留出足够空间。
工具调用:遵循标准OpenAI函数调用接口。使用--tool-call-parser solar open2和--enable-auto-tool-choice启动服务器。
推荐客户端生成设置:
reasoning effort:high(复杂推理和代理任务推荐)
temperature:1.0
top p:1.0
max tokens:最高256K(覆盖推理+输出预算)
多轮对话:在对话历史中保留之前的推理轨迹。默认think render option=preserved自动处理此问题。
限制
推理长度限制:高强度推理模式下,推理块最多131,072个token。max tokens需设置足够高(最高256K),否则推理轨迹可能过长导致答案被截断。
许可证
Solar Open 2采用Upstage Solar License分发。
衍生AI模型的关键要求(使用Solar Open 2创建/训练/微调/蒸馏/改进):
命名:模型名称需以"Solar"为前缀(如Solar-MyModel-v1)
归属:在相关公开材料中显著显示"Built with Solar"
通知:在衍生模型中附Upstage Solar License副本
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
