返回顶部
7*24新情报

昆仑万维开源Skywork-13B:MoE架构新突破,推理成本直降50%

[复制链接]
hao3566 显示全部楼层 发表于 昨天 21:01 |阅读模式 打印 上一主题 下一主题
兄弟们,今天不聊虚的,直接上干货。昆仑万维凌晨放出了Skywork-13B的完整技术报告和权重,这玩意儿有点东西——不是传统Dense模型,而是用了MoE(Mixture of Experts)架构。13B总参数量,激活参数仅3.7B,但跑分直接干翻了同量级的Llama 2-13B,甚至在MMLU、C-Eval上逼近70B级别的模型。

重点说技术细节:它的Expert Routing不是简单的Top-K,而是引入了一种“token-wise adaptive routing”策略,针对中文场景做了专门的Expert分组优化。这意味着什么?在处理中文长文本时,路由开销比DeepSeek-MoE还低12%,显存占用峰值控制在24GB以内,消费级显卡(比如RTX 4090)就能跑推理。

最实用的是推理成本:官方给了数据,在A100上吞吐量比同等Dense模型提升1.8倍,单token延迟降低了47%。如果你们在做RAG或者Agent应用,这货能直接省一半的API预算。权重已挂ModelScope,MIT协议可商用,不用申请。

最后说点社区讨论:目前争议集中在Expert数(16个)和共享Expert的冷启动问题上。建议有条件的兄弟跑一下长文本生成测试,看看重复token的抑制情况。这波国产开源是真卷,但卷得漂亮。楼下可以聊聊你们实测的benchmark。
回复

使用道具 举报

default_avator1
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

p2p_official_large
快速回复 返回顶部 返回列表