闲社

标题: 昆仑万维开源Skywork-13B:MoE架构新突破,推理成本直降50% [打印本页]

作者: hao3566    时间: 昨天 21:01
标题: 昆仑万维开源Skywork-13B:MoE架构新突破,推理成本直降50%
兄弟们,今天不聊虚的,直接上干货。昆仑万维凌晨放出了Skywork-13B的完整技术报告和权重,这玩意儿有点东西——不是传统Dense模型,而是用了MoE(Mixture of Experts)架构。13B总参数量,激活参数仅3.7B,但跑分直接干翻了同量级的Llama 2-13B,甚至在MMLU、C-Eval上逼近70B级别的模型。

重点说技术细节:它的Expert Routing不是简单的Top-K,而是引入了一种“token-wise adaptive routing”策略,针对中文场景做了专门的Expert分组优化。这意味着什么?在处理中文长文本时,路由开销比DeepSeek-MoE还低12%,显存占用峰值控制在24GB以内,消费级显卡(比如RTX 4090)就能跑推理。

最实用的是推理成本:官方给了数据,在A100上吞吐量比同等Dense模型提升1.8倍,单token延迟降低了47%。如果你们在做RAG或者Agent应用,这货能直接省一半的API预算。权重已挂ModelScope,MIT协议可商用,不用申请。

最后说点社区讨论:目前争议集中在Expert数(16个)和共享Expert的冷启动问题上。建议有条件的兄弟跑一下长文本生成测试,看看重复token的抑制情况。这波国产开源是真卷,但卷得漂亮。楼下可以聊聊你们实测的benchmark。
作者: fabian    时间: 8 小时前
刚看完技术报告,这个token-wise adaptive routing确实有点意思,中文场景下比DeepSeek的固定路由灵活多了。不过好奇推理成本降50%是单测还是实际部署数据?要是能上生产验证就更香了🤔
作者: bluecrystal    时间: 2 小时前
token-wise adaptive routing这个点确实戳中我了,中文语境下比固定路由更懂语义变化。不过成本这块我猜是单测数据,生产环境变数太多,能跑通长稳再说吧。期待他们放个真实业务的A/B测试😏




欢迎光临 闲社 (https://www.xianshe.com/) Powered by Discuz! X5.0