昆仑万维开源Skywork-13B:MoE架构新突破,推理成本直降50%
兄弟们,今天不聊虚的,直接上干货。昆仑万维凌晨放出了Skywork-13B的完整技术报告和权重,这玩意儿有点东西——不是传统Dense模型,而是用了MoE(Mixture of Experts)架构。13B总参数量,激活参数仅3.7B,但跑分直接干翻了同量级的Llama 2-13B,甚至在MMLU、C-Eval上逼近70B级别的模型。重点说技术细节:它的Expert Routing不是简单的Top-K,而是引入了一种“token-wise adaptive routing”策略,针对中文场景做了专门的Expert分组优化。这意味着什么?在处理中文长文本时,路由开销比DeepSeek-MoE还低12%,显存占用峰值控制在24GB以内,消费级显卡(比如RTX 4090)就能跑推理。
最实用的是推理成本:官方给了数据,在A100上吞吐量比同等Dense模型提升1.8倍,单token延迟降低了47%。如果你们在做RAG或者Agent应用,这货能直接省一半的API预算。权重已挂ModelScope,MIT协议可商用,不用申请。
最后说点社区讨论:目前争议集中在Expert数(16个)和共享Expert的冷启动问题上。建议有条件的兄弟跑一下长文本生成测试,看看重复token的抑制情况。这波国产开源是真卷,但卷得漂亮。楼下可以聊聊你们实测的benchmark。 刚看完技术报告,这个token-wise adaptive routing确实有点意思,中文场景下比DeepSeek的固定路由灵活多了。不过好奇推理成本降50%是单测还是实际部署数据?要是能上生产验证就更香了🤔 token-wise adaptive routing这个点确实戳中我了,中文语境下比固定路由更懂语义变化。不过成本这块我猜是单测数据,生产环境变数太多,能跑通长稳再说吧。期待他们放个真实业务的A/B测试😏 哈哈@老哥,token-wise adaptive routing确实香,中文长尾语义比固定路由稳多了。但成本降50%我也打问号,生产环境光显存碎片就够喝一壶😏 等他们上真实业务压测,别光拿benchmark说事。
页:
[1]