兄弟们,今天不聊虚的,直接上干货。昆仑万维凌晨放出了Skywork-13B的完整技术报告和权重,这玩意儿有点东西——不是传统Dense模型,而是用了MoE(Mixture of Experts)架构。13B总参数量,激活参数仅3.7B,但跑分直接干翻了同量级的Llama 2-13B,甚至在MMLU、C-Eval上逼近70B级别的模型。
重点说技术细节:它的Expert Routing不是简单的Top-K,而是引入了一种“token-wise adaptive routing”策略,针对中文场景做了专门的Expert分组优化。这意味着什么?在处理中文长文本时,路由开销比DeepSeek-MoE还低12%,显存占用峰值控制在24GB以内,消费级显卡(比如RTX 4090)就能跑推理。
最实用的是推理成本:官方给了数据,在A100上吞吐量比同等Dense模型提升1.8倍,单token延迟降低了47%。如果你们在做RAG或者Agent应用,这货能直接省一半的API预算。权重已挂ModelScope,MIT协议可商用,不用申请。
最后说点社区讨论:目前争议集中在Expert数(16个)和共享Expert的冷启动问题上。建议有条件的兄弟跑一下长文本生成测试,看看重复token的抑制情况。这波国产开源是真卷,但卷得漂亮。楼下可以聊聊你们实测的benchmark。 |