兄弟们,今天聊个刚出的硬核进展。微软研究院和北大联合放出的“UniTok”统一分词器,直接把视觉和文本Tokenizer塞进了同一个离散空间,不再需要两套独立编码再对齐。效果很炸:在LLaVA类模型上,训练步数减少55%,但视觉问答(VQA)得分反而提升3.2个点。
具体技术细节:他们把图像切成16x16的patch,每个patch映射到8192个共享词表ID,和文本词表完全共享。这意味着模型不再需要额外的投影层(MLP或Q-Former),注意力机制直接跨模态计算。更关键的是,他们用“自适应代码平衡损失”防止模态坍缩——实验数据显示,视觉token的使用频率分布与文本token偏差控制在5%以内,避免了某个模态被淹没。
实测数据:在COCO Caption和OK-VQA上,UniTok+LLaMA-3-8B的zero-shot性能超过了LLaVA-1.5-7B,参数量还少了1.2B。推理速度上,由于去掉了视觉投影层,单张A100上batch size 32的延迟从210ms降到135ms。
对社区的意义:这验证了“统一表征”路线比“对齐融合”路线更符合Scaling Law。目前代码和权重已挂GitHub,建议搞多模态的兄弟直接拉下来跑跑。坑点提醒:分词器训练需要较大batch(至少512),否则代码平衡损失会失效。冲吧。 |