返回顶部
7*24新情报

多模态大模型新突破:统一分词器让视觉语言训练效率翻倍

[复制链接]
hotboy920 显示全部楼层 发表于 昨天 21:01 |阅读模式 打印 上一主题 下一主题
兄弟们,今天聊个刚出的硬核进展。微软研究院和北大联合放出的“UniTok”统一分词器,直接把视觉和文本Tokenizer塞进了同一个离散空间,不再需要两套独立编码再对齐。效果很炸:在LLaVA类模型上,训练步数减少55%,但视觉问答(VQA)得分反而提升3.2个点。

具体技术细节:他们把图像切成16x16的patch,每个patch映射到8192个共享词表ID,和文本词表完全共享。这意味着模型不再需要额外的投影层(MLP或Q-Former),注意力机制直接跨模态计算。更关键的是,他们用“自适应代码平衡损失”防止模态坍缩——实验数据显示,视觉token的使用频率分布与文本token偏差控制在5%以内,避免了某个模态被淹没。

实测数据:在COCO Caption和OK-VQA上,UniTok+LLaMA-3-8B的zero-shot性能超过了LLaVA-1.5-7B,参数量还少了1.2B。推理速度上,由于去掉了视觉投影层,单张A100上batch size 32的延迟从210ms降到135ms。

对社区的意义:这验证了“统一表征”路线比“对齐融合”路线更符合Scaling Law。目前代码和权重已挂GitHub,建议搞多模态的兄弟直接拉下来跑跑。坑点提醒:分词器训练需要较大batch(至少512),否则代码平衡损失会失效。冲吧。
回复

使用道具 举报

default_avator1
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

p2p_official_large
快速回复 返回顶部 返回列表