【事件概述】
上海人工智能实验室 InternLM 团队公开 InternLumina-U2 推理代码。这是一款把文本、图像、视频与 3D 放进同一离散表示框架的统一多模态模型,单一模型面向文本问答、文生图、图像理解、指令图像编辑、视频理解和 3D 理解六类任务。当前公开范围是推理代码与 NVIDIA GPU 路径,后续又补充了昇腾 NPU 分支说明;模型权重、训练代码和完整技术报告尚未发布。
【模型与开发者】
模型:InternLumina-U2
开发者:上海人工智能实验室 Intern Lumina U2 Team / InternLM
官方首次公开日期:2026 年 9 月 1 日
架构:16B 总参数、约 1B 激活参数的 MoE 扩散语言模型
视觉表示:基于 AToken 的 8 码本全离散表示
许可:主仓库为 Apache License 2.0;其中 AToken 派生部分沿用 Apple 原许可
日期核对说明:官方 README 的新闻栏只标注“2026-08”,但 GitHub 官方仓库元数据和首次提交均记录在 2026-09-01,Hugging Face 官方组织下的占位模型仓库也创建于同日。本文采用可核对的首次公开时间,并明确不把 9 月 3 日补充昇腾分支说明误写成模型首次发布。
【关键能力与改动】
1. 六类任务共用一个模型:文本问答、文生图、图像理解、图像编辑、视频理解和 3D 理解不再分别依赖完全独立的模型栈,而是通过同一主干与离散 token 接口处理。
2. 8 码本视觉表示:AToken 为每个视觉位置分配 8 个互补码本,用于承载纹理、画面文字、几何与高频细节。输入端把各码本嵌入拼接后投影成一个主干 token,不通过增加序列长度来扩充单个位置的表示容量。
3. 空间并行、码本深度自回归:扩散语言模型主干并行去噪多个被遮蔽的空间位置,随后多码本 AR 头按码本顺序预测同一位置的 8 个代码,结合并行空间预测与码本内部顺序建模。
4. LLaDA-2.0 MoE 主干:官方把 LLaDA-2.0 的 16B-A1B 稀疏专家结构、块扩散目标和语言能力扩展到统一视觉任务。约 1B 激活参数描述的是单步计算稀疏度,不等于模型只需要存放 1B 权重。
5. NVIDIA 与昇腾双硬件路径:主分支面向 CUDA,昇腾支持位于独立分支。官方称通过融合算子、HSDP 分片和梯度检查点对昇腾千卡训练做了优化,但这属于发布方结果,尚待技术报告与第三方复核。
6. 视觉数据预编码:代码包含把图片转成离散 token 的工具;3D 路径可用 Blender 渲染 64 个彩色和深度视角,再反投影到体素网格后交给 AToken。预编码 token 可以重复使用,减少相同素材的重复处理。
【官方初步评测怎么看】
仓库列出 ChartQA、CharXiv-DQ、MathVision、DynaMath、HallusionBench、VideoMME、MVBench、3D MM-Vet、TIIF-Bench、DPG-Bench 与 ImgEdit 等结果,覆盖文档、数学、幻觉、视频、3D、图像生成和编辑。官方特别把这些成绩标为 preliminary、partial,完整比较表要等技术报告。因此这些数字只能视为项目方的早期结果,不能据此断言它在所有统一多模态任务上领先,也不应与测试设置不同的模型直接横向排名。
【适用对象】
现阶段主要适合研究统一多模态、离散视觉 tokenizer、扩散语言模型和跨 GPU/NPU 适配的研究者,以及希望提前阅读任务入口、数据格式和推理管线的工程团队。它暂不适合希望下载权重后立即搭建生产服务的普通开发者,因为官方模型检查点还未公开。
【实际影响】
统一模型的价值在于减少“理解用 VLM、生成用扩散模型、视频与 3D 再各接一套系统”的接口割裂。若后续权重兑现,研究者可以在同一 token 空间里分析图像生成与理解是否互相促进,也能测试文档、视频和 3D 表示能否共用一套主干。
本轮发布的直接价值更多是架构与工程透明度,而不是一个可立即商用的下载包。代码已经展示统一驱动脚本、各任务入口、视觉 tokenizer 和硬件分支,但没有模型权重就无法复现官方输出;这点决定了项目当前更接近研究预告与代码先行发布。
【部署条件】
官方测试环境为 Python 3.11、PyTorch 2.6.0、CUDA 12.4 与 flash-attn 2.7.2。图像、视频和 3D 的编解码都依赖 AToken,因此需要 FlashAttention;纯文本生成不需要视觉 tokenizer。代码导入阶段会初始化注意力和 MoE 算子,官方说明需要可见 GPU。根驱动脚本是单进程设计,一次运行一个请求,不会自动把批次切分到多张 GPU。
低层 `generate` 是块扩散接口,不能简单照搬 Transformers 的 `generate(max_length=...)`。项目提供 `infer_t2i_sft.py`、`infer_mmu_sft.py`、`infer_video_sft.py` 和 `infer_3d_sft.py` 等入口,正式使用应遵循各任务脚本及与检查点配套的系统提示。
【限制与使用提醒】
第一,当前官方仓库只有推理代码。GitHub README 与 Hugging Face 页面均表明模型权重尚未发布,训练代码和技术报告也在后续路线图中。任何声称现在已经可以从官方页面完整下载并复现模型的说法都不准确。
第二,16B 总参数、1B 激活参数并不等于低显存模型。完整权重、视觉 tokenizer、激活、长序列和生成过程都会占用显存;官方没有提供最低显存、推理速度或不同分辨率下的资源表,不能承诺消费级显卡可运行。
第三,现有评测是发布方提供的初步、局部结果,技术报告未出,训练数据、详细评测设置和消融实验还不完整。团队应等权重与报告发布后,在自己的中文、文档、视频、3D 和编辑任务上独立复测。
第四,代码会反序列化 `.pkl` 或 `.pt` token 文件。官方提醒旧格式可能使用受信任载荷模式,只应载入可信来源生成的文件;对外部 token 包应在隔离环境中审查,避免把它当普通无害素材。
第五,3D 原始资产路径依赖 Blender 与系统图形库,昇腾支持位于独立分支并要求匹配的 CANN 与 `torch_npu`。NVIDIA 主分支与昇腾分支不能视作零成本互换,升级依赖后需要重新验证数值一致性。
第六,统一多模态并不消除幻觉、图片文字错误、编辑偏离、视频时序误判或 3D 几何误读。生产使用仍需内容审核、输入隔离、文件大小限制、生成结果标识和人工验收。
【官方来源】
官方 GitHub 仓库:https://github.com/InternLM/InternLumina-U2
官方 Hugging Face 页面:https://huggingface.co/internlm/InternLumina-U2
官方项目页:https://internlm.github.io/InternLumina-U2/ |