模型介绍
中文整理Emu3.5:原生多模态模型是世界学习者
Emu3.5 Team, BAAI
模型用途
Emu3.5是一个通用多模态预测模型,支持交错的图像-文本生成和单图像生成(T2I/X2I)任务。Emu3.5-Image是专注于T2I/X2I任务的模型版本,在这些场景下可获得最佳性能。
主要能力
统一世界建模:跨视觉和语言联合预测下一状态,实现连贯的世界建模和生成。
端到端预训练:使用统一的next-token预测目标对交错的视觉-语言序列进行训练。
大规模预训练:基于超过10万亿个来自视频帧和转录本的交错tokens进行预训练,捕捉时空结构。
原生多模态输入输出:处理和生成交错的视觉-文本序列,无需模态适配器或任务特定的头部。
强化学习后训练:大规模强化学习增强推理能力、组合性和生成质量。
离散扩散适配(DiDA):将顺序解码转换为双向并行预测,实现约20倍更快的推理速度且无性能损失。
多功能生成:擅长长程视觉-语言生成、任意图像合成(X2I)以及富文本图像创建。
可泛化世界建模:支持时空一致的世界探索和跨不同场景的开放世界具身操作。
性能基准:在图像生成/编辑任务上与Gemini 2.5 Flash Image(Nano Banana)相当,在交错生成任务上表现更优。
输入输出
输入:支持文本提示、参考图像(用于X2I任务)、交错的视觉-文本序列
输出:交错的图像-文本序列、单图像生成(文本到图像或任意图像到图像)
运行要求
环境配置:编辑configs/config.py设置模型路径、VQ路径、任务模板、输入图像、采样参数和宽高比
硬件建议:为获得更好吞吐量,建议使用≥2个GPU
推理速度:标准模型为纯next-token预测器,每个图像生成可能需要几分钟;DiDA加速版本即将推出
vLLM推理:使用vLLM 0.11.0可实现4-5倍更快的端到端生成
基本用法
任务类型:支持t2i(文本到图像)、x2i(任意图像到图像)、howto、story、explore、vla等任务
宽高比:T2I任务支持多种预设宽高比(4:3、16:9、1:1等)和自动模式
采样参数:支持classifier-free guidance、temperature、top k/top p等
可视化:生成的protobuf文件可转换为文本、图像和视频格式
限制
两个模型均为纯next-token预测器,不含DiDA加速,每个图像生成可能需要数分钟
DiDA加速的权重和推理代码尚未发布
许可证
未提供许可证相关信息
发布计划
已完成:推理代码(NTP版本)
待完成:高级图像解码器、离散扩散适配(DiDA)推理与权重
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
