模型介绍
中文整理Emu3.5:原生多模态模型是世界学习者
Emu3.5 Team, BAAI
模型用途
Emu3.5是一个通用多模态预测模型,支持交错的图像-文本生成和单图像生成(T2I/X2I)任务。Emu3.5-Image是专注于T2I/X2I任务的模型版本,在这些场景下能提供最佳性能。
主要能力
统一世界建模:跨视觉和语言联合预测下一状态,实现连贯的世界建模和生成。
端到端预训练:使用统一的下一token预测目标对交错的视觉-语言序列进行训练。
大规模预训练:使用超过10万亿来自视频帧和转录本的交错token进行预训练,捕捉时空结构。
原生多模态输入输出:无需模态适配器或任务特定头部,即可处理和生成交错的视觉-文本序列。
强化学习后训练:大规模强化学习增强推理、组合性和生成质量。
离散扩散适配(DiDA):将顺序解码转换为双向并行预测,实现约20倍推理加速且无性能损失。
多功能生成:擅长长程视觉-语言生成、任意到图像(X2I)合成和富文本图像创建。
可泛化世界建模:支持时空一致的世界探索,以及跨多种场景的开放世界具身操作。
性能基准
在图像生成/编辑任务上与Gemini 2.5 Flash Image相当,在交错生成任务上表现更优。
输入输出
输入:支持文本提示、参考图像(用于X2I任务)、交错的视觉-文本序列。
输出:交错的图像-文本序列、单图像生成结果、protobuf格式的生成文件(包含文本段、生成帧、图像级思维链记录)。
运行要求
硬件:推荐使用≥2 GPU以获得更好的吞吐量。
环境:需要CUDA环境,vLLM 0.11.0或更高版本用于加速推理。
配置:需编辑configs/config.py设置模型路径、vq路径、任务类型(t2i/x2i/howto/story/explore/vla)、输入图像、采样参数(classifier-free guidance、temperature、top k/top p等)、宽高比(4:3、21:9、1:1、auto等)。
基本用法
环境配置:安装必要的依赖库,配置模型路径和任务参数。
运行推理:根据任务类型选择相应的配置命令,支持vLLM离线推理以获得4-5倍更快的端到端生成速度。
可视化输出:使用可视化工具将生成的protobuf文件转换为文本、图像和视频格式。
Gradio演示:提供交互式界面支持T2I/X2I任务和交错生成任务。
限制
两个模型均为纯下一token预测器,未使用DiDA加速,生成单张图像可能需要数分钟。
DiDA加速的模型权重即将发布。
高级图像解码器仍在开发中。
许可证
原始文档中未包含具体的许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
