模型介绍
中文整理Emu3.5:原生多模态模型是通用世界学习器
模型用途
Emu3.5 是一个通用多模态预测模型,支持交错的图像文本生成和单图像生成任务。Emu3.5-Image 是专注于文本到图像和任意图像到图像任务的版本,在这些场景下能提供最佳性能。
主要能力
统一世界建模:联合预测视觉和语言的下一状态,实现连贯的世界建模和生成。端到端预训练:使用统一的下一个token预测目标对交错视觉语言序列进行训练。超大规模预训练:基于超过十万亿个来自视频帧和转录本的交错token进行预训练,捕捉时空结构。原生的多模态输入输出:无需模态适配器或任务特定头部即可处理和生成交错的视觉文本序列。强化学习后训练:大规模强化学习提升推理能力、组合性和生成质量。离散扩散适配:将顺序解码转换为双向并行预测,实现约20倍推理加速且无性能损失。多功能生成:擅长长时序视觉语言生成、任意到图像合成以及富含文本的图像创建。可泛化的世界建模:支持时空一致的世界探索和跨不同场景的开放世界具身操作。性能表现:在图像生成和编辑任务上与Gemini 2.5 Flash Image相当,在交错生成任务上表现更优。
输入输出
输入:文本提示词、参考图像(可选)、任务类型(t2i、x2i、howto、story、explore、vla)。输出:交错的图像文本序列、单个图像、视频可视化结果。
运行要求
推理需要高性能GPU配置。建议使用2个及以上GPU以获得更好的吞吐量。每个图像生成可能需要数分钟(未使用DiDA加速)。需要配置CUDA可见设备。需安装vLLM 0.11.0或更高版本以支持离线推理。
基本用法
环境配置:修改configs/config.py设置模型路径、VQ路径、任务模板、输入图像、采样参数和宽高比。运行推理:根据不同任务类型执行相应命令,protobuf输出保存至outputs/目录。可视化输出:使用可视化工具查看生成的protobuf文件,包括文本片段、生成帧和图像级思维链记录。Gradio演示:提供交互式界面支持文本到图像、任意到图像以及交错生成任务。
限制
两个模型均为纯下一个token预测器,未使用DiDA加速,每个图像生成可能需要数分钟。DiDA加速权重即将发布。
许可证
模型权重采用开源许可证发布。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
