闲社服务运行正常AI智能体自动化平台

Emu3.5-Image

BAAI/Emu3.5-Image

发布机构北京智源人工智能研究院(BAAI)已核实

已核对来源国内镜像可用

Emu3.5:原生多模态模型是世界学习者 Emu3.5是一个通用多模态预测模型,支持交错的图像-文本生成和单图像生成(T2I/X2I)任务。Emu3.5-Image是专注于T2I/X2I任务的模型版本,在这些场景下能提供最佳性能。 统一世界建模:跨视觉和语言联合预测下一状态,实现连贯的世界建模和生成。

文字对话图文理解图片生成
模型详情

模型介绍

中文整理

Emu3.5:原生多模态模型是世界学习者

Emu3.5 Team, BAAI

模型用途

Emu3.5是一个通用多模态预测模型,支持交错的图像-文本生成和单图像生成(T2I/X2I)任务。Emu3.5-Image是专注于T2I/X2I任务的模型版本,在这些场景下能提供最佳性能。

主要能力

统一世界建模:跨视觉和语言联合预测下一状态,实现连贯的世界建模和生成。

端到端预训练:使用统一的下一token预测目标对交错的视觉-语言序列进行训练。

大规模预训练:使用超过10万亿来自视频帧和转录本的交错token进行预训练,捕捉时空结构。

原生多模态输入输出:无需模态适配器或任务特定头部,即可处理和生成交错的视觉-文本序列。

强化学习后训练:大规模强化学习增强推理、组合性和生成质量。

离散扩散适配(DiDA):将顺序解码转换为双向并行预测,实现约20倍推理加速且无性能损失。

多功能生成:擅长长程视觉-语言生成、任意到图像(X2I)合成和富文本图像创建。

可泛化世界建模:支持时空一致的世界探索,以及跨多种场景的开放世界具身操作。

性能基准

在图像生成/编辑任务上与Gemini 2.5 Flash Image相当,在交错生成任务上表现更优。

输入输出

输入:支持文本提示、参考图像(用于X2I任务)、交错的视觉-文本序列。

输出:交错的图像-文本序列、单图像生成结果、protobuf格式的生成文件(包含文本段、生成帧、图像级思维链记录)。

运行要求

硬件:推荐使用≥2 GPU以获得更好的吞吐量。

环境:需要CUDA环境,vLLM 0.11.0或更高版本用于加速推理。

配置:需编辑configs/config.py设置模型路径、vq路径、任务类型(t2i/x2i/howto/story/explore/vla)、输入图像、采样参数(classifier-free guidance、temperature、top k/top p等)、宽高比(4:3、21:9、1:1、auto等)。

基本用法

环境配置:安装必要的依赖库,配置模型路径和任务参数。

运行推理:根据任务类型选择相应的配置命令,支持vLLM离线推理以获得4-5倍更快的端到端生成速度。

可视化输出:使用可视化工具将生成的protobuf文件转换为文本、图像和视频格式。

Gradio演示:提供交互式界面支持T2I/X2I任务和交错生成任务。

限制

两个模型均为纯下一token预测器,未使用DiDA加速,生成单张图像可能需要数分钟。

DiDA加速的模型权重即将发布。

高级图像解码器仍在开发中。

许可证

原始文档中未包含具体的许可证信息。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部