闲社服务运行正常AI智能体自动化平台

Emu3.5-VisionTokenizer

BAAI/Emu3.5-VisionTokenizer

发布机构北京智源人工智能研究院(BAAI)已核实

已核对来源国内镜像可用

Emu3.5:原生多模态模型是世界学习者 Emu3.5是一个通用多模态预测模型,支持交错的图像-文本生成和单图像生成(T2I/X2I)任务。Emu3.5-Image是专注于T2I/X2I任务的模型版本,在这些场景下可获得最佳性能。 统一世界建模:跨视觉和语言联合预测下一状态,实现连贯的世界建模和生成。

图文理解图片生成
模型详情

模型介绍

中文整理

Emu3.5:原生多模态模型是世界学习者

Emu3.5 Team, BAAI

模型用途

Emu3.5是一个通用多模态预测模型,支持交错的图像-文本生成和单图像生成(T2I/X2I)任务。Emu3.5-Image是专注于T2I/X2I任务的模型版本,在这些场景下可获得最佳性能。

主要能力

统一世界建模:跨视觉和语言联合预测下一状态,实现连贯的世界建模和生成。

端到端预训练:使用统一的next-token预测目标对交错的视觉-语言序列进行训练。

大规模预训练:基于超过10万亿个来自视频帧和转录本的交错tokens进行预训练,捕捉时空结构。

原生多模态输入输出:处理和生成交错的视觉-文本序列,无需模态适配器或任务特定的头部。

强化学习后训练:大规模强化学习增强推理能力、组合性和生成质量。

离散扩散适配(DiDA):将顺序解码转换为双向并行预测,实现约20倍更快的推理速度且无性能损失。

多功能生成:擅长长程视觉-语言生成、任意图像合成(X2I)以及富文本图像创建。

可泛化世界建模:支持时空一致的世界探索和跨不同场景的开放世界具身操作。

性能基准:在图像生成/编辑任务上与Gemini 2.5 Flash Image(Nano Banana)相当,在交错生成任务上表现更优。

输入输出

输入:支持文本提示、参考图像(用于X2I任务)、交错的视觉-文本序列

输出:交错的图像-文本序列、单图像生成(文本到图像或任意图像到图像)

运行要求

环境配置:编辑configs/config.py设置模型路径、VQ路径、任务模板、输入图像、采样参数和宽高比

硬件建议:为获得更好吞吐量,建议使用≥2个GPU

推理速度:标准模型为纯next-token预测器,每个图像生成可能需要几分钟;DiDA加速版本即将推出

vLLM推理:使用vLLM 0.11.0可实现4-5倍更快的端到端生成

基本用法

任务类型:支持t2i(文本到图像)、x2i(任意图像到图像)、howto、story、explore、vla等任务

宽高比:T2I任务支持多种预设宽高比(4:3、16:9、1:1等)和自动模式

采样参数:支持classifier-free guidance、temperature、top k/top p等

可视化:生成的protobuf文件可转换为文本、图像和视频格式

限制

两个模型均为纯next-token预测器,不含DiDA加速,每个图像生成可能需要数分钟

DiDA加速的权重和推理代码尚未发布

许可证

未提供许可证相关信息

发布计划

已完成:推理代码(NTP版本)

待完成:高级图像解码器、离散扩散适配(DiDA)推理与权重

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

所选固定版本的完整仓库文件,包括模型权重、配置、分词器,以及作者提供的说明和其他文件。自动保留目录结构,不需要逐个选择或下载。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部