闲社服务运行正常AI智能体自动化平台

HiDream-O1-Image

HiDream-ai/HiDream-O1-Image

发布机构HiDream-ai

下载访问条件魔搭来源

HiDream-O1-Image是一个原生统一的图像生成基础模型,基于像素级统一Transformer架构构建,无需外部VAE或分离的文本编码器。该模型在单一共享token空间中原生编码原始像素、文本和任务特定条件,支持文本到图像生成、图像编辑和主体驱动的个性化生成,最高分辨率达2048×2048。 像素级统一Transformer:单一端到端模型处理原始像素,无需VAE,无需分离的文本编码器。 多任务统一架构:支持文本到图像生成、长文本渲染、指令编辑、主体驱动个性化生成和故

文字对话
模型详情

模型介绍

中文整理

HiDream-O1-Image

模型用途

HiDream-O1-Image是一个原生统一的图像生成基础模型,基于像素级统一Transformer架构构建,无需外部VAE或分离的文本编码器。该模型在单一共享token空间中原生编码原始像素、文本和任务特定条件,支持文本到图像生成、图像编辑和主体驱动的个性化生成,最高分辨率达2048×2048。

主要能力

像素级统一Transformer:单一端到端模型处理原始像素,无需VAE,无需分离的文本编码器。

多任务统一架构:支持文本到图像生成、长文本渲染、指令编辑、主体驱动个性化生成和故事板生成。

推理驱动提示代理:内置“思考“代理,在生成前解决隐含知识、布局和文本渲染细节。

原生高分辨率:直接合成最高2048×2048分辨率,呈现清晰的细粒度细节。

高效能8B参数规模:仅用80亿参数即可达到或超越更大规模的开源DiT模型和领先闭源模型的性能。

输入输出

输入:文本提示、参考图像(可选,用于编辑或主体驱动任务)、编辑指令(可选)

输出:生成的图像

运行要求

需要CUDA支持的GPU进行推理。建议安装flash-attn以优化注意力计算。若无法安装flash-attn,需编辑models/pipeline.py第341行将"use_flash_attn"设为False。PyTorch 2.9.x版本不推荐使用。

基本用法

文本到图像生成:使用inference.py脚本,通过--prompt参数指定文本提示生成图像。

基于指令的图像编辑:提供单张参考图像和编辑指令,模型根据指令修改图像内容。

多参考主体驱动个性化:提供多张参考图像定义主体,将其置于新场景中,同时保持主体特征一致。

Dev模型推理:可通过设置--model type dev使用蒸馏版模型,推理步数从50步减少到28步。编辑任务建议使用flow match调度器。

许可证

本仓库代码和HiDream-O1-Image模型均采用MIT许可证授权。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部