模型详情
模型介绍
中文整理# Boogu-Image-0.1 模型卡片
模型用途
Boogu-Image-0.1 是一个 Apache-2.0 开源的统一图像生成与编辑模型系列,包含 Base、Turbo、Edit 和 Edit-Turbo 等变体。该模型提供高质量的文本到图像生成、快速生成、图像编辑以及中英文文本渲染能力。
## 主要能力
- *摄影与成像**:准确理解摄影提示词,生成具有自然光线、连贯构图和忠实细节的高质量图像,即使在复杂的现实场景中也能保持主体、背景和空间关系的连贯性。
- *文本渲染**:支持多种文本密集型设计场景,包括海报、邮票、文档、界面、品牌指南和手写板等,具有可读的结构、稳定的排版和强大的中英文双语渲染能力。
- *风格化生成**:处理多种风格化生成任务,包括微缩3D场景、中国风金色美学、闪耀奇幻视觉、动漫肖像和神话角色艺术等,不仅限于风格迁移,而是稳定、吸引人且符合提示词的创意生成。
- *图像编辑**:处理广泛的编辑任务,包括对象插入、替换和删除、属性和材质修改、背景和场景替换,以及跨艺术风格的艺术风格迁移,同时保持源主体和构图的连贯性。
- *海报设计与产品渲染**:生成个性化海报布局和清晰的产品可视化效果,具有一致的 branding、精致的排版以及产品级光线和构图。
- *精确文本编辑**:支持细粒度的图像内文本编辑,可替换、添加或删除中英文字符,并灵活适配不同的字体、粗细、颜色和布局以匹配不同的设计意图。
- *综合性能**:在多种场景和基准测试中表现出色,Boogu-Image-0.1 系列在 Boogu Arena 评估中位列开源和闭源系统前列。
## 输入输出
- *输入类型**:
- 文本到图像(T2I):文本提示词
- 文本引导的图像到图像(TI2I):文本提示词 + 参考图像
- *输出**:图像
- *支持分辨率**:1K、1.5K、2K
- *支持宽高比**:1:1、2:3、3:2、3:4、4:3、1:2、2:1、9:16、16:9
- *模型参数规模**:约 10B 参数
运行要求
- *测试环境**:Python 3.10、CUDA 12.6、PyTorch 2.7.1
- *显存推荐配置(文本到图像 1K)**:
- 12GB:非量化需启用 sequential cpu offload,量化需启用 model cpu offload 并使用 fp8 权重
- 16GB:非量化需启用 sequential cpu offload,量化需启用 model cpu offload 并使用 fp8 权重
- 24GB:非量化需启用 model cpu offload,量化需使用 fp8 权重并启用 model cpu offload
- 32GB:非量化需启用 model cpu offload,量化需使用 fp8 权重
- 40GB:Base 模型非量化需启用 model cpu offload,量化需使用 fp8 权重
- 80GB:Base 模型可直接运行
- *显存推荐配置(文本到图像 2K)**:
- 12GB:非量化需启用 sequential cpu offload,量化需启用 group offload 并使用 fp8 权重
- 16GB:非量化需启用 sequential cpu offload,量化需启用 model cpu offload 并使用 fp8 权重
- 24GB:非量化需启用 model cpu offload,量化需使用 fp8 权重并启用 model cpu offload
- 32GB:非量化需启用 model cpu offload,量化需使用 fp8 权重
基本用法
- *安装**:需先安装 Python 和 PyTorch(带 CUDA 支持),然后克隆仓库并安装依赖。
- *下载模型权重**:使用 Hugging Face CLI 下载模型权重到本地 models/ 目录。
- *运行推理**:通过 --model 参数指定本地模型路径进行推理。
- *模型变体说明**:
- Boogu-Image-0.1-Base:基础模型,擅长多样性和可控性,适合微调和下游开发,主要用于超密集文本渲染
- Boogu-Image-0.1-Edit:图像编辑和转换变体,支持 1K、1.5K、2K 分辨率
- Boogu-Image-0.1-Turbo:蒸馏变体,仅需 3~4 步推理,专注于高质量生成和逼真图像,同时保留双语文本渲染能力,支持 1K 分辨率
- Boogu-Image-0.1-Edit-Turbo:编辑模型的蒸馏变体
限制
- *世界知识差距**:对于需要丰富常识、领域知识、真实品牌或人物、地标、名人、产品或复杂上下文理解的任务,Boogu 与强大的闭源系统仍有明显差距。
- *图像到图像一致性**:对于需要严格保留输入主体、身份、布局或细节的编辑任务,Boogu 的图像到图像一致性仍不够稳定。由于图像到图像能力更侧重于摄影和文本生成应用,Boogu 在某些上下文生成场景中仍落后于 Seedream 5.0 和 Nano Banana Pro。
- *文本渲染稳定性**:Boogu 可以处理许多中英文文本场景,但长文本、密集排版、小字体和复杂设计布局仍可能产生拼写错误、字符缺失或布局偏移。文本渲染目前专注于中英文,其他语言未专门优化,可能明显退化。
- *复杂姿势下的身体结构**:在多人互动、遮挡、夸张动作或异常视角下,手、四肢和身体结构可能变得不自然或不一致。
- *小脸和小肢体**:由于使用开源 FLUX.1 VAE,重建损失相对较大,因此小脸、小肢体、眼睛和文本等细节仍可能显示伪影或不稳定。
- *发布范围有限**:由于资源限制、工程复杂性和发布边界,无法开源所有训练和系统细节。当前开源版本旨在平衡可复现性、可用性和可持续维护,同时为社区研究和改进提供可靠的起点。
许可证
本项目基于 Apache-2.0 许可证发布。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行环境
运行模型需要的设备、工具与依赖,以原作者说明为准。
授权范围
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
