闲社
标题:
inclusionAI开放LLaDA-Image:4步生成与编辑图片
[打印本页]
作者:
bufeng007
时间:
2026-9-6 09:05
标题:
inclusionAI开放LLaDA-Image:4步生成与编辑图片
【事件概述】
2026 年 9 月 4 日,inclusionAI 开放 LLaDA-Image 模型家族的 Base、Turbo 检查点和推理代码。这是一套把文生图与指令式图片编辑放进同一模型的开源方案:Base 版本侧重高保真生成和编辑,Turbo 版本经蒸馏后把推荐采样步数压缩到 4 步。
【模型与开发者】
模型:LLaDA-Image、LLaDA-Image-Turbo
开发者:inclusionAI
官方发布日期:2026 年 9 月 4 日
任务:文生图、VQ 条件生成、参考图指令编辑、中英文文字渲染
模型页许可:Apache License 2.0
日期核对说明:官方 GitHub 仓库和 Hugging Face 模型卡的 News 均明确写明 2026-09-04 发布 Base 与 Turbo 检查点及推理代码;配套论文在 arXiv 的首次提交时间是 2026-09-03。本文把模型官方发布日写为 9 月 4 日,不把论文提交日、网页抓取时间或搜索结果日期混作发布日期。
【关键能力与改动】
1. 生成与编辑统一:同一个检查点可处理纯文本生成,也可接收参考图片,再根据自然语言指令修改画面,同时尽量保留原图内容。
2. 两种速度取向:Base 版本推荐 50 个采样步骤,面向高保真输出;LLaDA-Image-Turbo 使用 Twin-DMD 蒸馏,官方示例以 4 步运行,论文称可在 2 至 4 步完成快速生成和编辑。
3. 三种生成模式:官方推理管线提供 text、vq 和 editing 模式。文本与 VQ 模式要求高宽可被 16 整除,编辑模式要求高宽可被 32 整除。
4. 中英文文字能力:官方将中文和英文列为支持语言,并特别强调中英文文字渲染,适合海报、视觉物料和带字图片实验。
5. 统一扩散架构:项目以从零训练的 6B Diffusion Transformer 作为生成主体,并配合基于 LLaDA2.0-Mini 的冻结视觉语言理解模块;骨干与 DiT 均采用扩散建模。
6. 先学习视觉先验:团队先进行仅图像的预训练和中期训练,再引入图文配对监督以及生成、编辑联合训练,目的是降低从一开始就对大规模图文对的依赖。
7. 多精度权重:Base 与 Turbo 均提供 BF16 和 FP8 检查点,并给出基于 Diffusers 的本地推理代码。
【参数口径说明】
项目正文和论文把核心生成模型描述为 6B DiT;Hugging Face 文件分析页面对完整检查点自动显示约 7B 参数。后者可能把冻结的视觉语言模块等附加张量一并计入。本文采用开发者对生成主体的 6B 描述,同时保留这项口径差异,不把平台自动统计改写成新的官方型号。
【官方评测怎么看】
论文报告 LLaDA-Image Base 在 Qwen-Image-Bench 英文和中文轨道的总体分数分别为 53.53 与 53.38,并称在该基准的开源模型中达到当时最佳。这是开发团队在指定基准和评测流程下给出的结果,尚不能代表所有画风、文字密度、编辑指令和真实业务素材。
这些成绩属于 Base 模型,不能直接当作 Turbo 或 FP8 版本的质量分数。少步蒸馏和低精度权重可能带来速度、显存与画质之间的取舍,实际部署仍需要在自己的提示词、分辨率和硬件上复测。
【适用对象】
适合图像生成应用开发者、设计工具团队、电商视觉和海报原型制作者,以及研究统一生成与编辑架构的团队。Base 更适合优先考虑细节与保真度的离线制作;Turbo 更适合交互预览、批量试稿和对延迟更敏感的工作流。
【实际影响】
过去的开源工作流经常把文生图和图片编辑拆成不同模型或不同骨干,部署、调参和素材流转较复杂。LLaDA-Image 用同一检查点覆盖生成与参考图编辑,并提供 4 步 Turbo 路径,使开发者更容易搭建“先生成、再连续修改”的统一界面。FP8 权重也为服务器端降低模型存储与推理资源占用提供了测试入口。
不过,官方没有承诺任意消费级显卡都能流畅运行,也没有在模型页给出通用显存下限或跨硬件速度数据,因此不能仅凭“4 步”或“FP8”推断单卡性能。
【限制与使用提醒】
当前官方仓库已经提供模型权重和 Diffusers 推理代码,但 Opensource Plan 中的训练代码仍标记为 coming soon。论文标题中的“完全开放训练方案”主要反映论文与配方披露目标,不应被理解为全部训练代码已经落地。
模型输出仍可能出现手部、文字、空间关系、身份特征或局部编辑不准确等问题。用于广告、新闻、教育、医疗或商品展示时,应保留人工审核并标注合成内容;使用真人参考图编辑前,还需要确认肖像、隐私与授权。
VQ 条件模式依赖 LLaDA2 生成图像 VQ token,且官方明确要求该模式不要同时传入输入图片。部署方还需固定兼容的 Python、PyTorch、Transformers 与 Diffusers 版本,并对用户上传图片做文件类型、大小、内容安全和访问权限隔离。
Hugging Face 页面目前没有提供可直接调用的托管推理服务,使用者需要自行下载权重和准备 CUDA 或其他兼容环境。
【官方来源】
官方代码仓库:https://github.com/inclusionAI/LLaDA-Image
官方 Base 模型页:https://huggingface.co/inclusionAI/LLaDA-Image
官方 Turbo 模型页:https://huggingface.co/inclusionAI/LLaDA-Image-Turbo
配套论文:https://arxiv.org/abs/2609.03796
欢迎光临 闲社 (https://www.xianshe.com/)
Powered by Discuz! X5.0