模型介绍
中文整理模型名称:Z-Image-Turbo-SDA
模型用途
Z-Image-Turbo-SDA 是一个高效的 LoKr(低秩克罗内克积)适配器,专门用于解决少步数蒸馏 Flow Matching / Diffusion 模型中的"多样性崩溃"问题。该适配器通过语义方向对齐损失恢复生成多样性,同时保持8步基线模型的极端锐度和快速推理速度。
主要能力
该模型能够在8步推理条件下恢复教师模型70.2%的组合多样性(LPIPS指标),同时严格控制像素标准差,防止连续ODE微调中常见的"变暗/模糊"效应。模型成功解耦了结构多样性与破坏性噪声,在接近50步教师模型的宏观组合多样性的同时,保持清晰的最终像素。
输入输出
输入为文本提示和随机噪声种子,输出为具有恢复组合多样性的图像。
运行要求
基础模型:Z-Image-Turbo(8步Flow Matching)
适配器类型:LoKr(低秩克罗内克积,全秩,系数8)
优化器:AdamW(权重衰减0.001)
学习率:2.5e-4
多样性权重:1.0(标准余弦损失)
Huber Delta:0.08
时间步:严格离散调度器采样(索引1-6),在极低噪声处(索引7)跳过多样性损失
基本用法
该适配器训练为LoKr格式(LyCORIS生态系统)。现代diffusers版本配合peft可原生支持无缝加载LoKr权重。可与其他Z-Image-Turbo LoRA配合使用,但需手动平衡权重。建议将SDA LoRA的推理权重降低至0.5至0.7以避免结构伪影或模糊。
限制
当前v1版本经过额外的360步质量微调,多样性从峰值的70%回退至58%。为获得更好的解剖结构稳定性,模型不得不牺牲部分"语义推动"能力。尽管如此,模型在复杂姿态下仍可能产生偶发的解剖错误,这是少步数蒸馏模型的常见问题。在8步推理框架内,"宏观组合多样性"与"微观解剖刚性"之间的零和博弈仍是开放挑战。简单提示词比复杂提示词能展现更显著的多样性效果,因为复杂提示词对组合空间的拓扑约束更强。
许可证
未在原文中明确说明许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
