闲社服务运行正常AI智能体自动化平台

krea2-turbo-sda

F16/krea2-turbo-sda

发布机构F16

下载访问条件魔搭来源

Krea 2 Turbo — SDA Diversity LoRA (v1.0) 这是一个为 Krea 2 Turbo 设计的 rank-32 LoRA,旨在恢复 Turbo 蒸馏过程中损失的采样多样性,同时不降低图像质量或提示词遵循度。 该 LoRA 通过语义方向对齐(SDA)技术,使模型在同一提示词下使用不同随机种子时能够生成更多样化的图像。在测试中,使用相同提示词配合16个不同种子时,未使用 LoRA 的基准模型会生成几乎相同的图像,而加载该 LoRA 后可以产生在毛色

图片生成
模型详情

模型介绍

中文整理

Krea 2 Turbo — SDA Diversity LoRA (v1.0)

中文模型卡片

模型用途

这是一个为 Krea 2 Turbo 设计的 rank-32 LoRA,旨在恢复 Turbo 蒸馏过程中损失的采样多样性,同时不降低图像质量或提示词遵循度。

主要能力

该 LoRA 通过语义方向对齐(SDA)技术,使模型在同一提示词下使用不同随机种子时能够生成更多样化的图像。在测试中,使用相同提示词配合16个不同种子时,未使用 LoRA 的基准模型会生成几乎相同的图像,而加载该 LoRA 后可以产生在毛色、照明、季节、构图等方面有明显差异的变体。

测量效果

评估使用10个提示词 × 16个种子,与关闭适配器的基准模型对比:

成对 CLIP 余弦距离:基准 0.0296 → LoRA 0.0548,提升85%

成对 L2 距离:基准 0.2281 → LoRA 0.3167,提升39%

像素标准差:基准 0.1584 → LoRA 0.2117,提升34%

HPSv2.1 质量:基准 0.2990 → LoRA 0.2987,基本持平(-0.1%)

高频能量比:1.000 → 1.206,轻微提升,无模糊惩罚

提示词遵循度(24个多约束提示词 × 8个种子)与基准模型在统计上无显著差异。

技术原理

SDA 将多样性崩溃视为方向问题。对于一张训练图像,选取两个随机噪声并同时加噪至 σ = 0.9567(8步 Turbo 计划的最高可学习步骤)。冻结的教师模型(Krea 2 RAW,非蒸馏父模型)和学生模型(Turbo + LoRA)分别预测原始图像,两组预测通过 CLIP 编码后计算方向差异。损失函数使学生的方向向量与教师的方向向量对齐,而非将所有噪声映射到同一模板。

Forward XM best-of-5 在此基础上增加探索:每步采样5个候选噪声,无梯度评分,仅对方向对齐最佳的那个候选进行反向传播,实现约3倍的学习速度提升。

运行要求

推理时必须使用门控机制(gate = 2):LoRA 仅在前2个去噪步骤中启用,之后必须关闭。

门控设置效果:

gate=1:可用但训练步骤未被辅助,多样性降低约20%

gate=2:预期配置,效果如上所述

gate=8(始终启用):质量崩溃,高频能量达基准2.2倍或出现模糊,HPS 降低10%

该 LoRA 改变前两个高噪声步骤决定的构图,后续步骤为纯细节细化,适配器继续启用会造成损害。

基本用法

使用 diffusers 时,需要 0.39.0.dev0 或更新版本的 diffusers(较旧版本需从源码安装)。门控通过单行步骤回调实现。

权重格式:提供 ComfyUI 格式(krea2 turbo sda v1.0 comfy.safetensors)和 diffusers 格式(krea2 turbo sda v1.0 diffusers.safetensors)两种。

ComfyUI 使用注意:默认 ComfyUI 会在每步应用 LoRA,这会损害质量(见 gate=8 说明)。需使用 per-step LoRA 调度节点在第2步后禁用 LoRA,或使用 diffusers。

训练细节

学生模型:Krea 2 Turbo

教师模型:Krea 2 RAW(非蒸馏,单次前向,无 CFG)

方法:SDA 多样性对齐 + Forward XM best-of-5 + SFT 自锚点

训练节点:仅 σ = 0.9567(8步 Turbo 计划的最高可学习节点)

数据集:109张图片,1024×1024

LoRA 配置:rank 32,alpha 32

优化器:AdamW,学习率 2.5e-4 恒定,bf16 混合精度,梯度检查点,200步

训练时间:约1.9小时(48GB GPU)

框架:musubi-tuner(SDA/XM 分支)

限制

研究用途。适合需要同一提示词生成多样化样本的工作流程(探索、数据增强、偏好对挖掘)。

多样性提升仅针对同一提示词下的不同种子,不改变提示词语义。

恢复多样性会降低模型稳定性,可能增加解剖问题(如肢体异常)的概率。

所有评估数据来自固定测试集:1024×1024分辨率,8步去噪,guidance 1.0,shift μ = 1.15。

许可证

基于 Krea 2 构建,使用需遵守 Krea 2 社区许可证(详见基础模型仓库)。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部