闲社服务运行正常AI智能体自动化平台

ArtAug-lora-FLUX.1dev-v1

DiffSynth-Studio/ArtAug-lora-FLUX.1dev-v1

发布机构DiffSynth-Studio

下载访问条件魔搭来源

这是一个为 FLUX.1-dev 训练的 LoRA 模型,能够使模型生成的图像更符合人类的审美,包括但不限于:丰富的细节、唯美的光影、美学的构图、清晰的画面。本模型不需要任何触发词。 论文: https://arxiv.org/abs/2412.12888 开源代码: https://github.com/modelscope/DiffSynth-Studio

图片生成
模型详情

模型介绍

中文整理

FLUX 艺术增强 LoRA

简介

这是一个为 FLUX.1-dev 训练的 LoRA 模型,能够使模型生成的图像更符合人类的审美,包括但不限于:丰富的细节、唯美的光影、美学的构图、清晰的画面。本模型不需要任何触发词。

论文: https://arxiv.org/abs/2412.12888

开源代码: https://github.com/modelscope/DiffSynth-Studio

模型: ModelScope, HuggingFace

在线体验:点击右上角“一键生成”

训练方法

ArtAug 这项研究工作受到 GPT-o1 这类依靠模型交互和自我纠正式推理的启发,我们构建了一套训练链路,旨在通过图像理解模型和图像生成模型的交互增强图像生成模型的能力。ArtAug 的训练链路包括以下几个步骤:

  • **生成理解交互**:使用图像生成模型生成一张图像之后,我们使用多模态大语言模型(Qwen2-VL-72B)分析图像内容并给出修改建议,进而重新生成一张质量更好的图像。
  • **数据生成与过滤**:交互生成需要很长的推理时间,也可能出现糟糕的画面内容,所以我们离线地生成了大批图像对,进行过滤后用于后续的训练。
  • **差分训练**:我们使用差分训练技术训练 LoRA 模型,使 LoRA 模型能够学习到增强前和增强后的图像差异,而非直接在增强后的图像数据集上训练。
  • **迭代增强**:把训练好的 LoRA 模型融合到底模中,并基于融合后的模型重复以上步骤,循环多次,直到交互算法不再能提供明显增强效果。将每次迭代产生的 LoRA 模型合并,得到本模型。

这个模型可以将 Qwen2-VL-72B 对于美学的理解融入到 FLUX.1[dev] 中,提升其生成的图像质量。

使用方式

本模型使用 DiffSynth-Studio 训练而来,我们推荐使用 DiffSynth-Studio 进行生成。

由于本模型使用了通用的 FLUX LoRA 格式封装,可以被大多数 LoRA 加载器加载,你可以将这个 LoRA 模型接入到你的工作流中。

图像样例

FLUX.1-dev FLUX.1-dev + ArtAug LoRA

  • -

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部