闲社服务运行正常AI智能体自动化平台

Qwen-Image-2.1-viggle-turbo

Viggle/Qwen-Image-2.1-viggle-turbo

发布机构Viggle

下载访问条件魔搭来源

文本生成图像和基于指令的图像编辑,支持使用1至3张参考图像。 该模型是 Qwen/Qwen-Image-2.1 的少步骤蒸馏版本,由 Viggle 开发。相较于需要40步的基准模型,仅需6步即可完成生成,无需使用无分类器引导。在速度上端到端比基准模型快约5倍,质量与基准模型相当。在官方示例中,两者在大多数提示词下难以区分。 v0.3版本相比v0.2.1:噪点更少、表面更干净、精细纹理略软;多样性和小文本准确性保持相近。

图片生成
模型详情

模型介绍

中文整理

# Qwen-Image-2.1-viggle-turbo 模型卡片

模型用途

文本生成图像和基于指令的图像编辑,支持使用1至3张参考图像。

## 主要能力

该模型是 Qwen/Qwen-Image-2.1 的少步骤蒸馏版本,由 Viggle 开发。相较于需要40步的基准模型,仅需6步即可完成生成,无需使用无分类器引导。在速度上端到端比基准模型快约5倍,质量与基准模型相当。在官方示例中,两者在大多数提示词下难以区分。

v0.3版本相比v0.2.1:噪点更少、表面更干净、精细纹理略软;多样性和小文本准确性保持相近。

新增9步模式:前7步使用Turbo模式,后2步关闭LoRA由基准模型完成。可获得更精细的细节,小文本准确率更高。耗时约为6步的1.4至1.5倍,仍比基准模型快约3.5倍。该模式仅支持diffusers和演示Space。

6步模式已接近该模型的容量上限。自v0.2.1以来,6步下的每项提升都伴随其他方面的损失:更清晰则噪点增多,减少噪点则画面变软。进一步提升质量需要增加步数,9步模式正是为此设计。

## 输入输出

  • *输入**:文本提示词加1至3张参考图像
  • *输出**:生成的图像或编辑后的图像

运行要求

需要加载基础transformer模型。提供多种格式文件:safetensors格式的LoRA适配器(rank 256约1.3GB,rank 128约0.7GB)、PEFT格式、GGUF格式(支持Q8_0、Q6_K、Q5_K_M、Q4_K_M量化)。支持diffusers和ComfyUI。

基本用法

运行时将LoRA适配器加载到基础transformer上。推荐使用v0.3版本rank 256的LoRA文件。ComfyUI工作流使用rank 128版本。

限制

已知局限性包括:小而密集的文本可能出现质量问题;复杂的编辑操作效果可能不佳。如需更清晰的画面表现,可选择v0.2.1版本。

许可证

基于Qwen构建。具体许可证信息需参考Qwen项目。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部