模型介绍
中文整理# Qwen-Image-2.1-viggle-turbo 模型卡片
模型用途
文本生成图像和基于指令的图像编辑,支持使用1至3张参考图像。
## 主要能力
该模型是 Qwen/Qwen-Image-2.1 的少步骤蒸馏版本,由 Viggle 开发。相较于需要40步的基准模型,仅需6步即可完成生成,无需使用无分类器引导。在速度上端到端比基准模型快约5倍,质量与基准模型相当。在官方示例中,两者在大多数提示词下难以区分。
v0.3版本相比v0.2.1:噪点更少、表面更干净、精细纹理略软;多样性和小文本准确性保持相近。
新增9步模式:前7步使用Turbo模式,后2步关闭LoRA由基准模型完成。可获得更精细的细节,小文本准确率更高。耗时约为6步的1.4至1.5倍,仍比基准模型快约3.5倍。该模式仅支持diffusers和演示Space。
6步模式已接近该模型的容量上限。自v0.2.1以来,6步下的每项提升都伴随其他方面的损失:更清晰则噪点增多,减少噪点则画面变软。进一步提升质量需要增加步数,9步模式正是为此设计。
## 输入输出
- *输入**:文本提示词加1至3张参考图像
- *输出**:生成的图像或编辑后的图像
运行要求
需要加载基础transformer模型。提供多种格式文件:safetensors格式的LoRA适配器(rank 256约1.3GB,rank 128约0.7GB)、PEFT格式、GGUF格式(支持Q8_0、Q6_K、Q5_K_M、Q4_K_M量化)。支持diffusers和ComfyUI。
基本用法
运行时将LoRA适配器加载到基础transformer上。推荐使用v0.3版本rank 256的LoRA文件。ComfyUI工作流使用rank 128版本。
限制
已知局限性包括:小而密集的文本可能出现质量问题;复杂的编辑操作效果可能不佳。如需更清晰的画面表现,可选择v0.2.1版本。
许可证
基于Qwen构建。具体许可证信息需参考Qwen项目。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
