模型介绍
中文整理# Q-Judger 模型卡片
模型用途
Q-Judger是一个微调的判断模型,用于评估文本到图像(T2I)生成质量。该模型基于Qwen3.6-27B构建,使用结构化检查表对生成图像进行评分,并输出JSON格式的评估结果。
## 主要能力
该模型对图像进行5个顶层维度的层级评估:
- *质量(Quality)**
- 真实感:物理逻辑、材质纹理
- 细节:噪点、边缘清晰度、自然度
- 分辨率
- *美学(Aesthetics)**
- 构图、色彩和谐、灯光与氛围
- 解剖肖像:解剖真实度、情感表达、风格控制
- *对齐(Alignment)**
- 属性:数量、面部表情、材质属性、颜色、形状、尺寸
- 动作:接触交互、非接触交互、全身动作
- 布局:2D空间、3D空间
- 关系:组合关系、差异/相似性、包含关系
- 场景:真实场景、虚拟场景
- *真实世界保真度(Real-world Fidelity)**
- 公平性:社会偏见、文化公平性
- 安全与合规
- 世界知识:动物、对象、信息可视化、时间特征、文化元素
- *创意生成(Creative Generation)**
- 想象力、特征匹配、逻辑解决
- 文本渲染:文本准确性、文本布局、字体、跨语言生成
- 设计应用:平面设计、产品设计、空间设计、时尚造型、游戏设计、艺术设计
- 视觉叙事:电影风格、相机/镜头风格、分镜创作、镜头尺寸、构图、角度、漫画创作
模型启用思维链推理模式,在生成最终JSON输出前进行逐步推理。
## 输入输出
- *输入**:文本提示(prompt)+ 生成图像
- *输出**:结构化JSON,包含每维度评分
| 原始分数 | 含义 | 映射分数 |
|---------|------|---------|
| 0 | Fail | 0 |
| 1 | Pass | 60 |
| 2 | Excel | 100 |
| N/A | 不适用 | 排除 |
评分聚合方式:Level-3分数平均至Level-2,Level-2分数平均至Level-1,Level-1分数平均至总分。
运行要求
- Python虚拟环境
- PyTorch(根据CUDA版本选择安装)
- ms-swift及相关依赖
推理参数固定为:seed=42, temperature=0, top_k=1, top_p=1.0, repetition_penalty=1.05, max_new_tokens=4096, enable_thinking=True, max_batch_size=24
基本用法
准备CSV、JSON或JSONL格式输入文件,包含以下列:
- ID:提示标识符(1-1000)
- prompt:生成图像用的文本提示
- image:生成图像文件路径
使用CLI运行推理,必要参数包括:--input(输入文件)、--model(模型路径或HuggingFace模型ID)
## 人类一致性验证
模型与人类专家排名的Spearman相关系数:
- 质量:0.89
- 美学:0.89
- 对齐:0.89
- 真实世界保真度:0.92
- 创意生成:0.92
- 总体:0.92
所有相关性均具有统计显著性(p < 10⁻⁴)。
许可证
Apache License 2.0
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
