闲社服务运行正常AI智能体自动化平台

Mage-Flow

microsoft/Mage-Flow

发布机构microsoft

下载访问条件魔搭来源

Mage-Flow 高效原生分辨率图像生成与编辑基础模型 Mage-Flow 是一个紧凑的 40 亿参数生成模型,用于高效的文生图(text-to-image)生成和基于指令的图像编辑。 该模型通过精心设计的 tokenizer、骨干网络和系统协同设计,在保持快速、内存占用低、易于微调的同时,达到了与更大模型相当的生成质量。

图片生成
模型详情

模型介绍

中文整理

Mage-Flow 高效原生分辨率图像生成与编辑基础模型

模型用途

Mage-Flow 是一个紧凑的 40 亿参数生成模型,用于高效的文生图(text-to-image)生成和基于指令的图像编辑。

主要能力

该模型通过精心设计的 tokenizer、骨干网络和系统协同设计,在保持快速、内存占用低、易于微调的同时,达到了与更大模型相当的生成质量。

核心组件包括:Mage-VAE(轻量级高保真潜在空间 tokenizer)和 NR-MMDiT(40 亿参数的原生分辨率多模态扩散 Transformer)。

支持从 512 到 2048 的原生分辨率生成,涵盖任意宽高比,包括极端的 4:1 比例(如 512×2048、2048×512)。

提供三种变体:Base(30 步)、RL-aligned(20 步)和 4-step Turbo(4 步)。

在 1024×1024 分辨率下,单卡 A100 上 Turbo 版本推理速度约为 0.59 秒/图,编辑速度约为 1.02 秒/编辑,峰值显存约 18-20GB。

支持语义内容编辑、外观变换、图像修复和结构感知输出等多种编辑任务。

输入输出

文生图输入:文本提示(prompts)、负提示(neg prompts)、随机种子(seeds)、输出尺寸(height/width)

图像编辑输入:文本提示、参考图像(ref images)

输出:PIL.Image 格式的图像列表

运行要求

Python 环境

PyTorch(推荐 2.13.0 及以上版本,需匹配 CUDA 工具包版本)

flash-attn(需单独安装,关闭 build isolation 模式编译)

CUDA 支持(cu13x 或 cu126/cu129/cu130,具体取决于 nvcc 版本)

GPU 显存:约 18-20GB

基本用法

Python API

文生图:pipe.generate(prompts, **kw)

图像编辑:pipe.edit(prompts, ref_images, **kw)

主要参数说明:

prompts:字符串或字符串列表

steps:去噪步数(Base 默认 30,RL 默认 20,Turbo 默认 4)

cfg:无分类器引导比例(Turbo 建议设为 1.0)

height/width:输出尺寸,需为 16 的倍数,支持 512-2048

seed:随机种子,-1 表示随机

CLI 命令

mage-flow:文生图

mage-flow-edit:图像编辑

mage-flow-app:Gradio 网页界面

许可证

模型卡片中未明确标注许可证信息。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部