闲社服务运行正常AI智能体自动化平台

MiniMax-H3-NF4

DiffSynth-Studio/MiniMax-H3-NF4

发布机构DiffSynth-Studio

下载访问条件魔搭来源

本模型是视频生成模型 MiniMax-H3 的 NF4 量化版本,采用 bitsandbytes 4-bit 量化方案,配合 DiffSynth-Studio 使用,可以在显存和内存有限的设备上运行模型推理。 运行以下代码,使用 DiffSynth-Studio 进行推理,显存管理将会自动启用,实际的显存占用量取决于 GPU 上的可用显存,最低 8G 显存即可运行。 Comfy-Org/MiniMax-H3 提供了 MiniMax-H3 的 pruned 变体,它把 DiT

推理思考编程开发视频生成
模型详情

模型介绍

中文整理

MiniMax-H3-NF4

本模型是视频生成模型 MiniMax-H3 的 **NF4 量化版本**,采用 bitsandbytes 4-bit 量化方案,配合 DiffSynth-Studio 使用,可以在显存和内存有限的设备上运行模型推理。

环境安?

推理代码

启用显存管理

运行以下代码,使用 DiffSynth-Studio 进行推理,显存管理将会自动启用,实际的显存占用量取决于 GPU 上的可用显存,最低 8G 显存即可运行。

FL2VA:

Ref2VA:

展开代码

Comfy-Org/MiniMax-H3 提供了 MiniMax-H3 的 pruned 变体,它把 DiT 的时间步嵌入 MLP 替换为一张查找表,使 adaln proj.linear 的输入维度从 2688 降到 8,模型参数量降至约 20B。我们对其同样提供了 NF4 量化权重,单个 DiT 文件约 9.8 GB。

用法与上文完全一致,只需把 DiT 的 origin file pattern 换成 pruned 版本,文本编码器与两个 VAE 仍然复用同一套权重。

FL2VA:

展开代码

Ref2VA:

展开代码

极端硬件优化

如果你的计算设备性能极为有限,我们支持开启硬盘到显存的直连,在这样的配置下,模型中的张量将会按照计算顺序逐个从硬盘加载到显存,只需 8G 内存即可运行:

如果你希望在 Mac M 系列芯片上运行模型推理,我们也是支持的,尽管这并不推荐:

训练代码

本量化模型支持 LoRA 训练,请按照以下步骤启动训练程序。

下载样例数据集:

适合数据中心 GPU(例如 Nvidia H20)的训练配置:运行以下脚本,启动 LoRA 训练程序,需要 48G 显存。

适合消费级 GPU(例如 Nvidia RTX 4090)的训练配置:运行以下脚本,启动两阶段拆分训练与 gradient checkpointing offload,需要 24G 显存。

参考资料

DiffSynth-Studio 文档:Minimax-H3

DiffSynth-Studio 文档:显存管理

DiffSynth-Studio 文档:两阶段拆分训练

DiffSynth-Studio 文档:低显存训练

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部