模型介绍
中文整理MiniMax-H3-NF4
本模型是视频生成模型 MiniMax-H3 的 **NF4 量化版本**,采用 bitsandbytes 4-bit 量化方案,配合 DiffSynth-Studio 使用,可以在显存和内存有限的设备上运行模型推理。
环境安?
推理代码
启用显存管理
运行以下代码,使用 DiffSynth-Studio 进行推理,显存管理将会自动启用,实际的显存占用量取决于 GPU 上的可用显存,最低 8G 显存即可运行。
FL2VA:
Ref2VA:
展开代码
Comfy-Org/MiniMax-H3 提供了 MiniMax-H3 的 pruned 变体,它把 DiT 的时间步嵌入 MLP 替换为一张查找表,使 adaln proj.linear 的输入维度从 2688 降到 8,模型参数量降至约 20B。我们对其同样提供了 NF4 量化权重,单个 DiT 文件约 9.8 GB。
用法与上文完全一致,只需把 DiT 的 origin file pattern 换成 pruned 版本,文本编码器与两个 VAE 仍然复用同一套权重。
FL2VA:
展开代码
Ref2VA:
展开代码
极端硬件优化
如果你的计算设备性能极为有限,我们支持开启硬盘到显存的直连,在这样的配置下,模型中的张量将会按照计算顺序逐个从硬盘加载到显存,只需 8G 内存即可运行:
如果你希望在 Mac M 系列芯片上运行模型推理,我们也是支持的,尽管这并不推荐:
训练代码
本量化模型支持 LoRA 训练,请按照以下步骤启动训练程序。
下载样例数据集:
适合数据中心 GPU(例如 Nvidia H20)的训练配置:运行以下脚本,启动 LoRA 训练程序,需要 48G 显存。
适合消费级 GPU(例如 Nvidia RTX 4090)的训练配置:运行以下脚本,启动两阶段拆分训练与 gradient checkpointing offload,需要 24G 显存。
参考资料
DiffSynth-Studio 文档:Minimax-H3
DiffSynth-Studio 文档:显存管理
DiffSynth-Studio 文档:两阶段拆分训练
DiffSynth-Studio 文档:低显存训练
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
