闲社服务运行正常AI智能体自动化平台

MiniMax-H3-Fun-Controlnet-Union

PAI/MiniMax-H3-Fun-Controlnet-Union

发布机构PAI

下载访问条件魔搭来源

MiniMax-H3-Fun-Controlnet-Union 这是一个针对MiniMax-H3视频生成模型的ControlNet-Union控制分支权重。通过加载该检查点,可以对MiniMax-H3生成的视频进行条件控制,实现视频到视频的转换,并支持视频修复功能。 联合控制:单一检查点支持Canny边缘检测、Depth深度图、HED边缘、MLSD线段和Pose姿态五种控制条件,无需为每种条件切换不同检查点。

推理思考视频生成
模型详情

模型介绍

中文整理

MiniMax-H3-Fun-Controlnet-Union

模型用途

这是一个针对MiniMax-H3视频生成模型的ControlNet-Union控制分支权重。通过加载该检查点,可以对MiniMax-H3生成的视频进行条件控制,实现视频到视频的转换,并支持视频修复功能。

主要能力

联合控制:单一检查点支持Canny边缘检测、Depth深度图、HED边缘、MLSD线段和Pose姿态五种控制条件,无需为每种条件切换不同检查点。

控制分支结构:控制分支连接到50个transformer块中的5个(分别为第0、10、20、30、40层),每个控制跳跃通过零门投影添加到主分支。

引导蒸馏:使用guidance scale = 1.0运行,每个推理步骤仅需一次前向传播,无需无分类器引导。

视频修复支持:控制输入扩展为49维(潜在变量 + 遮罩潜在变量 + 遮罩通道)。

控制上下文缩放:可调节控制强度,1.0为最强控制,低于1.0减弱控制引导,0.0关闭控制分支。

输入输出

输入:控制视频(指定条件类型)+ 文本提示词

输出:受控制视频条件影响的生成视频

帧数自动调整为17×n+5(由视频VAE解码决定),时长上限15秒。保持控制视频的宽高比,分辨率为32的倍数,固定24帧/秒。

运行要求

基础模型:需要MiniMax-H3基础权重

内存需求:控制分支约6.8 GB,基础transformer约62 GB,Qwen3-VL文本编码器约62 GB

硬件:单个80 GB GPU无法完整加载所有组件,需使用模型组卸载或CPU卸载配合qfloat8量化

配置要求:config路径必须精确构建控制分支(控制块位置:[0, 10, 20, 30, 40],控制输入维度:49,控制应用音频:false)

基本用法

克隆VideoX-Fun仓库并创建所需目录。将基础MiniMax-H3模型和本检查点下载到models/Diffusion Transformer目录。编辑examples/minimax_h3_fun/predict_v2v_control.py中的设置后运行。

限制

内存需求极高,单卡80 GB GPU无法完整加载。

配置必须与训练时完全匹配,否则检查点加载失败。

guidance scale必须保持为1.0,高于1.0会导致重复应用引导,降低输出质量。

详细提示词可获得更好的稳定性,建议在提示词中描述场景、主体和摄像机。

许可证

本模型基于MiniMax-H3衍生,受MiniMax H3社区许可证约束。使用前请仔细阅读许可证,特别是地域限制和可接受使用政策。

注:此为旧版本。官方已发布更新的MiniMax-H3-Fun-Controlnet-Union-2.0版本,推荐使用新版本以获得更优效果。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部