|
【事件概述】
FastVideo 团队公开了 FastVideo-Minimax-FastH3-Preview-v0.2。这是基于 MiniMax-H3 的少步数蒸馏预览模型,目标是在一次流程中同步生成视频与音频,并把基础模型的 50 步采样压缩到一组经过训练的 4 步时间网格。
【模型与开发者】
模型:FastVideo-Minimax-FastH3-Preview-v0.2,简称 FastH3 Preview v0.2
开发者:FastVideo 团队 / Hao AI Lab
基础模型:MiniMaxAI/MiniMax-H3
官方发布日期:2026 年 8 月 23 日。该日期来自 FastVideo 官方 Hugging Face 模型仓库的创建时间 2026-08-23 04:46 UTC;页面最后更新时间为同日 05:12 UTC。许可证文件中的 2026 年 8 月 2 日是 MiniMax-H3 基础许可证的日期,并不是 FastH3 v0.2 的发布时间。
【关键能力与改动】
1. 通过 data-free DMD2 对官方称为 33B 双模态视频与音频扩散变换器的 MiniMax-H3 进行蒸馏。
2. 基础模型使用 50 个去噪步骤,v0.2 使用固定的 4 步训练网格 [999, 749, 500, 250],对应变换器评估次数减少 12.5 倍;这只是评估次数之比,不等同于任何硬件上的端到端速度提升。
3. 官方训练配置面向 768×1344、124 帧、约 5 秒的视频,并同步生成音频。
4. v0.2 延续 v0.1 的同一训练任务,从第 1400 步推进到第 2900 步,增加了 1500 个蒸馏步骤。官方称静态细节和音画同步有所改善,但这仍是项目方陈述,不作为独立实测结论。
5. v0.2 修正了 v0.1 模型卡的采样说明:只设置 num_inference_steps=4 会生成另一组时间点,在原生间隔下实际只有 3 次前向,并不等于模型训练过的 4 个跳点。使用者应显式指定官方时间网格。
6. 模型带有 VSA 块稀疏视频注意力参数;若启用稀疏推理,还需同时匹配 90% 稀疏率和 64 token 分块,不能只切换注意力后端。
【适用对象】
适合研究视频扩散蒸馏、音画联合生成和稀疏注意力的团队,以及愿意自行部署并验证少步数视频生成流程的开发者。仓库采用 Diffusers 模块化布局,蒸馏后的 transformer 权重与基础模型不同,文本编码器、视频和音频 VAE、分词器、处理器及调度器沿用基础发布。
【实际影响】
少步数蒸馏能明显减少扩散变换器的调用次数,有望降低生成延迟和计算成本;但真实收益仍取决于显卡、显存、稀疏后端和数据传输等因素。官方训练使用 32 张 NVIDIA GB200,这只是训练环境,不代表推理必须使用同样硬件,也不能据此推断普通显卡上的速度。参考条件分支 transformer_ref 没有打包在本仓库中,相关功能会从 MiniMax-H3 基础仓库获取组件。
【限制与许可证提醒】
这是训练到 2900/4000 步的 Preview 检查点,官方明确表示整体质量仍低于基础模型的 50 步采样,细微运动与音频细节尤其容易受影响。模型只在指定的 4 步网格上训练,改用其他步数或时间网格属于分布外用法;v0.1 的部分训练期验证视频也受错误采样设置影响,不应直接用来评价 v0.2。
该模型继承 MiniMax H3 Community License,并非 Apache 2.0。官方许可证限定适用地域,排除欧盟、英国、韩国和美国,并包含可接受使用、分发标注及部分商业授权要求;部署或再分发前必须阅读完整条款并确认自身地域和用途合规。
【官方来源】
Hugging Face 模型页:https://huggingface.co/FastVideo/FastVideo-Minimax-FastH3-Preview-v0.2
FastVideo GitHub:https://github.com/hao-ai-lab/FastVideo |
0