模型介绍
中文整理# LongCat-Video-Avatar-1.5 模型卡片
模型用途
LongCat-Video-Avatar-1.5 是一个开源的音频驱动人类视频生成框架,专注于生产级应用。该模型基于 LongCat-Video 基础模型构建,支持商业级 Avatar 视频合成,可应用于新闻播报、知识教育、日常生活、娱乐、歌唱、商业推广等场景。
## 主要能力
该模型支持以下核心任务:
- **Audio-Text-to-Video (AT2V)**:音频和文本驱动的视频生成
- **Audio-Text-Image-to-Video (ATI2V)**:音频、文本和图像驱动的视频生成
- **Video Continuation**:视频续作生成
关键特性:
- **升级音频编码器**:采用 Whisper-Large 替代 Wav2Vec2,生成更平滑自然的唇形动态
- **生产级稳定性**:实现精准唇同步、完整身体时间稳定性、长时间视频生成及严格的身份一致性
- **风格化领域泛化**:可泛化至动漫、动物及复杂现实场景(如多人交互、物体操作)
- **高效8步推理**:基于 DMD2 的步蒸馏将推理加速至 8 步 NFE,兼顾成本与视觉质量
## 输入输出
- *输入**:
- 音频文件(支持单流或多流音频)
- 文本提示(建议包含角色外观、动作、场景背景等丰富细节)
- 参考图像
- 可选:初始图像或视频
- *输出**:生成的视频(支持 480P 和 720P 分辨率)
运行要求
- 需克隆代码仓库并安装依赖
- 模型配置默认启用 FlashAttention-2,也可配置使用 FlashAttention-3 或 xformers
- 支持 INT8 量化以降低显存占用(仅 avatar-v1.5 版本支持)
基本用法
- 克隆仓库并安装依赖
- 从 Hugging Face 下载模型权重
- 使用 huggingface-cli 或相应工具下载模型
- *推理参数建议**:
- **唇同步**:音频 CFG 值建议设置在 3-5 之间,增大数值可改善同步效果
- **提示优化**:较长且描述性强的提示比短提示能获得更好的一致性和自然度,建议包含角色外观、动作、场景上下文等丰富细节
- **减少重复动作**:参考图像索引(--ref img index)设置在 0-24 之间可确保更好的一致性,设为 30 有助于减少重复动作;增大掩码帧范围(--mask frame range,默认值 3)也可减少重复,但过大会产生伪影
- **超分辨率**:通过 --resolution 参数控制输出 480P 或 720P
- **双音频模式**:合并模式(audio type 设为 para)需要两个等长音频片段,结果为两音频之和;拼接模式(audio type 设为 add)不需要等长输入,默认第一人先说话
- **模型版本**:--model type avatar-v1.0 使用 wav2vec2 音频编码器;--model type avatar-v1.5 使用 Whisper-large-v3 音频编码器,唇同步质量更优
- **蒸馏模式**:使用 avatar-v1.5 模型时需添加 --use distill 启用蒸馏采样
- **INT8量化**:添加 --use int8 加载 INT8 量化 DiT 模型以降低显存占用
限制
- 该模型未针对所有可能的下游应用进行专门设计或全面评估
- 开发者应考虑大型语言模型的已知限制,包括不同语言间的性能差异
- 在敏感或高风险场景部署前,应仔细评估准确性、安全性和公平性
- 开发者及下游用户有责任理解和遵守与使用场景相关的所有适用法律和法规,包括数据保护、隐私和内容安全要求
许可证
模型权重采用 **MIT 许可证** 发布。任何对本仓库的贡献均采用 MIT 许可证,除非另有说明。该许可证不授予使用美团商标或专利的任何权利。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
