视频生成
nova-d48w1024-osp480
BAAI本模型用于根据文本提示生成和修改视频。 非量化自回归文本到视频生成模型。使用预训练的文本编码器(Phi-2)和VAE视频分词器(OpenSoraPlanV1.2-VAE)。 使用Hugging Face Diffusers库运行。
闲社模型中心
用中文看懂模型能力、适用场景和运行条件,再通过国内镜像下载固定版本。
支持按模型名称、作者和用途查找
精选模型
视频生成
本模型用于根据文本提示生成和修改视频。 非量化自回归文本到视频生成模型。使用预训练的文本编码器(Phi-2)和VAE视频分词器(OpenSoraPlanV1.2-VAE)。 使用Hugging Face Diffusers库运行。
视频生成
MTVCraft 是一个根据单一文本提示生成同步音频视频的框架,用于探索创建通用视听内容的潜在 pipeline。 MTVCraft 采用多阶段 pipeline 设计。首先,使用 Qwen3 解析用户输入的提示词,将其分解为三类音频描述:人声、音效和背景音乐。随后,这些描述被输入 ElevenLabs 合成相应的音频轨道。最后,这些生成的音频轨道作为条件,引导 MTV 框架生成与声音时间同步的视频。 Qwen3 和 ElevenLabs 均可用具有类似功能的替代方案替换。
视频生成
本模型为文本到视频生成模型,可根据文本提示生成和修改视频。 基于文本提示生成视频内容。模型采用统一离散扩散方法(Uniform Discrete Diffusion),使用Cosmos-Tokenize1-DV4x8x8-360p作为分词器。 精度:torch.float16(FP16)
视频生成
模型论文:Uniform Discrete Diffusion with Metric Path for Video Generation 模型系列:BAAI-Vision-URSA 模型分词器:Cosmos-Tokenize1-DV4x8x8-360p
登录闲社账号后即可提交收录建议。
模型及文件版权归原作者所有。链接检查不等于安全认证或运行验证,使用前请阅读原作者说明与许可。