闲社服务运行正常AI智能体自动化平台

闲社模型中心

模型找得到,
下载更顺手。

用中文看懂模型能力、适用场景和运行条件,再通过国内镜像下载固定版本。

中文介绍原始出处国内镜像直连
按需求搜索不必记住模型名称

你想用模型完成什么?

支持按模型名称、作者和用途查找

4当前结果
固定版本避免文件混用
镜像直传不经闲社中转
按用途浏览先选任务,再看模型
清空筛选

精选模型

从已核对的模型开始

视频生成

nova-d48w1024-osp480

BAAI
国内镜像

本模型用于根据文本提示生成和修改视频。 非量化自回归文本到视频生成模型。使用预训练的文本编码器(Phi-2)和VAE视频分词器(OpenSoraPlanV1.2-VAE)。 使用Hugging Face Diffusers库运行。

中文资料固定版本完整下载方法

视频生成

MTVCraft

BAAI
国内镜像

MTVCraft 是一个根据单一文本提示生成同步音频视频的框架,用于探索创建通用视听内容的潜在 pipeline。 MTVCraft 采用多阶段 pipeline 设计。首先,使用 Qwen3 解析用户输入的提示词,将其分解为三类音频描述:人声、音效和背景音乐。随后,这些描述被输入 ElevenLabs 合成相应的音频轨道。最后,这些生成的音频轨道作为条件,引导 MTV 框架生成与声音时间同步的视频。 Qwen3 和 ElevenLabs 均可用具有类似功能的替代方案替换。

中文资料固定版本完整下载方法

视频生成

URSA-1.7B-FSQ320

BAAI
国内镜像

本模型为文本到视频生成模型,可根据文本提示生成和修改视频。 基于文本提示生成视频内容。模型采用统一离散扩散方法(Uniform Discrete Diffusion),使用Cosmos-Tokenize1-DV4x8x8-360p作为分词器。 精度:torch.float16(FP16)

中文资料固定版本完整下载方法

视频生成

URSA-0.6B-FSQ320

BAAI
国内镜像

模型论文:Uniform Discrete Diffusion with Metric Path for Video Generation 模型系列:BAAI-Vision-URSA 模型分词器:Cosmos-Tokenize1-DV4x8x8-360p

中文资料固定版本完整下载方法
没有找到需要的模型?

提交仓库编号和用途,我们核对后收录。

提交收录建议

登录闲社账号后即可提交收录建议。

模型及文件版权归原作者所有。链接检查不等于安全认证或运行验证,使用前请阅读原作者说明与许可。

返回顶部