模型介绍
中文整理MOSS-TTS 模型族
MOSS-TTS 模型族是来自 MOSI.AI 和 OpenMOSS 团队的开源语音与声音生成模型系列,专为高保真、高表现力且适用于复杂现实场景而设计,覆盖稳定长文本语音、多说话人对话、声音/角色设计、环境音效以及实时流式语音合成。
主要能力
MOSS-TTS:旗舰级生产模型,具有高保真度和优秀的零样本声音克隆能力。支持长语音生成、拼音/音素/时长精细控制,以及多语言/代码切换合成。
MOSS-TTSD:口语对话生成模型,支持表现力强、多说话人、超长对话。v1.0 版本在客观指标上达到行业领先水平,主观评估中优于 Doubao 和 Gemini 2.5-pro 等顶级闭源模型。
MOSS-VoiceGenerator:开源声音设计模型,可直接从文本提示生成多样化的声音和风格,无需参考语音。其表现在 Arena 评分中超越其他顶级声音设计模型。
MOSS-TTS-Realtime:多轮上下文感知的实时语音代理模型,使用增量合成确保自然连贯的回复。TTFB 达 180 毫秒,配合语言模型使用时首句延迟为 377 毫秒,适合构建低延迟语音代理。
MOSS-SoundEffect:专注于音效生成的内容创作模型,类别覆盖广泛且时长可控。可生成自然环境、城市场景、生物声音、人类动作和音乐片段,适用于电影、游戏和互动体验。
输入输出
输入格式:
文本:支持中文、英文、德语、法语、西班牙语、日语、韩语等 20 种语言。可混合原始文本与拼音或 IPA 符号以控制发音。
参考音频:用于声音克隆,需提供一段参考语音。
音频标记数:1秒约对应 12.5 个标记,用于控制生成时长。
输出:生成的音频内容
运行要求
环境:建议使用干净的隔离 Python 环境,安装 Transformers 5.0.0 或更高版本以避免依赖冲突。
依赖:需安装所有必需依赖项。可选安装 FlashAttention 2 以提升速度并降低 GPU 显存占用(仅支持特定 GPU,建议使用 torch.float16 或 torch.bfloat16)。
硬件:推荐使用支持 CUDA 的 GPU 以获得最佳性能。
基本用法
直接合成:支持中文/英文/拼音/IPA 直接输入生成语音。
声音克隆:提供前缀音频片段作为参考,模型将保持相同说话人身份和风格继续生成。
时长控制:在标记级别控制语速、节奏、停顿和发音速率。
拼音输入:使用带声调数字的拼音(如 ni3 hao3 wo3 men1),可配合 pypinyin 库将中文文本转换为拼音。
IPA 输入:使用 /.../ 包裹 IPA 序列以区别于普通文本,可使用 DeepPhonemizer 将英文文本转换为 IPA。
推荐解码参数(MossTTSDelay-8B):温度 1.7,top_p 0.8,top_k 25,重复惩罚 1.0。
限制
MOSS-TTS 是预训练基础模型,对解码超参数敏感,需按推荐默认值设置以获得最佳效果。
模型在某些极端场景或少数语言/口音上的表现可能受限。
许可证
开源模型,具体许可证信息请参阅项目官方仓库。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
