闲社服务运行正常AI智能体自动化平台

MOSS-TTS

openmoss/MOSS-TTS

发布机构openmoss

下载访问条件魔搭来源

MOSS-TTS 模型族是来自 MOSI.AI 和 OpenMOSS 团队的开源语音与声音生成模型系列,专为高保真、高表现力且适用于复杂现实场景而设计,覆盖稳定长文本语音、多说话人对话、声音/角色设计、环境音效以及实时流式语音合成。 MOSS-TTS:旗舰级生产模型,具有高保真度和优秀的零样本声音克隆能力。支持长语音生成、拼音/音素/时长精细控制,以及多语言/代码切换合成。 MOSS-TTSD:口语对话生成模型,支持表现力强、多说话人、超长对话。v1.0 版本在客观指标上达到

语音音频编程开发
模型详情

模型介绍

中文整理

MOSS-TTS 模型族

MOSS-TTS 模型族是来自 MOSI.AI 和 OpenMOSS 团队的开源语音与声音生成模型系列,专为高保真、高表现力且适用于复杂现实场景而设计,覆盖稳定长文本语音、多说话人对话、声音/角色设计、环境音效以及实时流式语音合成。

主要能力

MOSS-TTS:旗舰级生产模型,具有高保真度和优秀的零样本声音克隆能力。支持长语音生成、拼音/音素/时长精细控制,以及多语言/代码切换合成。

MOSS-TTSD:口语对话生成模型,支持表现力强、多说话人、超长对话。v1.0 版本在客观指标上达到行业领先水平,主观评估中优于 Doubao 和 Gemini 2.5-pro 等顶级闭源模型。

MOSS-VoiceGenerator:开源声音设计模型,可直接从文本提示生成多样化的声音和风格,无需参考语音。其表现在 Arena 评分中超越其他顶级声音设计模型。

MOSS-TTS-Realtime:多轮上下文感知的实时语音代理模型,使用增量合成确保自然连贯的回复。TTFB 达 180 毫秒,配合语言模型使用时首句延迟为 377 毫秒,适合构建低延迟语音代理。

MOSS-SoundEffect:专注于音效生成的内容创作模型,类别覆盖广泛且时长可控。可生成自然环境、城市场景、生物声音、人类动作和音乐片段,适用于电影、游戏和互动体验。

输入输出

输入格式:

文本:支持中文、英文、德语、法语、西班牙语、日语、韩语等 20 种语言。可混合原始文本与拼音或 IPA 符号以控制发音。

参考音频:用于声音克隆,需提供一段参考语音。

音频标记数:1秒约对应 12.5 个标记,用于控制生成时长。

输出:生成的音频内容

运行要求

环境:建议使用干净的隔离 Python 环境,安装 Transformers 5.0.0 或更高版本以避免依赖冲突。

依赖:需安装所有必需依赖项。可选安装 FlashAttention 2 以提升速度并降低 GPU 显存占用(仅支持特定 GPU,建议使用 torch.float16 或 torch.bfloat16)。

硬件:推荐使用支持 CUDA 的 GPU 以获得最佳性能。

基本用法

直接合成:支持中文/英文/拼音/IPA 直接输入生成语音。

声音克隆:提供前缀音频片段作为参考,模型将保持相同说话人身份和风格继续生成。

时长控制:在标记级别控制语速、节奏、停顿和发音速率。

拼音输入:使用带声调数字的拼音(如 ni3 hao3 wo3 men1),可配合 pypinyin 库将中文文本转换为拼音。

IPA 输入:使用 /.../ 包裹 IPA 序列以区别于普通文本,可使用 DeepPhonemizer 将英文文本转换为 IPA。

推荐解码参数(MossTTSDelay-8B):温度 1.7,top_p 0.8,top_k 25,重复惩罚 1.0。

限制

MOSS-TTS 是预训练基础模型,对解码超参数敏感,需按推荐默认值设置以获得最佳效果。

模型在某些极端场景或少数语言/口音上的表现可能受限。

许可证

开源模型,具体许可证信息请参阅项目官方仓库。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部