闲社服务运行正常AI智能体自动化平台

Voxtral-4B-TTS-2603

mistralai/Voxtral-4B-TTS-2603

发布机构Mistral AI已核实

下载访问条件国内镜像可用

Voxtral TTS 是一款前沿的开源文本转语音模型,具备快速、即时可适配的特点,可为语音代理生成逼真的语音。该模型发布 BF16 权重和一组参考语音。 企业级文本转语音,适用于生产级语音代理。支持 9 种主要语言的逼真、表达性语音,具有自然的韵律和情感范围,支持多种方言。支持 20 个预设语音,并可轻松适配新语音。 multilingual support 包括英语、法语、西班牙语、德语、意大利语、葡萄牙语、荷兰语、阿拉伯语和印地语。具备极低延迟,支持快速首音频时间,以及

语音音频
模型详情

模型介绍

中文整理

Voxtral 4B TTS 2603 模型卡片

模型用途

Voxtral TTS 是一款前沿的开源文本转语音模型,具备快速、即时可适配的特点,可为语音代理生成逼真的语音。该模型发布 BF16 权重和一组参考语音。

主要能力

企业级文本转语音,适用于生产级语音代理。支持 9 种主要语言的逼真、表达性语音,具有自然的韵律和情感范围,支持多种方言。支持 20 个预设语音,并可轻松适配新语音。 multilingual support 包括英语、法语、西班牙语、德语、意大利语、葡萄牙语、荷兰语、阿拉伯语和印地语。具备极低延迟,支持快速首音频时间,以及流式和批量推理。输出 24 kHz 音频,支持 WAV、PCM、FLAC、MP3、AAC 和 Opus 格式。针对高吞吐量、实时语音代理工作流进行了生产级性能优化。

输入输出

输入:文本和 10 秒音频参考(用于语音克隆)。输出:语音音频。

运行要求

权重格式:BF16。内存要求:单 GPU >= 16GB。软件依赖:vLLM >= 0.18.0、vllm-omni >= 0.18.0、mistral-common >= 1.10.0。

基本用法

推荐使用 vllm-omni 部署。安装 vllm 和 vllm-omni 后可进行服务部署和客户端调用。

限制

必须遵守适用法律,避免滥用。该模型不得以侵犯、盗用或以其他方式侵犯任何第三方权利(包括知识产权)的方式使用。

许可证

兼容该模型的参考语音采用 CC BY-NC 4.0 许可证授权,源自 EARS、CML-TTS、IndicVoices-R 和 Arabic Natural Audio 数据集。该模型继承相同许可证。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部