模型介绍
中文整理Voxtral 4B TTS 2603 模型卡片
模型用途
Voxtral TTS 是一款前沿的开源文本转语音模型,具备快速、即时可适配的特点,可为语音代理生成逼真的语音。该模型发布 BF16 权重和一组参考语音。
主要能力
企业级文本转语音,适用于生产级语音代理。支持 9 种主要语言的逼真、表达性语音,具有自然的韵律和情感范围,支持多种方言。支持 20 个预设语音,并可轻松适配新语音。 multilingual support 包括英语、法语、西班牙语、德语、意大利语、葡萄牙语、荷兰语、阿拉伯语和印地语。具备极低延迟,支持快速首音频时间,以及流式和批量推理。输出 24 kHz 音频,支持 WAV、PCM、FLAC、MP3、AAC 和 Opus 格式。针对高吞吐量、实时语音代理工作流进行了生产级性能优化。
输入输出
输入:文本和 10 秒音频参考(用于语音克隆)。输出:语音音频。
运行要求
权重格式:BF16。内存要求:单 GPU >= 16GB。软件依赖:vLLM >= 0.18.0、vllm-omni >= 0.18.0、mistral-common >= 1.10.0。
基本用法
推荐使用 vllm-omni 部署。安装 vllm 和 vllm-omni 后可进行服务部署和客户端调用。
限制
必须遵守适用法律,避免滥用。该模型不得以侵犯、盗用或以其他方式侵犯任何第三方权利(包括知识产权)的方式使用。
许可证
兼容该模型的参考语音采用 CC BY-NC 4.0 许可证授权,源自 EARS、CML-TTS、IndicVoices-R 和 Arabic Natural Audio 数据集。该模型继承相同许可证。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
