事件概述:Hugging Face于2026年9月30日介绍Open TTS Leaderboard,面向开源、多语言文本转语音(TTS)和声音克隆模型提供可扩展的公开评测与试听平台。项目针对TTS发布速度快、传统人工偏好榜单难以及时覆盖的问题,补充可复现的客观指标。
对象与开发者:项目由Hugging Face音频团队的Eric Bezzam、Steven Zheng、Eustache Le Bihan和mrfakename等开发与介绍。文章称,截至2026年9月30日,Hugging Face Hub上已有超过8000个TTS模型。
官方发布日期:Hugging Face Blog标注发布于2026年9月30日。
关键能力与改动:榜单从三个维度评估模型:一是使用Qwen3 ASR转写生成音频,计算词错误率或字符错误率(WER/CER)衡量可懂度;二是在H200 GPU上统计批量离线推理的实时因子(RTFx),并用首个音频到达时间(TTFA)衡量批量为1时的流式延迟,同时提供部分模型的CPU结果;三是用WavLM说话人嵌入余弦相似度(SIM)评估声音身份保持。平台还提供Listen标签页,允许用户对比生成音频、选择偏好,并按语言、数据集和是否声音克隆筛选。
适用对象:TTS和语音代理研究者、模型开发者、需要在多语言场景选型的应用团队,以及希望比较开放权重语音模型的用户。
实际影响与限制:客观指标把一次评测从收集人工投票所需的数周缩短到数小时,并提升了开源模型在榜单中的可见性;但平台明确说明,ASR得到的WER/CER只是可懂度代理,SIM只是声音身份保持估计,二者不能直接代表自然度、表现力或听众偏好,人工评价仍不可替代。不同语言的数据覆盖也不均衡,英语成绩不能直接推断其他语言;榜单脚本尚计划开源,使用者应结合目标语言、数据集和硬件重新验证。
官方来源:https://huggingface.co/blog/open-tts-leaderboard |