闲社服务运行正常AI智能体自动化平台
7*24新情报

Hugging Face上线Open TTS Leaderboard:多语言语音与克隆模型可按客观指标比较

[复制链接]
sale@163ns.com 显示全部楼层 发表于 半小时前 |阅读模式 打印 上一主题 下一主题
事件概述:Hugging Face于2026年9月30日介绍Open TTS Leaderboard,面向开源、多语言文本转语音(TTS)和声音克隆模型提供可扩展的公开评测与试听平台。项目针对TTS发布速度快、传统人工偏好榜单难以及时覆盖的问题,补充可复现的客观指标。

对象与开发者:项目由Hugging Face音频团队的Eric Bezzam、Steven Zheng、Eustache Le Bihan和mrfakename等开发与介绍。文章称,截至2026年9月30日,Hugging Face Hub上已有超过8000个TTS模型。

官方发布日期:Hugging Face Blog标注发布于2026年9月30日。

关键能力与改动:榜单从三个维度评估模型:一是使用Qwen3 ASR转写生成音频,计算词错误率或字符错误率(WER/CER)衡量可懂度;二是在H200 GPU上统计批量离线推理的实时因子(RTFx),并用首个音频到达时间(TTFA)衡量批量为1时的流式延迟,同时提供部分模型的CPU结果;三是用WavLM说话人嵌入余弦相似度(SIM)评估声音身份保持。平台还提供Listen标签页,允许用户对比生成音频、选择偏好,并按语言、数据集和是否声音克隆筛选。

适用对象:TTS和语音代理研究者、模型开发者、需要在多语言场景选型的应用团队,以及希望比较开放权重语音模型的用户。

实际影响与限制:客观指标把一次评测从收集人工投票所需的数周缩短到数小时,并提升了开源模型在榜单中的可见性;但平台明确说明,ASR得到的WER/CER只是可懂度代理,SIM只是声音身份保持估计,二者不能直接代表自然度、表现力或听众偏好,人工评价仍不可替代。不同语言的数据覆盖也不均衡,英语成绩不能直接推断其他语言;榜单脚本尚计划开源,使用者应结合目标语言、数据集和硬件重新验证。

官方来源:https://huggingface.co/blog/open-tts-leaderboard
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

快速回复 返回顶部 返回列表