Hugging Face 推出 Open TTS Leaderboard:用客观指标评测多语言语音合成与声音克隆
Hugging Face 发布 Open TTS Leaderboard,面向开源与多语言文本转语音模型,采用可理解度、速度与说话人相似度等客观指标评测,并支持声音克隆与流式性能对比。
核心事实
Hugging Face 博客发布文章,介绍新上线的 Open TTS Leaderboard。该榜单聚焦开源与多语言文本转语音(TTS)模型,并覆盖声音克隆评测。据文章说明,榜单采用客观指标:可理解度使用词错误率(WER)与字符错误率(CER),由 Qwen3 ASR 转写生成音频后与提示文本比对;速度使用批处理离线推理的逆实时因子(RTFx)与流式场景下的首音频时间(TTFA);说话人相似度则通过 WavLM 说话人嵌入的余弦相似度(SIM)计算。文章称,改用客观指标后,评测一个模型的时间从收集投票所需的数周缩短到数小时。
背景与影响
文章指出,开源 TTS 模型发布速度很快,截至 2026 年 9 月 30 日,Hugging Face Hub 上已有超过 8000 个 TTS 模型,但评测仍较为分散、缺乏统一标准。以人类偏好投票为基础的竞技场式榜单(如 TTS Arena v2、Artificial Analysis Voice Arena)被视为重要参考,但难以跟上模型发布节奏,且开源模型在其中的占比偏低。文章称,截至同一日期,Artificial Analysis 的 92 个模型中仅 16 个为开放权重。榜单默认视图按 Seed TTS Eval 英文切分与 CV3 Eval 零样本切分的宏平均 WER 排名,文章提到 hexgrad/Kokoro-82M、Supertone/supertonic-3、fishaudio/s2-pro 在英文 WER 上领先;多语言方面提到 k2-fsa/OmniVoice、fishaudio/s2-pro、FunAudioLLM/Fun-CosyVoice3-0.5B-2512;流式方面提到 kyutai/pocket-tts。榜单还设有 Listen 标签页供试听与投票,Streaming 标签页比较流式能力。
限制与来源
文章明确表示,该榜单并不取代人类偏好排名:基于 ASR 的 WER 只是可理解度的代理指标,说话人相似度估计的是声音身份保持程度,二者都不直接衡量自然度、表现力或听者偏好。文章还称,评测脚本将很快开源,并欢迎社区反馈数据集、模型与指标建议。上述模型排名、模型数量与时间点均来自 Hugging Face 博客原文,具体榜单内容与最新结果请以官网当前信息为准。