News
小米开源 Xiaomi-CocktailASR-1,聚焦目标说话人语音识别
Xiaomi-CocktailASR-1 可通过参考语音在多人混合音频中转录目标说话人,并支持目标缺失时拒识和可选推理模式。
小米研究团队公开了 Xiaomi-CocktailASR-1。该目标说话人语音识别模型使用参考语音作为声纹提示,可在单人或多人混合音频中只转录指定说话人,无需先做语音分离。
模型还支持目标说话人缺失时输出空文本的拒识能力,以及可选的推理模式。代码仓库采用 Apache 2.0 许可证,模型定义和权重通过 Hugging Face 提供;论文中的性能数字属于作者在所列数据集上的实验结果。