AB
AiBoss站
project

Xiaomi-CocktailASR-1 - 小米开源的说话人语音识别模型

Xiaomi-CocktailASR-1是小米开源的目标说话人语音识别大模型,基于LLM端到端架构,用参考语音作为声纹提示,无需语音分离可从多人混合语音中精准转录目标说话...

Xiaomi-CocktailASR-1是什么

Xiaomi-CocktailASR-1是小米开源的目标说话人语音识别大模型,基于LLM端到端架构,用参考语音作为声纹提示,无需语音分离可从多人混合语音中精准转录目标说话人。模型在多说话人基准上达SOTA水平,同时兼容单说话人场景,具备负样本拒识与思维链可解释推理能力,采用Apache 2.0协议开源。

Xiaomi-CocktailASR-1的主要功能

  • 目标说话人语音识别:给定参考语音与多人混合音频,直接转录目标说话人的内容,无需语音分离。
  • 单说话人兼容:同一模型即可处理单人场景,性能媲美主流单说话人 ASR,无需切换模型。
  • 负样本拒识:目标说话人不在音频中时输出空文本,有效降低误触发。
  • 思维链推理:CoT 模式输出说话人数、性别、声纹相似度等推理过程,兼顾可解释性与识别精度。

Xiaomi-CocktailASR-1的技术原理

  • 端到端统一架构:模型由三部分组成:基于 Data2Vec2 改进的 0.6B 音频编码器、轻量级线性 Adapter,及 Qwen3-8B 大语言模型骨干。输入按「参考语音 + 1 秒静音 + 混合语音」的顺序拼接,编码器输出帧级特征后,经 Adapter 对齐到 LLM 隐空间,与文本 Prompt 共同送入 LLM 生成目标说话人的转录。
  • 参考语音作为条件提示:编码器用 Data2Vec2 自监督掩码预测机制,在单一网络内融合语义与说话人信息,无需独立声纹编码器;参考语音被视作条件 Prompt,使编码器在特征提取阶段即自适应聚焦目标说话人、抑制干扰语音,从源头避免传统「分离+识别」级联系统的误差累积。
  • 多能力平衡的多阶段训练:通过约百万小时数据配比训练统一四种能力:约 40 万小时多说话人数据训练目标提取,约 60 万小时同说话人参考-目标对防止单场景过度抑制,约 1 万小时错配参考的负样本内化拒识能力且推理无需阈值,另有 CoT 数据教会模型先输出推理链再给出答案。
  • 双模式 Prompt 与拒识机制:标准模式用统一 Prompt 同时覆盖单人识别、多人目标识别与负样本拒识三类任务,目标缺失时模型自然输出空文本;CoT 模式则以独立 Prompt 触发 <think> 推理标签,输出说话人数量、性别与声纹相似度等中间步骤后再给出 <answer> 最终转录,提升可解释性并小幅降低 WER。

如何使用Xiaomi-CocktailASR-1

  • 安装依赖:执行 pip install torch torchaudio transformers soundfile 安装所需环境。
  • 下载模型:从 HuggingFace(Ease3/Xiaomi-CocktailASR-1)下载模型权重文件。
  • 加载模型:通过 AutoModel.from_pretrained("Ease3/Xiaomi-CocktailASR-1", trust_remote_code=True, torch_dtype="bfloat16").cuda().eval() 加载模型。
  • 准备音频:准备一段 16k 单声道参考语音(目标说话人声纹)和一段待识别的单人/多人音频(非 16k 会自动重采样)。
  • 单条推理:调用 model("target.wav", "ref_speaker.wav") 即可返回目标说话人的转录文本(负样本时自动输出空文本,无需额外参数)。
  • 思维链推理:追加 cot=True 参数,模型会在 <think> 中输出推理过程、在 <answer> 中输出最终结果。
  • 批量推理:将数据整理为 5 列 TSV(utt_id, wav, text, ref_wav, ref_id),运行 tools/test_batch_scp.py 并指定模型路径、输入 TSV 和输出文件即可批量转录。

Xiaomi-CocktailASR-1的核心优势

  • 多说话人 SOTA 性能:在 AliMeeting、AMI、LibriMix 等多个主流多说话人基准上达到最优识别水平(如 AliMeeting Far WER 20.63%,此前 SOTA 为 27.5%)。
  • 单多人场景统一:同一模型在单说话人场景下性能媲美主流 ASR,无需按说话人数切换模型。
  • 负样本拒识能力:目标说话人缺席时输出空文本,拒识率达 68%-80%,而 Qwen3-ASR、StepAudio 等模型拒识率为 0。
  • 思维链可解释推理:CoT 模式输出说话人数、性别、声纹相似度等推理过程,既提升可解释性又能小幅降低 WER。
  • 端到端简洁架构:参考语音直接作为声纹 Prompt,免去传统语音分离模块,避免级联系统的误差累积。
  • 使用门槛低:一行代码调用、支持自动重采样与批量推理、提供正负样本 Demo,开箱即用。

Xiaomi-CocktailASR-1的项目地址

  • GitHub仓库:https://github.com/xiaomi-research/xiaomi-cocktailasr-1
  • HuggingFace模型库:https://huggingface.co/Ease3/Xiaomi-CocktailASR-1
  • arXiv技术论文:https://arxiv.org/pdf/2609.11274

Xiaomi-CocktailASR-1的同类竞品对比

对比维度 Xiaomi-CocktailASR-1 Qwen3-ASR
产品定位 目标说话人语音识别(TS-ASR),专攻多人混合场景 通用语音识别大模型(LALM),覆盖多语言与方言
多说话人识别 SOTA:LibriMix 2mix WER 4.11%,AliMeeting Far 20.63% 基本失效:LibriMix 2mix WER 68.75%,AliMeeting Far 39.64%
单说话人识别 强劲:LibriSpeech WER 1.73%,CommonVoice(zh) 4.95% 相当:LibriSpeech WER 1.87%,CommonVoice(zh) 5.39%
负样本拒识 拒识率 68%-80%(LibriSpeech neg 79.59%) 拒识率 0%,目标缺席时仍会误转录
可解释推理 支持 CoT 思维链,输出声纹相似度等推理过程 不支持
技术架构 Data2Vec2 编码器 + Adapter + Qwen3-8B,参考语音作 Prompt 免语音分离 通用音频编码 + LLM 端到端架构
使用方式 model(target, ref) 一行调用,需目标说话人参考音频 常规 ASR 调用,无需参考音频

Xiaomi-CocktailASR-1的应用场景

  • 智能会议定向转写:在多人会议中只听转指定发言人的内容,自动过滤其他与会者的插话与讨论。
  • 语音助手机主指令识别:手机/音箱/车载场景下只对机主语音响应,背景人声不会误触发指令。
  • 客服与质检录音分析:从多人通话录音中精准提取指定一方的完整话术,用于合规质检与服务评估。
  • 智能家居语音控制:电视喧闹、多人交谈的家庭环境中,准确识别遥控器持有者的语音指令,避免误操作。
  • 无障碍助听与记录设备:为听障人士或记录者定向提取特定说话人的语音内容并实时转文字,嘈杂社交场合中专注「听清」想听的人。