AB
AiBoss站
快讯

英伟达详解 Nemotron 沙特阿拉伯语方言微调流程

英伟达技术博客介绍用 NeMo 框架微调 Nemotron 3.5 ASR 以适配沙特 Najdi 与 Hijazi 方言的流程,据报在目标测试集上将词错误率从 55.05% 降至 29.96%,并称未损害其他阿拉伯语方言表现。

核心事实

英伟达开发者博客发布技术文章,介绍如何用 NVIDIA NeMo 框架微调 Nemotron 3.5 ASR 模型,以适配沙特阿拉伯的 Najdi 与 Hijazi 方言。文章称,该模型本身支持覆盖 40 个语言区域的流式多语种转写,但特定部署场景下的方言与录音条件仍需要针对性微调。

据文章描述,团队在 133.7 小时的 Najdi 与 Hijazi 语音上微调后,目标测试集的词错误率(WER)从 55.05% 降至 29.96%,英文表现从 11.04% 改善至 10.42%,且未削弱其他阿拉伯语方言。文章还提到,改用更大的注意力上下文(13 帧前瞻)配合 beam-8 MALSD 解码,可在不重新训练的情况下再降低 2.71 个绝对百分点,代价是约 800 毫秒额外延迟。

背景与影响

文章指出,多语种 ASR 模型在通用基准上表现良好,但在实际部署中常因区域方言和本地录音条件而失效;仅用目标方言微调又可能削弱其他语言能力。为此,该流程采用最小化数据清洗、按权重混合回放数据(90% 沙特语音、7% 英文与 3% 阿拉伯语 FLEURS)、按时长分桶批处理,以及部分解冻编码器层等做法。

文章称,解冻全部 24 层编码器可获得最低错误率,但需训练 2.304 亿参数;冻结部分层则可降低算力需求。此外,Nemotron 3 Diarization 可将该流程扩展至最多 8 名说话人的带说话人标注转写。

限制与来源

文章强调,上述配置是特定实验中的排错示例,并非通用推荐默认值;回放数据只能保护其所代表的能力,部分解冻在混合比例变化时需重新调参,该流程也不构成对所有阿拉伯语方言或部署环境的普适证据。相关数据、超参数与硬件设置(实验使用两块 NVIDIA RTX PRO 6000 Blackwell 工作站版 GPU)均针对该次实验,实际效果可能不同。

来源:NVIDIA 开发者博客,作者署名 Imane Khaouja、Amine El Khair、Meshari Alaeena、Zahra Al-Kaf 与 Abdulrahman Alkhamees。文中数据与结论均引自该文,具体功能、可用性与许可请以英伟达官网当前信息为准。