project
Mega-ASRは、NTU、NUS、および上海AIラボが開発したオープンソースの音声認識モデルです。
Mega-ASRは、南洋理工大学(NTU)、シンガポール国立大学(NUS)、上海人工知能研究所が共同でオープンソース化した、堅牢で包括的なシナリオに対応する音声認識プラットフォームモデルです。このモデルは、基盤となるアーキテクチャとしてQwen3-ASR 1.7Bを使用しており、以下の用途向けに設計されています。
Mega-ASRとは何ですか?
Mega-ASRは、南洋理工大学(NTU)、シンガポール国立大学(NUS)、上海人工知能研究所が共同開発した、あらゆるシナリオに対応するオープンソースの堅牢な音声認識プラットフォームモデルです。Qwen3-ASR 1.7Bの基盤アーキテクチャに基づき、ノイズ、遠距離音場、エコー、遮蔽、伝送パケット損失など、現実世界の複雑な音響環境における音声認識の課題に取り組み、複合データの構築と音響から意味への段階的な最適化のための拡張可能なフレームワークを提案しています。
Mega-ASRの主な機能
-
あらゆる状況において堅牢な音声認識を実現このモデルは、7つの基本的な音響効果(ノイズ、遠方音場、遮蔽、反響残響、録音による音色変化、電子歪み、伝送パケット損失)と54の物理的に妥当な複合音響シナリオを網羅しており、単一のモデルでさまざまな現実世界の環境に対応できます。
-
音響学から意味最適化への漸進的アプローチ(A2S-SFT)3段階の段階的トレーニングでは、まずエンコーダーとアライナーを中程度に劣化した音声(WER<<30%→50%→70%)に適応するようにトレーニングし、次に大規模言語モデルの意味回復機能をアクティブ化し、最後にエンドツーエンドの共同微調整を実行して、「音響知覚」と「意味再構築」という2つの主要な結合ボトルネックを解決します。
-
二重粒度動的報酬最適化(DG-WGPO)WERが30%を超えると、モデルのエラーパターンが「単語レベルの混同」から「文レベルの錯覚/文の損失」へと急激に変化するという問題に対処するため、トークンレベルの精緻化報酬と文レベルの再構築報酬を導入し、WERゲーティングとの動的融合によって極端な条件下での意味保持能力を強化します。
-
環境を考慮したプラグアンドプレイルーティング本システムは、入力音声が「クリーン」か「劣化」かを自動的に判別する軽量オーディオ品質分類器(シングルレイヤー・トランスフォーマー)を内蔵しています。クリーン音声にはオリジナルのQwen3-ASRバックボーンを使用し、劣化音声にはMega-ASRの堅牢なLoRAブランチを使用することで、一切の干渉を伴わない音質向上を実現しています。
-
オープンソースデータセット Voices-in-the-Wild-2M240万の合成音声トラックと5,000の評価用音声トラック(1,500の実録音を含む)を含む、大規模で堅牢なASRデータセットを公開しました。このデータセットは7つのメタシーンと54の混合シーンを網羅しており、難易度分布は制御された実験によって調整されています。
Mega-ASRの技術原理
-
Voices-in-the-Wild-2M データ構築このシステムはスペクトルレベルのコードシミュレーションを採用しており、まず7つの原子音響効果を独立してシミュレーションし、次にインテリジェントエージェント(「教会=遠方場+反響」など)を通して物理的な合理性を検証し、それらを組み合わせて54の複合シーンを生成します。難易度分布は統一された厳しさパラメータk∈[0,1]によって制御され、WER>70%の不安定なサンプルは削除されます。
-
A2S-SFT 3段階トレーニング第1段階では、音声エンコーダーとアライナーのみをトレーニングし、WERが30%未満、50%未満、70%未満となるように段階的にトレーニング範囲を拡大します。第2段階では、音響モジュールを固定し、大規模言語モデルを個別に微調整して意味的事前情報を活性化します。第3段階では、すべてのモジュールを共同でトレーニングし、音響的証拠と意味的推論のエンドツーエンドの整合性を実現します。
-
DG-WGPO 動的報酬メカニズム静的報酬はWER報酬と重複防止ペナルティで構成され、動的報酬の中核はトークンレベルの精緻化報酬(ソフト置換エラーとハード置換エラーの区別)と文レベルの再構築報酬(最長共通部分列と長さペナルティに基づく)で構成され、これらはWERゲーティング(閾値τ=0.3)によってミラーリングされ、融合されます。WERが低い場合は局所的な精緻化に重点が置かれ、WERが高い場合は全体的な意味保持に重点が置かれます。
-
環境を考慮したルーティングモデル80次元のlog-Mel特徴量に基づき、軽量な畳み込みフロントエンド+単層Transformerエンコーダ+アテンションプーリング構造を用いることで、バイナリ分類精度は99.5%を超え、推論オーバーヘッドは極めて低く、クリーン音声と劣化音声の自動分離を実現しました。
Mega-ASRの使い方
-
環境準備と依存関係のインストールランタイム環境は、Qwen3-ASRオープンソースエコシステムに基づいて構築されています。80次元ログメルスペクトル特徴抽出とモデル重みロードをサポートするために、関連する音声処理ライブラリとモデル推論の依存関係(transformers、torchaudioなど)がインストールされています。
-
デュアルモデルの重みを読み込む同時に、ベースモデルとしてオリジナルのQwen3-ASR 1.7Bバックボーンと、Mega-ASRの堅牢なLoRAウェイトという2つのコンポーネントをロードします。さらに、軽量で環境を考慮したルーティングモデル(シングルレイヤーTransformer、128の隠れ次元、LoRAに基づいて微調整済み)もロードする必要があります。
-
音声の前処理結果は、ルーティングモデルに入力されます。このシステムは、入力音声から80次元のログメルスペクトル特徴量を抽出し、軽量な畳み込みフロントエンドを使用してエンコードした後、ルーティングモデルの単層トランスフォーマーに入力して二値分類を行います。これにより、現在の音声が「クリーンな音声」か「劣化音声」かを自動的に識別します(精度は99.5%以上)。
-
自動フロー推論ルーティングモデルは、音声がクリーンであると判断した場合、標準認識のために元のQwen3-ASRバックボーンを直接呼び出し、LibriSpeechなどのクリーンなドメインのパフォーマンスが損なわれないようにします。音声が劣化していると判断した場合は、自動的にMega-ASRの堅牢なLoRAブランチに切り替わり、複雑な音響環境下でも強力なノイズ耐性と意味回復機能を発揮します。
-
認識結果を取得するこのモデルは、極端な劣化シナリオ(遠距離ピーク -5.2dB、NOIZEUS 0dBなど)においても、空白出力や意味的錯覚を回避し、高い精度の音声認識結果を維持できるテキスト転写結果を出力します。
Mega-ASRの主な利点
-
複雑な状況下での優れたパフォーマンスVoices-in-the-Wild-Bench ハイブリッド劣化シナリオでは、WER は 2.73/4.57 に達し、Whisper-Large-v3 と比較して 65.8%/69.1% の減少、Gemini-3-Flash と比較して 65.8% の減少となりました。NOIZEUS 0dB の極限条件下では、WER は 19.80 に低下し、Qwen3-ASR と比較して 17.4% の減少、Gemini-3-Flash と比較して 64.5% の減少となりました。
-
優れた意味復元機能遠距離ピークが-5.2dBという極端な場合、Qwen3-ASRは無音を出力し(WER 100%)、Gemini-3-Proは滑らかだが無関係な錯覚的なコンテンツを出力し(WER 86.1%)、Mega-ASRは参照テキストを正確に復元します(WER 0.0%)。
-
クリーンなドメインのパフォーマンスはロスレスです環境を考慮したルーティングにより、LibriSpeechなどのクリーンなベンチマークのWERは1.78/3.57から1.63/3.37へとさらに最適化され、ホットワード認識やストリーミング推論といった本来の機能は影響を受けません。
-
高いトレーニング安定性データセット構築プロセスにおいて、WERが70%を超える学習不可能なサンプルは除外されます。A2S-SFTは、段階的に難易度を上げていくコース学習戦略を採用することで、極端な劣化条件下でのトレーニング中にモデルがクラッシュするのを回避します。
-
完全オープンソースで再現可能モデルの重み、トレーニングコード、データセット構築プロセス、評価ベンチマークはすべてオープンソースであり、成熟したQwen3-ASRエコシステムに基づいているため、コミュニティが容易にアクセスできます。
Mega-ASRプロジェクトの住所
- プロジェクトホームページ:https://xzf-thu.github.io/Mega-ASR/
- GitHubリポジトリ:https://github.com/xzf-thu/Mega-ASR
- ハグ顔モデルライブラリ:https://huggingface.co/zhifeixie/Mega-ASR
- arXiv技術論文:https://arxiv.org/pdf/2605.19833
Mega-ASRと類似製品との比較
| 比較対象寸法 | Mega-ASR | Whisper Large-v3 | Qwen3-ASR 1.7B | Gemini-3-Flash |
|---|---|---|---|---|
| オープンソースのステータス | 完全オープンソース | 完全オープンソース | 完全オープンソース | 非公開ソース |
| 基盤となるアーキテクチャ | Qwen3-ASR 1.7B | Whisper | Qwen3-ASR 1.7B | Gemini |
| 合成シーンカバレッジ | 7種類の原子 + 54種類の複合体 | 限定 | 限定 | 限定 |
| NOIZEUS 0dB WER | 19.80 | ~55.78 | 23.97 | 55.78 |
| VOiCES R4-B-F WER | 45.69% | ~60%+ | 54.01% | ~50%+ |
| クリアな音声パフォーマンス | 1.63/3.37 (LibriSpeech) | 1.78/3.53 | 1.78/3.57 | 1.52/3.29 |
| 意味復元機能 | 強力(極端な条件下ではWERが0%まで低下する可能性がある) | 弱い(文章や錯覚を容易に見落とす) | 中くらい | 虚弱(幻覚を起こしやすい) |
| プラグアンドプレイ機能の強化 | (環境認識型ルーティング)をサポートします | サポートされていません | サポートされていません | サポートされていません |
Mega-ASRの応用シナリオ
-
車載音声対話エンジン音、風切り音、複数の会話といった複雑な音響環境に対処し、航法およびコマンド認識の精度を向上させる。
-
遠隔会議/授業の文字起こし会議室での反響音、距離による減衰、機器録音時の音色変化といった問題を解決し、高品質な自動議事録作成を実現します。
-
屋外インタビューおよび生放送の字幕街の騒音、風、障害物などの悪条件下でも、字幕生成の完全性と正確性を維持する。
-
スマートホームの音声制御長距離かつ複数部屋にわたる残響環境における、ウェイクワードおよびコマンド認識の堅牢性を向上させる。
-
電話による顧客サービスとVoIP通話分析パケット損失、ビットレート圧縮、電子歪みなどのチャネル劣化問題に対処し、通話内容認識の品質を確保する。