project
Qwen3-ASR - アリババ同義によるオープンソースの音声認識モデルシリーズ
Qwen3-ASRは、アリババクラウドの同義千文チームが開発したオープンソースの音声認識モデルシリーズです。1.7Bの高精度バージョンと0.6Bの高効率バージョンの2つのASRモデルに加え、専用の強制アライメントモデルであるQwen3-ForcedAligner-0.6Bが含まれています。
Qwen3-ASRとは何ですか?
Qwen3-ASRは、Alibaba CloudのTongyi Qianwenチームが開発したオープンソースの音声認識モデルシリーズです。1.7Bの高精度バージョンと0.6Bの高効率バージョンの2つのASRモデルに加え、専用のQwen3-ForcedAligner-0.6B強制アライメントモデルが含まれています。これらのモデルは52の言語と方言をサポートし、ストリーミング推論と非ストリーミング推論を統合しており、強いノイズ、高速な音声、歌唱などの複雑なシナリオでも堅牢です。1.7Bモデルは中国語、英語、および方言認識において最先端(SOTA)のパフォーマンスを実現し、0.6Bモデルは2000倍のスループットで128の同時接続をサポートし、5時間の音声を10秒で処理します。
Qwen3-ASRの主な機能
-
多言語認識30の主要言語の音声認識と言語識別をサポートし、統一された多言語モデリングを可能にします。
-
方言のカバー範囲広東語、呉語、閩南語、および各省の地方方言を含む、22の中国語方言の認識をサポートしています。
-
アクセントカラーのマッチング16の国・地域における英語のアクセントの違いに対応し、地域を越えた認識能力を向上させています。
-
デュアルモード推論ストリーミング推論と非ストリーミング推論を統合的にサポートし、一度に最大20分間の音声を処理できます。
-
シナリオは堅牢です複雑な状況にも強く、強い騒音、低品質な音声、速い発話速度、高齢者や子供の声といった課題にも対応できます。
-
歌唱の書き起こし伴奏に合わせて歌うことをサポートし、中国語と英語の楽曲全体を文字起こしできます。
-
タイムスタンプのアライメント字幕生成や音声編集のニーズを満たすため、単語レベル/文レベルのタイムスタンプ調整機能を提供します。
Qwen3-ASRの技術原理
- 音声符号化層この技術は、革新的な事前学習済みAuT音声エンコーダーを採用し、高レベルの音響表現を抽出することで、従来のFバンク特徴量を置き換え、ノイズやアクセントに対する汎化能力を向上させています。
- マルチモーダルベースQwen3-Omniマルチモーダル大規模モデルをベースに、そのクロスモーダル理解能力を活用することで、従来のHMM/GMMパイプラインを必要とせずに、音声からテキストへの直接マッピングを実現します。
- トレーニングパラダイム大規模な多言語事前学習によって一般的な音響意味空間が確立され、その後、方言、歌声、騒音などのシナリオに合わせて微調整され、言語認識と音声認識のタスクが同時に最適化される。
- 効率的な推論0.6BモデルはvLLMアクセラレーションエンジンを使用し、バッチ推論と非同期サービスをサポートし、128の同時実行数で2000倍のスループットを実現します。ストリーミングバージョンはブロックキャッシュメカニズムを使用して、リアルタイム性能と精度をバランスよく両立させています。
- 強制的な位置合わせForcedAlignerは、非自己回帰型LLMアーキテクチャに基づいており、並列デコードによってタイムスタンプを予測することで、単一同時実行RTF 0.0089を達成し、従来のCTCおよびWhisperXソリューションの精度を上回ります。
Qwen3-ASRのプロジェクトアドレス
- プロジェクト公式サイト:https://qwen.ai/blog?id=qwen3asr
- GitHubリポジトリ:https://github.com/QwenLM/Qwen3-ASR
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/Qwen/qwen3-asr
- 技術論文:https://github.com/QwenLM/Qwen3-ASR/blob/main/assets/Qwen3_ASR.pdf
Qwen3-ASRの応用シナリオ
-
スマートミーティングこのモデルは、複数人で行われる会議の内容をリアルタイムで文字起こしでき、中国語と英語の混在や様々な方言に対応し、タイムスタンプ付きの議事録を自動的に生成します。
-
動画字幕映画、テレビシリーズ、ショートビデオ、ライブ配信向けに正確な字幕を生成するほか、BGM付きの歌唱コンテンツの認識や多言語翻訳字幕の作成にも対応しています。
-
電話によるカスタマーサービスこのモデルは、騒がしい通話環境や低品質な通話環境でも顧客の音声を安定して認識でき、リアルタイムのストリーミング文字起こしとキーワード抽出をサポートしています。
-
スマートスピーカー高齢者や子供の非標準的な発音にも対応し、遠距離音声認識や方言による対話もサポートし、家庭での音声制御体験を向上させます。
-
法的証拠収集これにより、複雑な音響環境下でも音声証拠を高精度で書き起こすことが可能になり、裁判手続きや内容検証に使用できる単語レベルのタイムスタンプが提供されます。