project
Fun-ASR-Realtime - アリババ千文が発表したストリーミングリアルタイム音声認識モデル
Fun-ASR-Realtimeは、アリババの千文プラットフォームが開発した大規模ストリーミングリアルタイム音声認識モデルです。このモデルはWebSocketストリーミングプロトコルを使用し、音声と単語の同時出力を実現しています。最初の単語の遅延は数百ミリ秒、最後の単語の遅延は極めて低くなっています。
Fun-ASR-Realtimeとは何ですか?
Fun-ASR-Realtimeは、アリババのQianwenプラットフォームが開発した大規模ストリーミングリアルタイム音声認識モデルです。このモデルはWebSocketストリーミングプロトコルを使用し、ユーザーの発話に合わせて単語を出力します。最初の単語の遅延はわずか数百ミリ秒、最後の単語の遅延は極めて低くなっています。中国語(北京語)、16の方言、30言語のリアルタイム認識に対応し、文脈理解、カスタムホットワード、感情分析、タイムスタンプ出力などの機能を備えています。
Fun-ASR-Realtimeの主な機能
-
リアルタイムストリーミング認識WebSocketによる全二重通信を通じて低遅延の音声テキスト変換を実現し、音声とテキストの同時出力に対応しています。
-
多方言・多言語対応広東語、呉語、閩語、客家語など16の方言と30の言語を網羅しており、海外顧客サービスや国際会議などの場面に適しています。
-
文脈の修正過去の会話の文脈やリアルタイムのホットワードに基づいて自己修正することができ、例えば文脈に基づいて「叶鹿」を「夜鹭」に修正するなどです。
-
感情認識Qwen-ASRモデルは7種類のきめ細かい感情認識をサポートし、Paraformerは3種類の極性感情認識をサポートします。
-
タイムスタンプ出力Fun-ASRとParaformerは、デフォルトで文レベルと文字レベルのタイムスタンプを出力するため、字幕のアライメントやキーワードの強調表示が容易になります。
-
ホットワードカスタマイズホットキーワードを通じて、ブランド名、人名、固有名詞の認識精度向上をサポートします。
-
VAD インテリジェント センテンスの内訳サーバーは音声メッセージの開始点と終了点を自動的に検出し、カスタマイズ可能な無音閾値と感度をサポートします。
-
非人間の音声フィルタリング音声認識精度を向上させるため、人間以外の音声コンテンツを自動的にフィルタリングします。
Fun-ASR-Realtimeの技術原理
- 大規模モデルストリーミングアーキテクチャこのモデルは、TransformerまたはConformerをベースとした大規模モデルをバックボーンネットワークとして使用し、ストリーミング推論メカニズムを通じて音声の入出力を同時に実現することで、処理前に音声セグメント全体の終了を待つことを回避し、最初の単語の遅延を数百ミリ秒のレベルに圧縮します。
- 因果的注意とチャンキングこのモデルは、推論時に因果的アテンションマスクを使用することで、各タイムステップでの予測が、将来の情報ではなく、現在および過去の音声フレームのみに依存するようにします。同時に、入力として固定長の音声ブロックを使用することで、レイテンシと精度とのバランスを取っています。
- 一般的な文脈強化訓練トレーニング段階では、過去の対話コンテキストとリアルタイムのホットワードが補助入力として導入されます。コンテキスト認識型再スコアリングメカニズムにより、モデルはコンテキストに応じて認識結果を動的に修正できます。例えば、バードウォッチングのコンテキストに基づいて、葉鹿をゴイサギに修正するといったことが可能です。
- マルチタスク共同モデリングこのモデルは、音声認識という主要タスクで学習され、感情認識と音声活動検出(VAD)のタスクでも共同で学習されます。共有エンコーダーを通して一般的な音響表現を抽出し、単一の順伝播で文字起こしされたテキスト、感情タグ、文の区切り境界を出力します。
- タイムスタンプのアライメントメカニズム接続時間分類(CTC)またはアテンションアライメントパスに基づいて、デコード処理中に音声内の各文字/単語の開始タイムスタンプと終了タイムスタンプが同時に予測され、字幕アライメントとキーワードローカリゼーションの要件を満たすために、出力は文レベルと文字レベルの両方の粒度で行われます。
Fun-ASR-Realtimeの使い方
-
認証情報を取得するAlibaba Cloud Refinement コンソール (https://help.aliyun.com/zh/model-studio/real-time-speech-recognition-user-guide) から API キーを取得し、環境変数に設定してください。
-
SDKをインストールするpipまたはMavenを使用して、DashScope SDKの最新バージョンをインストールしてください。
-
設定パラメータRecognitionインスタンスを作成し、モデル名を設定します。
fun-asr-realtime音声フォーマット(PCM/WAVなど)とサンプリングレート。 -
接続を確立するWebSocketを介して、Alibaba Cloud推論サーバーとの全二重接続を確立します。
-
音声を送信マイクまたは音声ファイルのデータを固定フレーム長でループ処理し、読み込んで送信します。
-
結果を受け取りましたコールバック内でリアルタイムの戻り値を処理します。
on_eventイベントが発生し、中間結果と文レベルの最終結果を取得します。 -
任務終了音声送信完了後に呼び出されます
stop()または送信finish-taskこのコマンドは、認証セッションを閉じます。
Fun-ASR-Realtimeの主な利点
-
低遅延と高精度最初の文字の遅延は数百ミリ秒ですが、精度はオフラインモデルに近く、速度と精度の両方を実現しています。
-
方言認識の分野でトップクラスの実績を誇る16種類の方言テストのうち12種類で、VolcanoやTencentの類似製品を上回り、呉語の方言の精度は業界最高水準に達した。
-
文脈自己修正文脈を理解する能力を備えており、後続の情報に基づいて、以前に誤って識別されたコンテンツを自動的に修正することができる。
-
産業環境において堅牢性を発揮複雑な背景、騒がしい遠距離の状況、アクセントのある場面などにおいて、中国語と英語の両方を認識する精度は、競合製品よりも優れている。
-
便利なエコシステムへのアクセスAlibaba CloudのBailianプラットフォームを通じて一元的に提供されるこのソリューションは、多言語SDKと直接WebSocket接続をサポートし、完全な高並行処理のベストプラクティスソリューションを提供します。
Fun-ASR-Realtimeと類似の競合製品との比較
| 寸法 | Fun-ASR-Realtime | GPT-4o-Transcribe / Realtime API |
|---|---|---|
| 製品ポジショニング | リアルタイム音声認識ストリーミング専用に設計された大型モデル | GPT-4oベースの文字起こしモデルは、リアルタイムAPIによるストリーミング再生、またはRESTによるバッチ文字起こしをサポートしています。 |
| 最初の文字の遅延 | ミリ秒レベルのネイティブストリーミングアーキテクチャ | ストリーミングモードでは、ネットワークとVADの設定によって異なりますが、レイテンシは約300~500msです。バッチモードにはリアルタイム機能はありません。 |
| ストリーミングアーキテクチャ | ネイティブWebSocket全二重ストリーミング、エンドツーエンド最適化 | リアルタイムAPI WebSocketを介したストリーミング入力はサポートされていますが、文字起こしモードではターン終了時にのみ完全な結果が返されるため、デルタ連続性が制限されます。 |
| 方言サポート | 16の方言(呉語、閩語、客家語など)と上海語における正答率は92.41%。 | 99以上の言語ではサンプルカバレッジがゼロですが、方言やリソースの少ない言語では精度が著しく低下し、中国語の方言に対する特別な最適化は行われていません。 |
| 文脈の修正 | サポートされています。文脈に基づいて以前の誤認を自動的に修正できます(例:「葉鹿」→「ゴイサギ」)。 | GPT-4oの言語理解能力に基づくと、曖昧な単語(their/there/they’reなど)の文脈解析において優位性があるが、リアルタイムでの文間エラー訂正メカニズムが欠けている。 |
Fun-ASR-Realtimeの応用シナリオ
- ライブストリーミング字幕長時間の生放送や複数人でのインタラクティブなシナリオにおいて、ミリ秒レベルの低遅延字幕出力を実現し、頻繁な話者切り替えや複雑な競争環境にも対応します。映画・テレビ界の嵐の中で行われた「無人島への帰還」の100時間生放送において、合計132万語のリアルタイム字幕出力でその性能が実証されています。
- 会議のリアルタイム文字起こしリモート会議やオフラインフォーラムなどのシナリオでは、発言中に文レベルおよび文字レベルのタイムスタンプ付きの構造化テキストを出力できるため、会議後に重要な発言を素早く確認したり、タイムノードを特定したりすることが容易になります。
- 顧客サービス通話品質検査顧客サービス担当者とユーザー間の双方向の対話をリアルタイムで識別し、感情状態を同時に検出するとともに、ホットワードのカスタマイズをサポートして、ブランド名、製品名、苦情キーワードを正確に捉え、通話中にリアルタイムでリスク警告を実現します。
- 音声入力方法この技術は、モバイルデバイス、車載端末、IoTデバイス向けに低遅延の方言入力機能を提供し、広東語、呉語、閩語を含む16の方言のリアルタイム文字起こしをサポートすることで、中国語を母語としないユーザーの入力効率とユーザーエクスペリエンスを向上させます。