AB
AiBoss
project

MAI Transcribe-1.5 - マイクロソフトのMAI音声認識モデル

MAI-Transcribe-1.5は、マイクロソフトのAIチームが開発した音声認識モデルです。43言語に対応し、文脈を考慮したキーワードバイアス機能を備え、FLEURSベンチマークテストにおいて最低の単語誤り率を達成しています。

MAI Transcribe-1.5とは何ですか?

MAI-Transcribe-1.5は、マイクロソフトのAIチームが開発した音声認識モデルです。43言語に対応し、文脈を考慮したキーワードバイアス機能を備えています。FLEURSベンチマークテストでは業界最低の単語誤り率(WER 4.86%)を達成しており、動画キャプション、会議の文字起こし、通話分析といった企業レベルの運用シナリオ向けに設計されています。

MAI Transcribe-1.5の主な特徴

  • 43言語の高精度文字起こし英語、中国語、日本語、ヒンディー語、アラビア語を含む43言語に対応し、自動言語認識をサポートしています。
  • キーワード/エンティティバイアス最大200個のドメイン固有の用語(人名、製品名、医療用語など)を挿入でき、文脈情報に基づいて、強制的に一致させるのではなく、バイアスを適用するかどうかを判断します。
  • 騒音環境下での堅牢性実際の環境における背景雑音や音質の変動に最適化されており、高い精度を維持します。
  • 長時間の音声を高速処理1時間の音声を約15分で文字起こしできるようになり、これは従来世代の最大5倍の速さです。
  • 産業シナリオへの適応医療、顧客サービス、金融などの分野の専門用語を理解する機能が組み込まれており、箱から出してすぐに使用できます。

MAI Transcribe-1.5の技術的原理

  • 多言語統合モデリングこのモデルは、アッサム語、グジャラート語、カンナダ語といったリソースの少ない言語を含む、主要言語43言語の膨大な音声データを用いて共同で学習されています。共有表現学習によって言語間転移学習を実現し、異なるアクセントや方言下でも安定性を確保します。
  • 文脈認識型キーワードバイアス機構従来の強制置換とは異なり、MAI-Transcribe-1.5は、ユーザーが提供するドメイン固有の語彙をソフトキューとしてデコード処理に組み込みます。このモデルは、音響的特徴と意味的文脈を組み合わせて、バイアス戦略をいつ有効にするかを動的に判断します。FLEURS多言語ベンチマークでは、一般的な語彙における誤検出を回避しながら、WERをさらに30%削減できます。
  • 長時間の音声の分割とストリーミングの最適化会議やポッドキャストなどの長時間の音声録音の場合、このモデルは改良されたセグメンテーションおよびキャッシングメカニズムを採用し、冗長な計算とメモリ使用量を削減することで、セグメント間の意味的な一貫性を維持しながら、エンドツーエンドの遅延を大幅に短縮します。

MAI Transcribe-1.5の使い方

  • Azure Speech SDKSDKをアプリケーションに統合して呼び出します。 MAI-Transcribe-1.5 モデルのエンドポイントは、WAV/MP3/FLAC形式をサポートしています(単一ファイルの最大サイズは300MBまたは2時間)。
  • REST APIHTTPリクエストを介して音声ストリームまたはファイルを直接送信し、JSON形式で文字起こし結果を取得します。
  • MAI Playground音声をMicrosoft MaiプレイグラウンドWebサイト(https://playground.microsoft.ai/)のインタラクティブなサンドボックスにアップロードすると、すぐに効果を体験できます。
  • Microsoft FoundryAzure Speechサービス経由でアクセスでき、音声1時間あたり0.36ドルで課金されます。モデルのデプロイは不要です。

MAI Transcribe-1.5の主な利点

  • 業界最高水準の精度FLEURS 43言語の平均WERは4.86%で、Elevenlabs Scribe v2(5.53%)、OpenAI Transcribe(5.73%)、Google Gemini Flash Lite(5.63%)よりも低い。
  • 言語カバー率が2倍になったバージョン1の25言語と比較して、新たに18言語が追加され、グローバル製品により適したものとなった。
  • ドメイン語彙にエラーはありませんキーワードバイアスを用いることで、企業内の専門用語、略語、医薬品名などを正確に書き起こすことができます。
  • コストとスピードのバランス1時間あたり0.36ドルという価格設定で、長時間の音声処理速度が5倍速いモデルもあり、非常にコストパフォーマンスに優れています。

MAI Transcribe-1.5プロジェクトのアドレス

  • プロジェクト公式サイト:https://microsoft.ai/models/mai-transcribe-1-5/
  • 技術論文:https://microsoft.ai/pdf/MAI-Transcribe-1.5-Model-Card.PDF

MAI Transcribe-1.5と類似の競合製品との比較

比較対象寸法 MAI-Transcribe-1.5 Elevenlabs Scribe v2
FLEURS 平均 WER 4.86%(最低) 5.53%
サポートされている言語の数 43種類 約32種類
キーワード/エンティティバイアス 最大200まで対応。 サポートされていません
長時間の音声処理速度 1時間の音声 ≈ 15分 標準速度
価格設定 時給0.36ドル 時給0.40ドルから
スピーカーの分離 現時点ではサポートされていません サポート
展開方法 Azure SDK / REST API API

MAI Transcribe-1.5の応用事例

  • 動画の字幕とコンテンツのローカライズグローバルな動画プラットフォーム向けに43言語で高精度の字幕を自動生成し、ローカライズコストを削減します。
  • 会議およびインタビューの文字起こし多言語の会議録音を検索可能なテキストにすばやく変換します。1時間の音声を約15分に変換できます。
  • 顧客サービス通話分析医薬品名や製品モデルなどの専門用語を正確に識別し、高度な品質検査や感情分析をサポートします。
  • 医学的口腔病歴医師の回診記録や手術記録から解剖学用語や薬学用語を自動的に転記し、医療記録の入力効率を向上させます。
  • アクセシビリティツール聴覚障害者向けにリアルタイムの音声認識サービスを提供し、騒がしい環境でも明瞭な音声認識をサポートします。