ニュース
Meta社が初のリアルタイム音声認識モデル「Muse Voice Transcribe」を発表
Meta社は、ストリーミング音声認識、話者セグメンテーション、エンドポイント検出を統合した初のリアルタイム音声認識モデル「Muse Voice Transcribe」を発表しました。このモデルは、複数のトラックにわたる20人以上の話者と70以上の言語の文字起こしに対応しています。適応型レイテンシーメカニズムを採用することで、リアルタイム応答と認識精度を両立させており、人工分析ストリーミング音声テキスト変換のリーダーボードで1位を獲得しています。