project
Universal-1 - AssemblyAIが発表した多言語音声認識・変換モデル。
Universal-1は、AI音声認識スタートアップ企業AssemblyAIが開発した多言語音声認識・文字起こしモデルです。1250万時間以上の多言語音声データで学習されており、英語、スペイン語、フランス語、ドイツ語などの言語に対応しています。
ユニバーサル1とは何ですか?
Universal-1は、AI音声認識スタートアップ企業AssemblyAIが開発した多言語音声認識・文字起こしモデルです。1,250万時間以上の多言語音声データで学習されており、英語、スペイン語、フランス語、ドイツ語などに対応しています。このモデルは、騒がしい環境、様々なアクセント、自然な会話など、多様な環境下で高精度な音声テキスト変換サービスを提供し、応答速度の速さとタイムスタンプ精度の向上を実現しています。Universal-1は、音声認識のあらゆる側面における精度向上を目指して設計されており、顧客が求める繊細な音声データのニーズを満たし、次世代AI製品・サービス構築のための強力なツールとして活用できます。
Universal-1の主な特徴
- 多言語対応Universal-1は、英語、スペイン語、フランス語、ドイツ語など複数の言語に対応しており、音声認識の精度を向上させるためにこれらの言語向けに最適化されています。
- 高精度Universal-1は、背景雑音、アクセントの多様性、自然な会話、言語のバリエーションなど、さまざまな条件下で優れた音声認識精度を維持します。
- 幻覚の発生率を低下させるWhisper Large-v3と比較して、Universal-1は音声データの誤認識率を30%削減します。つまり、音声入力がない場合にモデルが誤ってテキストを生成する回数が減少します。
- 迅速対応Universal-1は、効率的な並列推論機能を備えており、長時間の音声ファイルを迅速に処理し、高速な応答時間を実現します。バッチ処理速度はWhisper Large-v3の5倍です。
- 正確なタイムスタンプ推定このモデルは単語レベルの精度を持つタイムスタンプを提供するため、音声・動画編集や会議録音などのアプリケーションにとって非常に重要です。Universal-1のタイムスタンプ精度は、Whisper Large-v3よりも26%高くなっています。
- ユーザー設定ユーザー嗜好テストでは、ユーザーの71%がUniversal-1の出力を好み、実際の使用においてUniversal-1の方がユーザーのニーズをよりよく満たしていることが示された。
ユニバーサル1の性能比較
- 英語音声認識の精度:Universal-1は、OpenAIのWhisper Large-v3、NVIDIAのCanary-1B、Microsoft Azure Batch v3.1、Deepgram Nova-2、AmazonとGoogleのLatest-longなどのモデルと比較して、11のデータセットのうち5つで最も低い単語誤り率(WER)を達成しました。
- 英語以外の言語の音声認識精度:スペイン語、フランス語、ドイツ語のテストにおいて、Universal-1は15のデータセットのうち5つでより低いWERスコアを達成し、これらの言語における競争力を示した。
- タイムスタンプの精度:タイムスタンプの精度に関して言えば、Universal-1はWhisper Large-v3と比較して、100ミリ秒以内のタイムスタンプを持つ予測単語の割合を25.5%向上させ、67.2%から84.3%に増加させた。
- 推論効率:NVIDIA Tesla T4マシンでは、Universal-1は並列化なしの高速なwhisperバックエンドよりも3倍高速で、64回の並列推論で1時間の音声をわずか21秒で書き起こすことができます。
- 幻覚の減少:Universal-1は、Whisper Large-v3と比較して、音声の書き起こし時に幻覚の発生率を30%低減しました。
- 人間嗜好テスト:人間による選好テストでは、評価者はUniversal-1の出力を60%のケースで好んだのに対し、Conformer-2を好んだのはわずか24%だった。
- 音声パターンのセグメンテーションとクラスタリング:Universal-1は、Conformer-2と比較して、話者ダイアライゼーションの精度において以下の改善を実現しています。
- ダイアリゼーションエラー率(DER)は7.7%減少した。
- WERと話者マーキング精度の複合測定により、cpWERは13.6%減少した。
- 話者数推定の精度は71.3%向上した。
Universal-1の使い方
現在、Universal-1は英語とスペイン語で利用可能で、ドイツ語版とフランス語版も近日中にリリース予定です。AssemblyAIは今後、ユニバーサルモデルにさらに多くの言語サポートを追加していく予定です。興味のあるユーザーは、PlaygroundまたはAPI経由で試用できます。
- Playground で試してみてください:Universal-1を試す最も簡単な方法は、AssemblyAIのプレイグラウンド。Playgroundでは、ユーザーは音声ファイルを直接アップロードしたり、YouTubeのリンクを入力したりすることができ、モデルが迅速にテキストの文字起こしを生成します。
- 無料APIトライアル:ユーザーできる無料登録そしてAPIトークンを取得します。登録後、AssemblyAIのドキュメント(Docs)またはWelcome Colabにアクセスしてください。これらはAPIをすぐに使い始めるのに役立ちます。
Universal-1に関する詳細については、AssemblyAIの公式技術レポートを参照してください。https://www.assemblyai.com/discover/research/universal-1
Universal-1の応用シナリオ
- 対話型インテリジェンスプラットフォームアクセント、録音状況、話者の人数に関係なく、大量の顧客データを迅速かつ正確に分析し、重要な顧客の声に関する洞察と分析を提供することができます。
- AIメモ帳正確で錯覚のない会議議事録を生成し、正確な固有名詞、発言者、時間情報などを含む大規模な言語モデルに基づいて、要約、アクションアイテム、その他のメタデータを生成するための基盤を提供します。
- クリエイターツールエンドユーザー向けに、AIを活用したビデオ編集ワークフローを構築します。このワークフローでは、複数の言語における正確な音声認識、低いエラー率、そして信頼性の高い単語タイミング情報を活用します。
- 遠隔医療プラットフォーム正確かつ忠実な音声認識技術を活用した、自動化された臨床記録入力および請求提出プロセス。処方箋名や医学的診断名などの珍しい単語も含め、敵対的な状況や遠距離録音条件下でも高い成功率を実現します。