project
VITA-Audio - 低遅延かつ高速な推論を実現する、オープンソースのエンドツーエンド・マルチモーダル音声モデル。
VITA-Audioは、低遅延と高速な推論速度を特徴とするオープンソースのエンドツーエンドのマルチモーダル音声モデルです。軽量なマルチモーダルクロスラベル予測(MCTP)モジュールを介して、最初の順伝播で音声出力を生成できます。
VITA-Audioとは何ですか?
VITA-Audioは、低遅延かつ高速な推論速度を特徴とする、オープンソースのエンドツーエンド・マルチモーダル音声モデルです。軽量なマルチモーダル・クロスラベル予測(MCTP)モジュールにより、最初の順伝播で音声出力を生成できるため、最初の音声タグブロックの生成時間を大幅に短縮し、ストリーミングシナリオにおける遅延を大幅に低減できます。4段階の段階的学習戦略を採用することで、70億個のパラメータを持つ同規模のオープンソースモデルと比較して、推論速度を3~5倍高速化しています。また、自動音声認識(ASR)、テキスト音声合成(TTS)、音声質問応答(SQA)などのタスクにおけるベンチマークテストでも優れた性能を発揮します。
VITA-Audioの主な機能
- リアルタイムチャット機能VITA-Audioは、最初の順伝播で音声出力を生成できるマルチモーダルな大規模言語モデルであり、極めて低い遅延でリアルタイムの対話機能を実現します。軽量なマルチモーダルクロスタグ予測(MCTP)モジュールにより、単一の順伝播で複数の音声タグを効率的に生成できるため、ストリーミングシナリオにおける最初の音声生成の遅延を大幅に削減できます。
- 高効率な推論処理の高速化70億個のパラメータを持つVITA-Audioは、3~5倍高速な推論を実現します。独自の4段階プログレッシブトレーニング戦略により、音声品質の劣化を最小限に抑えながら効率的な推論を実現します。
- マルチモーダルなインタラクション機能VITA-Audioは、音声やテキストを含むマルチモーダルデータを理解・処理できます。音声アシスタントやインテリジェントな顧客サービスなど、マルチモーダルなインタラクションシナリオにおいて幅広い応用可能性を持ち、より豊かで自然な対話体験を提供します。
- 音声生成と音声認識VITA-Audioは、自動音声認識(ASR)、テキスト音声合成(TTS)、音声質問応答(SQA)タスクに関する複数のベンチマークテストにおいて、同規模のオープンソースモデルを大幅に上回る性能を発揮します。音声生成と認識において高い精度と効率性を示し、様々なシナリオにおける音声対話のニーズを満たします。
VITAオーディオ技術原理
- マルチモーダルクロスラベル予測(MCTP)モジュールこれはVITA-Audioの主要なイノベーションの一つです。このモジュールは、単一のモデル順伝播において複数のオーディオタグを効率的に生成できるため、ストリーミングシナリオにおける最初のオーディオ生成の遅延を大幅に削減し、極めて低遅延のリアルタイム対話機能を実現します。
- TiCodecモジュールこれは、連続的な音声波形を離散的なトークンに符号化し、離散的なトークンを再び波形に復号するために使用されます。これにより、音声とテキストを同一のシーケンス空間で統一的にモデル化することが可能になります。
- 非自己回帰(NAR)デコーダーと自己回帰(AR)デコーダーNARデコーダーは、単一の文内のすべての音声トークンの分布を予測するため、高速ですが精度は比較的低くなります。一方、ARデコーダーは、以前に生成されたトークンを利用するため、より高品質なトークンを生成しますが、処理速度は遅くなります。VITA-Audioは、この2つを組み合わせ、まずNARを使用して初期の音声トークン分布を生成し、次にARを使用してそれを精緻化することで、速度と品質のバランスを取っています。
- 4段階の漸進的トレーニング戦略
- フェーズ1:視覚と言語の整合性視覚アダプタをトレーニングし、説明的なキャプションと視覚的な質問応答データを使用してモデルを微調整することで、強力な視覚機能を構築します。
- フェーズ2:音声入力の微調整音声エンコーダーは、音声文字起こしペアデータを使用してトレーニングされ、その後、音声の質疑応答データを使用して微調整された。これにより、モデルは音声入力を理解し、応答できるようになった。
- フェーズ3:音声出力の微調整外部TTSモジュールを必要とせずにエンドツーエンドの音声出力を実現するように、オーディオデコーダーをトレーニングします。
- フェーズ4:マルチモーダルコマンドの微調整マルチモーダルタスクにおけるモデルのパフォーマンスをさらに最適化し、異なるモダリティからの入力を処理する能力を向上させる。
VITA-Audioプロジェクトの住所
- GitHubリポジトリ:https://github.com/VITA-MLLM/VITA-Audio
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/VITA-MLLM/vita-audio
- arXiv技術論文:https://arxiv.org/pdf/2505.03739
VITA-Audioの応用シナリオ
- スマートホームコントロールVITA-Audioは音声コマンドを理解し、照明、温度、セキュリティシステムなど、家庭内のスマートデバイスを制御できます。
- インテリジェントな顧客サービスオンラインカスタマーサービスの場面において、VITA-Audioはユーザーのテキストによる説明、画像のアップロード、音声メッセージを同時に理解し、質問に迅速かつ正確に回答することができます。
- 教育支援オンライン教育プラットフォームや学習アプリケーションにおいて、VITA-Audioは学生の学習を支援することができます。例えば、学生がアップロードした学習教材(教科書の画像、教育ビデオなど)を分析し、学生の質問と組み合わせることで、知識ポイントの説明や練習問題の解答といったサービスを提供できます。
- 医療支援VITA-Audioは、医師が医療画像を解釈したり、医療記録データを分析し、最新の医学研究文献を組み合わせて、補助的な診断や治療に関する提案を行うのに役立ちます。
- コンテンツ作成メディア企業や自社メディアプラットフォームにおいて、VITA-Audioは、クリエイティブなテーマやスタイルの要件を理解し、創造的なインスピレーションや執筆の提案を提供することで、コンテンツ制作者が記事やビデオスクリプトなどを作成するのを支援します。