AB
AiBoss
project

AudioX-Turbo - Noiz AIと清華大学が共同開発した音声生成フレームワーク

AudioX-Turboは、Noiz AIが香港科技大学および清華大学と共同で開発した、統合的で効率的な音声生成フレームワークです。テキスト、ビデオ、音声入力を自由に組み合わせることで、高品質な効果音や音楽の生成をサポートします。

AudioX-Turboとは何ですか?

AudioX-Turboは、Noiz AIが香港科技大学および清華大学と共同で開発した、統一された効率的な音声生成フレームワークです。テキスト、ビデオ、音声入力の任意の組み合わせから、高品質の効果音や音楽を生成することをサポートします。このモデルは、2.7Bマルチモーダル拡散トランスフォーマーアーキテクチャに基づいています。分布マッチング蒸留と敵対的蒸留により、推論ステップを50~200から4に圧縮し、1台のRTX 4090でわずか0.24秒で10秒の音声を生成します。チームは、約920万サンプルのIF-caps-Proデータセットを構築し、初めて正確なタイムスタンプ制御を実現しました。

AudioX-Turboの主な機能

  • テキスト音声変換(T2A)プレーンテキストのプロンプトに基づいて環境音やアクション効果音を生成し、音の種類、スタイル、シーンを正確に記述することをサポートします。
  • テキストから音楽への変換(T2M)テキストコマンドに基づいて、指定されたスタイル、楽器構成、リズム、雰囲気を持つ音楽クリップを生成し、複雑な音楽理論の説明にも対応しています。
  • 動画音声変換(V2A)動画の内容に基づいて、リアルタイムで動きのある効果音や環境音をマッチングさせ、無音動画に自動で吹き替えやフォーリー効果を加える。
  • 動画から音楽への変換(V2M)動画の感情、リズム、ダイナミクスを分析し、同期したBGMを自動的に生成します。複数の音楽スタイルに対応しています。
  • テキスト+ビデオ同時生成(TV2A/TV2M)映像とテキストコマンドを組み合わせることで、例えば「3秒目に雷、5秒目にギター」といったように、タイムスタンプレベルで正確な効果音や音楽を生成することができます。
  • 音声の完成と修復 文脈に応じた音声セグメントに基づいてスタイルを補完、修復、または転送することができ、音声コンテンツのインテリジェントな継続とノイズリダクションをサポートします。
  • 画像から音声への変換(ゼロサンプル)画像に関する特別な訓練は必要なく、静止画像の内容に基づいて、対応する環境音やシーン効果音を推測して生成することができる。

WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ

AudioX-Turboの技術原理

  • マルチモーダル拡散トランスフォーマーアーキテクチャこのモデルは、フローマッチングフレームワークに基づいて構築された2.7Bマルチモーダル拡散トランスフォーマーを採用しています。テキストはT5エンコーダーで処理され、意味的特徴が抽出されます。ビデオはシンクロフォーマーで処理され、時間的な視覚表現が抽出されます。オーディオはVAE圧縮によって潜在空間表現に変換されます。これらの3つのモダリティは、共有トランスフォーマーに均一に投影され、クロスアテンション融合のために入力されます。これにより、任意の組み合わせでテキスト、ビデオ、オーディオを共同生成することが可能になります。
  • 分配適合蒸留および逆蒸留教師モデルの50~200回のサンプリングプロセスを4ステップに圧縮するため、チームは2段階の蒸留戦略を採用しました。まず、分布マッチング蒸留(DMD)によって生徒モデルを訓練し、教師モデルのフローフィールド分布を近似することで、1ステップの予測で複数ステップの結果と一致させました。次に、拡散識別器を導入して敵対的蒸留を実行し、4ステップの制約の下で音声の詳細をさらに洗練させました。生徒モデルは、いくつかの客観的指標において教師モデルを上回る結果となりました。
  • 強力な命令データセット IF-caps-Proチームは、約920万個のサンプルを含むIF-caps-Proデータセットを構築しました。このデータセットの核となるイノベーションは、構造化されたアノテーションにあります。各データポイントには、正確なタイムスタンプ、イベント数、楽器の種類、出現順序が含まれています。これにより、モデルは「ギター+ドラムビート」のような静的な組み合わせを理解できるだけでなく、「まずセミが3秒間鳴き、次に5秒目にギターを追加し、8秒目にフェードアウトする」といった複雑なタイミング指示を正確に実行できるようになり、制御可能な生成能力が大幅に向上しました。
  • 3段階の漸進的トレーニング戦略トレーニングプロセスは3つの段階から構成されます。第1段階では、プレーンテキストと音声データを用いた事前学習を行い、基本的な音響理解を確立します。第2段階では、動画データを導入してマルチモーダルな共同生成へと拡張し、音声と映像の同期関係を学習します。第3段階では、蒸留による高速化を行い、多段階モデルを4段階の超高速バージョンに圧縮します。この段階的な戦略により、推論コストを圧縮しながらも、モデルがマルチモーダルな理解能力を失わないことが保証されます。

AudioX-Turboの使い方

  • 環境設定GitHubリポジトリをクローンし、FFmpeg、libsndfile、およびrequirements.txtに記載されている依存関係をインストールして、Python 3.8環境を作成します。
  • 重量ダウンロードAudioX-Turbo 4ステップ学生モデル、VAE、およびSynchformerビデオエンコーダー用の事前学習済み重みは、Hugging FaceまたはGitHubリリースからダウンロードできます。
  • 推論を開始する:走る python run_gradio.py ローカルのWebインターフェースを起動するか、Python APIを直接呼び出してモデルとトークナイザーをロードします。
  • パラメータ設定タスクの種類に応じて設定します video_pathtext_promptaudio_path テキスト、ビデオ、オーディオなどの入力パラメータを使用することで、このモデルはあらゆる入力の組み合わせに対応できます。
  • 音声を生成する: 順方向推論を実行すると、4回のサンプリングステップで10秒間の高品質オーディオを生成でき、RTX 4090では約0.24秒かかります。

AudioX-Turboの主な利点

  • スピード推論わずか4回のサンプリングステップで、100ステップ以内に教師モデルの音質に匹敵することができ、NFEを約25分の1に削減し、ほぼリアルタイムの生成を実現します。
  • 統合マルチモーダル単一のモデルでテキスト、ビデオ、音声のあらゆる組み合わせの入力に対応できるため、異なるタスクごとに個別のエキスパートモデルをトレーニングする必要がなくなります。
  • 正確な指示に従うタイムスタンプ、イベント数、楽器の注釈を含む920万件の構造化データエントリにより、モデルは「最初にセミが鳴き、次にギターを演奏する」といった複雑なタイミング指示を正確に理解することができる。
  • 高品質の蒸留フローマッチングに基づき、拡散判別器と組み合わせた分散マッチング蒸留(DMD)を用いることで、学生モデルはいくつかの指標において教師モデルを上回る性能を示した。

AudioX-Turboプロジェクトの住所

  • GitHubリポジトリ:https://github.com/NoizAI/AudioX-Turbo
  • ハギングフェイスモデルライブラリ:https://huggingface.co/HKUSTAudio/AudioX-Turbo
  • arXiv技術論文:https://arxiv.org/pdf/2606.12555

AudioX-Turboと類似製品との比較

寸法 AudioX-Turbo MMAudio
開発チーム Noiz AI × 香港科技大学 × 清華大学 ソニーAIチーム
モデルパラメータ 2.7B(MMDiT) 157M(マルチモード変圧器)
インフラストラクチャー マルチモーダル拡散トランスフォーマー(フローマッチング) マルチモーダル変圧器 + フローマッチング
推論ステップ数 4つのステップ(蒸留と圧縮) デフォルトは25ステップ(1~50ステップまで設定可能)
生成速度 RTX 4090では、10秒のオーディオクリップはわずか... 0.24秒 約8秒間の音声を生成します。 1.23秒
サポート方法 テキスト/ビデオ/音声 任意の組み合わせ(T2A、T2M、V2A、V2M、TV2A、TV2M、音声補完、画像ゼロサンプル) 動画・テキスト・画像を音声に変換する(V2A、T2A、I2A)
統一モデル はい(単一のモデルで全てのタスクをカバーできます) はい(単一モデルによるマルチモーダル共同トレーニング)
タイムスタンプ制御 強力(事象の順序、数量、および計測機器のラベル表示は秒単位で正確です) 中程度(音声と映像の同期には同期モジュールを使用)
命令データセット 自社開発 IF-caps-Pro(約920万個のサンプル。タイムスタンプ、イベント数、測定機器の情報がラベル付けされている。) 大規模な音声および動画データセット(かなりのノイズを含む)

AudioX-Turboの応用事例

  • インタラクティブドラマやゲーム向けのリアルタイム音声演技: 4段階の迅速な推論により、ゲームエンジンのリアルタイム効果音と動的なBGMをサポートします。
  • 映画やテレビのフォーリー・ポストプロダクション無音の動画から正確な環境音や移動音効果を自動的に生成できるため、手作業による効果音作成のコストを削減できます。
  • AIによるライブストリーミングとバーチャルアンカー映像や箇条書きのテキストに基づいて、リアルタイムで伴奏やインタラクティブな効果音を生成できます。
  • 音楽制作支援テキストによる説明に基づいて参考となる音楽クリップを素早く生成でき、動画の感情表現と音楽を同期させることも可能です。
  • オーディオコンテンツの自動化タイムスタンプを組み合わせることで音声イベントの順序を正確に制御できるため、ポッドキャストやラジオドラマに適しています。