AB
AiBoss
project

AudioX - 香港科技大学とDark Side of the Moonが共同開発した拡散変換モデルで、任意のコンテンツから音声を生成することを可能にする。

AudioXは、香港科技大学とDark Side of the Moonが共同で提案した、任意のコンテンツから音声や音楽を生成するために特別に設計された統一拡散トランスフォーマーモデルです。このモデルは、テキスト、ビデオ、画像、音楽など、さまざまな入力形式に対応できます。

AudioXとは何ですか?

AudioXは、香港科技大学とDark Side of the Moonが共同で提案した、あらゆるコンテンツから音声や音楽を生成するために特別に設計された、統合型拡散変換モデルです。このモデルは、テキスト、ビデオ、画像、音楽、音声など、複数の入力モダリティに対応し、高品質な音声出力を生成します。その核となる革新性は、マルチモーダルマスキング学習戦略にあります。この戦略では、入力モダリティをランダムにマスキングすることで、モデルが不完全な入力から学習することを強制し、それによってクロスモーダル表現能力を向上させます。

AudioXの主な機能

  • マルチモーダル入力のサポート
    • テキスト音声変換このモデルは、テキストによる説明に基づいて、対応する効果音を生成します。例えば、「犬の鳴き声」という入力があれば、犬の鳴き声の音声を生成できます。
    • 動画から音声へこの機能は、動画コンテンツに合わせた効果音を生成します。例えば、車の走行映像が与えられた場合、モデルは車のエンジン音を生成できます。
    • 画像から音声への変換この機能は、画像の内容に基づいて対応する効果音を生成します。例えば、嵐の画像が与えられれば、モデルは嵐の音を生成できます。
    • 音楽世代この機能は、テキストによる説明や動画コンテンツに基づいて音楽を生成します。例えば、「リラックスできるピアノ曲」という入力があれば、モデルはリラックスできるピアノ曲を生成できます。
    • 音声インペインティングこの機能は、文脈情報に基づいて音声の欠落部分を修復します。例えば、空白部分のある音声クリップが与えられた場合、モデルは空白部分を埋めて音声を完全なものにすることができます。
    • 音楽完成この関数は、与えられた楽曲の後半部分を生成します。例えば、楽曲の冒頭部分が与えられれば、残りの部分を生成できます。
  • 高品質オーディオ生成AudioXは拡散モデル技術を用いて、高品質で高忠実度のオーディオと音楽を生成し、生成されたオーディオが音質とディテールにおいて実際のオーディオに限りなく近いものとなるようにしています。
  • 柔軟な自然言語制御ユーザーは、自然言語による説明を通して、生成される音声コンテンツを正確に制御できます。例えば、効果音の種類、音楽のスタイル、使用する楽器などを指定することで、生成される音声を自分のニーズにより合致させることができます。
  • クロスモーダル学習機能AudioXは複数のモダリティからの入力を処理し、それらを効果的に統合して入力条件に合った音声を生成します。例えば、テキストとビデオの両方の入力が与えられた場合、モデルは両方の意味情報を総合的に考慮して、シーンにより関連性の高い音声を生成できます。
  • 高い一般化能力AudioCaps、VGGSound、MusicCaps、V2M-benchなど、複数のデータセットやタスクにおいて優れた性能を発揮し、様々なシナリオにおける汎用性と適応性を示しています。
  • ゼロサンプル生成機能AudioXは、特定のモダリティ(画像など)に関する特別なトレーニングを必要とせずとも、ゼロサンプル条件下で高品質のオーディオを生成することができ、汎用性の高い強力な生成能力を実証しています。

AudioXの技術原理

  • 拡散モデルAudioXは、拡散モデルという基本的な考え方を用いて、入力データに徐々にノイズを加え、その後、逆のプロセスで徐々にノイズを除去することで、最終的に高品質のオーディオや音楽を生成します。
    • 順方向拡散プロセス入力データにガウスノイズを徐々に加えることで、一連のノイズを含む潜在変数を生成する。
    • 逆ノイズ除去処理ノイズ除去ネットワーク(通常はTransformer)を訓練することで、ノイズが徐々に除去され、クリーンな音声データが再構築されます。
  • マルチモーダルマスクトレーニング戦略AudioXは、モデルのクロスモーダル学習能力を向上させるため、マルチモーダルマスキング学習戦略を採用しています。学習中、モデルは入力モダリティの一部をランダムにマスキングすることで、不完全な入力から学習することを強制し、堅牢性と汎化能力を向上させます。
  • マルチモーダルエンコーダとデコーダAudioXは、複数の専用エンコーダーを統合して、異なるモダリティからの入力データを処理し、これらのエンコードされた特徴を統合された潜在空間に融合します。
    • ビデオエンコーダーCLIP-ViT-B/32を使用して、ビデオフレームから特徴量を抽出します。
    • テキストエンコーダーテキストの特徴を抽出するには、T5-baseを使用します。
    • オーディオエンコーダーオートエンコーダーを使用して、音声から特徴量を抽出します。
    • 機能融合異なるモダリティからの特徴は、線形変換と連結演算によって統合され、統一されたマルチモーダル埋め込みベクトルとなる。
  • 拡散過程における条件付き埋め込み拡散処理において、マルチモーダル埋め込みベクトルは条件付き入力として機能し、入力条件に合致した音声や音楽の生成をモデルが支援します。融合されたマルチモーダル特徴量は、拡散時間ステップとともに拡散モデルに入力されます。ノイズを段階的に除去することで、入力条件に合致した高品質の音声や音楽が生成されます。
  • データセットとトレーニングAudioXを訓練するために、研究者たちは2つの大規模なマルチモーダルデータセットを構築した。1つはVGGSoundデータセットに基づいたvggsound-capsで、19万件の音声キャプションが含まれている。もう1つはV2Mデータセットに基づいたV2M-capsで、600万件の音楽キャプションが含まれている。

AudioXプロジェクトのアドレス

AudioXの応用例

  • 動画のBGM動画コンテンツに基づいてBGMや効果音を自動生成することで、動画の魅力と感情的な共鳴を高めることができます。
  • アニメーション効果音アニメーションシーンに合わせて、足音、風の音、爆発音などの効果音を生成し、アニメーションの没入感を高めます。
  • 音楽世代テキストによる説明やスタイルの要件に基づいて音楽を生成し、音楽制作者にインスピレーションや支援を提供する。
  • 言語学習言語学習コンテンツに関連した効果音やBGMを生成し、学習体験を向上させます。