AB
AiBoss
project

MultiFoley - Adobeがミシガン大学と共同開発したサウンド生成システム

MultiFoleyは、Adobe Researchとミシガン大学が共同開発したサウンド生成システムです。テキスト、音声、動画のマルチモーダル制御に基づいてフォーリー効果音を生成できます。このシステムでは、テキストプロンプトや参照音声などに基づいてフォーリー効果音を生成できます。

マルチフォーリーとは何ですか?

Adobe Researchとミシガン大学が共同開発したサウンド生成システム「MultiFoley」は、テキスト、音声、動画のマルチモーダル制御に基づいてフォーリー効果音を生成できます。このシステムでは、テキストプロンプト、参照音声、または動画の一部に基づいて、動画と同期したサウンドをカスタマイズして生成できるため、動画視聴体験が向上します。MultiFoleyは、インターネット動画データセットとプロ仕様の録音データで学習されており、高品質でフル帯域幅(48kHz)の音声生成を実現します。MultiFoleyは、動画制作における柔軟なサウンドデザイン制御を提供し、ユーザーがクリアでクリエイティブな効果音を作成できるよう支援します。

MultiFoleyの主な機能

  • テキスト制御によるフォーリー生成テキストプロンプトを使用して、リアルなものから独創的なものまで、ビデオと同期した効果音を生成および誘導します。
  • 音声制御付きフォーリー生成この機能を使うと、ユーザーは効果音ライブラリから参照音声を選択し、無音の動画にその音声を適用して、動画と同期させることができます。
  • フォーリーオーディオ拡張機能オーディオトラックの一部を拡張して、完全なフォーリーサウンドを生成します。
  • 品質管理テキストに品質タグを追加することで、高品質なフルバンド(48kHz)オーディオが生成されます。
  • マルチモーダル制御テキスト、音声、ビデオからの条件付き信号を組み合わせることで、サウンドデザインをきめ細かく制御できます。

マルチフォーリーの技術的原理

  • 合同訓練インターネット上の動画データセット(低品質の音声)とプロが使用した効果音(SFX)録音データを用いて学習を行い、高品質なフルバンド音声を生成します。
  • 拡散トランス拡散モデルに基づいてランダムノイズから新しいサンプルを生成し、それらをビデオ誘導フォーリーサウンド生成に使用し、マルチモーダル制御と組み合わせる。
  • 高音質オーディオ自己エンコーダー(DAC-VAE)変分オートエンコーダー(VAE)に基づいて、48kHzの音声波形が40Hzの潜在特徴量にエンコードされ、音声と映像の同期に使用されます。
  • フリーズビデオエンコーダー音声と映像の同期に使用され、映像を特徴量にエンコードし、それを基となる音声エンコードと組み合わせて使用します。
  • 複数条件トレーニング戦略これにより、このモデルは音声拡張機能やテキスト駆動型のサウンドデザインといった下流タスクを柔軟にサポートできるようになります。
  • マルチヘッド注意機構モデルの表現力を高め、さまざまな種類の特徴量や依存関係を並行して学習します。

MultiFoleyのプロジェクト住所

MultiFoleyの応用事例

  • 映画およびビデオ制作映画制作において、足音やドアの閉まる音など、画面上の動作と同期した効果音を生成することは、観客の没入感を高める。
  • ゲーム開発ゲーム内では、様々なゲーム環境やアクションに合わせてリアルなサウンドが生成され、ゲーム体験を向上させます。
  • アニメーション制作アニメーションにおいては、アニメーションキャラクターの動きに基づいて対応する音声が生成され、アニメーションをより生き生きとしたものにする。
  • 広告制作広告業界では、広告の魅力を高めるために、広告のクリエイティブに基づいて目を引く効果音が生成される。
  • バーチャルリアリティ(VR)VR体験において、仮想環境と同期したサウンドを生成することは、ユーザーの没入感と体験の質を高める。