project
ControlFoley - Xiaomiのオープンソースの制御可能なビデオおよびオーディオエフェクト生成モデル
ControlFoleyは、Xiaomiが開発したオープンソースの制御可能なビデオオーディオ生成モデルであり、V2A(ビデオ・トゥ・アクション)分野における制御性の課題に取り組んでいます。このモデルは、独自開発の時空間オーディオ技術を活用し、テキスト誘導型、テキスト制御型、リファレンスオーディオ制御型の3種類のビデオ吹き替えタスクを統一的にサポートしています。
コントロールフォーリーとは何ですか?
ControlFoleyは、Xiaomiが開発したオープンソースの制御可能なビデオ・オーディオ生成モデルであり、V2A(Video-to-Action)分野における制御性の課題に取り組んでいます。このモデルは、テキスト誘導型、テキスト制御型、リファレンスオーディオ制御型の3種類のビデオ吹き替えタスクを統一的にサポートしています。独自開発の時空間オーディオ・ビデオエンコーダCAV-MAE-ST、時間音色分離、およびモーダルロバストトレーニングにより、意味的アライメント、時間同期、およびオーディオ品質を包括的に向上させています。このモデルは複数のベンチマークで最先端(SOTA)性能を達成しており、コードとモデルの重みは公開されています。
ControlFoleyの主な機能
-
TV2A(テキストガイド付きビデオ吹き替え)映像とテキストの指示に基づいて同期した効果音を生成し、テキストは映像と音声の意味を補足する。
-
TC-V2A(テキスト制御ビデオナレーション)テキストと動画の間で意味的な矛盾が生じた場合は、時間同期を維持しつつ、テキストの意図を優先すべきである。
-
AC-V2A(リファレンスオーディオコントロールビデオダビング)音色スタイルは、映像のリズムを乱すことなく、基準となる音声に基づいて制御されます。
ControlFoleyの技術原理
-
共同視覚コーディング: 自社開発のCAV-MAE-ST時空間オーディオ・ビデオエンコーダは、オーディオとビデオの時空間対応に焦点を当て、動作のリズムと時間同期の理解を強化し、CLIPと組み合わせることで意味と同期の両方を考慮します。
-
時間音色の分離基準音声に含まれるタイミング情報を抑制し、全体的な音色特性を維持し、基準音声が映像同期に干渉しないようにする。
-
モーダルロバストトレーニングランダム化モーダルドロップアウトと統合マルチモーダル表現アライメントは、さまざまな入力の組み合わせに適応します。REPAアライメントターゲットによって意味的一貫性が向上します。
ControlFoleyの使い方
- オープンソースのリソースを入手するコードとモデルの重みをダウンロードするには、GitHubリポジトリにアクセスするか、公式オンラインデモを使用して直接お試しください。
- 環境設定リポジトリの指示に従って依存関係をインストールし、Pythonランタイム環境と必要なオーディオおよびビデオ処理ライブラリを設定してください。
- タスクモードを選択クリエイティブなニーズに合わせて、TV2A(テキストガイダンス)、TC-V2A(テキスト制御)、AC-V2A(リファレンスオーディオ制御)の3種類のタスクタイプから1つを選択してください。
- 入力条件を準備するビデオファイルをインポートします。TV2Aを選択した場合は、テキストプロンプトを追加します。TC-V2Aを選択した場合は、画面と競合するテキストコマンドを入力します。AC-V2Aを選択した場合は、参照オーディオファイルをアップロードします。
- 生成推論を実行するモデル推論スクリプトを実行すると、ControlFoleyは、視覚的な符号化と時間・音色の分離メカニズムに基づいて、ビデオと同期した効果音を生成します。
- エクスポートと後処理生成された音声を取得した後、最終的な音声トラックはVAEデコーダーとボコーダーを通して出力され、その後ビデオと合成されて吹き替えが完了する。
ControlFoleyの主な利点
-
統一フレームワーク1つのモデルで、テキストガイダンス、テキスト制御、参照音声制御という3種類のタスクをカバーできるため、複数のツールを切り替える必要がなくなります。
-
正確な同期当社が独自開発したCAV-MAE-ST時空間エンコーダは、音声と映像のタイミング認識能力を向上させ、その音声・映像アライメント精度はオープンソースの競合製品を凌駕します。
-
トーンデカップリング時間と音色の分離技術により、参照音声は音色スタイルのみに影響を与え、ビデオの元のリズムを妨げないことが保証されます。
-
堅牢な制御ランダム化されたモーダルドロップアウトと均一表現アライメントのトレーニングにより、モデルは単一モーダル入力またはマルチモーダル入力に対して安定した出力を行うことができる。
-
オープンソースの最先端技術VGGSound-TestやKling-Audio-Evalなど、複数のベンチマークにおいて、意味的な整合性と音質の両面でトップクラスの性能を発揮します。
ControlFoleyのプロジェクト住所
- プロジェクト公式サイト:https://yjx-research.github.io/ControlFoley_web_page/
- GitHubリポジトリ:https://github.com/xiaomi-research/controlfoley
- ハギングフェイスモデルライブラリ:https://huggingface.co/YJX-Xiaomi/ControlFoley
- arXiv技術論文:https://arxiv.org/abs/2604.15086
ControlFoleyの類似製品の比較
| 比較対象寸法 | ControlFoley | MMAudio | HunyuanVideo-Foley |
|---|---|---|---|
| タスク範囲 | TV2A、TC-V2A、AC-V2Aの3種類の制御可能なタスクを統合的にサポートします。 | 主に基本的なTV2Aビデオ吹き替えに対応しています。 | 主に基本的なTV2Aビデオ吹き替えに対応しています。 |
| テキストの競合処理 | 強力:競合シナリオでは、DeSyncはわずか0.36~0.38で、テキストの意図を優先します。 | 弱点:テキストが視覚情報によって容易に隠されてしまう。 | 弱点:テキスト制御機能が限られている |
| リファレンスオーディオコントロール | 同期を損なうことなく、時間と音色の分離をサポートします。 | サポートされていません | サポートされていません |
| 音声と映像の同期 | 利点:CAV-MAE-STは時空間対応性を向上させます。 | 良い | 良い |
| オープンソースのステータス | コード、重み付け、技術レポートはすべてオープンソースです。 | オープンソース | オープンソース |
ControlFoleyの応用事例
-
ショートビデオ制作制作者の意図に合わせ、モデルの自動推測による偏りを避けるために、無音の映像にカスタマイズされた効果音を追加します。
-
アニメーションとゲームキャラクターの動作に合わせて、特定のスタイルの衝撃音や環境音を生成します。例えば、通常のノック音をドラムの音に置き換えるといったことが可能です。
-
映画やテレビ番組のポストプロダクション映画全体の音響効果と音色は、ブランドや作品シリーズ全体の音の一貫性を保つため、参考となる音声素材に基づいて統一されています。
-
広告とマーケティングテキストコマンドに基づいて、ブランドのトーンに合わせた同期済みのナレーションを素早く生成し、リズム感と感情表現を向上させます。
-
セルフメディアライブストリーミングライブストリームのクリップや派生動画に、マルチモーダルで制御可能な没入型オーディオを付加することで、コンテンツの完全性を向上させる。