project
ActAnywhere - AdobeのAIビデオ背景生成モデル
ActAnywhereは、スタンフォード大学とAdobe Researchの研究者が共同開発した動画生成モデルです。特に、前景の被写体(人物など)を新しい背景に合成する必要がある場合など、動画の背景生成の問題を解決することを目的としています。
ActAnywhereとは何ですか?
ActAnywhereは、スタンフォード大学とAdobe Researchの研究者によって開発された動画生成モデルです。特に、前景の被写体(人物など)を新しい背景にシームレスに統合する必要があるシーンにおいて、動画の背景生成の問題を解決するために開発されました。このモデルは、映画制作や視覚効果(VFX)分野に適用可能で、前景の被写体の動きに合わせて動画の背景を自動的に生成するため、従来の手動合成プロセスに比べて大幅な時間と労力の節約につながります。
公式プロジェクトホームページ:https://actanywhere.github.io/
arXiv論文へのリンク:https://arxiv.org/abs/2401.10822
ActAnywhereの機能
- 前景の被写体が背景に溶け込んでいるActAnywhereは、前景の被写体の動きや外観に合わせた背景を自動的に生成できるため、被写体と背景の相互作用が自然で一貫性のあるものに見える。
- 条件付きフレーム駆動型背景生成ユーザーは新しいシーンを描写する画像(条件付きフレーム)を提供することができ、ActAnywhereはこの条件付きフレームに基づいてビデオ背景を生成します。これにより、ユーザーは特定の建物、自然の風景、屋内環境など、特定の背景要素を指定できます。
- 時間的一貫性ActAnywhereは、時間的な自己注意機構を用いることで、カメラの動き、照明の変化、影の効果などを含め、生成される動画が時間経過とともに一貫性を保つことを保証します。
- 自己指導型学習ActAnywhereは、大規模な人間とシーンのインタラクション動画データセットを用いて自己教師あり学習を行うため、人間の注釈なしに動画の背景を生成する方法を学習できます。
- ゼロショット学習ActAnywhereは、追加のトレーニングなしに、これまで見たことのない新しいデータ(人間以外の対象など)を生成することができ、これは、モデルがトレーニングデータから一般的な背景生成戦略を学習できることを示しています。
ActAnywhereの仕組み
ActAnywhereは、以下の手順と構成要素を通して、非常にリアルで時間的に一貫性のあるビデオ背景を生成します。
- データ準備:
- 前景被写体のセグメンテーションアルゴリズム(Mask R-CNNなど)を使用して、入力ビデオから前景被写体のセグメンテーションシーケンス(S)と対応するマスク(M)を取得します。
- 生成する背景を記述する画像である条件付きフレーム(c)を導入します。これは背景画像でも、前景と背景の両方を含む合成フレームでも構いません。
- 特徴エンコーディング:
- 前景被写体のセグメンテーションシーケンスは、事前学習済みの変分オートエンコーダー(VAE)を使用して潜在特徴(ˆS)にエンコードされます。
- 前景マスクシーケンスはダウンサンプリングされ、潜在特徴と位置合わせされて特徴の次元に一致するように調整されます。
- 拡散過程:
- トレーニング中、元のビデオフレームはVAEエンコーダを使用して潜在表現(Z)にエンコードされ、その後、順方向拡散プロセス中にガウスノイズが徐々に追加されます。
- テスト中、潜在表現(Z0)はガウスノイズで初期化され、逆拡散プロセスによって徐々にノイズ除去されて最終的なビデオフレームが生成されます。
- 時間注意機構:
- 特徴投影層と1次元時間自己注意ブロックを含む一連のモーションモジュールをノイズ除去済みのU-Netに挿入することで、時間的な一貫性を実現します。
- 条件付きフレームの特徴量(Fc)は、CLIP画像エンコーダによって抽出され、U-Netのクロスアテンション層に注入され、生成されたビデオの背景が条件付きフレームと一致するようにします。
- 研修目標:
- このモデルは、付加されたノイズを予測するという簡略化された拡散目的関数を用いて学習されます。モデルは、予測されたノイズと実際のノイズとの差を最小化することによって学習されます。
- データ拡張と処理:
- トレーニング中は、不完全なセグメンテーションマスクを処理するために、ランダムな矩形切り抜きと画像収縮操作が適用されます。
- テスト中は、セグメント、マスク、または条件付きフレームをランダムに破棄することにより、分類器不要のガイダンスが実現されます。
- モデルトレーニング:
- トレーニングは、240万本の動画を含む大規模な人間とシーンのインタラクション動画データセット(HiC+)を用いて実施された。
- AdamWオプティマイザを使用し、学習率を3e-5に固定して、共有VAEおよびCLIPエンコーダを固定し、U-Netをファインチューニングした。
- 生成プロセス:
- テスト中は、前景被写体のシーケンスと条件付きフレームが学習済みモデルに入力され、前景被写体の動きに合わせて調整されたビデオ背景が生成されます。
ActAnywhereのアプリケーションシナリオ
- 動画背景の差し替えActAnywhereは、動画内の被写体を全く新しい背景に配置できるため、映画制作、広告、バーチャルリアリティ(VR)、拡張現実(AR)などの分野で非常に役立ちます。例えば、俳優を架空のシーンに配置したり、実際の撮影なしに特定の環境をシミュレートしたりすることが可能です。
- 視覚効果の強化視覚効果(VFX)制作において、ActAnywhereは、動的な天候、光と影の変化、群衆の相互作用といった複雑な背景効果を、実際に撮影することなく生成するために使用できます。
- クリエイティブコンテンツ制作アーティストやコンテンツクリエイターは、ActAnywhereを使って、キャラクターを異なる歴史時代や未来の世界に配置したり、架空の生き物と交流させたりするなど、創造的なアイデアを素早く実験し、実現することができます。
- 教育と訓練教育分野では、ActAnywhereは、学生が複雑な概念や歴史的出来事をよりよく理解できるようにするためのシミュレーションシナリオを作成したり、緊急事態をシミュレーションする安全訓練に利用したりすることができます。
- ゲームとエンターテイメントゲーム開発者はActAnywhereを使って動的な背景を生成することで、プレイヤーにより豊かでリアルなゲーム体験を提供できます。また、映画の予告編、ミュージックビデオ、その他のエンターテイメントコンテンツの制作にも利用できます。