project
Video Alchemist - マルチエージェントによるオープンアンサンブルパーソナライゼーション機能を備えたAIビデオ生成モデル。
Video Alchemistは、Snapなどの企業が開発した新しい動画生成モデルです。マルチ被写体、オープンセットのパーソナライゼーション機能を備え、テスト中に最適化を必要とせずに、テキストプロンプトと参照画像に基づいて動画を生成できます。このモデルは…
Video Alchemistとは何ですか?
Snapなどの企業が開発したVideo Alchemistは、マルチ被写体、オープンセットのパーソナライゼーション機能を備えた斬新な動画生成モデルです。テスト中に最適化を必要とせず、テキストプロンプトと参照画像に基づいて動画を生成できます。このモデルはDiffusion Transformerモジュールに基づいており、2つのクロスアテンションレイヤーを介して参照画像の埋め込みと被写体レベルのテキストプロンプトを動画生成プロセスに統合します。Video Alchemistはまた、自動データ構築パイプラインとさまざまなデータ拡張技術を導入し、モデルの被写体識別への焦点を強化し、「コピー&ペースト効果」を回避します。その性能を評価するために、新しい動画パーソナライゼーションベンチマークであるMSRVTT-Personalizationが提案されています。
Video Alchemistの主な機能
- パーソナライズされたビデオ生成複数の対象物に対応したオープンセットのパーソナライゼーション機能が組み込まれており、テスト中に最適化を行うことなく、前景と背景の両方のオブジェクトを同時にパーソナライズできます。
- テキストプロンプトと参照画像に基づく条件付き生成Video Alchemistは、テキストによる手がかりと、その手がかりに含まれる対象を概念化するための参照画像のセットが与えられると、テキストと参照画像に基づいて対応するビデオを生成できます。
- 拡散トランスモジュールの応用このモデルは、新しい拡散変換モジュールに基づいて構築されており、追加のクロスアテンション層を介して各条件付き参照画像とそれに対応する被験者レベルのテキストキューを融合し、複数被験者の条件を生成し、各被験者のテキスト説明をその画像表現に結び付けます。
Video Alchemistの技術的原理
- 複数分野のオープンコレクションのパーソナライゼーションVideo Alchemistは、複数の被写体に対応したオープンコレクションのパーソナライゼーション機能を内蔵しており、テスト中に最適化を行うことなく、前景と背景のオブジェクトを同時にパーソナライズできます。また、新しい被写体や背景ごとに個別の最適化を行うことなく、さまざまな斬新な被写体や背景のコンセプトに対応できます。
- 拡散トランスモジュールVideo Alchemistは、新しい拡散トランスフォーマーモジュールに基づいて構築されており、追加のクロスアテンションレイヤーを介して、各条件付き参照画像とそれに対応する被写体レベルのテキストキューを融合します。具体的には、このモデルは以下の手順で複数被写体の条件付き生成を実現します。
- 入力処理:テキストプロンプトと一連の参照画像が与えられると、モデルはまずこれらの入力をエンコードします。
- クロスアテンションレイヤー:デュアルクロスアテンションレイヤーを使用することで、参照画像の埋め込みと被写体レベルのテキストキューがビデオ生成プロセスに統合され、生成されたビデオが被写体のアイデンティティと背景の忠実度を自然に保持できるようになります。
- 被写体レベルの融合:被写体レベルの融合メカニズムを導入し、各被写体のテキスト記述をその画像表現に結び付けることで、生成されるビデオにおける被写体の正確性と一貫性を確保します。
- 自動データ構築パイプラインと画像強調参照画像と動画のペアデータセットを収集するという課題に対処するため、Video Alchemistは、被写体の識別に重点を置き、「コピー&ペースト効果」を回避するために、幅広い画像拡張技術を組み込んだ、斬新な自動データ構築パイプラインを設計しました。
- データ収集:複数のフレームから主要な画像を収集し、データ拡張処理を実行する。
- 画像強調:回転、拡大縮小、色調整などの様々なデータ拡張技術を用いることで、モデルの汎化能力が向上し、過学習が抑制されます。
- MSRVTTパーソナライゼーションベンチマークVideo Alchemistの性能を評価するために、新しいビデオパーソナライゼーションベンチマークであるMSRVTT-Personalizationが導入されました。このベンチマークは、被写体の忠実度を正確に評価し、顔の切り抜きに基づく条件付きモード、単一または複数の任意の被写体、前景と背景のオブジェクトの組み合わせなど、さまざまなパーソナライゼーションシナリオをサポートします。
ビデオアルケミストプロジェクトの住所
- プロジェクト公式サイト:https://snap-research.github.io/open-set-video-personalization
- arXiv技術論文:https://arxiv.org/pdf/2501.06187
Video Alchemistの応用事例
- ショートビデオ制作個人ユーザーは、創造的な物語や幻想的な場面を動画に変換し、独自のショートビデオを作成して、ソーシャルメディアプラットフォームで共有することで、自身の個性をアピールできます。
- アニメーション制作クリエイターはVideo Alchemistを使ってアニメーションキャラクターや背景を生成し、複雑なアニメーションソフトウェアやスキルを必要とせずに、アニメーション短編映画を素早く作成できます。
- 歴史的出来事教師は、生徒が歴史的背景や出来事の経過をよりよく理解できるよう、歴史的な出来事に関する動画を作成することができる。
- スクリプトシーンプロデューサーや監督は、チーム内のコミュニケーションや投資家へのプロジェクト構想のプレゼンテーションのために、脚本に基づいたシーンの予備的なビデオサンプルを作成することができる。
- キャラクターの行動キャラクターの動きや表情を生成することができ、俳優や監督がキャラクターの演技要件をより深く理解するのに役立つ。