project
VACE - Alitongyiが立ち上げた動画生成・編集フレームワーク
VACE(Video Creation and Editing)は、アリババ同義研究所が開発した、動画生成と編集をワンストップで行えるフレームワークです。参照動画の生成、動画間編集、マスキングなど、様々な動画関連タスクを統合しています。
VACEとは何ですか?
VACE(Video Creation and Editing)は、アリババ同義研究所が開発した、動画生成と編集をワンストップで行えるフレームワークです。参照動画生成、動画間編集、マスキング編集など、複数の動画タスクを統合モデルに組み込むことで、効率的なコンテンツ作成と編集を実現します。VACEの中核となるのは、テキスト、画像、動画、マスクなどの複数のモーダル入力を統合条件ユニットに組み込むビデオ条件ユニット(VCU)です。これにより、様々なタスクを柔軟に組み合わせることが可能になります。オープンソース版のWan2.1-VACE-1.3Bは480P解像度に対応し、Wan2.1-VACE-14Bは480Pと720Pの両方の解像度に対応しています。実験結果によると、VACEは複数のタスクにおいてタスク固有のモデルと同等のパフォーマンスを発揮し、より幅広い応用可能性を提供するとともに、動画コンテンツ制作の新たな道を切り開きます。
VACEの主な機能
- テキストからビデオへの変換テキストプロンプトに基づいて動画を生成します。
- ビデオ生成に関する言及テキストと参照画像を組み合わせて動画を生成します。
- ビデオ拡張機能既存のビデオクリップに基づいて、新しい開始部分または終了部分を生成します。
- 動画編集入力ビデオに対して、全体的なスタイル変換(色付けやスタイル化など)を実行します。
- マスキングビデオ編集編集は、インペインティングやアウトペインティングなど、特定の領域で行われます。
- 本体の切除と再建動画から特定の被写体を削除し、背景を埋める。
- タスクの組み合わせとイノベーションこの手法は、参照画像の生成や被写体の置換、姿勢制御、動画の拡張など、さまざまなタスクを組み合わせたものです。動画の生成は、姿勢、深度、オプティカルフローなどの条件に基づいて制御されます。
VACEの技術原則
- Video Condition Unit(VCU)VCUはVACEの中核となる入力インターフェースであり、テキスト、画像、動画、マスクなど、複数のモダリティからの入力を統合するために使用されます。統一されたフォーマットに基づいてモデルに入力を渡すことで、さまざまなタスクの柔軟な組み合わせをサポートします。
- コンテキストアダプタ構造コンテキストアダプタに基づいて、編集領域や参照コンテンツなど、さまざまなタスクの概念がモデルに組み込まれます。時間と空間の次元を形式的に表現することで、さまざまなタスク要件に対応できます。
- 拡散モデルこれは拡散モデル(拡散トランスフォーマーなど)に基づいて構築されており、段階的なノイズ除去によって高品質のビデオコンテンツを生成します。
- マルチモーダル入力処理テキスト、画像、動画、マスクなど、複数の入力形式に対応し、特定のエンコーダに基づいてそれらを統一された特徴空間にマッピングします。例えば、動画入力は動画VAE(変分オートエンコーダ)で処理し、セグメンテーションとマスキング処理はローカル編集タスクを処理します。
- トレーニングと最適化戦略段階的な学習戦略に基づき、基本的なタスク(修復や拡張など)から始まり、徐々に複雑なタスク(複合タスクなど)へと拡張していきます。フルモデルのファインチューニングとコンテキストアダプタのファインチューニングをサポートしており、後者は収束が速く、プラグイン機能にも対応しています。
VACEのプロジェクト住所
- プロジェクト公式サイト:https://ali-vilab.github.io/VACE-Page/
- GitHubリポジトリ:https://github.com/ali-vilab/VACE
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/ali-vilab/vace
- arXiv技術論文:https://arxiv.org/pdf/2503.07598
VACEの適用シナリオ
- クリエイティブなビデオ制作テキストや画像から、広告やアニメーションなどのクリエイティブな動画コンテンツを素早く生成できます。
- 映像の修復と高画質化古い動画の修復、映像の欠落部分の補完、または動画のスタイルの改善。
- 高効率なビデオ編集被写体の差し替えやアニメーションの追加といった複雑な編集作業が可能になります。
- ビデオ拡張機能短い動画用の新しいクリップを生成して、動画コンテンツを拡張します。
- インタラクティブなビデオ制作ユーザーの入力(ポーズやスケッチなど)に基づいて、パーソナライズされた動画を生成します。