project
ExVideo - アリババと華東師範大学が共同開発した、AIを活用した動画長さ延長・最適化技術
アリババと華東師範大学の研究者によって開発されたExVideoは、ビデオ合成モデルのポストチューニング技術です。既存のビデオ合成モデルの時間スケールを拡張し、より長いビデオを生成します。このチームはStable Vをベースにしています...
ExVideoとは何ですか?
アリババと華東師範大学の研究者によって開発されたExVideoは、ビデオ合成モデルのポストチューニング技術です。既存のビデオ合成モデルの時間スケールを拡張し、より多くのフレームを持つより長いビデオを生成します。研究チームは、Stable Video Diffusionモデルをベースに、元のモデルの生成能力を維持しながら、最大128フレームの一貫性のあるビデオを生成できる拡張モデルをトレーニングしました。ExVideoは、3D畳み込み、時間的注意、位置埋め込みなどの時間モジュールを最適化することで、より長い時間範囲のコンテンツを処理できるようにします。元のモデルの生成能力を維持しながらビデオフレーム数を大幅に増加させ、トレーニングコストも比較的低いため、計算リソースが限られているシナリオに特に適しています。
ExVideoの機能
- 時間スケールの拡張ExVideoの主要機能の一つは、ビデオ合成モデルの時間スケールを拡張できることです。これにより、当初設計されたよりも長いビデオシーケンスを処理・生成することが可能になります。この拡張機能により、ExVideoはより多くのフレームを含むビデオを生成し、より完全なストーリーを伝えたり、より長いダイナミックなシーンを表現したりすることができます。
- チューニング後の戦略ExVideoのポストチューニング戦略は、同社の技術の中核を成す重要な要素です。Stable Video Diffusionなどのモデルの特定部分を再学習させることで、ExVideoはこれらのモデルが128フレーム以上の長尺動画を生成できるようにします。これにより、動画の長さが伸びるだけでなく、様々な入力に対するモデルの汎化能力も維持され、多様で適応性の高い動画が生成されます。
- パラメータの高効率従来のトレーニング方法と比較して、ExVideoはポストチューニング戦略を採用しており、全く新しいモデルをゼロからトレーニングする必要性をなくしています。その代わりに、既存のモデルを最適化することで、必要なパラメータ数と計算リソースを大幅に削減し、モデルの拡張をより効率的かつ実用的なものにしています。
- 発電能力を維持するExVideoは動画の長さを延長する際に、動画の品質維持に重点を置いており、その結果、長さが長くなっただけでなく、視覚的な一貫性、明瞭さ、そして全体的な品質において高い基準を満たす動画が実現します。
- 互換性と普遍性ExVideoは、様々なビデオ合成モデルとの互換性を考慮して設計されており、多様なビデオ生成タスクに幅広く適用可能です。3D畳み込み、時間的注意機構、位置埋め込みなど、どのようなモデルアーキテクチャにも対応できるよう、ExVideoは適切な拡張戦略を提供します。
ExVideoの公式サイトへの入り口
- 公式プロジェクトホームページ:https://ecnu-cilab.github.io/ExVideoProjectPage/
- GitHubリポジトリ:https://github.com/modelscope/DiffSynth-Studio
- ハグフェイスモデルのダウンロード:https://huggingface.co/ECNU-CILab/ExVideo-SVD-128f-v1
- ModelScopeモデルのダウンロード:https://www.modelscope.cn/models/ECNU-CILab/ExVideo-SVD-128f-v1/summary
- arXivの技術論文:https://arxiv.org/abs/2406.14130
ExVideoの技術原則
- パラメータのポストチューニングExVideoは、既存のビデオ合成モデルを改善するために、事後パラメータ調整アプローチを採用しています。これは、モデル全体を再学習させるのではなく、モデルの特定の部分を再学習させることで、効率性を向上させるものです。
- 時間モジュール拡張ExVideoは、ビデオ合成モデルにおける時間モジュールに関して、拡張戦略を提案している。これらの戦略には、より長いビデオシーケンスに対応するための、3D畳み込み層、時間的注意機構、および位置埋め込み層の最適化が含まれる。
- 3D畳み込み層3D畳み込み層は、ビデオ合成において時間軸に沿った特徴を捉えるために使用されます。ExVideoは、追加の微調整なしにさまざまな時間スケールに適応できるため、元のモデルに3D畳み込み層を保持しています。
- 時間注意機構モデルの長期シーケンス処理能力を向上させるため、ExVideoは時間的注意モジュールを微調整しました。これにより、モデルはビデオコンテンツの時間的な一貫性をより正確に理解できるようになります。
- 位置埋め込み従来のビデオ合成モデルでは、ビデオ内のフレーム順序を表すために、静的または学習可能な位置埋め込みが使用される場合があります。ExVideoは、学習可能な位置埋め込みを導入し、ループパターンで初期化することで、より長いビデオシーケンスに対応します。
- アイデンティティ3D畳み込み位置埋め込み層に続いて、ExVideoは長期的なビデオ特徴を学習するための追加の3D畳み込み層を導入します。この層は、ビデオ表現が変更されないようにし、元のモデルとの一貫性を維持するために、トレーニング前に単位行列で初期化されます。
- エンジニアリング最適化限られた計算リソースで効果的なトレーニングを可能にするため、ExVideoは、パラメータの固定、混合精度トレーニング、勾配チェックポイント、フラッシュアテンションなどのさまざまなエンジニアリング最適化技術を採用するとともに、DeepSpeedライブラリを使用してオプティマイザの状態と勾配を分割します。
- トレーニングプロセスExVideoは、多数の動画を含む公開データセットであるOpenSoraPlan2を使用してトレーニングされ、多様な動画を生成するモデルの能力が向上しました。
- 損失関数とノイズスケジューリングトレーニング中、ExVideoは元のモデルと同じ損失関数とノイズスケジューリング戦略を維持し、モデルトレーニングの安定性と効率性を確保しました。