project
AtomoVideo - アリババが発表した、高精細な画像から動画への生成フレームワーク。
AtomoVideoは、アリババの研究チームが提案した高忠実度画像-動画変換(I2V)フレームワークです。入力された静止画像から高品質の動画コンテンツを生成することを目的としています。このフレームワークは、元の画像を保持しながら、生成された動画の品質を維持します。
AtomoVideoとは何ですか?
AtomoVideoは、アリババの研究チームが提案した、高精度な画像から動画への変換(I2V)フレームワークです。入力された静止画像から高品質な動画コンテンツを生成することを目的としています。このフレームワークは、多段階の画像挿入、高品質なデータセット、およびトレーニング戦略に基づいて、生成された動画と参照画像との間で高い忠実度を維持しながら、豊かな動きの強度と優れた時間的一貫性を実現します。
Runway Gen-2やPika 1.0と比較して、AtomoVideoは画像の詳細を保持すること、動的なビデオを生成すること、そしてパーソナライズされた制御可能な生成機能を提供することにおいて、いくつかの利点を示しています。
AtomoVideoの公式サイトへの入り口
- 公式プロジェクトホームページ:https://atomo-video.github.io/
- arXivの研究論文:https://arxiv.org/abs/2403.01800
AtomoVideoの機能
- 高精細画像から動画への生成AtomoVideoは、ユーザーが入力した静止画像と非常に高い整合性を持つ動画コンテンツを生成できます。生成された動画は、スタイル、内容、細部に至るまで、元の画像と非常に類似しています。
- ビデオフレーム予測このフレームワークは、長尺の動画シーケンスの生成をサポートします。連続するフレームを繰り返し予測することで、一連の初期フレームからより長い動画コンテンツを生成できます。
- 時間的な一貫性と安定性AtomoVideoは、動画生成時に時間的な連続性と安定性を優先し、急激な切り替えや途切れ途切れのフレームがなく、スムーズな再生を実現します。
- テキストからビデオへの変換AtomoVideoは、高度なテキスト画像変換モデルを組み合わせることで、テキストから動画コンテンツを生成することも可能にし、ユーザーがテキストによる説明を通して動画コンテンツの作成を誘導できるようにします。
- パーソナライズされ、制御可能な発電AtomoVideoは、パーソナライズされたテキストベースの画像モデルと制御可能な生成モデルを組み合わせることで、ユーザーの具体的なニーズに基づいたカスタマイズされたビデオコンテンツを生成することができます。
AtomoVideoの仕組み
- 全体的なプロセスAtomoVideoは、事前学習済みのテキスト画像変換(T2I)モデルをベースとし、各空間畳み込み層とアテンション層の後に、新しい1次元時間畳み込みモジュールと時間アテンションモジュールを追加します。学習中は、追加された時間層と入力層のパラメータのみが更新され、T2Iモデルのパラメータは固定されたままです。
- 画像情報注入生成された動画において入力画像との一貫性を保つため、AtomoVideoは2つの異なる箇所で画像情報を注入します。まず、入力画像はVAEエンコーダを使用して低レベル表現にエンコードされ、その後ガウスノイズと結合されます。同時に、CLIP画像エンコーダを使用して画像の高レベル意味表現が抽出され、クロスアテンション層を介して生成プロセスに注入されます。
- ビデオフレーム予測AtomoVideoは、長尺動画を生成するために反復予測手法を採用しています。一連の初期動画フレームが与えられると、モデルは次のフレームを予測します。この手法により、限られたGPUメモリ容量の制約下でも長尺動画シーケンスを生成することが可能になります。
- 訓練と推論トレーニング中、AtomoVideoは内部の1500万件のデータセットを使用します。各動画の長さは約10~30秒で、動画のテキスト説明もモデルに入力されます。トレーニング中は、ゼロ終端信号対雑音比(SNR)とv予測戦略が採用され、動画生成の安定性が向上します。モデルの入力サイズは512×512で、24フレームが含まれます。推論中、モデルは分類器フリーガイダンスと画像およびテキスト条件付き注入を組み合わせて実行し、生成される出力の安定性を向上させます。
- パーソナライズされたビデオ生成AtomoVideoは、トレーニング中にベースとなる2D UNetのパラメータを固定し、追加されたパラメータのみをトレーニングするため、コミュニティで人気のカスタムモデルと組み合わせることができます。例えば、光と影の効果の生成に優れ、I2V生成に使用すると光の要素を含む動画を生成する傾向のあるepiCRealismのようなT2Iモデルと組み合わせることができます。