project
VLOGGER - Googleが開発した、画像を合成された人型動動画に変換するモデル。
VLOGGER AIは、Googleの研究チームが開発したマルチモーダル拡散モデルで、単一の入力画像と音声サンプルから、リアルで一貫性のある人間の動きの動画を生成するように特別に設計されています。このモデルの主な機能は、人工知能を活用することです...
VLOGGERとは何ですか?
VLOGGER AIは、Googleの研究チームが開発したマルチモーダル拡散モデルで、単一の入力画像と音声サンプルから、人物のリアルで一貫性のあるダイナミックな動画を生成するために特別に設計されています。このモデルの主な機能は、人工知能を用いて静止画像を動的な動画キャラクターに変換しつつ、写真に写っている人物のリアルな外見を維持することです。さらに、VLOGGERは音声に基づいて人物の動きを制御でき、顔の動きや口の動きだけでなく、頭の動き、視線、まばたき、上半身や手のジェスチャーなども制御できるため、音声駆動型動画合成を新たなレベルへと引き上げます。
VLOGGERの公式サイトへの入り口
- 公式プロジェクトホームページ:https://enriccorona.github.io/vlogger/
- arXivの研究論文:https://arxiv.org/abs/2403.08764v1
VLOGGERの特徴
- 画像と音声を主体としたビデオ生成VLOGGERは、人物の一枚の画像と対応する音声入力から、話している人物の動画を生成できます。ユーザーは画像と音声クリップを提供するだけで、VLOGGERは表情、口の動き、身振り手振りが音声と同期した人物の動画を生成します。
- 多様性と真正性VLOGGERは、背景の一貫性と動画の信憑性を維持しながら、被写体のさまざまな動作や表情を捉えることができる、非常に多様な動画を生成します。
- 動画編集VLOGGERは、既存の動画を編集するために使用できます。例えば、動画内の人物の表情を変更して、元の動画のピクセルと一貫性を保つことができます。
- 動いて話すキャラクターを生成するVLOGGERは、動画に映っている人物の元の映像がなくても、単一の入力画像と音声から、話している顔の動画を生成できます。
- 動画翻訳VLOGGERは、新しい音声に合わせて唇や顔の領域を編集することで、ある言語の動画を別の言語に変換し、多言語対応の動画コンテンツを実現します。
VLOGGERの仕組み
VLOGGERは主に、音声駆動の動き生成と時間的に整合性のあるビデオ生成を組み合わせた2段階のプロセスに基づいて動作します。
フェーズ1:音声駆動型モーション生成
- 音声処理VLOGGERはまず音声入力を受け取ります。音声入力は音声または音楽です。入力がテキストの場合は、テキスト読み上げ(TTS)モデルを使用して音声波形に変換されます。
- 3Dモーション予測次に、システムはTransformerアーキテクチャに基づくネットワークを使用して音声入力を処理します。このネットワークは、音声に同期した3Dの顔の表情と体の姿勢を予測するように訓練されています。ネットワークは、マルチステップのアテンション層を使用して音声の時間的特徴を捉え、一連の3D姿勢パラメータを生成します。
- 制御表現を生成するこのネットワークは、予測された顔の表情(θe i)と身体姿勢の残差(∆θb i)を出力します。これらのパラメータは、ビデオ生成プロセスを制御する2次元表現を生成するために使用されます。
フェーズ2:時間連続ビデオ生成
- ビデオ生成モデルVLOGGERの第2段階は、第1段階で生成された3Dモーション制御と参照画像(つまり、人物の単一画像を入力として受け取る)を受け取る時間拡散モデルです。
- 条件付きビデオ生成この動画生成モデルは、拡散ベースの画像間変換モデルであり、予測された2D制御を使用して、入力された音声と3Dモーションパラメータに従ってアニメーション化された一連のフレームを生成します。
- 超解像度動画の品質を向上させるため、VLOGGERには、基本となる動画解像度を128×128から256×256や512×512などの高解像度にアップスケールする超解像拡散モデルも搭載されています。
- 時間延長VLOGGERは、時間的アウトペインティングを用いて任意の長さの動画を生成します。まず一定数のフレームを生成し、次に前のフレームの情報に基づいて新しいフレームを繰り返し生成することで、動画の長さを拡張します。
データセットとトレーニング
- VLOGGERは、MENTORと呼ばれる大規模なデータセット(2200時間、80万件の動画)で学習されました。このデータセットには、多数の人物と動的なジェスチャーが含まれています。学習過程で、モデルは3Dポーズパラメータと入力画像に基づいて、一貫性のある高品質な動画シーケンスを生成する方法を習得しました。