AB
AiBoss
project

Pippo - Meta社の、マルチビュー高解像度ポートレートビデオを生成するための単一画像モデル

Pippoは、Meta Reality Labsが開発した画像から動画を生成するモデルで、1枚の写真から1K解像度のマルチビュー高解像度ポートレート動画を生成できます。このモデルはマルチビュー拡散トランスフォーマーに基づいており、30億枚のポートレート画像で事前学習されています。

ピッポとは何ですか?

Meta Reality Labsが開発した画像から動画を生成するモデル「Pippo」は、1枚の写真から1K解像度のマルチビュー高解像度ポートレート動画を生成できます。このモデルはマルチビュー拡散トランスフォーマーをベースとしており、30億枚のポートレート画像で事前学習を行い、2,500枚のスタジオ撮影画像で事後学習を行っています。Pippoの中核技術には、ピクセルアライメント条件を注入するControlMLPモジュールと、推論時に学習時よりも5倍以上多くのビューを生成できるアテンションバイアス技術が含まれています。Pippoは、マルチビュー生成の3D一貫性を評価するために再投影誤差を導入しています。

ピッポの主な機能

  • マルチビュー生成Pippoは、全身または顔の1枚の写真から、複数の視点からの高解像度ビデオを生成でき、全身、顔、または頭部のみのビデオの生成をサポートします。
  • 高効率コンテンツ生成Pippoは、マルチビュー拡散トランスフォーマーを使用することで、トレーニング時の視点よりも最大5倍多くのビデオコンテンツを生成できます。
  • 高解像度対応Pippoは、1K解像度での安定したマルチビューポートレート生成を初めて実現しました。
  • 空間アンカーポイントとControlMLPControlMLPモジュールを通して、プリュッカー光線や空間アンカーなどのピクセルアライメント条件を注入することで、より優れた3D一貫性が実現されます。
  • 自動補完の詳細単眼映像を処理する際、Pippoは靴、顔、首などの欠落した部分を自動的に補完することができる。

ピッポの技術原則

  • 多段階トレーニング戦略
    • 事前トレーニング段階Pippoはまず、注釈情報が一切含まれていない30億枚の非構造化人物肖像画像で事前学習された。
    • 中級トレーニング段階高品質のスタジオデータセットにおいて、このモデルは複数の視点から画像を共同で生成し、低解像度のビューを使用してノイズを除去し、浅いMLPを通してターゲットカメラを大まかにエンコードします。
    • トレーニング後の段階: 少数のビューを高解像度でノイズ除去し、ピクセル位置合わせ制御(空間アンカーやプリュッカー光線など)を導入して3Dの一貫性を実現します。
  • ピクセル位置合わせ制御(ControlMLPモジュール)Pippoは、ControlMLPモジュールを介して、プリュッカー光線や空間アンカーなどのピクセル位置合わせ条件を注入します。これらの条件は、学習フェーズで使用され、推論フェーズでは任意の位置に固定されます。
  • 注意バイアス技術推論段階において、Pippoは、モデルが訓練段階よりも5倍以上多くの視点を同時に生成できるようにするアテンションバイアス技術を提案した。
  • 3D一貫性評価指標Pippoは、複数の視点から生成された3Dの一貫性を評価するための、改良された3D一貫性評価指標である再投影誤差を導入しました。

ピッポのプロジェクトアドレス

Pippoアプリケーションシナリオ

  • 仮想現実(VR)と拡張現実(AR)Pippoは高品質なマルチビューポートレート動画を生成することができ、これはVRやAR環境における仮想キャラクター生成に直接利用することで、没入感を高めることができる。
  • 映画およびテレビ制作映画やテレビのポストプロダクションにおいて、Pippoはマルチビューの特殊効果ショットを迅速に生成するために使用でき、撮影コストと時間を削減できる。
  • ビデオ会議Pippoは、一枚の写真から複数の視点からの動画を生成することで、ビデオ会議に参加する遠隔地の参加者に、より自然でインタラクティブな体験を提供することができます。
  • ゲーム開発Pippoはゲーム内のキャラクターアニメーションを生成するために使用でき、視覚効果とプレイヤーの没入感を高めることができます。
  • ソーシャルメディアとコンテンツ制作クリエイターはPippoを使ってマルチビュー動画を生成し、ソーシャルメディアプラットフォーム向けに、よりリッチなコンテンツを提供することができます。