AB
AiBoss
project

FantasyID - アリババと北京郵電大学が共同で立ち上げた、本人確認機能を備えた動画生成フレームワーク

FantasyIDは、アリババグループと北京郵電大学が開発した、新しいアイデンティティ保持型ビデオ生成(IPT2V)フレームワークです。強化された顔認識情報に基づいて、高品質でアイデンティティが一貫したビデオを生成します。FantasyIDは、拡散変換(D...)に基づいています。

FantasyIDとは何ですか?

FantasyIDは、アリババグループと北京郵電大学が共同開発した、新しいアイデンティティ保持型動画生成(IPT2V)フレームワークです。強化された顔認識情報に基づいて、高品質でアイデンティティに一貫性のある動画を生成します。FantasyIDは、拡散変換器を用いて3D顔形状の事前情報を導入することで、動画合成における顔構造の安定性と妥当性を確保します。また、参照顔を単純にコピーするのではなく、マルチビュー顔強調戦略を採用することで、表情や頭部の姿勢のダイナミズムを高めます。さらに、学習可能な階層型知覚注入メカニズムを用いて、融合された2Dおよび3D特徴を拡散モデルの各層に選択的に注入することで、アイデンティティ保持と動きのダイナミズムのバランスを取ります。

FantasyIDの主な機能

  • 身元保護目標は、生成された動画に登場する人物の顔の特徴が入力参照画像と一致するようにすること、そして複雑な動きや表情においても高いレベルの同一性を維持することである。
  • 動的強化生成される動画における「コピー&ペースト」現象を避けるため、表情や頭の姿勢の多様性を高める。
  • 高品質なビデオ生成3D顔面幾何学的事前情報と2D視覚的特徴を組み合わせることで、動画の時空間的な一貫性を維持しながら、安定した構造と豊富なディテールを備えた動画を生成する。
  • 微調整は不要ですこれにより、入力画像ごとにモデルを微調整する必要がなくなり、効率的かつ柔軟な本人確認機能付き動画生成が可能になるため、大規模なアプリケーションにも適しています。

FantasyIDの技術的原理

  • 3D顔面幾何学的事前情報DECAフレームワークに基づき、入力された顔画像から3D顔構造(形状点群など)を抽出し、ビデオ生成のための安定した幾何学的制約を提供するとともに、動的な変化の際にも顔構造の安定性を確保します。
  • マルチビュー顔強調複数の視点からの顔画像セットを構築し、異なる角度から顔画像をサンプリングすることで、モデルの2D顔外観特徴の理解度を高め、生成される動画における顔の均一性を回避し、動的なパフォーマンスを向上させます。
  • 機能融合抽出された2D視覚特徴と3D幾何学的特徴は、融合トランスフォーマーによって結合され、包括的な顔記述子が生成されます。この記述子は、ビデオ生成のガイドとして使用されます。
  • 階層型センシング信号注入拡散変換器の階層的な特性に対処するため、学習可能な階層的知覚メカニズムを設計し、融合された特徴を異なるレベルに選択的に注入することで、アイデンティティの保持と動的なパフォーマンスのバランスを実現します。
  • 拡散モデル拡散ベースの生成フレームワークは、段階的なノイズ除去プロセスを通じて、テキストによる説明や識別特徴に適合するビデオコンテンツをノイズから再構築します。

FantasyIDプロジェクトのアドレス

FantasyIDの応用シナリオ

  • パーソナライズされたバーチャルアバター仮想空間における社会的交流、メタバース、ゲームにおいて、ユーザーのアイデンティティと一致する仮想アバターを生成するために使用される。
  • 仮想コンテンツ制作映画、広告、短編動画の制作を支援する動的な動画コンテンツを生成することで、制作コストを削減します。
  • バーチャルカスタマーサービスとデジタルヒューマンオンラインカスタマーサービスやインテリジェントアシスタント向けに、自然でリアルなデジタルヒューマンアバターを作成し、インタラクティブな体験を向上させます。
  • バーチャルメイクアップと服の試着Eコマースと美容業界を組み合わせることで、メイクや服の試着といったダイナミックな動画を作成し、ショッピング体験を最適化することができる。
  • インタラクティブ教育教師やトレーナーのダイナミックな動画を作成し、オンラインコースやシミュレーションシナリオで使用することで、教育効果を高める。