AB
AiBoss
project

ConsisID - 北京大学、鵬城実験室、およびその他の機関が共同開発した、テキストから動画を生成するモデル。

ConsisIDは、北京大学や鵬城実験室などが開発したテキストからビデオへの変換(IPT2V)生成モデルです。周波数分解技術に基づいて、ビデオ内の個人の識別情報の一貫性を維持します。このモデルは、チューニング不要(チューニングフリー)のアプローチを採用しています。

ConsisIDとは何ですか?

ConsisIDは、北京大学や鵬城実験室などが開発したテキストから動画への変換(IPT2V)モデルです。周波数分解技術に基づき、動画内の人物間の同一性を維持します。このモデルは、チューニング不要の拡散トランスフォーマー(DiT)アーキテクチャを採用し、低周波グローバル特徴と高周波固有特徴を組み合わせ、階層的な学習戦略を用いて、高い同一性を持つ高品質で編集可能な動画を生成します。ConsisIDは、複数の評価項目において既存技術を凌駕し、同一性を維持した動画生成技術の発展を牽引しています。

ConsisIDの主な機能

  • 身元保護動画生成中は、人物の身元に一貫性を持たせ、動画内の人物の特徴が提供された参照画像と一致するようにしてください。
  • 高品質なビデオ生成視覚的にリアルで詳細なビデオコンテンツを生成する。
  • 微調整は不要です調整不要モデルであるため、新しいケースごとに微調整する必要がなく、参入障壁が低くなります。
  • 編集可能性この機能により、ユーザーはテキストプロンプトを使用して、キャラクターの動き、表情、背景など、ビデオコンテンツを制御できます。
  • 一般化能力訓練データ領域外の人々にも対応できるため、モデルの汎化能力が向上します。

ConsisIDの技術原理

  • 周波数分解
    • 低周波制御グローバル顔特徴抽出器を使用して、参照画像と顔のキーポイントを低周波特徴にエンコードし、それをネットワークの浅い層に統合することで、トレーニングの難易度を軽減します。
    • 高周波制御高周波の詳細を捉え、それをTransformerモジュールに注入するための局所的な顔特徴抽出器を設計しました。これにより、モデルが細かい特徴を保持する能力が向上します。
  • 階層型トレーニング戦略
    • 粗いものから細かいものへのトレーニングまず、モデルにグローバルな情報を学習させ、次にそれをローカルな情報に洗練させることで、ビデオの空間的および時間的な両方の次元における一貫性を維持する。
    • 動的マスク損失損失関数の計算は顔マスクによって制約されるため、モデルは顔領域に焦点を当てることができる。
    • 動的クロスフェイス損失顔の相互参照画像を導入することで、モデルが未知の人物にも一般化できる能力が向上する。
  • 機能融合顔認識バックボーンネットワークとCLIP画像エンコーダを使用して特徴を抽出し、Q-Formerに基づいて特徴を融合することで、高頻度の意味情報を含む固有のアイデンティティ特徴を生成する。
  • クロスアテンションメカニズム相互注意機構に基づき、このモデルは事前学習済みモデルによって生成された視覚ラベルと相互作用し、DiT内の高周波情報を効果的に強化することができる。

ConsisIDのプロジェクトアドレス

ConsisIDの応用シナリオ

  • パーソナライズされたエンターテイメントユーザーは、ソーシャルメディアプラットフォームでの使用や個人的な娯楽のために、自分自身や指定されたキャラクターに似た仮想アバターを作成する。
  • バーチャルストリーマーニュース放送やオンラインライブ配信では、ConsisIDを使用して生成されたバーチャルアンカーが24時間365日稼働します。
  • 映画およびテレビ制作映画のポストプロダクションでは、特殊効果シーンに登場するキャラクターを作成したり、全く新しい仮想キャラクターを作成したりするために使用される。
  • ゲーム業界ゲームキャラクターデザインのプロトタイプを提供したり、プレイヤーに似たゲーム内のノンプレイヤーキャラクター(NPC)を生成したりする。
  • 教育およびシミュレーション訓練教育目的や専門的な訓練のために、歴史上の人物を作成したり、特定のシナリオをシミュレーションしたりする。例えば、医療シミュレーションや運転訓練などが挙げられる。