project
DisPose - 北京大学をはじめとする複数の大学が開発した、キャラクター画像制御アニメーションの品質向上を目的とした技術。
DisPoseは、北京大学、中国科学技術大学、清華大学、香港科技大学の研究チームが共同開発した、キャラクターアニメーションの品質向上を目的とした制御技術です。骨格ポーズと参照画像から有効なデータを抽出することに基づいています。
DisPoseとは何ですか?
北京大学、中国科学技術大学、清華大学、香港科技大学の共同研究チームによるDisPoseは、人体画像アニメーションの品質向上を目的とした制御技術です。骨格姿勢と参照画像から有効な制御信号を抽出することに基づいており、追加の高密度入力は不要です。DisPoseは姿勢制御をモーションフィールドガイダンスとキーポイントマッピングに分解し、高密度モーションフィールドを生成することで、異なる体型間での汎化能力を維持しながら、領域レベルのガイダンスを提供します。DisPoseには、既存モデルで生成される動画の品質と一貫性を向上させるプラグアンドプレイ型のハイブリッドControlNetが含まれています。
DisPoseの主な機能
- スポーツ分野における指導骨格の姿勢から高密度なモーションフィールドを生成し、領域レベルでの高密度なガイダンスを提供することで、ビデオ生成におけるモーションの一貫性を向上させます。
- 要点の対応参照画像内のポーズキーポイントに対応する拡散特徴を抽出し、その拡散特徴をターゲットポーズに転送し、同一性情報の一貫性を維持する。
- プラグアンドプレイモジュールプラグインモジュールとして、既存のキャラクター画像アニメーションモデルにシームレスに統合でき、既存のモデルパラメータを変更する必要がありません。
- 品質と一貫性の向上Hybrid ControlNetは、生成される動画の品質と外観の一貫性を向上させます。
- 追加の集中的な入力は不要ですこの方法は、追加の高密度入力(深度マップなど)に頼ることなく機能し、参照キャラクターと運転ビデオ間の体型の違いに対する感度を低減します。
DisPoseの技術原理
- スポーツフィールドの評価:
- まばらなスポーツフィールドDWposeは骨格の姿勢を推定し、キーポイントに基づいて動きの変位を追跡し、それを軌跡グラフとして表現します。
- 密集したスポーツフィールド条件付き動き伝播(CMP)は、疎な動き場と参照画像に基づいて密な動き場を予測し、より詳細な動き信号を提供する。
- 重要なポイントの特徴抽出: 事前学習済みの画像拡散モデルを使用して参照画像からDIFT特徴を抽出し、これらの特徴をキーポイントにマッピングしてキーポイント特徴マップを作成します。
- ハイブリッドコントロールネットハイブリッド型のControlNetを設計することで、既存モデルの他の部分を凍結させることなくトレーニング中に更新を行うことが可能になり、モーションフィールドガイダンスとキーポイントマッピングを既存のアニメーションモデルにシームレスに統合することが容易になった。
- 機能融合:
- 特徴融合層は、疎な動きの特徴と密な動きの特徴を組み合わせて、最終的な動き場誘導信号を生成する。
- マルチスケールポイントエンコーダは、キーポイント特徴とU-Netエンコーダからの中間特徴を組み合わせることで、特徴間の意味的な対応関係を強化します。
- 制御信号の統合動き場の誘導とキーポイントの対応関係は、追加の制御信号として基となるビデオ拡散モデルに注入され、正確なキャラクター画像アニメーションを生成する。
Disposeプロジェクトのアドレス
- プロジェクト公式サイト:lihxxx.github.io/DisPose
- GitHubリポジトリ:https://github.com/lihxxx/DisPose
- arXiv技術論文:https://arxiv.org/pdf/2412.09349
DisPoseの応用シナリオ
- 芸術創作アーティストは、モーションペインティングやデジタル彫刻など、特定の動きや表現を用いたダイナミックな作品を制作する。
- ソーシャルメディアソーシャルメディアプラットフォームでは、パーソナライズされたアニメーションアバターやアニメーション絵文字を作成して、インタラクションの楽しさを高めましょう。
- デジタル人間とバーチャルアイドルライブ配信、ビデオ会議、またはバーチャルアイドルとしてのパフォーマンスで使用するための、バーチャルキャラクターの動きや表情を作成および制御します。
- 映画製作映画のポストプロダクションにおいて、キャラクターの動きを生成または修正することは、制作効率を向上させる。
- 仮想現実(VR)と拡張現実(AR)VRやARアプリケーションでは、ユーザーとインタラクションする仮想キャラクターが生成され、より自然でリアルなインタラクティブ体験を提供する。