project
HumanDiT - 浙江大学とByteDanceが共同開発した、姿勢に基づいた人物動画生成フレームワーク。
HumanDiTは、浙江大学とByteDanceが共同で提案した、ポーズ誘導型の高忠実度人物動画生成フレームワークです。拡散変換(DiT)をベースとしており、大規模データセットで学習し、動画を生成できます。
HumanDiTとは何ですか?
HumanDiTは、浙江大学とByteDanceが共同で提案した、ポーズ誘導型の高忠実度人体動画生成フレームワークです。拡散変換(DiT)をベースとしており、大規模データセットで学習することで、詳細な身体描写を伴う長尺の人体動画を生成できます。HumanDiTの最大の特長は、キーポイントDiTを介して連続するポーズシーケンスを生成するポーズ誘導メカニズムにあり、動画内の人体の動きの一貫性と自然さを確保します。また、長尺シーケンスにおける個人の特徴を保持するために、プレフィックス潜在参照戦略を採用しています。HumanDiTは、様々な動画解像度と可変長のシーケンスをサポートしており、長尺動画の生成に適しています。ポーズアダプタを使用することで、与えられたシーケンスのポーズ転送を実現し、ポーズアライメントの精度をさらに向上させています。
HumanDiTの主な機能
- 姿勢誘導型ビデオ生成HumanDiTは、キーポイント拡散変換(Keypoint-DiT)に基づいて連続するポーズシーケンスを生成し、ビデオにおける人間の動きの連続性と自然さを保証します。
- 長尺動画生成複数のビデオ解像度と可変シーケンス長に対応しているため、長尺の高品質ビデオの生成に適しています。
- パーソナライズされた機能は維持されています接頭辞潜在参照戦略を用いて、長いシーケンス内のパーソナライズされた特徴を保持する。
- 柔軟な入出力静止画像や既存の動画から動画を生成できるため、さまざまな用途に適しています。
- 姿勢の適応と洗練特定のシーケンスのポーズ転送はポーズアダプタに基づいて行われ、顔と手の特徴と参照画像との位置合わせはポーズ精緻化モジュールによって強化される。
HumanDiTの技術原則
- 姿勢誘導および拡散変換器HumanDiTは、キーポイントDiTコンバーターを使用して推論フェーズ中にポーズガイダンスに基づいて動画を生成し、連続するポーズシーケンスを生成します。これにより、動画内の人間の動きの連続性と自然さが確保されるとともに、DiTコンバーターは様々な解像度とシーケンス長の動画に対応できます。
- 接頭辞潜在参照戦略長尺動画シーケンスの生成において、個々の特徴を保持するために、HumanDiTはプレフィックス潜在参照戦略を導入しています。この戦略では、動画の最初のフレームをノイズのないプレフィックス潜在ベクトルとして使用し、モデルが生成時に参照することで、視覚的な一貫性を維持します。
- 姿勢アダプタおよび姿勢調整モジュールHumanDiTは、ポーズアダプタを使用して指定されたシーケンスのポーズ転送を実現し、さらにポーズ精緻化モジュールによって生成されたポーズシーケンスを最適化します。これにより、顔や手などの細部の生成品質が向上し、参照画像との位置合わせが確実に行われます。
- 大規模データセットでのトレーニングHumanDiTは、構造化データ処理パイプラインを通じて収集された、14,000時間分の高品質ビデオを含む大規模なデータセットで学習されています。このデータセットは、さまざまな人間の動作シナリオを網羅しています。これにより、モデルは豊富な動作事前情報を学習することができ、推論時に高い汎化能力を発揮します。
HumanDiTプロジェクトの住所
- プロジェクト公式サイト:https://agnjason.github.io/HumanDiT-page/
- arXiv技術論文:https://arxiv.org/pdf/2502.04847
HumanDiTの応用シナリオ
- バーチャルヒューマンHumanDiTは、仮想人間の動的な動画を生成するために使用でき、より自然で滑らかな動きを実現します。仮想カスタマーサービスのシナリオでは、仮想人間がユーザーの質問に基づいてリアルタイムで対応する動作や表情を生成することで、より鮮やかでリアルな対話体験を提供できます。
- アニメーション映画HumanDiTは、高品質で長尺の人間動作動画を生成できます。これは、アニメーションキャラクターの動作シーケンスを生成するために使用でき、アニメーターが高品質のモーションクリップを迅速に生成し、制作効率を向上させるのに役立ちます。
- 没入型体験HumanDiTは、没入型体験における仮想キャラクターやアクションを作成するために使用できます。没入型VR体験において、HumanDiTはシーンに合わせたキャラクターの動きや表情を生成することができ、参加者はよりリアルで鮮やかな体験を得ることができます。
- 動画の生成と継続単一の画像から動画を生成することも、既存の動画から後続のコンテンツを生成し続けることも可能です。