project
FlexiAct - 清華大学とテンセントが共同で立ち上げた行動移転モデル
FlexiActは、清華大学とテンセントARCラボが共同開発した革新的な動作転送モデルです。FlexiActは、対象画像が与えられると、空間構造に大きな違いがある状況でも、参照動画から対象人物へ動作を転送することができます。
FlexiActとは何ですか?
FlexiActは、清華大学とテンセントARCラボが共同開発した革新的なモーション転送モデルです。FlexiActは、対象画像が与えられると、参照動画から対象物へ動作を転送し、空間的な差異が大きい異種シーンやドメイン間の課題においても、正確な動作適応と外観の一貫性を実現します。このモデルは、軽量なRefAdapterモジュールと周波数認識型動作抽出(FAE)モジュールを導入することで、レイアウト、視点、骨格構造の違いといった既存手法の限界を克服し、同一性の一貫性を維持します。FlexiActは、人間と動物の両方において優れたモーション転送性能を発揮し、幅広い応用可能性を示しています。
FlexiActの主な機能
- 被験者間行動転移あるキャラクターから別のキャラクターへ、またはキャラクターから動物へ行動を移すことをサポートします。
- 一貫した外観を維持する移行処理中は、対象物の外観(服装、髪型など)が元の対象画像と一致していることを確認してください。
- 柔軟な空間構造への適応参照動画と対象画像の間でレイアウト、視点、骨格構造に違いがあっても、自然な動きの転送を実現できる。
FlexiActの技術原則
- RefAdapter(空間構造アダプタ)RefAdapterは軽量な画像条件付きアダプタであり、主に参照動画とターゲット画像間の空間構造の違いに対処するために設計されています。トレーニング中、空間構造の多様性を最大化するために、条件付き画像として動画フレームをランダムに選択します。これにより、モデルは視覚的な一貫性を維持しながら、さまざまな姿勢、レイアウト、および視点に適応できます。少数のトレーニング可能なパラメータ(LoRAモジュールなど)を注入することで、CogVideoX-I2VのMMDiTレイヤー内で柔軟な空間適応を実現し、従来の手法の厳しい制約を回避します。
- 周波数認識型モーション抽出FAEは、独立した時空間アーキテクチャに依存せず、ノイズ除去処理中にアクションを直接抽出する革新的なアクション抽出モジュールです。FAEは、ノイズ除去の異なるタイムステップにおいて、モデルが動き(低周波)と外観の詳細(高周波)に異なる程度の注意を払っていることを観測します。初期のタイムステップでは、モデルは動きの情報に重点を置き、後期のタイムステップでは外観の詳細に重点を置きます。FAEは、注意の重みを動的に調整し、初期のタイムステップでは動きの抽出を優先し、後期のタイムステップでは外観の詳細に焦点を当てることで、正確なアクション抽出と制御を実現します。
FlexiActのプロジェクト住所
- プロジェクト公式サイト:https://shiyi-zh0408.github.io/projectpages/FlexiAct/
- GitHubリポジトリ:https://github.com/shiyi-zh0408/FlexiAct
- ハギングフェイスモデルライブラリ:https://huggingface.co/shiyi0408/FlexiAct
- arXiv技術論文:https://arxiv.org/pdf/2505.03730
FlexiActの応用事例
- 映画およびテレビ制作リアルなキャラクターの動きを素早く生成し、撮影コストを削減します。
- ゲーム開発ゲームキャラクターに多様なアクションを生成し、ゲーム体験を向上させる。
- 広告とマーケティング広告の魅力を高めるために、仮想の広報担当者によるアクションを生成する。
- 教育と訓練学習と回復を支援するための、教育およびリハビリテーション訓練動作を生成する。
- エンターテイメントと交流ユーザーが興味深い動画を作成し、エンターテイメント体験を向上させることを支援します。