project
Motion Anything - TencentがJD.comおよび他の大学と共同で開発した、マルチモーダルなモーション生成フレームワーク。
Motion Anythingは、オーストラリア国立大学、シドニー大学、テンセント、マギル大学、JD.comなどの機関によって開発されたマルチモーダルモーション生成フレームワークです。テキスト、音楽、またはその両方を組み合わせたものに基づいて、高品質で制御可能なモーションを生成します。
モーションエニシングとは何ですか?
Motion Anythingは、オーストラリア国立大学、シドニー大学、テンセント、マギル大学、JD.comなどの機関によって開発されたマルチモーダルモーション生成フレームワークです。テキスト、音楽、またはその両方を組み合わせた高品質で制御可能な人間の動きを生成します。Motion Anythingは、既存の手法では条件に基づいて動的なコンテンツ生成を優先できないという問題に対処するため、モーションシーケンス内のキーフレームとアクションをきめ細かく制御できるアテンションベースのマスクモデリング手法を導入しています。このフレームワークは、時間適応型および空間アライメントトランスフォーマーに基づいており、複数のモーダル条件を効果的に統合することで、生成されるモーションの一貫性と多様性を向上させています。また、テキスト、音楽、ダンスのペアサンプル2153組を含むText-Music-Dance(TMD)データセットを公開し、マルチモーダルモーション生成研究の新たなベンチマークを提供します。
モーション 何でもの主な機能
- マルチモーダル条件下でのモーション生成テキストによる説明、音楽、またはその両方を組み合わせて、高品質な人間の動きを生成します。
- きめ細かな制御アテンションメカニズムに基づいて、キーフレームとモーションアクションをきめ細かく制御することで、より正確な生成結果を実現します。
- 動的な優先順位調整モーション生成の優先順位は、与えられた条件(テキストや音楽など)に基づいて動的に調整され、その条件に最も関連性の高い動的なフレームや身体部位の生成が優先されます。
- 異種モダリティ間の連携テキスト、音楽、動きを時間的・空間的な次元で効果的に整合させることで、生成される動きの一貫性と整合性を向上させます。
モーションエニシングの技術原理
- アテンションベースのマスクモデリングこのモデルは、アテンション機構を用いて、条件(テキストまたは音楽)に最も関連性の高い動きの部分を選択してマスクします。生成時には、マスクされたキーフレームとアクションの復元を優先し、動的なコンテンツに焦点を当てます。
- 時間適応型トランスフォーマー条件の種類(テキスト、音楽、またはその両方の組み合わせ)に基づいて、注意の計算を動的に調整します。モーションキーフレームをテキスト内のキーワードまたは音楽のリズムに合わせることで、時間的な一貫性を向上させます。
- 空間アライメントトランスフォーマー埋め込まれた条件と動作を再配置して、空間的な次元を明らかにします。マスクされたキーアクションを復元して、動作と条件間の空間的な一貫性を確保します。
- マルチモーダル条件付きコーディングこの技術は、テキストや音楽など複数のモダリティを同時に処理し、適応型エンコーダに基づいて異なるモダリティからの情報を統合してモーション生成を行います。これにより、マルチモーダル環境下でも制御可能なモーション生成が可能になり、生成品質が向上します。
- データセットのサポート本研究は、テキスト、音楽、ダンスのサンプルを2153組収録した新しいテキスト・音楽・ダンス(TMD)データセットを提供し、マルチモーダルなモーション生成のための豊富なデータサポートを実現します。
Motion Anythingのプロジェクトアドレス
- プロジェクト公式サイト:https://steve-zeyu-zhang.github.io/MotionAnything/
- GitHubリポジトリ:https://github.com/steve-zeyu-zhang/MotionAnything
- arXiv技術論文:https://arxiv.org/pdf/2503.06955
Motion Anythingの応用シナリオ
- 映画とアニメーション高品質なアニメーションを迅速に生成し、制作コストを削減し、視覚効果を向上させます。
- VR/AR仮想キャラクターにリアルな動きを生成し、没入感を高め、自然なインタラクションを実現します。
- ゲーム開発ストーリーや音楽に基づいてキャラクターの動きを生成し、ゲームの楽しさとスムーズさを向上させる。
- 人間とコンピュータの相互作用ロボットと人間のインタラクションをよりユーザーフレンドリーにし、音声コマンドによる動作生成を可能にするために、自然な動きを生成する。
- 教育と訓練体育、ダンス、その他の科目の指導を支援するための標準的な動作デモンストレーションを作成し、それによってトレーニング効果を向上させる。