project
UnityVideo - Kuaishou Kelingが香港科技大学と共同でオープンソース化した動画生成フレームワーク
UnityVideoは、香港科技大学がKuaishou Kelingチーム、清華大学などと共同で開発した、斬新なマルチモーダル・マルチタスク動画生成フレームワークです。セグメンテーション、スケルトン化、深度、オプティカルフローなど、複数の視覚モダリティを統合し、学習機能も備えています。
UnityVideoとは何ですか?
UnityVideoは、香港科技大学がKuaishouのKelingチーム、清華大学などと共同で開発した、斬新なマルチモーダル・マルチタスク動画生成フレームワークです。セグメンテーション、スケルトン化、深度、オプティカルフローといった複数の視覚モダリティと学習パラダイムを統合することで、動画生成モデルの物理世界理解能力を向上させます。このフレームワークは、動的なノイズ注入とモダリティ適応型学習メカニズムにより、RGB動画と補助モダリティ間の双方向学習を実現し、モデルの収束を加速させ、ゼロショット汎化能力を大幅に向上させます。
UnityVideoの主な機能
-
マルチモーダルビデオ生成このフレームワークは、テキストによる説明から高品質のRGBビデオを生成し、複数の補助的なモダリティ(深度マップ、オプティカルフロー、セグメンテーションマスク、人体骨格、DensePoseなど)を組み合わせて共同生成することで、ビデオの物理的なリアリズムと一貫性を向上させることができます。
-
制御可能なビデオ生成複数のモーダル条件(深度マップ、オプティカルフローなど)に基づいた制御可能なビデオ生成をサポートし、与えられたモーダル情報に基づいて特定の要件を満たすビデオコンテンツを生成します。
-
最頻値推定RGBビデオから他の補助的なモーダル情報(深度マップ、オプティカルフロー、セグメンテーションマスクなど)を推定し、ビデオコンテンツのマルチモーダル解析を実現します。
-
ゼロショット一般化ゼロショット汎化能力が非常に高く、トレーニングデータ外のシーンやオブジェクトに対しても高品質な動画を生成でき、複数のモダリティ情報を正確に推定できます。
-
マルチタスク共同訓練このシステムは、単一のフレームワーク内でビデオ生成、制御可能な生成、モダリティ推定などの複数のタスクをサポートし、複数のタスクを共同で学習させることで、モデルの全体的なパフォーマンスと汎化能力を向上させます。
UnityVideoの技術的原則
- 統一されたマルチモーダルフレームワーク拡散モデル(DiT拡散変換器など)に基づく統一フレームワークを用いて、RGBビデオと複数の補助的なモダリティ情報を共有特徴空間に統合します。動的なノイズ注入戦略により、トレーニング中に条件付き生成、モダリティ推定、結合生成などの異なるタスクがランダムに選択され、モデルが複数のタスクとモダリティの結合分布を同時に学習できるようになります。
- モーダル適応学習この問題を解決するために、モダリティ適応型スイッチャーを導入し、各モダリティに独立したパラメータテーブル(AdaLNパラメータなど)を割り当てることで、モデルが異なるモダリティに基づいてネットワークパラメータを動的に調整できるようにします。コンテキスト内学習器を使用して、モダリティの種類を示すテキスト情報(「深度マップ」や「オプティカルフロー」など)を挿入することで、モデルが異なるモダリティを意味的に区別し、モダリティ認識能力を向上させます。
- 動的な騒音スケジューリングトレーニング中、ノイズ注入戦略は動的に調整され、タスクの種類(条件付き生成、モダリティ推定、共同生成)に基づいてRGBと補助モダリティに異なるノイズを適用することで、タスク間の協調学習を促進します。確率的なタスク選択メカニズムは、異なるタスクの学習難易度のバランスを取り、共同トレーニング中にモデルが特定のタスクを優先することを防ぎます。
- コース学習戦略学習アプローチとしては、まずピクセルアライメントされたモダリティ(深度やオプティカルフローなど)を単一人物のデータで学習させ、空間対応の基礎を確立し、その後、複数人物のデータやより多くのモダリティへと拡張することで、複雑なシーンを理解するモデルの能力を徐々に向上させていく。
- 大規模マルチモーダルデータセット本プロジェクトでは、RGB、深度、オプティカルフロー、セグメンテーションマスク、スケルトンなど、さまざまなモダリティを網羅した130万組のマルチモーダルビデオサンプルを含むOpenUniデータセットを構築し、モデルトレーニングのための豊富なデータを提供します。また、マルチモーダルビデオタスクにおけるモデルのパフォーマンスを評価するためのUniBenchベンチマークセットも提供し、モデルの汎化能力と精度を保証します。
UnityVideoプロジェクトのアドレス
- プロジェクト公式サイト:https://jackailab.github.io/Projects/UnityVideo/
- GitHubリポジトリ:https://github.com/dvlab-research/UnityVideo
- ハギングフェイスモデルライブラリ:https://huggingface.co/JackAILab/UnityVideo
- arXiv技術論文:https://arxiv.org/pdf/2512.07831
UnityVideoの応用シナリオ
-
映画およびテレビの特殊効果制作このフレームワークは、滝、オーロラ、液体の流れといったリアルな特殊効果ビデオを迅速に生成でき、映画やテレビのポストプロダクションにおける効率的なプレビューとクリエイティブな検証を可能にします。
-
仮想現実(VR)と拡張現実(AR)このフレームワークは、非常にリアルな仮想シーンと動的な背景を生成することができ、ユーザーの没入感とインタラクティブな体験を向上させます。
-
教育と訓練授業内容に基づいて、物理実験や生物アニメーションなどの科学現象をシミュレーションした動画が生成され、学生が複雑な概念をよりよく理解できるように支援する。
-
ゲーム開発このフレームワークは、ゲーム内の動的なシーン、キャラクターのアクション、カットシーンを生成することができ、ゲームの視覚効果と開発効率を向上させます。
-
広告とマーケティングブランドの説明に基づいて、ソーシャルメディアやテレビCMなど、多様なマーケティングニーズに対応するクリエイティブな広告動画を迅速に生成します。