AB
AiBoss
project

Vid2World - 清華大学と重慶大学が共同で、動画モデルを世界モデルに変換するフレームワークを発表。

Vid2Worldは、清華大学と重慶大学が共同開発した革新的なフレームワークです。これは、完全なシーケンスで非因果的な受動的なビデオ拡散モデル(VDM)を、自己回帰的でインタラクティブな、行動条件付きのワールドモデルに変換することをサポートします。このモデルは、…に基づいています。

Vid2Worldとは何ですか?

清華大学と重慶大学が共同開発した革新的なフレームワークであるVid2Worldは、フルシーケンスの非因果的受動ビデオ拡散モデル(VDM)を、自己回帰的、インタラクティブ、かつ行動条件付きのワールドモデルへと変換することを可能にします。ビデオ拡散の因果関係と因果的行動誘導という2つのコア技術に基づき、このモデルは、因果関係の生成と行動条件付けにおける従来のVDMの欠点を克服します。Vid2Worldは、ロボット操作やゲームシミュレーションといった複雑な環境において優れた性能を発揮し、高忠実度で動的に一貫性のあるビデオシーケンスの生成と、行動に基づいたインタラクティブな予測をサポートします。Vid2Worldは、ワールドモデルの実用性と予測精度を向上させる新たな道を開き、幅広い応用が期待されます。

Vid2Worldの主な機能

  • 高忠実度ビデオ生成視覚的な忠実度と動的な一貫性の点で、実際の動画と非常に類似した予測を生成する。
  • 行動条件付け入力された動作シーケンスに基づいて対応するビデオフレームを生成し、きめ細かなモーションコントロールをサポートします。
  • 自己回帰生成この動画は、自己回帰的な手法を用いてフレームごとに生成され、各生成ステップは過去のフレームと動作のみに依存します。
  • 因果推論このモデルは因果推論を行うことができ、その予測は過去の情報のみに基づいており、将来の情報には影響されない。
  • 下流タスクをサポートするロボット操作の補助やゲームシミュレーションなど、対話型のタスクをサポートします。

Vid2Worldの技術的原理

  • 動画拡散の原因ビデオ拡散モデル(VDM)は、ビデオシーケンス全体を同時にノイズ除去します。しかし、このフルシーケンス生成方法は、将来のフレームが過去のフレームに影響を与えるため、因果推論には適していません。因果生成を実現するために、Vid2Worldは事前学習済みのVDMを修正します。時間的注意層は因果マスクを適用し、注意機構が過去のフレームのみにアクセスできるように制限することで、因果性を実現します。時間的畳み込み層は、ハイブリッド重み転送スキームを導入し、事前学習済みの重みを保持しながら、モデルを因果畳み込み層に適応させます。拡散強制に基づいて、トレーニング中に各フレームのノイズレベルが独立してサンプリングされ、モデルが異なるフレーム間のノイズレベルの組み合わせを学習できるようになり、自己回帰生成をサポートします。
  • 因果関係に基づく行動指針モデルが細かな動作に対応できるようにするため、Vid2Worldは因果的動作誘導メカニズムを導入しています。各動作は軽量な多層パーセプトロン(MLP)を用いてエンコードされ、対応するフレームに追加されます。トレーニング中は、各動作が一定の確率で独立して削除されるため、モデルは条件付きスコア関数と無条件スコア関数の両方を学習する必要があります。テスト中は、動作の変化に対する応答性が、条件付きスコア関数と無条件スコア関数の線形結合に基づいて調整されます。動作を独立して削除することで、モデルは動作が生成結果に与える影響を学習し、自己回帰生成中の動作入力に対してより適切に対応できるようになります。

Vid2Worldプロジェクトのアドレス

Vid2Worldの応用シナリオ

  • ロボット操作ロボットのタスク計画を支援するために、高精度の予測を生成する。
  • ゲームシミュレーション現実世界のゲームプレイに酷似した動画を生成し、ニューラルゲームエンジンの開発を支援する。
  • 戦略評価さまざまな戦略の実行結果をシミュレーションすることで、戦略の最適化に役立てる。
  • 動画予測既存のフレームやアクションシーケンスに基づいて後続のフレームを予測する。ビデオ補完などに使用される。
  • 仮想環境の構築操作に反応する仮想シーンを生成し、仮想現実のインタラクティブ性を向上させる。