AB
AiBoss
project

Genie 2 - Google DeepMindの最新世代の基礎世界モデル

Genie 2は、DeepMindが開発した次世代の大規模ベースワールドモデルで、1枚の画像から最大1分間のインタラクティブな3Dゲームワールドを生成できます。Genie 2は、オブジェクト間の相互作用、キャラクターのアニメーション、物理効果など、複雑なダイナミクスをシミュレートできます。

Genie 2とは何ですか?

Genie 2は、DeepMindが開発した次世代の大規模ベースワールドモデルで、1枚の画像から最大1分間のインタラクティブな3Dゲームワールドを生成できます。Genie 2は、オブジェクト間の相互作用、キャラクターアニメーション、物理効果などの複雑なダイナミクスをシミュレートでき、キーボードとマウスの両方での操作に対応しています。Genie 2は長期記憶機能を備えており、一時的にビューポートから外れたシーンを記憶し、正確に再現できます。Genie 2は、論理的に一貫性のある新しいシーンコンテンツをリアルタイムで生成し、ワールド全体の一貫性を最大1分間維持できます。

Genie 2の主な特徴

  • 画像から生成された3DワールドGenie 2は、1枚の画像からインタラクティブな3Dゲーム世界を生成でき、最大プレイ時間は1分です。
  • モーションコントロールこのモデルはキーボードとマウスの入力に反応し、キャラクターを正しく認識して動かすことができます。
  • 反事実的なシナリオを生成する同じスタート画面を基に、複数の異なる開発パスを作成することができる。
  • 長期記憶一時的に視界から外れた場面を記憶し、再び視界に入った際に正確に再現することができる。
  • 継続的に新しいシーンを生成: 処理中に、世界の整合性を維持しながら、論理的に一貫性のある新しいシーンコンテンツをリアルタイムで作成します。
  • 多様な環境の創出一人称視点、等角投影視点、三人称運転視点など、さまざまな視点を生成できます。
  • 3D構造の作成複雑な3Dビジュアルシーンを作成する。
  • オブジェクトの特性と相互作用風船が破裂する、ドアが開く、爆発する樽を発射するなど、さまざまな物体間の相互作用をモデル化する。

Genie 2の技術的原理

  • 自己回帰潜在変数拡散モデル大規模なビデオデータセットで学習された自己回帰潜在変数拡散モデル。
  • ビデオフレーム処理動画の潜在変数フレームは、まずオートエンコーダーに基づいて処理され、その後、大規模なTransformer動的モデルに渡されます。
  • カジュアルなマスクトレーニングTransformerモデルは、大規模言語モデルで使用されるマスキング手法と同様に、因果マスクに基づいて学習されます。
  • 回帰サンプリング推論フェーズでは、Genie 2は単一のアクションと過去の潜在変数フレームを使用して、フレームごとに自己回帰的な方法でサンプリングを行います。
  • 分類器ガイダンスなしモーションコントロールにおいて、分類器を用いない誘導方式は、動作の制御性を向上させるために利用できる。

Genie 2プロジェクトのアドレス

Genie 2の応用シナリオ

  • エージェントのトレーニングと評価: 複雑な仮想環境を作成し、シミュレーション環境におけるAIエージェントの性能と意思決定能力を訓練およびテストする。
  • ゲーム開発Genie 2によって生成されるダイナミックな世界を活用することで、ゲーム開発者はより豊かでインタラクティブなゲームコンテンツを設計し、プレイヤーの没入感を高めることができる。
  • シミュレーションとトレーニング軍事訓練における戦場環境や教育における歴史的出来事をシミュレートすることができ、訓練や学習のためのリアルなシミュレーション体験を提供する。
  • ロボット学習ロボット訓練プラットフォームとして、さまざまな環境や状況をシミュレートすることで、ロボットが現実世界でどのように移動し、操作するかを学習するのに役立つ。
  • 仮想現実(VR)と拡張現実(AR)VRとAR技術を組み合わせることで、エンターテインメント、教育、専門研修などのための仮想環境を構築し、没入感のある体験を提供する。