AB
AiBoss
project

Aether - 上海AIラボのオープンソース生成世界モデル

Aetherは、上海AIラボが開発したオープンソースの生成世界モデルで、完全に合成データで学習されています。Aetherは、3D時空間モデリングと生成モデリングを深く統合した初のモデルであり、4D動的再構成、モーション条件付きビデオ予測などの機能を備えています。

エーテルとは何ですか?

Aetherは、上海AIラボが開発したオープンソースの生成型世界モデルであり、合成データのみで学習されています。Aetherは、3D時空間モデリングと生成型モデリングを深く統合した初のモデルであり、4D動的再構成、モーション条件付きビデオ予測、目標指向型ビジュアルプランニングという3つのコア機能を備えています。Aetherは、周囲の環境を認識し、物体の位置と動きの関係を理解し、インテリジェントな意思決定を行うことができます。Aetherは、現実世界において強力なゼロショット汎化能力を発揮し、仮想データ学習を用いて複雑なタスクを効率的に完了させ、具現化されたインテリジェントシステムに対して堅牢な空間推論と意思決定支援を提供します。

エーテルの主な機能

  • 4D動的再構成動画から時間と空間を含む3Dシーンモデルを再構築し、動的な変化を捉える。
  • 動きの状況に基づく動画予測初期観測結果と移動軌跡に基づいて、将来のシーン変化を予測する。
  • 目標指向型の視覚的計画初期シナリオと目標シナリオに基づいて合理的な経路を生成し、インテリジェントシステムが行動経路を計画するのを支援する。

エーテルの技術原理

  • 統合マルチタスクフレームワークこのアプローチは、動的再構成、ビデオ予測、およびアクションプランニングを統合した最適化のための統一フレームワークです。タスクインターリーブ型の特徴学習に基づき、異なるタスク間での協調最適化を実現し、モデルの安定性と堅牢性を向上させます。
  • 幾何学的知覚モデリング本プロジェクトでは、3D時空間モデリングを導入し、幾何学的空間を構築してモデルの空間推論能力を強化します。大量のシミュレーションRGBDデータ(カラー画像と深度マップ)を用いて、包括的なデータクリーニングと動的再構築のワークフローを開発し、豊富なアクションシーケンスに注釈を付けます。
  • カメラ軌跡をモーション表現として用いるカメラの軌跡は、グローバルな動きを表すものとして選択されます。ナビゲーションタスクでは、カメラの軌跡はナビゲーションパスに直接対応します。ロボット操作では、ハンドルカメラの動きによってエンドエフェクタの6次元の動きを捉えることができます。
  • 拡散モデルとマルチモーダル融合事前学習済みのビデオ拡散モデルに基づき、Aetherは合成4Dデータを用いて事後学習されます。深度ビデオをスケール不変の正規化視差表現に変換し、カメラ軌跡をDiDiffusion Transformers(DiT)の時空間フレームワークに沿ったスケール不変のレイマップシーケンスとしてエンコードします。タスク間およびモダリティ間の条件信号を動的に統合することで、Aetherはマルチモーダル情報の融合と協調最適化を実現します。
  • ゼロショット汎化能力完全に仮想データで学習されたこのモデルは、実世界へのゼロショット汎化を実現します。観測フレーム、ターゲットフレーム、モーション軌跡などのさまざまな条件付き入力と拡散プロセスを組み合わせることで、多様なタスクに対応した統一的なモデリングと生成を可能にします。これにより、実世界のデータがなくても、実世界のシナリオで非常に優れたパフォーマンスを発揮します。

Aetherのプロジェクトアドレス

Aetherの応用事例

  • ロボットナビゲーションこれはロボットが経路を計画し、動的な障害物を回避するのに役立ちます。
  • 自動運転道路状況をリアルタイムで再現し、交通状況を予測する。
  • バーチャルリアリティユーザー体験を向上させるために、没入感のある仮想シーンを生成する。
  • 産業用ロボットロボットの動作経路を最適化して、生産効率を向上させる。
  • インテリジェントモニタリング監視カメラの映像を分析して、異常行動を予測する。