project
SpatialClaw - NVIDIAとKAISTが共同開発した、トレーニング不要の空間推論フレームワーク
SpatialClawは、NVIDIA ResearchとKAISTが共同開発した、学習不要の空間推論フレームワークです。コード・アズ・アクションのメカニズムを用いて、永続的なPythonカーネル内で複雑な3D/4D空間推論タスクを繰り返し実行します。(最後の文は不完全で、おそらく別の無関係な点を指していると思われます。)
SpatialClawとは何ですか?
SpatialClawは、NVIDIA ResearchとKAISTが共同開発した、学習不要の空間推論フレームワークです。コードをアクションとして実行するメカニズムにより、永続的なPythonカーネル内で複雑な3D/4D空間推論タスクを繰り返し実行し、20のベンチマークで平均59.9%の精度を達成しました。これは、従来の手法を11.2パーセントポイント上回るものです。
SpatialClawの主な機能
-
アクションインターフェースとしてのコードエージェントは、永続的なJupyterカーネル内でセルごとにPythonコードを書き込み、深度再構築やセグメンテーションマスキングなどの知覚ツールの出力を自由に組み合わせます。
-
5段階の薬剤サイクルシステムは、計画、コード生成、ASTセキュリティ検証、実行とフィードバックの組み立て、および解答の提出または反復的な修正を順次実行します。
-
マルチモーダルセンシング統合Depth Anything 3やSAM 3などの画像認識ツールをネイティブにサポートし、リアルタイムの幾何計算のためにNumPy/SciPyと連携します。
-
完全訓練不要の導入同じシステムプロンプトとツールセットは、Qwen3.5/3.6およびGemma4を含む6つの基幹ネットワーク上で直接動作します。
-
動的4D推論サポート単一画像、複数視点、動画、および4次元時間シーンにおける空間関係の理解と計測計算を網羅しています。
SpatialClawの技術的原理
- アクションインターフェースとしてのコードSpatialClawは、従来の構造化ツール呼び出しをPythonコード生成に置き換えます。VLMを使用すると、ユーザーは永続的なJupyterカーネル内でコードを自由に記述、実行、変更できます。アクションスペースはもはや定義済みのJSON形式に限定されず、任意の複雑な空間計算ロジックを表現できます。
- 5段階の薬剤サイクルシステムは、計画、コード生成、ASTセキュリティ検証、実行とフィードバックの組み立て、および回答の提出または反復修正を順次実行し、閉ループを形成します。実行後の変数状態と視覚化結果は、マルチモーダルフィードバックとしてVLMにフィードバックされ、コード修正の次のステップを駆動します。
- 永続的な Jupyter カーネルコードの実行後、変数とオブジェクトはメモリに保持され、後続のセルは中間結果を直接再利用できるため、多段階反復推論がサポートされます。カーネル内のmatplotlibの出力は画像フィードバックとして取得され、VLMが計算プロセスを「視覚化」してそれに応じて調整できるようになります。
- 知覚ツールの統合Depth Anything 3やSAM 3といった視覚的な基盤モデルは、Pythonモジュールとして公開されています。VLMは、深度推定、セグメンテーションマスク生成、NumPy/SciPyを用いた幾何学的計算などをコードを通して自由に組み合わせることで、モジュール式の組み合わせを可能にします。
- ASTセキュリティチェック抽象構文木の静的解析によって危険な呼び出しを傍受し、ホワイトリストに登録された検出ツールと数学ライブラリのみを実行できるようにすることで、悪意のあるコードを防止し、リソース消費の上限を制御します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
SpatialClawの使い方
-
環境準備GitHubリポジトリをクローンし、永続的なJupyterカーネルと、Depth Anything 3やSAM 3などの依存関係を設定します。
-
モデルアクセス推論の基盤として、Qwen3.5/3.6またはGemma4でサポートされているVLMを選択してください。
-
タスク入力空間推論問題を含む画像、複数視点画像、または動画データを提出してください。
-
エージェントループシステムは、計画、コード生成、AST検証、実行、フィードバックアセンブリという反復サイクルを自動的に実行します。
-
結果取得カーネル変数の状態と視覚化出力から、最終的な空間推論の解答を抽出する。
SpatialClawの主な利点
-
トレーニング不要、プラグアンドプレイベンチマークやモデル固有の微調整は不要なため、導入の障壁と計算コストが削減されます。
-
コードアクションの柔軟性固定されたJSONツール呼び出しと比較して、Pythonコードは任意の複雑な空間計算ロジックを表現できる。
-
著しく優れたパフォーマンスDSI-BenchやMindCubeといった動的なタスクにおいて、それぞれ17.6パーセントポイントと15.3パーセントポイントのパフォーマンス向上を実現した。
-
モデル間の一般性同じアーキテクチャは、26Bから397Bまでのパラメータスケールを持つ6つの異なるVLMにおいて、一貫した性能向上を実現した。
-
安全な執行保証悪意のあるコードの実行を防止し、カーネルの安定性を確保するための、ASTセキュリティ検証メカニズムが組み込まれています。
SpatialClawプロジェクトの住所
- プロジェクト公式サイト:https://spatialclaw.github.io/
- GitHubリポジトリ:https://github.com/NVlabs/SpatialClaw
- arXiv技術論文:https://spatialclaw.github.io/static/pdfs/spatialclaw.pdf
SpatialClawの競合製品比較
| 寸法 | SpatialClaw | SpaceTools |
|---|---|---|
| 位置 | NVIDIAとKAISTは共同で、学習不要の空間推論エージェントフレームワークを公開した。 | 宇宙エージェントに関する、これまでで最も優れたベースライン手法。 |
| アクションインターフェース | コードはアクションであり、Pythonコードは永続的なJupyterカーネル内で生成および実行されます。 | 構造化ツール呼び出しは、固定のJSON形式で事前定義された認識ツールを呼び出します。 |
| トレーニング要件 | トレーニングは一切不要で、同じプロンプトセットを6種類の異なるVLMで直接実行できます。 | 特定のベンチマークまたはモデルに対しては、トレーニング/微調整が必要です。 |
| サポート方法 | 単一画像、複数視点、動画、および4D時系列シーン。 | 主に単一画像および複数視点フォーマットをサポートしており、動的な4D機能は限定的です。 |
| コアメカニズム | 5段階のサイクル(計画→コード生成→AST検証→実行フィードバック→反復修正)。 | 単一ステップまたは有限ステップのオプションを備えたツールチェーンのオーケストレーション。コードレベルのフィードバックループは不要。 |
| ダイナミックな4Dパフォーマンス | DSI-Benchのスコアが+17.6、MindCubeのスコアが+15.3向上し、時間推論のネイティブサポートが追加されました。 | 動的タスクはパフォーマンスが低く、時系列状態蓄積メカニズムが欠如している。 |
| 反復誤差修正 | VLMは実行エラーと変数ステータスのフィードバックを処理し、コードレベルでの自己修正をサポートします。 | ツールのエラーは自動的に修正するのが難しく、通常は手動での介入が必要となる。 |
SpatialClawの応用シナリオ
-
ロボットのナビゲーションと把持本システムは、移動ロボットやロボットアームに対して、対象物との正確な距離測定と空間的な位置関係の判断を提供し、経路計画や把持姿勢の決定を支援する。
-
AR/VR対応屋内レイアウト家具、ドア、窓などの要素の相対的な位置と寸法を自動的に識別し、適切な室内レイアウトプランを生成して、それをリアルタイムで仮想空間に重ね合わせます。
-
自動運転の知覚複数のカメラからの入力を統合して3Dシーンを再構築し、道路要素の空間的なトポロジー関係を理解することで、意思決定と計画策定を支援する。
-
建物の安全点検多視点画像解析に基づき、建設現場構造物の空間的な適合性を評価し、足場の間隔や手すりの高さなどの安全指標を検出する。
-
産業用精密測定部品の非接触3D寸法測定および幾何公差検査は、多視点深度推定によって実施される。