project
Spatial-TTT - 清華大学と渾源オープンソースが共同開発した、ストリーミング型視覚空間インテリジェンスフレームワーク。
Spatial-TTTは、清華大学、テンセント渾源、南洋理工大学が共同開発したストリーミング視覚空間インテリジェンスフレームワークです。このフレームワークは20億個のパラメータしか持たず、テストタイムトレーニング(TTT)技術を用いてビデオストリーミング中にユーザーをトレーニングします。
Spatial-TTTとは何ですか?
Spatial-TTTは、清華大学、テンセント渾源、南洋理工大学が共同開発したストリーミング型視覚空間インテリジェンスフレームワークです。わずか20億個のパラメータで、テストタイムトレーニング(TTT)技術を用いてビデオストリーミング中に内部空間メモリを継続的に更新し、最大120分のビデオで空間推論を実現します。VSI-BenchやMindCube-Tinyなどの複数のベンチマークにおいて、GPT-5やGemini-3-proといったクローズドソースの大規模モデルを凌駕し、業界をリードするソリューションよりも40%以上低いピークGPUメモリ使用量を達成しています。
Spatial-TTTの主な機能
-
ストリーミングスペースのメモリ管理ビデオストリームはチャンク単位で入力され、モデルパラメータ(高速重み)はオンラインで更新されるため、ビデオ全体を一度に読み込むことなく、3D空間証拠を継続的に蓄積できます。
-
長期的な空間推論相対距離/絶対距離の推定、物体の計数とサイズの判定、部屋の大きさの認識、方向認識、経路計画、外観順序の推論といったタスクをサポートします。
-
超長時間ビデオ処理10分から120分の連続ビデオストリームを安定して処理でき、VSI-SUPER長期メモリベンチマークにおいて性能低下なく維持されます。
-
効率的な推論1秒間に1024フレームの入力で、ピーク時のビデオメモリがわずか11.9GBの場合、理論上の計算コストは799.4TFLOPSとなり、同様の大型モデルと比較して大幅に低くなります。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
空間TTTの技術原理
- ハイブリッドTTTアーキテクチャ研究チームは、デコーダー内で TTT 層と標準的な自己注意アンカー層を 3:1 の比率で交互に配置しました。TTT 層の 75% は、長距離の空間情報を高速な重みに書き込む役割を担い、線形複雑度でメモリ拡張を実現します。残りの 25% の完全な注意層は、事前学習済みモデルの意味理解とクロスモーダルアライメント機能を保持し、純粋な TTT 構造によって元の視覚言語機能が損なわれるのを防ぎます。
- 空間予測メカニズム従来のTTTは、点ごとの線形射影を使用してQを生成します。
/K/V は視覚トークンの局所的な幾何学を無視します。Spatial-TTT は TTT ブランチに軽量な 3D 時空間畳み込みを導入し、時空間コンテキスト間の予測関係、非孤立トークンのマッピング、幾何学的対応、視点の変化、および時間的連続性の安定した捕捉の重み学習を高速化します。 - 緻密な場面描写の監督と段階的なトレーニング既存の空間インテリジェンスデータはほとんどが疎で局所的であるため、迅速な重み学習とグローバルな更新を実行することが困難です。研究チームは、グローバルなコンテキスト、オブジェクトのカテゴリと数量、および空間的な関係を網羅する高密度の3Dシーン記述データを構築し、空間認識の2段階の漸進的なトレーニングを採用しました。第1段階では、高密度の記述を通じて「空間全体を記憶する」ことを学習し、グローバルな3D認識を形成します。第2段階では、数百万の空間VQAデータを使用して、ストリーミング推論能力を強化します。
Spatial-TTTの使い方
-
環境準備GitHubリポジトリ(https://github.com/THU-SI/Spatial-TTT/)にアクセスしてコードをクローンし、Python環境と依存関係を設定してください。
-
モデル読み込み中事前学習済みのSpatial-TTT-2Bの重みを読み込み、TTT fastの重みを初期化します。
-
入力ビデオストリーム長尺の動画は連続したチャンクに分割され、それらが一度に1チャンクずつモデルに入力されます。各チャンクが処理されると、モデルは自動的に内部の空間状態を更新します。
-
宇宙に関するQ&A自然言語による空間に関する質問(例えば、「赤いろうそくを起点として窓に向かって立つと、どうやってドアにたどり着きますか?」)を入力すると、モデルは蓄積された空間記憶に基づいて回答を生成します。
-
拡張アプリケーションロボット、自動運転システム、ARデバイスからのリアルタイムビデオストリームに接続することで、連続的な空間認識を実現できる。
Spatial-TTTの主な利点
-
小さなパラメータは大きなモデルよりも優れた性能を発揮する2Bパラメータは、複数の空間ベンチマークにおいて、GPT-5やGemini-3-proといったクローズドソースの巨大モデルを凌駕しており、MindCube-Tinyの精度はGemini-3-proよりも12パーセントポイント高い。
-
線形スケーラビリティ重みを高速重み付けによってオンラインで更新することで、ビデオメモリと計算量はビデオの長さに比例して直線的に増加し、従来の長コンテキストモデルにおける複雑さの二次的な爆発を回避します。
-
内容の蓄積ではなく空間記憶無限に拡大するコンテキストウィンドウに頼るのではなく、観測結果を更新、修正、呼び出し可能な内部空間状態に変換することで、物理エージェントの長期運用により適したものとなっている。
-
ビデオメモリ効率が大幅に向上1024フレーム/秒の場合、ビデオメモリ使用量は11.9GBとなり、業界トップクラスのソリューション(21.2GB)よりも40%以上低くなっています。さらに、明示的なジオメトリエンコーダを使用した比較モデルでは、同じフレームレートで動作させることはできません。
Spatial-TTTプロジェクトの住所
- プロジェクト公式サイト:https://liuff19.github.io/Spatial-TTT/
- GitHubリポジトリ:https://github.com/THU-SI/Spatial-TTT
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/THU-SI/spatial-ttt
- arXiv技術論文:https://arxiv.org/pdf/2603.12255
Spatial-TTTの競合製品比較
| 比較対象寸法 | Spatial-TTT | Gemini-3-pro |
|---|---|---|
| パラメータサイズ | 2B | 非公開ソースのため、一般には入手できません。 |
| モデルの特性 | オープンソース (清華/テンセント渾源/NTU) | クローズドソース(Google) |
| コアメカニズム | TTT高速重み付け + 3D時空間畳み込み + ハイブリッドアテンション | 長文コンテキスト+マルチモーダル事前学習 |
| VSI-Bench平均スコア | 64.4 | 56.0 |
| MindCube-Tinyの精度 | 76.2% | 63.9% |
| 120分間のビデオ処理 | 安定した動作(リコール30.0/カウント38.4) | 公式にはサポートされていません。長時間の動画は、パフォーマンスの低下やメモリ不足エラーが発生しやすいです。 |
| ピーク時ビデオメモリ:1024フレーム/秒 | 11.9GB | 21.2GB+ |
| 1024フレームの計算 | 799.4 TFLOPs | 1403.1 TFLOPs |
| 空間記憶法 | パラメータ化された空間の状態をオンラインで更新 | 長いコンテキストウィンドウキャッシュに依存します |
Spatial-TTTの応用シナリオ
-
ロボットナビゲーションサービスロボットや家庭用ロボットは、部屋の中を継続的に移動しながら、空間マップをリアルタイムで更新し、「窓に対するソファの位置」といった質問に答えたり、目標地点に到達するための経路を計画したりします。
-
自動運転車両は長距離走行中に道路、交差点、障害物間の空間的な関係を継続的に蓄積し、複雑な方向判断や距離推定を支援する。
-
AR/VR空間インタラクションヘッドマウントディスプレイは、ユーザー操作中に環境レイアウトを継続的に認識し、仮想世界と現実世界を融合させる空間的なアンカーリングやオブジェクト間の関係性に関するクエリを可能にする。
-
インテリジェントな監視とセキュリティこのシステムは、長時間のビデオストリームに対してオンラインで空間分析を実行し、オフラインでの本格的な処理を必要とせずに、オブジェクトの出現順序、カウント、および位置の変化を追跡します。