AB
AiBoss
project

TIPSv2 - Google DeepMindのオープンソースマルチモーダルモデル

TIPSv2は、Google DeepMindが開発したマルチモーダルモデルです。このモデルは、iBOT++、ヘッドオンリーEMA、マルチグラニュラーテキスト拡張という3つの主要なイノベーションにより、高密度画像パッチとテキスト埋め込みの正確な位置合わせという問題を解決します。

TIPSv2とは何ですか?

TIPSv2は、Google DeepMindが開発したマルチモーダルモデルです。iBOT++、Head-only EMA、マルチグラニュラーテキスト拡張という3つの主要なイノベーションにより、高密度な画像パッチとテキスト埋め込みを正確に位置合わせするという課題に取り組んでいます。このモデルは8600万から11億までのパラメータをカバーし、9つのタスクと20のデータセットで最先端(SOTA)のパフォーマンスを実現しており、特にゼロショットセマンティックセグメンテーションにおいて優れた性能を発揮します。現在、モデルの重み、コード、およびHuggingFaceオンラインデモは完全にオープンソースで公開されています。

TIPSv2の主な機能

  • ゼロショットセマンティックセグメンテーションテキストによる説明を用いて、トレーニングを必要とせずに画像内の物体の境界を正確にセグメント化できる。
  • 画像テキスト検索画像からテキストを検索したり、テキストから画像を検索したりする双方向のクロスモーダル検索をサポートします。
  • ゼロショット画像分類テキスト埋め込みマッチングを通じて、ImageNetなどの分類タスクを直接実現します。
  • 深度および法線ベクトル予測パッチレベルの特徴量を使用して、シーンの形状を推定します。
  • 特徴量の可視化画像をアップロードして、パッチに埋め込まれたPCA特徴マップを探索し、モデルの認識を直感的に理解してください。

TIPSv2の技術的原則

  • iBOT++パッチレベルの自己蒸留損失をすべてのトークン(可視トークンを含む)に拡張することで、生徒モデルが教師モデルのすべてのパッチ表現と一致するように強制され、ADE150ゼロショット分割において+14.1 mIoUの改善がもたらされます。
  • Head-only EMAEMAをプロジェクターのみに適用することで、トレーニングパラメータが42%削減され、メモリ使用量も大幅に削減されます。
  • 多段階テキスト強調PaliGemmaは高密度な局所キャプションを生成するために使用され、Gemini Flashはグローバルな深度記述を生成するために使用されます。これらのキャプションは、堅牢性を向上させるために、トレーニング中にランダムに交互に使用されます。
  • 対照学習と自己監督型共同訓練テキスト監視信号と自己監視信号を同時に受信することで、基盤となるネットワークの高密度なテキスト・画像アライメント機能が解き放たれる。

TIPSv2の主要情報と使用要件

  • 研究開発チーム:Google DeepMind、責任著者はBingyi Cao、Koert Chen、André Araujoです。
  • オープンソースの範囲モデルの重み(86Mから1.1Bまでの4つの仕様)、PyTorchとJAX/Scenicのデュアルフレームワークコード、HuggingFaceのオンラインデモ、およびColab Notebookはすべて完全に利用可能です。
  • 動作環境Python 3.11以降に対応し、PyTorchまたはJAX/Scenicバックエンドをサポートしています。
  • 依存関係のインストールtorch、torchvision、tensorflow_text、scikit-learnなどのコアライブラリのインストールが必要です。

TIPSv2の主な利点

  • パッチ - テキスト配置SOTAゼロショットセグメンテーションは、ADE150やPASCAL VOCを含む4つの主要ベンチマークにおいて、いずれも優れた性能を発揮します。複雑な後処理プロトコルを必要とせず、コサイン類似度を直接最大化することで、より高いmIoUを実現します。
  • 極めて高いパラメータ効率ヘッドのみのEMA戦略は、トレーニングメモリを42%節約し、蒸留によって、小さなモデルが密なアライメントタスクにおいて、より大きな教師モデルよりも優れた性能を発揮できる。
  • この研修は非常に費用対効果が高い。パラメータとデータ量が少ないTIPSv2-gは、パラメータが56%多く、データが47倍多いPE-coreを5つのテストのうち3つで上回りました。また、パラメータが6倍多く、データが15倍多いDINOv3-Lを、6つのテストのうち4つで上回りました。
  • 普遍性は3つの側面を包含する密なアライメント(セグメンテーション)、グローバルアライメント(検索/分類)、および純粋なビジョンタスク(深度/法線ベクトル)に精通しており、9つのタスクと20のデータセットにおいてバランスの取れたパフォーマンスを発揮します。
  • 明確な意味的特徴PCAによる可視化の結果、そのパッチ埋め込みはSigLIP2やDINOv3よりも滑らかであり、オブジェクトの境界や意味的な詳細がより完全に保持されていることが示された。

TIPSv2プロジェクトのアドレス

  • プロジェクト公式サイト:https://gdm-tipsv2.github.io/
  • GitHubリポジトリ:https://github.com/google-deepmind/tips
  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/google/tipsv2
  • arXiv技術論文:https://arxiv.org/pdf/2604.12012

TIPSv2と類似の競合製品との比較

寸法 TIPSv2 DINOv3 SILC
機構 Google DeepMind Meta 複数の機関
コアメカニズム iBOT++ + 比較学習 + 多粒度キャプション 純粋な自己教師あり学習(DINO + iBOT) 対照学習+マスキング言語
テキストの監督 多粒子合成キャプション なし 単一粒子サイズ
ゼロショット分割 直接的なコサイン類似度を用いるため、後処理は不要です。 スライディングウィンドウプロトコルが必要です TCLスライディングウィンドウプロトコルに依存します
パラメータ効率 高い(ヘッドのみのEMAはメモリを42%節約します) 低(フルモデルEMA、データ量が多い) 中くらい
パッチ - テキスト配置 SOTA 弱い(テキストの配置なし) より強力だが、複雑なプロトコルが必要

TIPSv2の応用シナリオ

  • 自動運転このシステムは、ゼロショットセグメンテーションと深度推定を用いて、道路シーンをリアルタイムで理解し、障害物と通行可能なエリアを識別するため、新しいカテゴリの再学習は不要です。
  • 電子商取引とコンテンツモデレーションこれにより、双方向の画像・テキスト検索が可能になり、ユーザーはテキストを使って画像を検索したり、画像を使ってテキストを検索したりできるため、製品のおすすめや違法コンテンツの特定に役立ちます。
  • 医用画像解析医師はテキストによる説明を読むだけで病変部位を特定できるため、医療画像のラベル付けや専門的なトレーニングにかかるコストを大幅に削減できる。
  • ロボットの視覚ナビゲーション自然言語による指示を受け取ると、ロボットは環境内の特定の物体に対して、きめ細かな視覚的位置決めと把持操作を実行する。
  • 科学研究とモデルの解釈可能性PCA特徴可視化を通してパッチ埋め込みの意味構造を探索し、視覚言語モデルの知覚メカニズムをより深く理解する。