project
LocateAnything - NVIDIAのビジュアル言語ローカライズモデル
LocateAnythingは、NVIDIAが開発したビジュアル言語ローカライズモデルです。並列バウンディングボックスデコード技術に基づいており、自然言語を入力することで画像内のターゲットを正確に選択できます。このモデルは、マルチターゲット検出、GUIローカライズ、OCRテキスト検出などをサポートしています。
LocateAnythingとは何ですか?
LocateAnythingは、NVIDIAが開発したビジュアル言語ローカリゼーションモデルです。並列バウンディングボックスデコード技術に基づき、自然言語を入力することで画像内のターゲットを正確に選択できます。このモデルは、複数オブジェクト検出、GUIローカリゼーション、OCRテキスト検出、ポイントレベルのポインティングなどのタスクをサポートしています。推論速度は12.7 BPS(H100)に達し、Qwen3-VLの10倍の速度を実現し、LVISなどのベンチマークで最先端のパフォーマンスを発揮します。ロボット工学、ドキュメントインテリジェンス、自動運転などのシナリオに適しています。
LocateAnythingの主な機能
-
これは、目的地に到達しつつあることを示しています。自然言語による説明に基づいて、画像内の特定の対象物を特定し、選択します。
-
複数ターゲットの高密度検出画像内の複数のオブジェクトカテゴリを同時に検出することをサポートし、密なバウンディングボックスのセットを出力します。
-
GUI要素の配置インターフェース内のボタンや入力ボックスなどのインタラクティブな要素を識別・特定でき、ポイントレベルの出力にも対応しています。
-
テキスト検出とOCR画像内のテキスト領域を特定でき、文書、シーン、表構造内のテキスト認識をサポートします。
-
ポイントレベルの位置決め高精度なポインティングタスク向けに、正確な点座標を出力する機能をサポートしています。
-
ハイブリッド推論モードデフォルトモードは高速並列モードですが、複雑な状況に遭遇すると自動的に安定した直列モードに切り替わります。
LocateAnythingの技術的原理
-
並列フレーム復号(PBD)このモデルは、各境界ボックスまたは点を原子単位として扱い、単一の順伝播中に完全な座標セットを並列に予測します。
(x1,y1,x2,y2)これは、トークンを順次生成する従来の方法ではありません。 -
モデルアーキテクチャこのモデルは、Moon-ViTビジュアルエンコーダを使用してネイティブ解像度の視覚的特徴を抽出し、それを2層MLPプロジェクターでマッピングして、Qwen2.5言語デコーダに入力し、ローカリゼーションと推論を行います。
-
構造化された出力このモデルは、セマンティックブロック、バウンディングボックスブロック、ネガティブサンプルブロック、エンドブロックを生成し、
<box>、<ref>構造的な結果を整理し、特定するために、特別なトークンが使用されます。 -
ハイブリッド推論モードデフォルトでは、スループットを最大化するために高速並列モード(MTP)を使用し、フォーマットの異常や空間的な曖昧さが発生した場合は、自動的かつシームレスに安定シリアルモード(NTP)に切り替わります。
-
修正再デコード並列復号でフレーム構造の歪みや座標の競合が検出された場合、問題のあるブロックは自動的に破棄され、システムは検証済みのプレフィックスに戻り、NTPを介してそれを再生成および修正します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
LocateAnythingの使い方
-
環境準備GitHubからEagleリポジトリをクローンして、以下を入力してください...
Embodiedディレクトリ実行pip install -e .依存関係のインストールが完了しました。 -
モデル読み込み中輸入
LocateAnythingWorkerクラスをインスタンス化し、Hugging Faceからロードします。nvidia/LocateAnything-3B事前学習済みの重み。 -
ターゲット検出: 電話
detect()このメソッドは、画像とカテゴリ名のリスト(例:...)を受け取ります。["person", "car"]このモデルは、一致するすべてのターゲットの境界ボックス座標を返します。 -
フレーズの位置:使用
ground_multi()このメソッドは、画像と説明文(例:...)を入力として受け取ります。"people wearing red shirts")意味記述に適合する特定のターゲットを特定する。 -
テキスト検出: 電話
detect_text()この手法では、モデルが画像内のテキスト領域を自動的に識別し、対応する境界ボックスのセットを出力する。 -
GUIの位置決め:合格
ground_gui()このメソッドはインターフェース要素を特定し、設定します...output_type="point"境界ボックスの代わりに点の座標を出力することもできます。 -
ポイントレベルのポインティング:使用
point()この手法は、画像と説明を入力として受け取り、指定されたターゲットの正確な一点座標を取得して、高精度なポインティングを実現する。 -
バッチ推論構成
la_flash走ってbatch_utils/参加するPYTHONPATH、 電話detect_batch()複数の画像クエリペアを同時に処理する。 -
結果分析: 出力の抽出
<box>ラベル内の整数座標(0~1000の範囲)を1000で割った値が、元の画像の幅と高さのピクセル値にマッピングされます。 -
微調整適応JSONLデータレシピを準備して使用してください。
torchrun完全なファインチューニングスクリプトを実行するか、LoRAスクリプトを実行してバックボーンを固定し、プロジェクター層と低ランクアダプタ層のみをトレーニングします。
LocateAnythingの主な利点
-
スピードリーディング単一のH100画像で12.7BPSを実現しており、これはQwen3-VLの約10倍、Rex-Omniの約2.5倍の速度です。
-
精度SOTALVIS、M6Doc、ScreenSpot-Pro、DocLayNetなど、複数のベンチマークで最高のパフォーマンスを実現します。
-
一般的かつ統一的単一のモデルで、検出、位置特定、GUI、OCR、レイアウトなど、さまざまなタスクをカバーできるため、異なるシナリオごとに専用モデルに切り替える必要はありません。
-
幾何学的整合性並列復号は、フレーム内の座標の幾何学的結合関係を維持し、逐次生成によって引き起こされる構造的歪みを回避する。
-
ビデオメモリの最適化:合格
la_flash実行時において、A100などのコンシューマー/データセンター向けGPUでは、ピーク時のビデオメモリを35GBから11GBに削減できる。
LocateAnythingのプロジェクトアドレス
- プロジェクト公式サイト:https://research.nvidia.com/labs/lpr/locate-anything/
- GitHubリポジトリ:https://github.com/NVlabs/Eagle/tree/main/Embodied
- ハギングフェイスモデルライブラリ:https://huggingface.co/nvidia/LocateAnything-3B
- 技術論文:https://research.nvidia.com/labs/lpr/locate-anything/LocateAnything.pdf
LocateAnythingと類似の競合製品との比較
| 比較対象寸法 | LocateAnything-3B | Rex-Omni |
|---|---|---|
| 所属 | NVIDIA | オープンソースコミュニティ |
| 製品ポジショニング | 一般的な視覚言語の位置特定および検出モデル | 一般的な視覚的位置特定と理解モデル |
| コアデコード技術 | 並列ボックスデコーディング(PBD)は、完全なバウンディングボックスの単一予測を細分化します。 | シリアル/ハイブリッド座標トークン生成 |
| 推論速度(H100) | 12.7 BPS | ~5.0 BPS |
| 速度乗数 | ベンチマーク | 約2.5倍遅い |
| LVISの精度(F1@平均) | 50.7 | 46.9 |
| COCO精度(F1@平均) | 54.7 | 52.9 |
| Dense200の精度 | 58.7 | 58.3 |
| DocLayNet文書の精度 | 76.8 | 70.7 |
| M6Doc文書の精度 | 70.1 | 55.6 |
| TotalText(OCR) | 43.3 | 40.6 |
| HumanRefは場所を指します | 68.8 | 65.4 |
LocateAnythingの応用シナリオ
-
身体化された知能とロボット工学これによりロボットは視覚認識能力を獲得し、言語コマンドを通じて対象物の位置を特定したり操作したりすることが可能になる。
-
インテリジェントな文書処理文書内のタイトル、表、段落、スタンプなどの構造化された要素を自動的に識別して選択します。
-
GUI自動テストインターフェース内のボタン、入力ボックス、アイコンの位置を特定でき、自動テストやRPAプロセスをサポートします。
-
自動運転の知覚ストリートビュー画像から車両、歩行者、交通標識を高密度に検出し、正確な境界ボックスを出力することができます。
-
小売業および倉庫業: 棚にある特定の商品や倉庫内の目的の荷物を素早く見つける方法を説明します。