AB
AiBoss
project

LLMDet - Alitongyiが中山大学およびその他の機関と共同で開発した、オープンボキャブラリーの物体検出モデル。

LLMDetは、アリババグループの同義研究室、中山大学コンピュータ科学工学部、彭城研究室など複数の機関によって開発されたオープンソースの語彙的物体検出器です。大規模言語モデル(LLM)との共同学習に基づいて物体検出精度を向上させています。

LLMDetとは何ですか?

LLMDetは、アリババグループの同義研究室、中山大学コンピュータ科学工学部、鵬城研究室などが共同開発したオープンソースの語彙的物体検出器です。大規模言語モデル(LLM)との共同学習により、物体検出性能を向上させています。LLMDetは、画像、位置ラベル、詳細な画像レベルの記述(GroundingCap-1M)を含むデータセットを収集し、LLMによって生成された長文記述で視覚的特徴を強化します。標準的な位置ラベルと記述生成損失に基づいて学習されます。LLMDetは、複数のベンチマークで優れたゼロショット検出性能を達成しています。強力な基盤となる視覚モデルとして、LLMとの相互利益関係を築き、より堅牢なマルチモーダルモデルの構築に活用できます。

LLMDetの主な機能

  • オープン語彙検出LLMDetは、トレーニング段階で検出されなかったあらゆるカテゴリのターゲットを検出することができ、テキストラベルと視覚的特徴の整合に基づいて新しいカテゴリの認識を実現します。
  • ゼロサンプル転送機能: 対象カテゴリのラベル付けを行わずに、新しいデータセットに直接適用して検出を行った場合でも、高い汎化能力を発揮します。
  • 画像認識と説明生成LLMDetは、物体の種類、質感、色、動作などの豊富な詳細情報を含む画像レベルのキャプションを生成することができ、モデルが画像の内容をよりよく理解するのに役立ちます。
  • マルチモーダルモデルのパフォーマンスを向上させる基本的な視覚モデルとして、大規模言語モデル(LLM)と組み合わせることで、より強力なマルチモーダルモデルを構築し、視覚的な質問応答や画像記述などのタスクにおけるモデルのパフォーマンスを向上させることができます。

LLMDetの技術原則

  • データセットの構築GroundingCap-1Mデータセットを使用しました。このデータセットでは、各画像に位置ラベルと詳細な画像レベルの説明が付随しています。説明には豊富な情報が含まれており、モデルが画像内のオブジェクトとその関係性をよりよく理解するのに役立ちます。
  • モデルアーキテクチャこれは、標準的なオープンボキャブラリー物体検出器とLLM(ローカルモジュール)で構成されています。検出器は画像の特徴を抽出し、物体の位置を特定する役割を担い、LLMはこれらの特徴を用いて詳細な画像レベルの記述と領域レベルのフレーズを生成します。
  • 共同トレーニングLLMDetは、2段階の学習プロセスに基づいてLLMとの協調最適化を実現します。まず、プロジェクターを学習させ、検出器の特徴をLLMの入力空間にマッピングします。次に、検出器、プロジェクター、LLMをまとめて微調整し、学習目標には標準的な位置特定損失と記述生成損失が含まれます。
  • マルチタスク学習LLMDetは、画像レベルおよび領域レベルの記述生成タスクを導入することで、視覚的特徴を詳細な記述で充実させ、モデルの全体的な画像理解能力を向上させます。このマルチタスク学習アプローチにより、検出性能が向上し、モデルのオープンボキャブラリー機能が強化されます。

LLMDetプロジェクトの住所

LLMDetの応用シナリオ

  • スマートセキュリティこのシステムは、カメラ内の異常な対象物や行動をリアルタイムで検知でき、高い適応性を持ち、再学習も不要です。
  • 自動運転これは、車両が道路上の様々な障害物や見慣れない状況を認識するのに役立ち、安全性と信頼性を向上させます。
  • 画像コンテンツレビュー画像コンテンツを自動的に審査し、違法または不適切なコンテンツを特定し、審査効率を向上させます。
  • インテリジェントなフォトアルバム管理写真を自動的に分類・ラベル付けして検索や管理を容易にし、複数の未知のカテゴリにも対応します。
  • 医用画像解析大量のラベル付きデータを必要とせずに、医療画像を解析し、異常領域を迅速に特定できる。