project
DINO-X - IDEA研究所が発表した汎用大規模ビジュアルモデル
DINO-Xは、IDEA Researchが開発した汎用大規模ビジョンモデルで、オープンワールドでの物体検出と理解能力を備えています。テキスト、ビジュアル、カスタムキューをサポートし、ユーザーの指示なしに画像内のあらゆる物体を認識できます。1億を超えるデータに基づいており…
DINO-Xとは何ですか?
DINO-Xは、IDEA Researchが開発した汎用ビジュアルモデルで、オープンワールドの物体検出と理解能力を備えています。テキスト、ビジュアル、カスタムキューをサポートし、ユーザーの指示なしに画像内のあらゆる物体を認識できます。1億サンプルを超えるGrounding-100Mデータセットに基づき、DINO-XはCOCO、LVIS-minival、LVIS-valベンチマークで新たな性能記録を樹立しました。このモデルには、強力な認識能力を提供するDINO-X Proと、推論速度を最適化しエッジ環境への展開に適したDINO-X Edgeの2つのバージョンがあります。DINO-Xはロングテール物体認識に優れており、自動運転やインテリジェントセキュリティなどの分野で幅広く応用でき、産業の高度化に新たな推進力をもたらします。
DINO-Xの主な機能
- オープンワールドにおける物体検出とセグメンテーション画像内の様々な物体を検出・分割することができ、ロングテールカテゴリでは一般的でない物体も検出可能です。
- フレーズの位置このモデルは、与えられたテキストフレーズに基づいて、画像内の対応するオブジェクトを特定します。
- 視覚的な手がかりのカウント画像内に境界ボックスやドットを描くなどの視覚的な手がかりに基づいて、特定のオブジェクトの数を数える。
- 姿勢推定画像内の人物や特定のカテゴリ(人物のポーズや手のポーズなど)の重要なポイントを予測します。
- 予告なしの物体検出と認識プロンプトなしで画像内のあらゆる物体を検出する機能をサポートしています。
- 密集エリア字幕画像内の特定の領域に対して、詳細な説明文を生成します。
- オブジェクトベースの質問応答画像内の特定の物体に関する質問に答えることができる。
DINO-Xの技術原理
- トランスフォーマーエンコーダ・デコーダアーキテクチャTransformerアーキテクチャに基づき、エンコーダは画像の特徴を抽出し、デコーダは物体検出および物体理解タスクを実行します。
- マルチモーダル事前学習大規模データセットGrounding-100Mで事前学習されたDINO-Xは、豊富な視覚的および言語的特徴を学習し、開語を検出する能力を向上させます。
- 先端延長入力オプションが拡張され、テキストプロンプト、ビジュアルプロンプト、カスタムプロンプトをサポートすることで、より幅広い検出シナリオに対応できるようになりました。
- マルチセンサー統合境界ボックスヘッド、セグメンテーションヘッド、キーポイントヘッド、言語ヘッドなど、複数の知覚ヘッドを統合することで、多様な知覚および理解タスクをサポートします。
- 2段階トレーニング戦略:
- フェーズ1テキスト手がかり検出、視覚手がかり検出、および物体セグメンテーションの同時学習。
- フェーズ2DINO-Xのバックボーンを固定し、個別のトレーニング用にキーノードと言語ヘッドを追加し、モデルのきめ細かな知覚および理解能力を拡張します。
- 知識抽出とFP16推論の最適化このモデルは、知識蒸留技術に基づいてProモデルから知識を抽出し、FP16量子化技術を使用して推論速度を向上させます。
- 言語ヘッダーのデザインDINO-X言語ヘッダーは、凍結されたDINO-X抽出オブジェクトタグを使用し、それらをタスクタグと組み合わせ、自己回帰的な方法で応答出力を生成します。
DINO-Xプロジェクトの住所
- プロジェクト公式サイト:deepdataspace.com
- arXiv技術論文:https://arxiv.org/pdf/2411.14347
DINO-Xの応用事例
- 自動運転歩行者、車両、交通標識など、道路環境をリアルタイムで識別・理解する能力は、自動運転車の安全性と応答性を向上させる。
- スマートセキュリティ監視システムにおいて、不審な行動、侵入者、その他のセキュリティ上の脅威を検知・識別することで、監視におけるインテリジェンスのレベルを向上させる。
- 工業試験製造業においては、品質管理、製品欠陥の検出、生産ラインの効率性および製品品質の確保に用いられる。
- ロボットビジョンサービスロボットや産業用ロボットに組み込むことで、周囲の状況をよりよく理解し、相互作用能力や動作能力を向上させることができる。
- 視覚障害者の支援これは視覚障害者向けの補助機器に組み込むことができ、視覚障害者が周囲の状況をよりよく理解し、移動するのに役立ちます。