AB
AiBoss
project

Finedefics - 北京大学の研究チームが開発した、きめ細かく、複数のモードを持つ大規模モデル。

北京大学の彭玉新教授の研究チームが開発したFinedeficsは、きめ細かいマルチモーダル大規模モデルであり、きめ細かい視覚認識(FGVR)タスクにおけるマルチモーダル大規模言語モデル(MLLM)の性能を向上させます。このモデルは、オブジェクト固有の情報を組み込むことで、これらのモデルの性能を向上させます。

財政赤字とは何ですか?

Finedeficsは、北京大学の彭玉新教授の研究チームが開発した、きめ細かなマルチモーダル大規模モデルです。このモデルは、きめ細かな視覚認識(FGVR)タスクにおけるマルチモーダル大規模言語モデル(MLLM)の性能を向上させます。従来のモデルにおける視覚オブジェクトと細粒度サブカテゴリ間の不整合という問題を、オブジェクトのきめ細かな属性記述を導入し、対照学習に基づいて視覚オブジェクトの表現とカテゴリ名を整合させることで解決します。

Finedeficsの主な機能

  • より詳細な画像認識機能の向上Finedeficsは、従来のモデルにおける視覚オブジェクトと細粒度サブカテゴリ間の不一致を、オブジェクトの細粒度属性記述を導入し、対照学習を用いて視覚オブジェクトの表現をカテゴリ名に整合させることで解決します。
  • データと知識の協働トレーニングこのモデルは、大規模な言語モデルを活性化させることで視覚オブジェクトのきめ細かい属性知識を構築し、この知識を画像やテキストと整合させ、データと知識の協調的な学習を実現します。
  • 高性能いくつかの権威ある高精度画像分類データセット(Stanford Dog-120、Bird-200、FGVC-Aircraftなど)において、Finedeficsは平均76.84%の精度を達成しました。これは、他の類似モデルと比較して大幅な改善です。
  • 属性記述の構築と整合Finedeficsは、毛色や毛質といった細かなサブカテゴリを区別する重要な特徴を抽出することで、それらを自然言語による記述に変換します。そして、これらの記述を中間点として、大規模な言語モデルの表現空間において、視覚的なオブジェクトをカテゴリ名と対応付けます。

Finedeficsの技術的原則

  • 属性記述の構築Finedeficsはまず属性記述によって特徴セットを構築し、毛色、毛の種類、毛の質感といった細かいサブカテゴリを区別する重要な特徴を抽出します。これらの特徴は画像オブジェクトの属性ペア(例:「毛色:茶色」)として抽出され、その後、自然言語によるオブジェクト属性記述(例:「写真の子猫は茶色の毛に縞模様があり、毛並みは柔らかい」)に変換されます。
  • 属性強化の整合性Finedeficsは属性強化型アライメントを採用しており、構築されたオブジェクト属性記述を、視覚オブジェクトと細粒度サブカテゴリ間の共通アライメント対象として利用します。このモデルは、オブジェクト-属性、属性-カテゴリ、カテゴリ-カテゴリ間の対照学習を活用し、視覚オブジェクトと細粒度サブカテゴリ間の対応関係を完全に確立します。
  • 比較学習と指導の微調整トレーニング段階では、Finedeficsは対照学習を採用し、視覚オブジェクトの全体的な表現、属性の説明、カテゴリ名を大規模な言語モデルに入力します。難易度の高いネガティブサンプルを導入することで、アライメントを最適化します。さらに、指示による微調整によって、きめ細かい視覚認識タスクにおけるパフォーマンスが向上します。

Finedeficsのプロジェクトアドレス

Finedeficsの応用シナリオ

  • 生物多様性モニタリングファインデフィックスは、鳥類、植物、動物など、生物種を自動的に識別・分類するために使用できる。
  • インテリジェント交通システム運輸分野では、Finedeficsは車両の識別や分類に利用でき、例えば異なるブランドやモデルの自動車(例:BMW、メルセデス・ベンツ、アウディ)を区別したり、同じブランド内の異なるモデル(例:アウディA4、A6、A8)を識別したりすることができます。
  • スマートリテールファインデフィックスは、小売業において、果物、花、その他の小売商品など、さまざまな商品の識別と分類に役立てることができます。在庫管理、商品推奨、自動決済システムなどに活用することで、小売業の業務効率を向上させることができます。
  • 工業試験および品質管理工業生産において、Finedeficsは、機械部品の異なるモデルを識別したり、製品の品質問題を検出したりするなど、部品や製品の微細な差異を検出・分類するために使用できます。