project
BGE-VL - 北京人工知能研究院(BAAI)が複数の大学と共同でオープンソース化したマルチモーダルベクトルモデル。
BGE-VLは、北京人工知能研究院が複数の大学と共同で開発したマルチモーダルベクトルモデルです。大規模な合成データセットであるMegaPairsで学習されています。BGE-VLは、テキストから画像への検索や複合画像検索など、マルチモーダルな検索タスクに重点を置いています。
BGE-VLとは何ですか?
BGE-VLは、北京人工知能研究院(BAAI)が複数の大学と共同で開発したマルチモーダルベクトルモデルです。大規模合成データセットMegaPairsで学習されています。BGE-VLは、テキストから画像への検索や複合画像検索などのマルチモーダル検索タスクに特化しており、効率的なマルチモーダルデータ合成手法を活用してモデルの汎化能力と検索性能を向上させています。BGE-VLシリーズには、CLIPアーキテクチャに基づくBGE-VL-BaseとBGE-VL-Large、および大規模マルチモーダルモデルアーキテクチャに基づくBGE-VL-MLLMが含まれます。このモデルは複数のベンチマークで非常に優れた性能を発揮し、複合画像検索タスクで新たなベンチマークを設定し、検索精度を大幅に向上させています。BGE-VLの最大の強みは、データ合成手法の拡張性と高品質、そしてマルチモーダルタスクにおける卓越した汎化能力にあります。
BGE-VLの主な機能
- 画像とテキストの検索入力されたテキストの説明に基づいて最も関連性の高い画像を取得したり、入力された画像に基づいて関連するテキスト情報を取得したりできます。
- 複合画像検索ユーザーが画像コマンドとテキストコマンドを同時に入力することをサポートし、両方の情報から総合的に理解することで、より正確なターゲット画像を取得します。
- マルチモーダル埋め込み画像とテキストを統一されたベクトル空間にマッピングすることで、異なるモダリティからのデータをベクトル類似性を用いて比較および取得することが可能になります。
- コマンドの微調整このモデルは、合成されたマルチモーダルな指示データに基づいて微調整され、複雑なマルチモーダルなタスクをより良く理解し実行できるようにすることで、モデルの汎化能力とタスクへの適応性を向上させます。
BGE-VLの技術原理
- データ合成手法(メガペア):
- データマイニング目標は、膨大な画像とテキストのコーパスから多様な画像ペアを抽出し、様々な類似性モデル(CLIPなど)を使用して、クエリ画像に関連する候補画像を見つけることです。
- 命令生成マルチモーダル大規模言語モデル(MLLM)と大規模言語モデル(LLM)に基づいて、オープン領域の検索指示が生成され、画像ペア間の関係が要約され、高品質の検索指示が作成される。
- 三重構造このツールは、モデル学習のために「クエリ画像、クエリ文、ターゲット画像」を含むマルチモーダルな3要素データを生成します。このデータは手動でのアノテーションが不要なため、効率的で拡張性に優れています。
- マルチモーダルモデルアーキテクチャ:
- CLIPベースのアーキテクチャBGE-VL-BaseとBGE-VL-Largeは、CLIPに似たアーキテクチャを使用して、画像エンコーダとテキストエンコーダを用いて画像とテキストを同じベクトル空間にマッピングし、比較学習することでモデルのパフォーマンスを最適化します。
- マルチモーダル大規模モデルアーキテクチャBGE-VL-MLLMは、より複雑なマルチモーダル大規模モデルアーキテクチャに基づいており、複雑なマルチモーダルな相互作用や指示理解タスクを処理できます。
- コマンドの微調整このモデルは、合成されたマルチモーダルな指示データに基づいて微調整され、マルチモーダルなタスクに対する理解力と実行能力が向上している。
- 比較学習と最適化トレーニング中、モデルはマルチモーダル埋め込みのベクトル表現を比較学習して最適化し、関連する画像やテキストをベクトル空間内でより近づけ、無関係なデータを遠ざけます。大規模な合成データを用いたトレーニングに基づき、モデルはより汎用的なマルチモーダル特徴表現を学習し、様々なマルチモーダルタスクにおいて優れた性能を発揮します。
BGE-VLプロジェクトの住所
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/BAAI/megapairs
BGE-VLの応用シナリオ
- インテリジェント検索ユーザーは画像をアップロードしたり、テキストを入力したりすることで、関連コンテンツを素早く見つけることができ、検索精度が向上します。
- コンテンツのおすすめユーザーがアップロードしたコンテンツや興味に基づいて、類似の画像やテキスト素材を推奨し、パーソナライズされた体験を向上させます。
- 画像編集支援デザイナーが類似スタイルの参考画像を素早く見つけるのに役立ち、クリエイティブな効率性を向上させます。
- インテリジェントな顧客サービス画像とテキストを組み合わせてユーザーの問題を理解することで、より直感的な解決策を提供し、サービス効率を向上させることができます。
- 文化遺産研究画像検索とテキスト検索に基づいて、関連する文化遺物や研究資料を迅速に見つけることができ、考古学調査や保存活動を支援する。