AB
AiBoss
project

Infinity-MM - Zhiyuanが公開した、数千万件のレコードを含むマルチモーダルな指示データセット。

Infinity-MMは、北京人工知能研究院(BAAI)が公開した、数千万サンプルを含むマルチモーダルな学習データセットです。4300万サンプル、10TBのデータが含まれています。このデータセットは、高品質と多様性を確保するために品質フィルタリングと重複排除処理が施されており、オープンソースの画像処理技術の向上に貢献します。

Infinity-MMとは何ですか?

Infinity-MMは、北京人工知能研究院(BAAI)が公開した、数千万のサンプルを含むマルチモーダル指示データセットです。4300万のサンプルと10TBのデータボリュームを誇ります。このデータセットは、高品質と多様性を確保するために品質フィルタリングと重複排除処理が施されており、オープンソースの視覚言語モデル(VLM)の性能向上に貢献しています。BAAIは、オープンソースのVLMに基づいた合成データ生成手法を導入し、データセットの規模と多様性をさらに拡大しました。BAAIはInfinity-MMを基に、20億個のパラメータを持つマルチモーダルモデルAquila-VL-2Bの学習に成功し、同規模のモデルの中で最先端の性能を達成しました。

Infinity-MMの主な機能

  • オープンソースモデルのパフォーマンスを向上させるInfinity-MMは、大規模かつ高品質な指示データを提供することで、オープンソースの視覚言語モデル(VLM)の性能を向上させ、クローズドソースのモデルと同等、あるいはそれに近いレベルにまで高めます。
  • データセットの構築このデータセットには、視覚的な質問応答、テキスト認識、文書分析、数学的推論など、さまざまな種類のサンプルを網羅した、厳密に選別され重複が排除された4300万件のマルチモーダルサンプルが含まれています。
  • 合成データ生成オープンソースのVLMと詳細な画像注釈に基づいて、画像コンテンツに密接に関連する多様な指示を生成し、データセットの規模を拡大し、データの多様性を向上させます。
  • モデルのトレーニングと評価Infinity-MMデータセットを用いて、20億個のパラメータを持つVLM(仮想学習モデル)であるAquila-VL-2Bを学習させたところ、このモデルは複数のベンチマークテストで優れた性能を示した。
  • マルチモーダル研究の推進大規模かつ高品質なデータセットを提供することを基盤として、マルチモーダルAI分野の研究開発を促進する。

Infinity-MMの技術原理

  • データ収集と前処理Infinity-MMのデータは複数の公開データセットから取得され、高品質と多様性を確保するために重複排除と品質フィルタリングが施されています。
  • 合成データ生成方法
    • 画像と説明文のラベル付けシステムオープンソースの認識モデル(RAM++など)を使用して、画像に自動的にラベルを付け、重要な情報を抽出し、画像の意味的基盤を形成します。
    • 指示タグシステム異なるレベルと種類の指示を網羅する、3段階の指示ラベルシステムを設計してください。
    • 画像と指示ラベルの対応関係を確立するこの機能は、画像タグと指示タグの対応関係を追跡し、一致する指示/タスクタグを迅速に取得できるようにします。
  • 問題の生成とフィルタリング指標モデルは、画像と指示の種類に基づいて具体的な質問を生成し、合理的な判断を下します。
  • 回答生成とフィルタリング質問が生成された後、システムはそれに対応する指示回答を生成し、それらは画像コンテンツまたはタスクとの一致を確実にするために厳密にフィルタリングされます。
  • 段階的トレーニング戦略Aquila-VL-2Bモデルは、段階的な学習方法に基づいており、視覚情報の理解と処理能力を段階的に向上させる。
  • マルチモーダル建築Aquila-VL-2Bモデルは、LLaVA-OneVisionアーキテクチャに基づいており、テキストタワー(Qwen2.5-1.5B-instruct)とビジュアルタワー(Siglip400m)を組み合わせたものです。
  • トレーニング効率の向上Zhiyuanが独自開発したFlagScaleフレームワークは、モデル学習に適応し、学習効率を従来のDeepSpeedベースの学習コードの1.7倍に向上させている。

Infinity-MMプロジェクトの住所

Infinity-MMの応用例

  • 視覚的質問応答(VQA)画像と関連する質問のペアデータに基づいて、画像の内容に関する質問を理解し、回答するモデルが訓練されます。
  • 画像キャプション画像の説明文を生成するもので、ソーシャルメディア、コンテンツ管理、画像検索など幅広い分野で活用されている。
  • 文書の理解と分析文書内の視覚情報とテキスト情報を抽出・理解し、自動化されたオフィス業務、高度な文書処理、情報抽出に適しています。
  • 数学的および論理的推論数学の問題や論理的推論課題を解決するためのモデルを訓練することは、教育技術、自動テスト、およびインテリジェントな個別指導システムにとって非常に有用である。
  • マルチモーダルインタラクションシステム視覚情報と言語情報を組み合わせることで、人間とコンピュータのインタラクションの自然さと効率性が向上し、インテリジェントアシスタントや顧客サービスロボットに適したものとなる。