project
AIMv2 - Appleのオープンソースのマルチモーダル自己回帰型事前学習済みビジュアルモデル
AIMv2は、Appleが開発したオープンソースのマルチモーダル自己回帰型事前学習済みビジュアルモデルで、画像とテキストのディープフュージョンによってビジュアルモデルのパフォーマンスを向上させます。革新的な事前学習フレームワークを採用しており、画像を重複しない画像パッチに分割し、テキストを統合します。
AIMv2とは何ですか?
AIMv2は、Appleが開発したオープンソースのマルチモーダル自己回帰型事前学習済みビジョンモデルで、画像とテキストのディープフュージョンによってビジョンモデルのパフォーマンスを向上させます。革新的な事前学習フレームワークを採用しており、画像を重複しない画像パッチに分割し、テキストをサブトークンに分解した後、両者を連結して自己回帰型事前学習用の統一されたシーケンスを作成します。これにより、学習プロセスが簡素化され、モデルのマルチモーダルデータに対する理解が深まります。AIMV2は、携帯電話からPCまで、さまざまなデバイスに適した、さまざまなパラメータスケール(3億、6億、12億、27億など)のバージョンを提供しています。パフォーマンス面では、AIMV2はマルチモーダルおよび従来のビジョンタスクの両方で優れた性能を発揮します。
AIMv2の主な機能
- 視覚的質問応答(VQA)AIMV2は視覚的特徴を抽出し、それを質問文と組み合わせ、大規模言語モデル(LLM)に入力して、正確で文脈に合った回答を生成します。
- これは、その人物が理解を代表していることを示している。RefCOCOやRefCOCO+などのベンチマークテストにおいて、AIMV2は自然言語による記述を視覚領域に正確にマッピングする。
- 画像キャプション生成LLMと組み合わせることで、AIMV2は高品質な画像記述を生成できる。
- マルチメディア検索:AIMV2のマルチモーダル表現機能は、マルチメディア検索タスクを効率的に処理し、画像とテキストの同時検索をサポートする。
- 大規模言語モデル(LLM)との統合:AIMV2のアーキテクチャは、LLM駆動型のマルチモーダルアプリケーションとの互換性が非常に高く、様々なマルチモーダルシステムにシームレスに統合できます。
- ゼロサンプル適応性AIMV2はゼロショット認識適応をサポートしており、追加のトレーニングなしに新しい視覚タスクに適応できる。
AIMv2の技術原則
- マルチモーダル自己回帰事前学習フレームワークAIMV2は、画像を重なり合わないパッチに分割し、テキストをサブワードトークンに分割した後、両者を連結してマルチモーダルシーケンスを作成します。事前学習段階では、モデルは自己回帰アプローチを用いて、シーケンス内の次の要素(画像パッチまたはテキストトークン)を予測します。この設計により、モデルは視覚モダリティと言語モダリティ間の関連性を同時に学習することができます。
- 視覚エンコーダーとマルチモーダルデコーダーAIMV2のアーキテクチャは、ビジュアルエンコーダとマルチモーダルデコーダで構成されています。ビジュアルエンコーダは、ビジュアルトランスフォーマー(ViT)アーキテクチャに基づいており、画像パッチの処理を担当します。マルチモーダルデコーダは、因果的自己注意機構を用いて、先行するコンテンツに基づいて次の要素を予測します。
- 損失関数設計AIMV2は、画像領域とテキスト領域それぞれに個別の損失関数を定義しています。テキスト損失には標準的な交差エントロピー損失を使用し、画像損失にはピクセルレベルの回帰損失を使用し、予測された画像パッチと正解画像パッチを比較します。全体的な目標は、テキスト損失と画像損失の加重和を最小化し、両方のモダリティにおけるモデルのパフォーマンスのバランスを取ることです。
- トレーニングデータとスケーラビリティAIMV2は、公開されているDFN-2BやCOYOデータセットを含む、多数の画像とテキストのペアリングデータセットを事前学習に利用しています。学習プロセスはシンプルかつ効率的で、過度に大きなバッチサイズや特別なバッチ間通信方法を必要としません。AIMV2の性能はデータ量とモデルサイズの増加に伴って向上し、優れたスケーラビリティを示しています。
- 事前学習済み最適化戦略AIMV2は、高解像度への適応や元の解像度の微調整など、さまざまな学習後処理戦略を探求しています。これらの戦略により、モデルは異なる解像度やアスペクト比の画像をより適切に処理できるようになり、下流タスクにおけるパフォーマンスがさらに向上します。
AIMv2プロジェクトのアドレス
- GitHubリポジトリ:https://github.com/apple/ml-aim
- arXiv技術論文:https://arxiv.org/pdf/2411.14402
AIMv2の応用シナリオ
- 画像認識AIMV2は、複数の画像認識ベンチマークにおいて、固定された特徴抽出器として使用できます。
- 物体検出とインスタンスセグメンテーションAIMV2は、物体検出やインスタンスセグメンテーションのタスクにおいて、物体検出モデル(Mask R-CNNなど)のバックボーンネットワークとして統合することができます。
- オープンレキシカルオブジェクト検出AIMV2は、オープンレキシカルな物体検出タスクにおいて非常に優れた性能を発揮し、未知のカテゴリを認識・特定することで、高い汎化能力を示しています。