AB
AiBoss
project

Mini-InternVL - 上海AI研究所が清華大学およびその他の機関と共同で開発した、軽量かつマルチモーダルな大規模モデル。

Mini-InternVLは、大規模モデルであるShusheng·Wanxiangの「ミニ」バージョンです。上海AI研究所、清華大学、南京大学などが共同で開発した、軽量でマルチモーダルな大規模言語モデルシリーズです。1B、2B、4Bの3つのパラメータバージョンがあります。

Mini-InternVLとは何ですか?

Mini-InternVLは、大規模モデル「Shusheng·Wanxiang」の「ミニ」バージョンです。上海AI研究所、清華大学、南京大学などが共同開発した軽量マルチモーダル大規模言語モデルシリーズです。1B、2B、4Bの3つのパラメータバージョンがあり、少ないパラメータ数で高いパフォーマンスを実現しています。特にMini-InternVL-4Bは、パラメータ数がわずか5%でInternVL2-76Bの約90%のパフォーマンスを実現しています。Mini-InternVLは、ビジュアルエンコーダとしてInternViT-300Mを使用し、異なる事前学習済み言語モデルと組み合わせています。動的な解像度入力戦略とピクセルシャッフル操作に基づいてビジュアルタグの数を減らし、処理効率を向上させています。Mini-InternVLは、いくつかの一般的なマルチモーダルベンチマークで優れたパフォーマンスを発揮し、シンプルな転移学習フレームワークを使用して特定のドメインの下流タスクにも適応できます。

Mini-InternVLの主な機能

  • マルチモーダルな理解と推論画像とテキストが入力として与えられた場合、それらの間の意味的な関係を理解し、推論する。
  • ドメイン横断的な適応性知識抽出と転移学習の技術に基づいており、さまざまな分野やタスクに適応させることができる。
  • 軽量で効率的Mini-InternVLは、比較的少ないモデルパラメータ数(1億~40億)を維持しながら、大規模モデルに匹敵する性能を実現します。これにより、リソースが限られた環境(コンシューマー向けGPUやエッジデバイスなど)でも効率的に動作し、導入コストとコンピューティングリソースの要件を削減できます。
  • 視覚的な指導の調整視覚的な指示に基づいて最適化する能力があり、ユーザーの画像ベースの指示をよりよく理解し、実行する能力も備えています。
  • 動的解像度入力動的解像度入力戦略をサポートしており、アスペクト比に応じて画像を異なるサイズのタイルに分割し、それに応じた処理を実行します。

Mini-InternVLの技術原理

  • ビジュアルエンコーダー(InternViT-300M)モデルの中核となるコンポーネントであるビジュアルエンコーダーは、入力画像をモデルが理解できる特徴表現に変換する役割を担います。InternViT-300Mは、より高性能なInternViT-6Bモデルから知識蒸留によって豊富な視覚知識を継承した軽量なビジョンモデルです。この蒸留プロセスにより、InternViT-300Mはモデルパラメータ数を少なく抑えながら、複数のビジョン領域で優れた性能を発揮します。
  • 知識抽出目標は、大規模な教師モデルから小規模な生徒モデルへ知識を伝達し、生徒モデルが教師モデルの性能を継承できるようにすることです。Mini-InternVLでは、InternViT-6Bが教師モデルとして機能し、負のコサイン類似度損失に基づいて隠れ状態の知識をInternViT-300Mに伝達します。
  • MLPプロジェクターMLP(多層パーセプトロン)プロジェクターは、ビジュアルエンコーダーと言語モデルを接続するために使用されます。ビジュアルエンコーダーが出力する特徴ベクトルを、言語モデルが処理するのに適した空間に投影することで、視覚情報とテキスト情報を効果的に融合し、相互作用させることを可能にします。
  • 事前学習済み言語モデル(LLM)Mini-InternVLは、Qwen2-0.5B、InternLM2-1.8B、Phi-3miniなど、さまざまな事前学習済み言語モデルを組み合わせたものです。
  • 動的解像度入力戦略このモデルは、動的な解像度入力戦略を採用しています。この戦略では、画像の縦横比に基づいて画像を448×448ピクセルのタイルに分割し、これらのタイルを固定の順序で組み合わせ、最終的に2688×896ピクセルの解像度の画像表現を生成します。さらに、モデルは各タイルにサムネイルを追加して、全体的なコンテキスト情報を提供します。
  • ピクセルシャッフル操作ピクセルシャッフルに基づいて、このモデルは画像解像度を元の値の4分の1に低下させ、それによって視覚マーカーの数を削減します。

Mini-InternVLプロジェクトの住所

Mini-InternVLの応用事例

  • 自動運転これは、環境認識、行動予測、経路計画において、多視点画像の処理、交通参加者の行動の識別と予測、安全かつ効率的な運転経路の生成などに使用されます。
  • 医用画像処理疾患の診断、画像への注釈付け、治療に関する推奨事項の作成を支援し、医用画像を分析し、診断支援と治療に関する提案を提供する。
  • リモートセンシング土地利用分類、災害監視、環境監視を実施すること。さまざまな種類の土地利用を特定すること。自然災害の影響を評価すること。環境変化を監視すること。
  • 文書と図表の理解文書コンテンツの抽出、表やグラフの解析、文書要約やグラフの説明の生成、データ視覚化および分析のサポートを行います。
  • 動画の理解動画からキーフレームとコンテンツを抽出し、動画内の人物の行動や出来事を特定し、動画の要約を作成し、動画に関する質問に答えます。