AB
AiBoss
project

InternVL3 - 上海AIラボが開発したオープンソースのマルチモーダル大規模言語モデル

InternVL3は、上海人工知能研究所が開発したオープンソースのマルチモーダル大規模言語モデル(MLLM)であり、卓越したマルチモーダル知覚および推論能力を誇ります。このモデルシリーズは、1Bから78Bまでの7つの異なるサイズがあり、テキストを同時に処理できます。

InternVL3とは何ですか?

InternVL3は、上海人工知能研究所が開発したオープンソースのマルチモーダル大規模言語モデル(MLLM)であり、卓越したマルチモーダル知覚および推論能力を誇ります。このモデルシリーズは、1Bから78Bまでの7つの異なるサイズがあり、テキスト、画像、ビデオなど、さまざまな種類の情報を同時に処理できます。InternVL3は、革新的なネイティブマルチモーダル事前学習手法を採用し、言語学習とマルチモーダル学習を単一の事前学習段階に統合することで、マルチモーダル能力と純粋言語能力の両方を強化しています。ハイブリッド選好最適化アルゴリズムとマルチモーダルテストの強化により、モデルの推論能力が大幅に向上しています。

InternVL3の主な機能

  • マルチモーダルな知覚と推論InternVL3は、テキスト、画像、動画など、複数の種類の情報を処理することができ、優れたマルチモーダル知覚および推論能力を発揮します。
  • 拡張されたマルチモーダル機能このモデルは、ツールの使用、GUIエージェント、産業用画像解析、3D視覚認識など、より多くのアプリケーションシナリオをカバーすることで、マルチモーダル機能をさらに拡張しています。
  • ネイティブマルチモーダル事前学習InternVL3は、言語学習とマルチモーダル学習を同じ事前学習段階に統合する革新的なネイティブマルチモーダル事前学習手法を採用しており、マルチモーダル能力と純粋な言語能力の両方を向上させます。
  • 長文の文脈理解可変視覚位置符号化(V2PE)を統合することで、InternVL3は長文の文脈理解においてより優れた性能を発揮します。
  • 効率的な展開と呼び出しInternVL3は、LMDeployのapi_serverを介してOpenAI互換APIとしてデプロイできるため、ユーザーはOpenAIのAPIインターフェースを介してモデルを簡単に呼び出すことができます。

InternVL3 技術原理

  • ネイティブマルチモーダル事前学習InternVL3は、言語学習と視覚学習を単一の事前学習フェーズに統合する革新的なネイティブマルチモーダル事前学習手法を採用しています。言語モデルを個別に学習させてからマルチモーダルタスクに適応させる従来の手法とは異なり、InternVL3は、画像とテキスト、動画とテキストのシーケンスといった大規模なマルチモーダルデータとプレーンテキストデータを混合して直接学習します。この統合された学習アプローチにより、モデルは言語表現と視覚表現の両方を同時に学習できるため、追加のアライメントモジュールを必要とせずに、視覚言語タスクをより効率的に処理できます。
  • 監督と微調整微調整段階では、InternVL3はランダム化JPEG圧縮、二乗損失重み付け、マルチモーダルデータパッケージングなどの手法を採用しました。InternVL2.5と比較して、InternVL3は高品質な学習サンプルの範囲をさらに拡大し、ツール使用、3Dシーン理解、GUI操作など、複数のドメインを網羅しました。これにより、複雑なシナリオにおけるモデルの堅牢性が向上しました。
  • 混合選好最適化InternVL3は、選好損失、品質損失、生成損失を組み合わせることでモデルの推論性能を大幅に向上させるMPO技術を導入しています。MPOは、正例と負例の両方からの追加的な監視を導入することで、モデルの出力が真の分布により近いものとなり、推論中のバイアスを低減します。
  • 動的前処理とマルチモーダル入力処理InternVL3は動的な前処理をサポートしており、入力画像の縦横比に応じて画像サイズを動的に調整し、複数の小さなブロックに分割することで、モデルの入力要件に適応します。このモデルは、複数画像入力や動画入力など、さまざまなマルチモーダル対話シナリオをサポートし、複雑なマルチモーダルタスクを柔軟に処理できます。

InternVL3プロジェクトの住所

InternVL3の応用シナリオ

  • 画像と動画の理解InternVL3は、画像分類、物体検出、動画説明文生成などのタスクに使用できます。入力された画像や動画に基づいて詳細な説明文を生成し、コンテンツ作成や自動編集に活用できます。
  • インテリジェントなインタラクションとツールの使用このモデルはツールの使用とGUIエージェント機能をサポートしており、コンピュータや携帯電話上でプロフェッショナルソフトウェアを操作するための指示に従うグラフィカルユーザーインターフェース(GUI)エージェントとして機能できます。
  • 産業用画像解析と3Dビジョン認識InternVL3のマルチモーダル機能は、産業用画像解析や3D視覚認識にも及び、複雑な産業シーン画像を処理し、建築図面の理解や空間認識推論といったタスクをサポートすることを可能にする。
  • インテリジェントな顧客サービスと言語モデルの応用InternVL3は、その強力な言語生成機能に基づいて、より効率的かつ正確な顧客サポートを提供するインテリジェントな顧客サービスシステムの開発に活用できます。