project
InternVL3.5 - 上海AIラボによるオープンソースのマルチモーダル大規模モデル
InternVL3.5(Shusheng·Wanxiang 3.5)は、上海人工知能研究所が開発したオープンソースのマルチモーダル大規模モデルです。このモデルは、汎用機能、推論機能、展開効率において包括的なアップグレードを受けており、10億から2410億までの9つのパラメータサイズを提供しています。
InternVL3.5とは何ですか?
InternVL3.5 (Shusheng·Wanxiang 3.5) は、上海人工知能研究所が開発したオープンソースのマルチモーダル大規模モデルです。このモデルは、汎用機能、推論機能、展開効率において包括的なアップグレードが施されており、10億から2410億までの9つのサイズを提供し、さまざまなリソース要件に対応しています。密モデルとエキスパートハイブリッドモデル (MoE) を含み、GPT-OSS 言語モデルプラットフォームをサポートする初のオープンソースのマルチモーダル大規模モデルです。InternVL3.5 は、カスケード強化学習 (CRL) フレームワークを採用し、「オフライン ウォームアップ - オンライン ファインチューニング」の 2 段階プロセスを通じて推論機能を大幅に向上させています。フラッグシップモデルである InternVL3.5-241B-A28B は、学際的推論ベンチマーク MMMU において、オープンソースモデルの中で最高スコア 77.7 を達成し、GPT-5 を上回りました。動的ビジュアル解像度ルーティング(ViR)と分離型デプロイメント(DvD)フレームワークを活用することで、高解像度入力時のモデルの応答速度が大幅に向上し、38Bモデルではスループットが4.05倍に向上しました。
InternVL3.5の主な機能
-
マルチモーダルセンシング画像や動画の質問応答など、マルチモーダルな知覚タスクにおいて優れた性能を発揮します。241B-A28Bモデルは、平均スコア74.1で既存のオープンソースモデルを上回り、商用モデルのGPT-5(74.0)に近い性能を示しています。
-
マルチモーダル推論多分野推論ベンチマークであるMMMUにおいて77.7点を獲得し、前バージョンより5パーセントポイント以上向上し、オープンソースベンチマークの中で1位にランクインした。
-
テキスト機能このモデルは、AIME、GPQA、IFEvalなどの複数のベンチマークで平均85.3のスコアを達成し、オープンソースベンチマークの最先端に位置づけられています。
-
GUIインテリジェントエージェントこれによりGUIエージェントの機能が向上し、クロスプラットフォームでの自動操作が可能になります。例えば、ScreenSpotのGUI位置特定タスクでは、92.9というスコアで主流のオープンソースモデルを凌駕しています。
-
エンボス加工スペースの削減接地能力が強化されており、新しい複雑な実体シナリオにも一般化でき、汎用的な長距離物体把持操作をサポートする。
-
ベクターグラフィックス処理SGP-Benchにおいて70.7という新たなオープンソーススコアを獲得し、ウェブページのグラフィック生成やエンジニアリング図面の解析といった専門的な場面における有効性を実証した。
InternVL3.5の技術的原則
-
カスケード強化学習このプロセスは、オフラインでのウォームアップとオンラインでのファインチューニングの2段階で構成されます。オフライン段階では、混合選好最適化(MPO)アルゴリズムを使用して、基本的な推論能力を迅速に向上させ、後続のトレーニングに高品質のサンプルを提供します。オンライン段階では、GSPOアルゴリズムを使用して、モデル自体が生成したサンプルに基づいて出力分布を動的に調整し、トレーニングの安定性と推論性能を大幅に向上させます。
-
動的ビジュアル解決ルーティング(ViR)圧縮率は画像スライスごとに動的に選択され、意味的に密度の高い領域では高解像度を維持し、背景領域を適応的に圧縮して視覚トークンを削減することで、パフォーマンスをほとんど犠牲にすることなく推論速度を大幅に向上させます。
-
分離型デプロイメントフレームワーク(DvD)ビジュアルエンコーダーと言語モデルを異なるGPUに配置し、BF16高精度特徴転送と非同期パイプライン設計を組み合わせることで、ビジュアルコンピューティングと言語生成を並列実行することが可能になり、スループットが大幅に向上し、従来の逐次展開におけるリソースブロッキングの問題を解決します。
-
フルスケールモデルの最適化本モデルは、10億から2410億までの9種類のモデルサイズを提供し、さまざまなリソース要件に対応します。高密度モデルやエキスパートハイブリッドモデル(MoE)も含まれています。GPT-OSS言語モデルベースをサポートする初のオープンソースマルチモーダル大規模モデルであり、多様なアプリケーションニーズを満たします。
-
マルチモーダルな協調的推論視覚や言語といった多次元情報を統合することで、マルチモーダルなタスクの効率的な処理が可能になり、複雑なタスクにおけるモデルの推論能力が向上し、マルチモーダル技術が「理解」から「行動」へと飛躍することを促進する。
InternVL3.5のプロジェクトアドレス
- GitHubリポジトリ:https://github.com/OpenGVLab/InternVL
- HuggingFace モデルアドレス:https://huggingface.co/OpenGVLab/InternVL3_5-241B-A28B
- 技術報告書:https://huggingface.co/papers/2508.18265
- オンライン体験アドレス学者モデル
InternVL3.5の応用シナリオ
-
オフィスオートメーションGUIインテリジェントエージェント機能により、Excelへのデータ入力、PPTのデザインとレイアウト、メール送信などのタスクを自動処理するなど、クロスプラットフォームの自動化されたオフィス業務を実現でき、作業効率を向上させることができます。
-
スマートホームコントロール身体に備わった空間推論能力を活用することで、ロボットが家庭環境において、物体の位置特定、経路計画、物理的な相互作用といったタスクを完了するのを支援します。例えば、インテリジェントな清掃ロボットは、環境のレイアウトに基づいて清掃経路を自律的に計画します。
-
教育指導マルチモーダルな推論機能とテキスト処理機能に支えられ、学生一人ひとりに合わせた学習指導を提供し、数学や物理の問題解決、論理的推論訓練といった複雑な教科固有の質問に答えることで、学習成果を向上させる。
-
コンテンツ作成汎用的なマルチモーダル知覚能力を活用することで、画像の説明文、動画の字幕、その他のコンテンツを自動的に生成し、クリエイターが迅速にクリエイティブなコンテンツを生成できるよう支援するとともに、コンテンツ制作の効率と品質を向上させます。
-
ウェブデザインとグラフィック制作ベクターグラフィックス処理機能を活用し、ユーザーの指示に基づいてSVGベクターグラフィックスを生成または編集します。Webデザインやアイコン作成などに適しており、デザイン効率とパーソナライズされた体験を向上させます。