AB
AiBoss
project

InternVL-Uは、上海AIラボをはじめとする複数の組織が開発した、オープンソースのマルチモーダル統合モデルです。

InternVL-Uは、上海人工知能研究所が複数のトップ大学と共同でオープンソース化した、4Bパラメータを持つ軽量で統一されたマルチモーダルモデルです。初めて「理解-推論-生成-編集」のエンドツーエンドのクローズドループを実現しました。このモデルは「統一されたコンテキストモデリング+モーダル...」を採用しています。

InternVL-Uとは何ですか?

InternVL-Uは、上海人工知能研究所が複数のトップ大学と共同で開発した、40億パラメータを持つ軽量で統合されたマルチモーダルモデルです。初めて「理解→推論→生成→編集」のエンドツーエンドのクローズドループを実現しました。このモデルは、統合されたコンテキストモデリング、モダリティ固有のモジュール化、および分離された視覚表現という3つのコア設計を採用し、従来のモデルに内在する高いトレーニングコストと不均一な能力というボトルネックを克服しています。テキストレンダリング、科学的推論、空間モデリングなどの複雑なシナリオにおいて、140億レベルのモデルを凌駕する性能を発揮します。科学画像生成におけるGenExamベンチマークスコアは22.9で、すべてのオープンソース統合モデルをリードしており、科学研究と教育、インテリジェントなオフィスワーク、クリエイティブなコンテンツ作成のための効率的で柔軟なマルチモーダルソリューションを提供します。

InternVL-Uの主な機能

  • マルチモーダルな理解画像内の視覚情報を正確に分析し、ユーザーから寄せられる様々な複雑な質問に答えることができます。
  • 論理的推論このモデルは、思考連鎖の手法を用いて、抽象的な自然言語による指示を、具体的で実行可能な手順に分解します。
  • 画像生成テキスト記述に基づいて、高精細で意味的に正確かつ美的にも優れた視覚イメージを生成する。
  • 画像編集これにより、元の背景テクスチャや照明効果を維持しながら、画像の特定領域を正確に変更することが可能になります。
  • テキストレンダリングこのモデルは、中国語と英語の文字、数字、数式記号を正確に生成でき、文字の歪みやスペルミスを完全に排除します。
  • 科学的可視化分子構造やアルゴリズムのフローチャートなど、各分野の基準に準拠した専門的な科学研究図の作成をサポートします。
  • 空間モデリングこのモデルは、立体形状の計算、CADマルチビュー変換、および3Dオブジェクトの任意角度回転を実行できます。
  • 楽しい創作活動InternVL-Uは、絵文字やミームなど、オンラインでの拡散に適した楽しくクリエイティブなコンテンツを素早く生成できます。

InternVL-U 技術原則

  • 視覚表現の分離InternVL-Uは非対称な視覚表現戦略を採用しています。理解タスクでは、事前学習済みのViTを用いて高意味特徴を抽出し、複雑なシーンの理解精度を確保します。生成タスクでは、独立したVAEを用いて画像を潜在空間に圧縮し、ピクセルレベルの詳細を保持します。このモデルは、意味理解と画像再構成の間の最適化の競合を回避することで、理解と生成の両方のベンチマークにおいて優れた性能を維持します。
  • デュアルストリームMMDiTジェネレーターヘッドビジュアル生成ヘッドは、マルチモーダルなコンテキスト特徴と画像潜在特徴を別々に処理するために、デュアルストリーム構造を採用しています。シグモイドゲート付きアテンション機構を用いて重みを調整し、長いコンテキストシナリオにおける性能低下を軽減します。また、統一されたMSRoPE 3D位置エンコーディングを採用することで、空間構造の正確な保持を保証し、512ピクセルから1024ピクセルまでのマルチ解像度生成をサポートすることで、高解像度におけるスティッチングアーティファクトを回避します。
  • 3段階の段階的トレーニング本モデルは、事前学習、継続的事前学習、および微調整という3段階の戦略を採用しています。第1段階では、バックボーンネットワークを固定し、生成ヘッドを学習させてマルチモーダルな文脈理解能力を活性化します。第2段階では、バックボーンネットワークを固定し、マルチ解像度生成能力を学習させて、美的センスの高いサンプルを選択します。第3段階では、モデル全体を解凍し、思考連鎖データと統合することで、理解、推論、生成間の深い連携を実現します。

InternVL-Uプロジェクトの住所

  • GitHubリポジトリ:https://github.com/OpenGVLab/InternVL-U
  • ハギングフェイスモデルライブラリ:https://huggingface.co/InternVL-U/InternVL-U
  • arXiv技術論文:https://arxiv.org/pdf/2603.09877

InternVL-Uの応用シナリオ

  • 科学研究と教育このソフトウェアは、研究者や学生に対し、分子構造、アルゴリズムのフローチャート、力解析図などの専門的な視覚化機能を提供し、教育デモンストレーションや論文用図版の作成を支援します。
  • スマートオフィスこれにより、文書の自動生成、ポスターの一括編集、複数箇所でのテキストの同時修正が可能になり、ビジネス文書やマーケティング資料の制作効率が向上します。
  • クリエイティブデザインこのツールは、デザイナーが高精細なコンセプトアート、様式化された画像、およびマルチ解像度のビジュアル素材を迅速に生成することを支援し、プロのデザイナーにとっての参入障壁を低くします。
  • コンテンツ運用これは、新しいメディア事業者がワンクリックで絵文字やミームなどの楽しいコンテンツを作成し、ソーシャルメディアでの拡散シナリオに適応できるように支援します。
  • 工業生産このモデルは、CADマルチビュー変換、ソリッドジオメトリ計算、および3Dオブジェクトの回転を実行でき、エンジニアリング設計や製品プロトタイプの視覚化を支援します。