AB
AiBoss
project

NVLM - NVIDIAのマルチモーダル大規模言語モデル

NVLMはNVIDIAが開発した最先端のマルチモーダル大規模言語モデル(LLM)であり、視覚言語タスクにおいて、トップクラスの独自モデル(GPT-4oなど)やオープンアクセスモデル(Llama 3-V 405BやInternVL 2など)に匹敵する性能を実現しています。

NVLMとは何ですか?

NVLMは、NVIDIAが開発した最先端のマルチモーダル大規模言語モデル(LLM)であり、視覚言語タスクにおいて、トップクラスの独自モデル(GPT-4oなど)やオープンアクセスモデル(Llama 3-V 405BやInternVL 2など)に匹敵する性能を実現しています。NVLM 1.0ファミリーには、デコーダーのみのモデルNVLM-D、クロスアテンションベースのモデルNVLM-X、ハイブリッドアーキテクチャNVLM-Hの3つのアーキテクチャがあります。これら3つのアーキテクチャはすべて、マルチモーダル学習後もテキスト性能を維持し、場合によってはLLMバックボーンの性能を上回ります。NVLMは、厳選されたマルチモーダル事前学習済みデータセットと教師ありファインチューニングデータセットに基づき、特に数学およびコーディングタスクにおいて優れた性能を発揮します。

NVLMの主な機能

  • 画像理解物体、場面、活動など、画像の内容を認識し理解することができる。
  • 言語理解語彙、文、意味などを含む自然言語テキストの理解。
  • 異種モダリティ融合視覚情報と言語情報を組み合わせることで、より深いレベルの理解を実現する。
  • 画像の説明生成画像の説明文を生成します。
  • 視覚的推論予測、比較、分析などの複雑な視覚的推論を実行する。
  • マルチモーダル翻訳: テキストによる説明を視覚的な表現に変換するなど、異なるモダリティ間での情報変換を実行する。

NVLMの技術原理

  • モデルアーキテクチャ
    • NVLM-D(デコーダーモデルのみ)画像の特徴はLLMデコーダに直接組み込まれており、すべてのモダリティを均一に処理します。
    • NVLM-X(クロスアテンションモデル)画像の特徴は、クロスアテンション機構を用いて処理される一方、テキスト処理性能を維持するためにLLMバックボーンのパラメータは固定される。
    • NVLM-H(ハイブリッドモデル)これはNVLM-DとNVLM-Xの利点を組み合わせ、グローバルサムネイルとローカル画像特徴の両方を処理します。
  • ダイナミックな高解像度入力この手法では、高解像度画像を複数のタイルに分割し、各タイルを個別に処理した後、結果を統合することで、画像の詳細を処理する能力を向上させます。
  • 1次元タイルラベルデザイン高解像度画像を処理する際には、モデルが画像内のさまざまな部分とその全体における位置を理解するのに役立つように、1次元タイルタグが導入されます。
  • マルチモーダルな事前学習と教師ありファインチューニング: 事前学習には高品質のマルチモーダルデータセットを、教師ありファインチューニングには特定のタスクに特化したデータセットを使用することで、特定のタスクにおけるモデルのパフォーマンスを向上させます。

NVLMプロジェクトの住所

NVLMの応用シナリオ

  • 画像と動画の説明画像や動画コンテンツの説明文を自動生成します。ソーシャルメディア、コンテンツ管理、検索エンジン最適化に適しています。
  • 視覚的質問応答(VQA)画像コンテンツに関する質問に答え、顧客サービス、教育、情報検索に適しています。
  • 文書理解とOCRスキャンした文書、チケット、フォームからテキストや情報を抽出し、オフィス業務や文書管理の自動化に活用できます。
  • マルチモーダル検索これにより、ユーザーは画像またはテキストによるクエリを通じて関連情報を取得できるため、電子商取引やコンテンツ推薦システムに適しています。
  • 運転支援システムとロボット視覚環境における指示を理解し、それに応じて動作することができ、自律走行車やロボットのナビゲーションに利用されている。