project
Eagle 2.5 - NVIDIAのビジュアル言語モデル
Eagle 2.5はNVIDIAが開発したビジュアル言語モデルであり、わずか8バイトのパラメータで長文コンテキストのマルチモーダル学習に特化したAIモデルです。パラメータ数が少ないにもかかわらず、高解像度画像や長尺動画の処理において非常に優れた性能を発揮します。
Eagle 2.5とは何ですか?
Eagle 2.5 は NVIDIA のビジュアル言語モデルで、わずか 8 バイトのパラメータで長コンテキストのマルチモーダル学習に重点を置いています。パラメータ数が少ないにもかかわらず、高解像度画像や長尺のビデオシーケンスの処理に優れており、パラメータ数の多い Qwen 2.5-VL-72B や InternVL2.5-78B と同等のパフォーマンスを実現しています。Eagle 2.5 は、情報優先サンプリングとプログレッシブポストトレーニングという革新的なトレーニング戦略を採用しています。情報優先サンプリングは、画像領域の保存と自動ダウンサンプリング技術によって画像の整合性を確保し、視覚的な詳細を最適化します。プログレッシブポストトレーニングは、コンテキストウィンドウを徐々に拡張することで、さまざまな入力長に対して安定したパフォーマンスを維持します。
Eagle 2.5の主な特徴
- 長尺動画と高解像度画像の理解Eagle 2.5は、大規模な動画や高解像度画像の処理に対応し、特に長尺の動画シーケンス(例えば512フレームの入力)の処理に優れています。Video-MMEベンチマークでは72.4%という高いスコアを記録し、より大規模なモデルに匹敵する性能を発揮します。
- 多様なタスクサポートこのシステムは、動画および画像認識タスクにおいて非常に優れた性能を発揮し、MVBench、MLVU、LongVideoBenchなどの動画ベンチマークではそれぞれ74.8%、77.6%、66.4%のスコアを達成し、DocVQA、ChartQA、InfoVQAなどの画像認識タスクではそれぞれ94.1%、87.5%、80.4%のスコアを達成しています。
- 柔軟性と一般化能力Eagle 2.5は、SigLIPの視覚符号化とMLPの射影層を組み合わせることで、様々なタスクにおいて高い柔軟性と汎化能力を発揮します。
Eagle 2.5の技術的原理
- 情報優先サンプリングEagle 2.5は、画像領域保存(IAP)技術を採用し、元の画像領域の60%以上を保持しながら、アスペクト比の歪みを軽減します。自動ダウンサンプリング(ADS)技術は、コンテキストの長さに基づいて視覚情報とテキスト情報を動的にバランス調整し、テキストの整合性を確保しつつ、視覚的なディテールを最適化します。
- 段階的な研修後この戦略では、モデルのコンテキストウィンドウを32,000トークンから128,000トークンへと段階的に拡張することで、入力長が異なっても安定したパフォーマンスを維持し、単一のコンテキスト範囲への過学習を回避します。これにより、多様なタスクにおいてモデルの柔軟性が確保されます。
- カスタマイズされたデータセットEagle 2.5は、長尺動画の理解を目的として特別に設計されたカスタムデータセットであるEagle-Video-110Kデータセットを使用しています。このデータセットは、ストーリーレベルのセグメンテーションと人間によるチャプターメタデータを組み合わせたトップダウン方式と、GPT-4oを使用して短いセグメントの質問と回答のペアを生成するボトムアップ方式という、2つのアノテーション手法を採用しています。コサイン類似度フィルタリングにより、データセットは冗長性よりも多様性を重視し、物語の一貫性と詳細なアノテーションを保証します。
- 視覚符号化層と投影層Eagle 2.5は、SigLIPのビジュアルエンコーディングとMLPの射影レイヤーを組み合わせることで、ビジュアル埋め込みを言語モデルの表現空間に整合させます。これにより、多様なタスクにおけるモデルの柔軟性と適応性が向上します。
Eagle 2.5プロジェクトのアドレス
- プロジェクト公式サイト:https://nvlabs.github.io/EAGLE/
- arXiv技術論文:https://arxiv.org/pdf/2504.15271
Eagle 2.5の応用シナリオ
- インテリジェントなビデオ分析Eagle 2.5は、長時間のビデオシーケンスの処理、ビデオコンテンツに関連するテキスト説明の理解と生成に優れています。監視システムにおいては、ビデオストリームをリアルタイムで分析し、異常な動作を検出し、アラートを生成することができます。
- 高解像度画像処理Eagle 2.5は高解像度画像の処理に優れており、画像分類、物体検出、画像キャプション生成を可能にします。
- コンテンツ作成とマーケティングEagle 2.5は、広告、ソーシャルメディアコンテンツ制作、その他の分野に適した、高品質な画像説明文や動画スクリプトを生成できます。
- 教育と訓練教育分野において、Eagle 2.5は、学生が複雑な概念をよりよく理解できるよう、教育ビデオや画像に関連付けられた説明文を生成することができます。
- 自動運転とロボット工学Eagle 2.5のマルチモーダル理解機能は、カメラからの視覚データを処理し、テキストコマンドと組み合わせて意思決定を行うことができます。