project
DeepEyesV2 - Xiaohongshuによるオープンソースのマルチモーダルインテリジェントエージェントモデル
DeepEyesV2は、Xiaohongshuチームが開発したマルチモーダルインテリジェントエージェントモデルです。2段階のトレーニング方法により、強力なツール呼び出し機能とマルチモーダル推論機能を実現しています。このモデルは、テキスト情報と画像情報を理解し、プロアクティブなコード実行、Web検索などをサポートします。
DeepEyesV2とは何ですか?
Xiaohongshuチームが開発したDeepEyesV2は、2段階の学習方法によって強力なツール呼び出しとマルチモーダル推論能力を実現するマルチモーダルインテリジェントエージェントモデルです。このモデルは、テキストと画像情報を理解し、コード実行やWeb検索などの外部ツールを能動的に呼び出し、これらのツールから返された結果を推論プロセスに統合して、複雑な現実世界の問題を解決します。モデルの第1段階では、教師ありファインチューニングを使用してツール使用の基本的な理解を確立し、第2段階では、強化学習を使用してモデルのツール呼び出し効率と汎化能力を向上させます。DeepEyesV2は、新たに提案されたRealX-Benchベンチマークテストで非常に優れたパフォーマンスを発揮し、強力なマルチスキル連携能力を実証しています。
DeepEyesV2の主な機能
-
マルチモーダルな理解このモデルは、テキスト情報と画像情報を同時に処理し、複雑なテキストや画像の内容を理解することができます。
-
アクティブなツール呼び出し必要に応じて、コード実行環境やウェブ検索などの外部ツールを積極的に活用し、追加情報を取得したり、複雑なタスクを実行したりする。
-
動的な推論と意思決定ツール呼び出しの結果を推論プロセスに統合し、反復処理を通じて問題を段階的に解決する。
-
タスク適応型知覚や推論など、さまざまなタスクの種類に基づいて適切なツールをインテリジェントに選択することで、効率と精度を向上させます。
-
複雑な課題解決ツールと反復的な推論を組み合わせることで、知覚、探索、推論を組み合わせた統合タスクなど、複数の能力の連携を必要とする複雑なタスクを解決することができます。
DeepEyesV2の技術的原理
-
コールドスタートフェーズ:
-
教師ありファインチューニング(SFT)知覚データ、推論データ、長い思考連鎖データなど、ツール使用手順を含む大量のサンプルデータを使用してモデルを微調整することで、モデルはツール使用に関する基本的な理解を構築できるようになります。
-
データ設計このデータは様々なタスクタイプを網羅しており、モデルが様々なシナリオにおいて適切なツール呼び出し戦略を学習できることを保証します。
-
-
強化学習フェーズ:
-
戦略最適化コールドスタートを基盤として、強化学習を用いてモデルのツール呼び出し戦略をさらに最適化し、効率性と汎化能力を向上させる。
-
ターゲット不要なツール呼び出しを削減し、未知の複雑なシナリオにおいてツールを創造的に組み合わせることで、モデルの柔軟性と適応性を向上させる。
-
DeepEyesV2プロジェクトのアドレス
- プロジェクト公式サイト:https://visual-agent.github.io/
- GitHubリポジトリ:https://github.com/Visual-Agent/DeepEyesV2
- arXiv技術論文:https://arxiv.org/pdf/2511.05271
DeepEyesV2の応用シナリオ
-
高度な質問応答と情報検索ユーザーが質問をするために画像をアップロードすると、DeepEyesV2は画像認識とウェブ検索を組み合わせて正確な回答を提供することができます。
-
教育と学習支援画像認識と推論を通して、学生に宿題の個別指導や知識探求のサポートを提供する。
-
コンテンツの作成と編集画像コンテンツを分析し、画像編集に関する提案と関連テキストの生成を行います。
-
インテリジェントな顧客サービスと技術サポート画像認識とウェブ検索を活用し、ユーザーにトラブルシューティングや相談ソリューションを提供します。
-
健康管理これは、医師が医療画像を分析するのを支援し、オンライン検索と組み合わせることで、健康相談や予備診断を提供する。