project
DeepEyes - 西安交通大学と共同でXiaohongshuが開発した、マルチモーダルな深層思考モデル。
DeepEyesは、小紅書チームと西安交通大学が共同開発したマルチモーダル深層思考モデルです。エンドツーエンドの強化学習に基づき、教師ありファインチューニング(SFT)に頼ることなく、OpenAI o3と同様の「グラフ思考」能力を実現しています。
DeepEyesとは何ですか?
DeepEyesは、小紅書チームと西安交通大学が共同開発したマルチモーダル深層思考モデルです。エンドツーエンドの強化学習に基づき、教師ありファインチューニング(SFT)に頼ることなく、OpenAI o3と同様の「画像による思考」能力を実現しています。DeepEyesは、推論中にトリミングやスケーリングなどの画像ツールを動的に呼び出し、細部の認識と理解を強化します。このモデルは、視覚推論ベンチマークV* Benchで最大90.1%の精度を達成し、強力な視覚探索能力とマルチモーダル推論能力を実証しています。DeepEyesは優れた画像位置特定能力を備えており、錯覚を効果的に軽減し、モデルの信頼性と汎化能力を向上させています。
DeepEyesの主な機能
- 図を使って考えてみようこの技術は画像を推論プロセスに直接統合することで、ユーザーが単に「画像を見る」だけでなく「画像を使って考える」ことを可能にし、推論プロセス中に画像情報を動的に呼び出すことで、詳細の認識と理解を向上させます。
- ビジュアル検索高解像度画像内の小さな物体やぼやけた領域を素早く特定し、切り抜きや拡大縮小ツールに基づいて詳細な分析を行うことで、検索精度を大幅に向上させることができます。
- 幻覚緩和このモデルは画像の詳細に焦点を当てることで、回答生成時に発生する可能性のある錯覚現象を軽減し、回答の精度と信頼性を向上させます。
- マルチモーダル推論これにより、視覚的推論とテキスト推論のシームレスな統合が実現し、複雑なタスクにおけるモデルの推論能力が向上します。
- 動的ツール呼び出しこのモデルは、外部ツールを必要とせずに、トリミングやスケーリングなどの画像ツールをいつ呼び出すかを自律的に判断できるため、より効率的で正確な推論を実現できます。
DeepEyesの技術原理
- エンドツーエンド強化学習DeepEyesは、教師ありコールドスタートファインチューニング(SFT)を必要とせず、エンドツーエンドの強化学習(RL)を用いてモデルをトレーニングします。報酬信号に基づいてモデルの動作を直接最適化し、推論中に画像情報を効果的に活用する方法を自律的に学習します。報酬関数には、精度報酬、フォーマット報酬、条件付きツール報酬が含まれており、モデルが画像ツールを効率的に使用しながら、質問に正しく回答することを保証します。
- インターリーブ型マルチモーダル思考連鎖(iMCoT)DeepEyesは、推論中に視覚情報とテキスト情報を動的に切り替えられる「インターリーブ型マルチモーダル思考連鎖(iMCoT)」を導入しました。推論の各ステップにおいて、モデルは追加の視覚情報が必要かどうかを判断し、生成されたバウンディングボックスの座標に基づいて画像から重要な領域を切り出し、これらの領域を新たな視覚的証拠として再入力します。
- ツールによるデータ選択モデルのツール活用行動をより効果的に促進するため、ツール活用を重視したデータ選択メカニズムを採用しています。トレーニングデータは、モデルのツール呼び出し能力を効果的に向上させるサンプルとなるよう慎重に選択されています。データセットには、高解像度画像、グラフ、推論データが含まれており、モデルの汎化能力を高めるために様々なタスクタイプを網羅しています。
- 動的ツール呼び出し動作トレーニング中、モデルのツール呼び出し動作は、初期探索、積極的な使用、効率的な利用という3つの段階を経ます。モデルは、初期の無作為な試行から、効率的かつ正確なツール呼び出しへと徐々に進化し、最終的には人間と同様の視覚的推論プロセスを実現します。
- マルチモーダル融合DeepEyesは、視覚情報とテキスト情報を深く融合させることで、統一された推論フレームワークを構築する技術です。この融合により、視覚タスクにおけるモデルのパフォーマンスが向上し、マルチモーダルタスクにおける全体的なパフォーマンスも強化されます。
DeepEyesプロジェクトの住所
- プロジェクト公式サイト:https://visual-agent.github.io/
- GitHubリポジトリ:https://github.com/Visual-Agent/DeepEyes
- ハギングフェイスモデルライブラリ:https://huggingface.co/ChenShawn/DeepEyes
- arXiv技術論文:https://arxiv.org/pdf/2505.14362
DeepEyesの応用シナリオ
- 教育指導このツールは、試験問題に含まれる図表や幾何学的図形を分析し、学習効率を高めるために、学生に詳細な問題解決手順を提供します。
- 医用画像医療画像を分析することで医師の診断を支援し、診断の精度と効率を向上させる。
- インテリジェント交通システム道路状況画像のリアルタイム分析は、自動運転システムがより正確な判断を下し、交通安全性を向上させるのに役立ちます。
- セキュリティ監視監視カメラの映像を分析し、異常な行動を特定することで、公共の安全と犯罪防止能力を向上させる。
- 工業生産オンライン品質検査と機器故障予測は、生産効率を向上させ、メンテナンスコストを削減します。