project
HyperEyes - Xiaohongshuがケンブリッジ大学と共同で開発した、並列マルチモーダル検索インテリジェントエージェント。
HyperEyesは、Xiaohongshuとケンブリッジ大学が共同開発した並列マルチモーダル検索エージェントです。視覚的な位置特定と検索を単一のアトミックアクションに統合するUGSパラダイムを先駆的に導入し、1回の処理で複数のエンティティを同時に検索することを可能にしました。
HyperEyesとは何ですか?
HyperEyesは、Xiaohongshuとケンブリッジ大学が共同開発した並列マルチモーダル検索エージェントです。UGSパラダイムの先駆けとして、視覚的な位置特定と検索を単一のアトミックアクションに融合し、1回のラウンドで複数のエンティティを同時に検索できるようにしました。HyperEyesは、効率性を考慮したデュアル粒度強化学習フレームワークを採用しています。6つのベンチマークテストにおいて、30Bバージョンは、同規模の最も強力なオープンソースモデルを精度で9.9%上回り、ツール呼び出しラウンドを5.3倍削減し、精度と効率性の両方でパレート最適性を達成しました。
HyperEyesの主な機能
-
並列マルチモーダル検索この技術は、単一の処理サイクル内で画像内の複数のエンティティを同時に検出・取得できるため、従来のような逐次的な切り抜き検索処理に取って代わる。
-
統一されたエビデンスに基づく検索視覚的な位置決め境界ボックスは、検索アクションのパラメータに直接埋め込まれており、複数のターゲット境界ボックスが単一の関数呼び出しで渡されます。
-
段階的拒絶サンプリングラウンド予算の増加に伴い、効率的な軌道を改良し、冗長性のない並列シードデータを30,000個構築する。
-
二重粒度効率を考慮した強化学習TRACEは軌道レベルの効率スケールを動的に厳格化する一方、OPDは失敗した軌道にトークンレベルの修正信号を注入する。
-
IMEBベンチマーク評価精度と検索効率を同時に定量化するためにCASスコアリングを用いた、300件のマルチエンティティ視覚評価セットを公開しました。
-
マルチツールコラボレーション画像検索ツールとテキスト検索ツールを統合し、視覚的証拠とテキスト証拠の同時取得をサポートする。
HyperEyesの技術原理
- UGS活動空間の再構築視覚的な位置決めは、独立した予備段階から検索動作に組み込まれたパラメータへと変化し、物理レベルでは単一ラウンドで複数のターゲットを同時に処理する経路が開かれる。
- 並列データ合成パイプライン複数のエンティティクエリは、複数の種類の画像を組み合わせることによって合成されます。複数の制約を持つ交差問題は、グラフランダムウォークに基づいて構築され、ショートカットソリューションは排除されます。
- TRACEダイナミックリファレンス報酬現在の最適軌道は動的なベンチマークとして使用されます。報酬は、モデルがベンチマークよりも効率的である場合にのみ与えられ、ベンチマークは各ラウンドごとに自動的に厳しくなります。
- OPD非対称戦略蒸留最終的に軌道が誤って回答された場合、235Bティーチャーモデルが起動され、失敗した軌道に対してトークンレベルの密な監視を提供し、効率的な同時実行の本能を保護します。
- 共同最適化目標GRPOは、軌道レベルの効率性報酬とトークンレベルの蒸留損失を組み合わせることで、ポリシーネットワークの精度と効率性を同時に最適化します。
- CASのコスト認識スコア精度、トークン消費量、ツールラウンドを効率性指標に統合するために、Acc²×100/(N_tok+2N_tool+1)という式が使用されます。
HyperEyesの使い方
- オープンソースのリソースを入手するGitHubリポジトリ(https://github.com/DeepExperience/HyperEyes)をご覧ください。
- 基本モデルを準備するビジュアル言語モデルのバックボーンとしてQwen3-VL-30Bまたは235Bをダウンロードしてデプロイし、GPUメモリが推論に十分であることを確認してください。
- 外部検索ツールの設定エージェントが並行してUGS検索を実行するための外部ツールとして、画像検索およびテキスト検索API(Bing画像検索やGoogleカスタム検索など)と統合します。
- 複数エンティティクエリの入力複数の要素を含む複雑な画像をアップロードし、自然言語で質問を入力すると、HyperEyesはUGSを使用して統合された証拠に基づく検索を自動的に実行し、単一の同時処理ラウンドですべてのターゲットを特定して取得します。
- 並列検索結果を表示するこのモデルは、構造化された検索結果と最終的な回答を返します。これには、各エンティティに関する視覚的およびテキストによる証拠が含まれます。
- 検索効率を評価するツール呼び出しラウンドの正確性、トークン消費量、および全体的な効率は、CAS(コスト認識スコア)指標を使用して定量的に評価されます。
HyperEyesの主な利点
-
効率性の飛躍的向上バージョン30Bは、ツール呼び出しラウンドの平均がわずか2.2回であり、これは同規模の最も強力なオープンソースモデルの5分の1に相当し、5.3倍の効率向上を実現しています。
-
精度においてトップクラス6つのベンチマークにおいて、同規模の最も強力なオープンソースモデルを9.9%上回り、235BバージョンはGemini-3.1-Proに1.1%近い性能を発揮します。
-
騒音耐性並行戦略は過剰検索の錯覚を回避し、真偽混合証拠テストにおいて精度を3.7%~5.8%向上させる。
-
エラーの連鎖を排除するUGSは連続栽培の依存関係を排除し、事前配置のずれがその後の検索結果を汚染することもなくなります。
-
パレート最適精度と効率の両面において、このモデルは最高水準を上回り、CASスコアは2番目に優れたオープンソースモデルの7.6倍に達している。
-
フルスタック効率の再構築行動空間やデータ合成から強化学習のトレーニングに至るまで、基盤となる構造を再構築することで、逐次的な問題を体系的に解決します。
HyperEyesプロジェクトの住所
- GitHubリポジトリ:https://github.com/DeepExperience/HyperEyes
- arXiv技術論文:https://arxiv.org/abs/2605.07177
HyperEyes競合製品比較
| 比較対象寸法 | HyperEyes-30B | DeepEyes-V2 | VDR |
|---|---|---|---|
| 開発チーム | 小紅樹/ケンブリッジ大学 | 小紅書 | 非公開 |
| 検索パラダイム | 並列並行処理(UGS) | 連続トリミング - 検索 | シリアル深度検索 |
| 平均的な工具のラウンド数 | 2.2 | 3.6 | 11.6 |
| 6つのベンチマークの平均精度 | 64.0% | 39.1% | 54.1% |
| IMEB精度 | 46.7% | 18.0% | 21.2% |
| CAS効率スコア | 0.910 | 0.119 | 0.014 |
| コアメカニズム | TRACE+OPDデュアル粒度RL | ツール報酬インセンティブ | 複数ターンにわたる深層推論 |
| エラー連鎖リスク | 免疫(原子作用) | 高リスク | 中程度のリスク |
HyperEyesの応用事例
-
複数文字の視覚的推論集合写真に写っている特定の人物の身元、職業、過去の出来事を特定し、複数の人物に関する伝記情報を取得する。
-
Eコマース製品比較複数の製品を含む複雑なシーングラフに対して同時検索を実行し、価格、ブランド、レビュー情報を取得します。
-
異種感覚知識に関するQ&A画像内の複数のオブジェクト、ランドマーク、およびアート作品間の関係を含む複雑なクエリに回答します。
-
ニュースファクトチェック複数の人物や場面が写っているニュース画像を同時に取得し、出来事や背景情報の信憑性を検証する。
-
学業成績チャート分析複数の図表、数式、引用を含む論文のスクリーンショットを並行して検索し、内容を取得する。
-
ソーシャルメディアのモデレーション複雑な画像内の複数の要素に対して同時検索を実行することで、違法または誤解を招くコンテンツを迅速に特定できます。