project
MineExplorer - Meituanが開発した、オープンワールドにおける分単位の長距離タスクを評価するためのベンチマークツール。
Meituan LongCatチームが開発したMineExplorerは、Minecraftをベースとした、分単位の長時間オープンワールドタスクを評価するための初のベンチマークです。MineExplorerには、1~4回のジャンプを含む813の手動検証済みインスタンスが含まれており、タスクには隠された前提条件があります。
MineExplorerとは何ですか?
Meituan LongCatチームが開発したMineExplorerは、Minecraftをベースとしたオープンワールド型の長時間タスクを評価するための初のベンチマークです。MineExplorerには、1~4ホップの手動検証済みインスタンスが813個含まれています。タスクには隠された前提条件があり、指示には依存関係グラフが列挙されていないため、モデルはサブタスクを自律的に推論する必要があります。MineExplorerはゲーム固有の知識を積極的に排除し、一般的な動的探索機能のみをテストします。5つのエージェントによる協調的なデータ合成とルールベースのマイルストーン自動評価フレームワークが付属しており、コードとデータセットは現在オープンソースで公開されています。
MineExplorerの主な機能
-
1分間のオープンワールドレビューMinecraftのリアルタイム3Dサンドボックスをベースに、各タスクは1800の環境ステップを実行し、モデルは動的なビジュアルに応じて戦略を継続的に調整する必要がある。
-
隠された複数ジャンプタスク本書は、1~4ホップの手動検証例を813個提供します。指示には最終目標のみが示され、先行するサブタスクは伏せられています。モデルは依存関係グラフを独自に推論する必要があります。
-
知識分離評価Minecraft固有のゲームシステムを積極的に排除し、一般的な世界観の知識に基づいたクエストのみを残す。
-
ルールに基づく自動評価サブタスクを自動化されたマイルストーンチェッカーに変換し、手動での注釈なしに自動採点を可能にします。
-
マルチエージェントデータ合成5つのエージェントが連携して、タスクの選択、シナリオ設計、マイルストーン設計、専門家によるレビューと検証といった全プロセスを含むタスクを自動的に生成します。
MineExplorerの技術原理
-
動的な環境相互作用アーキテクチャ評価環境は、静的なスクリーンショットによる質疑応答環境ではなく、リアルタイムで動作する物理的なサンドボックスです。モデルが実行する各アクションに応じて世界の状況がリアルタイムで更新され、最新の観測結果に基づいて継続的な意思決定が行われます。
-
暗黙的なDAGタスクモデリング各複合タスクは、タスク依存グラフGτを4つ組τ=(q,s₀,Gτ,Mτ)として定義される。重要な設計上のポイントは、命令qがDAG内のすべてのノードを列挙するわけではなく、エージェントが環境から隠された先行タスクを推論する必要がある点である。
-
マルチエージェントによる協調的な問題解決プロセスこのシステムはオーケストレーターによって制御されます。5人の専門エージェント(タスクセレクター、シーンデザイナー、マイルストーンデザイナー、Minecraftエキスパート、バリデーター)がグループチャットで協力し、初期化と議論の2段階で最初のドラフトを作成・修正します。これにより、単一のエージェントの場合と比較して効率が約30%向上します。
-
知識フィルタリング機構LLM審査員は、各個別課題について専門知識の評価を行い、一般的な世界知識とMinecraft固有のメカニズムを区別し、後者に依存する難易度の高いゲーム固有の課題を除外する。
-
ReAct機能分解フレームワークReActパラダイムから着想を得て、オープンワールド探索機能システムは、知覚、推論、行動という3つの次元に分解され、14のきめ細かい指標から構成される。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
MineExplorerの使い方
- 環境準備GitHubリポジトリをローカルマシンにクローンしてください。その際、Python 3.9以降と必要なMinecraftランタイム環境がインストールされていることを確認してください。
- テスト環境を起動します評価環境がリアルタイムで動作し、モデルアクションコマンドを受信できるように、Minecraftサンドボックスサーバーを設定して起動します。
- 運用ベンチマーク評価MineExplorerが提供する813個の検証インスタンスをロードし、テスト対象のマルチモーダルモデルを環境に接続すると、モデルはリアルタイム画面に基づいてアクションシーケンスを出力します。
- 自動評価評価が完了すると、システムは自動的にルールベースのマイルストーンチェッカーを呼び出し、バックパックのアイテム数や座標エリアなどの定量的指標に基づいてTSRおよびMSRスコアを計算します。
- カスタムタスク生成マルチエージェントデータ合成スクリプトを実行し、タスクホップ数を設定すると、5つの協調エージェントが隠された前提条件を持つ新しいタスクインスタンスを自動的に生成します。
- トレーニングと反復生成されたタスクはモデルへのトレーニングデータ入力として使用され、探索とフィードバックのループがMinecraftサンドボックス内で繰り返し実行されることで、オープンワールドの長期的な計画能力が向上する。
- 結果を表示評価レポートは各項目ごとにスコアを自動的に出力し、モデル別および難易度別の段階的な比較をサポートします。
MineExplorerの主な利点
-
分単位のオープンワールド評価の先駆者リアルタイムで動作するMinecraft 3Dサンドボックスをベースとしたこのモデルは、3分間の動的なインタラクション中に継続的に意思決定を行う必要がある。
-
隠された複数ジャンプタスク指示書には最終目標のみが示されており、依存関係グラフは列挙されていないため、モデルは隠れたサブタスクを自律的に推論する必要がある。
-
知識分離設計常識的なワールドクエストは維持しつつ、Minecraft特有のゲームシステムを積極的に排除する。
-
マルチエージェントによる効率的な問題定式化5つのエージェントが連携してタスクを生成することで、単一のエージェントと比較して効率が約30%向上し、1~12ホップのカスタム拡張をサポートします。
-
ルールに基づく自動評価これは、サブタスクを自動化されたマイルストーンチェッカーに変換し、手動で注釈を付けることなく定量化およびスコアリングが可能で、結果は再現可能です。
MineExplorerプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/meituan-longcat/MineExplorer
- arXiv技術論文:https://arxiv.org/pdf/2605.30931
MineExplorerと類似の競合製品との比較
| 比較対象寸法 | MineExplorer | MineDojo |
|---|---|---|
| 評価目標 | ゲーム固有の知識を排除し、一般的なオープンワールド探索能力をテストする。 | 身体を持つ知能エージェントが、Minecraft内でタスクを完了し、インターネットの知識を活用する能力を測定した。 |
| タスク設計 | ジャンプ1~4は、先行する複数ジャンプのタスクを隠蔽します。命令には依存関係グラフが列挙されていないため、手動で推測する必要があります。 | 何千もの手順型および創造的なタスクがあり、それぞれに目標と手順が明確に定義された指示書が付いています。 |
| 知識の源 | これは、一般的な世界の知識のみに依存しており、Minecraft Wikiの仕組みを積極的にフィルタリングしています。 | YouTube動画、Wiki、Redditなどの大規模なゲーム知識ベースを深く統合します。 |
| データ合成 | 5人のエージェントが連携してタスクを自動生成し、効率を約30%向上させる。 | インターネット上のマルチモーダルデータに基づいて、タスク関数と報酬関数を自動的に構築する。 |
| 評価方法 | ルールに基づいたマイルストーン自動チェッカーは、認識、推論、行動に関する14の指標を網羅しています。 | プログラム課題はシミュレーターの状態に基づいて評価され、創造的な課題はMINECLIPビデオモデルを使用して採点される。 |
| オープンソースに重点を置く | 評価基準と拡張可能なトレーニング環境により、1~12回のジャンプによるカスタムタスクをサポートします。 | 研修の枠組みと評価システムは、インターネット上の知識から汎用性の高いスキルを習得することに重点を置いている。 |
MineExplorerの応用シナリオ
-
マルチモーダル大型モデル機能評価これは、Claude、GPT、Geminiといった主要なMLLMプログラム向けに、動的なオープンワールドにおける長期計画と推論のための標準化されたテスト環境を提供する。
-
エージェントのトレーニング環境Minecraftサンドボックスのトレーニング場として、継続的な相互作用を通じて、モデルが知覚・推論・行動の閉ループ能力を向上させることをサポートします。
-
モデル選択リファレンスこのランキングは、オープンワールド探査機能に関する比較概要を業界に提供し、選定や機能限界の評価に役立つ。
-
学術研究プラットフォーム長距離推論、暗黙的タスク分解、視覚的グラウンディング、行動アライメントといった最先端分野の研究を促進する。
-
身体化された知能の事前調査と検証ロボット工学や自動運転などの実世界アプリケーション向けに、低コストで機能検証を行うためのサンドボックスを提供します。