AB
AiBoss
project

VitaBench - Meituanの大規模エージェント評価ベンチマーク

VitaBenchは、MeituanのLongCatチームが発表した、複雑な問題に対する大規模なインテリジェントエージェントを評価するためのベンチマークです。食品配達、レストランでの食事、旅行など、日常生活で頻繁に発生するシナリオを例として用い、66種類のツールを含むインタラクティブなシステムを構築しています。

VitaBenchとは何ですか?

VitaBenchは、MeituanのLongCatチームが開発した、複雑な問題に対する大規模インテリジェントエージェントの評価ベンチマークです。食品配達、レストランでの食事、旅行といった、日常生活で頻繁に発生するシナリオを例として、66種類のツールを含むインタラクティブな評価環境を構築し、包括的なシナリオ横断型タスクを設計しています。エージェントのパフォーマンスを、深層推論、ツール使用、ユーザーインタラクションの3つの側面から測定します。エージェントタスクを定量的に分解し、大規模な実世界環境データベースを構築し、実ユーザーシミュレータを導入し、アトミック評価基準(ルーブリック)によってきめ細かな動作カバレッジを実現した、初のベンチマークです。

VitaBenchの主な機能

  • 複雑なタスク評価環境の構築食品配達、レストランでの食事、旅行といった、生活の中で頻繁に発生する場面を媒体として、66種類のツールを含むインタラクティブな評価環境を構築し、現実世界の場面における複雑なニーズをシミュレートするために、複数の場面にまたがる包括的なタスクを設計した。
  • タスクの複雑性次元を定量化するタスクの複雑さは、深層推論、ツール使用、ユーザーインタラクションという3つの側面から定量化されます。推論の複雑さは、観測空間のサイズ、部分的な観測可能性、推論ポイントの数などの指標によって測定されます。ツールの複雑さは、単一シナリオタスクと複数シナリオタスクによって区別されます。インタラクションの複雑さを測定するために、実際のユーザーシミュレータが導入されます。
  • きめ細かな評価を実現する最新の研究に基づき、タスク目標は細分化された評価基準(ルーブリック)に分解されます。重なり合うスライディングウィンドウで対話の軌跡全体をスキャンすることで、タスクの完了は厳格な「すべてかゼロか」の基準で判断され、より包括的かつ詳細な行動分析が可能になります。
  • オープンソースのリソースを提供するVitaBenchは現在、プロジェクトのホームページ、論文へのリンク、コードリポジトリ、データセットなどを含め、完全にオープンソース化されており、研究者や開発者が現実世界のシナリオにおけるインテリジェントエージェントの研究開発と実装を促進するための豊富なリソースを提供しています。

VitaBenchの技術原理

  • 多次元複雑性の構築複雑なタスクは、深い推論、ツールの使用、ユーザーとのインタラクションという3つの側面から構築され、現実世界のシナリオにおけるタスクの複雑さをシミュレートします。
  • 実世界のデータベース大規模な実世界環境データベースを構築し、エージェントに部分的に観測可能な環境を提供することで、複雑な環境におけるエージェントの推論能力を測定する。
  • ユーザーシミュレーターさまざまなユーザーの行動や嗜好をシミュレートするリアルユーザーシミュレーターを導入することで、インテリジェントエージェントが複数ターンの対話において多様なユーザー行動に適応できるようにする。
  • 噴霧化評価基準タスクの目的は、一連の細かな評価基準(ルーブリック)に分解され、対話の軌跡をスライディングウィンドウを通してスキャンすることで、エージェントの行動をきめ細かく評価する。
  • シナリオ横断型タスク設計複数のシナリオを統合したタスクを設計し、インテリジェントエージェントが複数のシナリオ間で切り替えて実行し、情報を統合する能力を検証し、実世界のシナリオにおける全体的なパフォーマンスを評価する。

VitaBenchプロジェクトの住所

  • プロジェクト公式サイト:https://vitabench.github.io
  • GitHubリポジトリ:https://github.com/meituan-longcat/vitabench
  • arXiv技術論文:https://arxiv.org/abs/2509.26490
  • HuggingFaceデータセット:https://huggingface.co/datasets/meituan-longcat/VitaBench

VitaBenchのアプリケーションシナリオ

  • 食品配達テイクアウトを注文する際のユーザーの複雑なニーズ(個人の好み、予算、時間的制約に基づいてレストランや料理を選択するなど)をシミュレートし、エージェントがユーザーのニーズを理解し、適切な選択肢を提案し、複数回の対話を通じて注文を完了する能力を評価する。
  • レストランで食事をするこの研究では、レストランの検索や予約から、料理の注文、会計までの全プロセスを網羅し、ユーザーのニーズに基づいた適切なレストランの推薦や、予約、メニュー検索といったタスクの処理など、複雑なシナリオにおけるインテリジェントエージェントの推論能力とツール使用能力を検証します。
  • 旅行旅行計画、交通機関の予約、観光スポットのおすすめなど、複数の側面を含み、さまざまなツールや情報リソースを統合してユーザーにパーソナライズされた旅行ソリューションを提供するなど、シナリオ横断的なタスクにおけるインテリジェントエージェントの総合的なパフォーマンスを評価します。
  • インテリジェントエージェントの研究と評価これは、研究者や開発者向けに標準化された評価基準を提供し、複雑なタスクにおけるインテリジェントエージェントのパフォーマンスを評価および最適化するのに役立ち、インテリジェントエージェント技術の開発と応用を促進します。
  • 人間とコンピュータの相互作用に関する研究本研究は、実際のユーザーシミュレーターと複数ターンの対話タスクを通して、インテリジェントエージェントとユーザー間の相互作用パターンを調査し、エージェントの自然言語理解能力と対話管理能力の向上を目指すものである。