project
VitaBench 2.0 - Meituan LongCatの長期動的エージェント評価ベンチマーク
VitaBench 2.0は、MeituanのLongCatチームが発表した、実生活シナリオにおける長期的な動的ユーザーモデリングに基づくインテリジェントエージェント評価のための初のベンチマークです。56人のシミュレーションユーザー、819の複雑なタスク、2000を超える動的な嗜好、そして6つの...
VitaBench 2.0とは何ですか?
VitaBench 2.0は、美団のLongCatチームが開発した、長期的な動的ユーザーモデリングを用いて実生活シナリオにおけるインテリジェントエージェントを評価する初のベンチマークです。56人のシミュレーションユーザー、819の複雑なタスク、2000を超える動的な嗜好、66の実行可能なツールを備え、平均インタラクション期間は1580日です。このシステムは、長期にわたるインタラクションにおける大規模モデルのパーソナライゼーション能力と主体性を評価します。
VitaBench 2.0の主な機能
-
現実的なユーザー軌跡の構築食品配達、店舗サービス、出張などの分野を網羅し、56人の仮想ユーザーの長期的なライフプランを作成する。
-
動的な嗜好の変化2,000を超える設定項目が組み込まれており、ユーザー一人あたり平均48以上の動的な変更が発生します。
-
複雑なタスクの評価ユーザーライフサイクル全体を通して、819個の実行可能なタスクを提供します。
-
デュアルメモリーモード対決エージェントメモリ(アーカイブを積極的に維持する)とRAGメモリ(歴史的断片の検索)の統合的な評価。
-
積極的なタスク設計これは、情報が不十分な場合に、AIが積極的に質問したり、意思決定を行ったりする能力をテストするものです。
VitaBench 2.0の技術的原理
-
3Dデコンストラクション・アーキテクチャこのシステムは、ユーザー情報(プロファイル+設定+履歴+タスク)→パーソナライズされたメモリ→インテリジェントエージェントのタスクを完全な閉ループに接続します。
-
時間スケールが明らかになったユーザーの嗜好の変化や変動を正確に再現するために、インタラクションイベントは厳密にタイムラインに従ってエージェントに公開されます。
-
メモリーアリーナ機構拡張可能なインターフェースを使用することで、2つのメモリアーキテクチャを同じユーザーシナリオで公平に比較し、異なる設計が意思決定に及ぼす実際の影響を評価することができます。
-
ノイズ信号分離相互作用の約20%には、無関係なノイズ、探索的なノイズ、代理ノイズが含まれており、モデルが様々な手がかりから真の嗜好を抽出する能力をテストしている。
VitaBench 2.0の使い方
- リポジトリのクローン作成:埋め込む
git clone https://github.com/meituan-longcat/vitabench-2.0.git評価フレームワークと実行スクリプトを入手してください。 - データをダウンロードHuggingFaceデータセットから、56人のユーザー、819のタスク、66のツールの軌跡を含む標準化されたデータセットを取得します。
- 依存関係をインストールしますプロジェクトディレクトリに移動し、インストールコマンドを実行して、Python環境と必要なライブラリを設定します。
- モードを選択ベンチマークとして、フルコンテキスト、エージェントメモリ、RAGメモリの3つのメモリ設定のうち1つを選択してください。
- アクセスモデルリポジトリのドキュメントに従って、大規模モデルまたはエージェントを評価インターフェースに接続し、ユーザーイベントを受信してタイムラインに従ってツールを呼び出せるようにしてください。
- スタートアップ評価評価スクリプトを実行して、エージェントが食品配達、店舗訪問、出張などのシナリオで標準化されたタスクを順番に実行できるようにします。
- レポートを表示生成されたパフォーマンスレポートを分析し、Avg@4やPass@4などの指標を時間減衰曲線と比較し、長期的なユーザーモデリングにおけるモデルの欠点を特定します。
VitaBench 2.0の主な利点
- 業界初インテリジェントエージェントのシナリオと豊富なユーザーエコシステムを組み合わせ、実生活における長期的な動的ユーザーモデリングを目指した、初の評価ベンチマーク。
- 超長期間平均インタラクションサイクルは1580日(最大2974日)であり、ユーザーの嗜好の長期的な変化と変動を真に反映している。
- 非常にリアルなユーザープロファイル56人の仮想ユーザーは、性別、年齢、居住都市、職業、婚姻状況など、複数の側面を網羅する現実世界の統計データに基づいて構築されている。
- 動的な嗜好の変化2,000を超える設定が組み込まれており、各ユーザーは平均して48以上の動的な変化を体験し、現実生活における習慣の変化をシミュレートします。
- 統合メモリ評価エコシステム: 実世界のシナリオにおいて、初の長期的なインテリジェントエージェント評価プラットフォームを構築し、エージェントメモリとRAGメモリの2つのアーキテクチャを統一的に比較する。
VitaBench 2.0プロジェクトのアドレス
- プロジェクト公式サイト:https://vitabench2.github.io/
- GitHubリポジトリ:https://github.com/meituan-longcat/vitabench-2.0
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/meituan-longcat/VitaBench-2.0
- arXiv技術論文:https://arxiv.org/pdf/2605.27141
VitaBench 2.0 競合製品比較
| 寸法 | VitaBench 2.0 | SWE-bench |
|---|---|---|
| 主要目標 | この評価では、AIがユーザーの嗜好を理解し、長期的な動的相互作用を通じて積極的なサービスを提供する能力を評価する。 | GitHub上で、AIが現実世界のソフトウェアエンジニアリング問題を解決する能力を評価する。 |
| タスクの種類 | ライフスタイル関連のサービスに関する意思決定(食品の注文、旅行、店内での商品推奨など) | コードの修正、機能の実装、およびテストの合格が完了しました。 |
| 期間 | 平均期間は1580日、最長期間は2974日です。 | 期限という概念を持たない、単一の独立したタスク。 |
| ユーザーディメンション | ユーザープロファイル、嗜好の変化、社会的背景を含む、56人のシミュレーションユーザー。 | ユーザーコンセプトは考慮せず、コードベースと問題点のみに焦点を当てる。 |
| メモリ機構 | 主要な評価項目:3つのメモリモード(エージェント型、RAG型、フルコンテキスト型)の比較。 | これはメモリを必要とせず、現在のコードコンテキストのみに依存します。 |
| イニシアチブの要件 | 情報が不足している場合にAIが質問をするような、先を見越したタスクを設計する。 | 操作は一切不要で、コードパッチが直接出力されます。 |
| データノイズ | 相互作用の約20%は無関係なノイズや探索的なノイズで構成されており、信号分離が必要となる。 | 問題の説明とコードは比較的明確で、ノイズも少ない。 |
| 最高モデルスコア | 全ての歴史的モードにおける最高得点は約0.50(クロード・オーパス4.6)です。 | 最上位モデルは、40%~60%以上の合格率を達成する。 |
| 応用分野 | パーソナルアシスタント、インテリジェントカスタマーサービス、ライフスタイルサービスプラットフォーム | 自動プログラミング、コードレビュー、DevOpsツール |
VitaBench 2.0の応用シナリオ
-
AIパーソナルアシスタントのレビューこのテストは、インテリジェントアシスタントが長期にわたる付き添いの中で、状況を理解し、パーソナライズされたサービスを提供する能力を評価することを目的としている。
-
インテリジェントな顧客サービス最適化顧客サービスシステムの記憶精度と、ユーザー嗜好の動的な適応性を評価する。
-
ライフスタイルサービスプラットフォームこれは、食品配達、旅行、ホテルなどのシナリオにおける推薦アルゴリズムの現実的な評価環境を提供する。
-
メモリモジュールの開発研究者がさまざまなシナリオにおけるエージェントメモリとRAGメモリの性能を比較するのに役立つ。
-
長期的文脈モデル境界探索超長期時系列データや高ノイズ環境における大規模モデルの限界を検証する。