AB
AiBoss
project

PAST-Bench - プリンストン大学が発表した、個人エージェントのパフォーマンス帰属分析ベンチマーク。

PAST-Benchは、プリンストン大学のMengdi Wang氏のチームが開発したベンチマークテストで、パーソナルAIエージェントの再帰的な自己改善能力を検証することを目的としています。PAST-Benchは、記憶ありと記憶なしの条件下でのタスクパフォーマンスを比較し、…

PAST-Benchとは何ですか?

PAST-Benchは、プリンストン大学のMengdi Wang氏のチームが開発したベンチマークテストで、パーソナルAIエージェントの再帰的な自己改善能力を検証することを目的としています。PAST-Benchは、メモリの有無によるタスクパフォーマンスを比較することで、エージェントがセッション間で保存した経験がその後の行動を真に改善するかどうかを判断します。PAST-Benchは、メモリ、プロセスの再利用、情報収集、更新という4つの機能を網羅し、26のシナリオと204のタスクラウンドで構成されています。

PAST-Benchの主な機能

  • 再帰的自己改善の評価個人用AIエージェントが蓄積したセッション間の経験(記憶、スキル、タスク履歴)が、その後の行動を真に向上させるかどうかを検証する。
  • 孤立経験の蓄積の影響「経験の蓄積によるスコア向上」と、「基本モデルの強化/プロンプト/課題の難易度の変化」などの他の要因を区別する。
  • 四次元能力診断これは、メモリ、プロセスの再利用、情報収集、ステータス更新という4つの側面を網羅し、エージェントのどの特定の機能に欠陥があるかを特定します。
  • メカニズム帰属分析最終スコアを見るだけでなく、「保存→取得→適用」という完全な経路を追跡し、改善が実際の経路によって裏付けられているかどうかを判断します。

PASTベンチの技術原理

  • タスクファミリーのシーケンス設計エージェントは、同じタスクファミリー内で複数のセッションを順次実行します。初期のセッションでは経験を保存する機会が作成され、後のセッションではこれらの経験が正しく使用されたかどうかが検証されます。
  • 対照実験後続の各セッション用に、記憶保持機能を無効にした対照バージョンが用意され、その他の条件はすべて同一となる。自己進化の差Δは、記憶保持ありのスコアから記憶保持なしのスコアを差し引くことで得られる。
  • メカニズム証拠追跡実行時には、メモリ書き込み、スキル呼び出し、セッション取得、ステータス更新などのテレメトリデータを記録し、メカニズム証拠スコアを計算し、改善が期待どおりの経路をたどっているかどうかを検証します。
  • 継続的な製品監査エージェントによって保存された実際のコンテンツ(メモリエントリ、スキルファイル、セッションインデックス)を調べ、その構造、適時性、および再利用性を分析します。

PAST-Benchの使い方

  • 環境準備GitHubからPAST-Benchリポジトリをクローンし、コア依存関係とエージェントアダプタをインストールします。
  • モデル構成環境変数に、使用するモデルのAPIキーを設定してください。
  • サンドボックス建築:埋め込む past-bench build-image --kind sandbox 評価に必要なDockerサンドボックスイメージをビルドします。
  • クイック検証:使用 past-bench evolve 単一のタスクファミリーを実行し、追加します --compare-no-persistence パラメータに対してスモークテストを実施してください。
  • 総合評価評価プロセスでは、26のタスクファミリーすべてを繰り返し実行し、各タスクファミリーは自動的に2つの制御実験セット(持続性ありと持続性なしの2つ)を実行します。
  • 結果分析:存在する --trace-dir ディレクトリで表示 sequence_comparison.jsonそして、Δ値とメカニズムの証拠スコアを取得します。
  • カスタムアクセス自分のエージェントを評価する必要がある場合は、 agents/ アダプタをディレクトリに実装し、サポートを確認してください。 --compare-no-persistence オンオフを切り替えるだけです。

PAST-Benchの主な利点

  • 真の帰属能力PAST-Benchは、改善が蓄積された経験、より強力なモデル、プロンプトの変更、または簡略化されたタスクのいずれによるものかを正確に区別できます。
  • マッチドコントロール実験デザイン各タスクファミリーには、永続化を無効にしたコントロールバージョンが用意されており、その他の条件はすべて同じで、メモリありとメモリなしの直接的な因果比較ができるようにしている。
  • メカニズムレベルの診断このシステムは、エージェントが正しく回答したかどうかを判断するために、メカニズム証拠スコアを提案します。また、「保存→検索→適用」という一連の流れを追跡し、「偶然の正解」と「経験の真の再利用」の違いを識別します。
  • 4次元能力分析自己改善という漠然とした概念は、記憶、プロセスの再利用、情報収集、ステータス更新という4つの具体的な能力に分解され、欠点を正確に特定するために用いられる。
  • 診断に基づいた改善ベンチマークによって明らかになった実行時障害は、Hermes+フレームワークの開発に直接つながり、それが評価ツールであるだけでなく、エージェントアーキテクチャ最適化のための診断エンジンでもあることを証明した。

PAST-Benchプロジェクトの住所

  • GitHubリポジトリ:https://github.com/Gen-Verse/PAST-Bench
  • arXiv技術論文:https://arxiv.org/pdf/2608.04003

PAST-Bench製品と類似競合製品との比較

寸法 PAST-Bench SWE-Bench
主要目標 エージェントによって保存されたセッション間の経験が、その後の行動を真に改善するかどうかを検証する。 エージェントが実際のGitHubの問題を初回で正しく修正できるかどうかをテストします。
評価ユニット タスクファミリーのための複数ターンにわたる会話シーケンス(早期蓄積→後期再利用) 単一の独立したコード修正タスク
持続的なデザイン コアデザイン永続的な状態(記憶、スキル、会話履歴)の有効化と無効化をサポートします。 持続性なし各タスクは全く新しい環境であり、エージェントはゼロから開始します。
制御機構 マッチングコントロール実験—同じタスクファミリーを「記憶あり」バージョンと「記憶なし」バージョンで別々に実行し、正確な帰属Δ値を設定する。 制御なし設計 – パッチが正しいかどうかのみを判断し、改善の原因を区別しない。
帰属の粒度 メカニズムレベルメカニズム証拠スコアを使用して、「保存→取得→適用」までの完全な経路を追跡します。 結果レベル最終パッチがテストケースに合格するかどうかのみを確認してください。
機能範囲 メモリ、プロセスの再利用、情報収集、状態更新(セッション間機能の4つのタイプ) コードの理解、デバッグ、テスト駆動開発(シングルセッション機能)
典型的な出力 sequence_comparison.json(Δ値およびメカニズム的証拠スコアを含む) 合格率(解決率%)

PAST-Benchの応用シナリオ

  • 学術研究これは、エージェントの再帰的な自己改善のための標準化された、再現性のある、定量的な評価環境を提供し、異なるアーキテクチャの客観的な比較をサポートします。
  • フレームワーク開発4つの次元の機能を分解することで、エージェントフレームワークの欠点を正確に特定し、アーキテクチャの最適化(Hermes+の作成など)を導くことができます。
  • モデル選択固定されたフレームワークの下で、異なる基本モデルのセッション間経験再利用パフォーマンスを比較し、各モデルの機能バイアスを特定する。
  • 永続的な検証さまざまな記憶構造や検索戦略の実際の効果を検証し、「保存されているが見つからない」や「保存されているが使用されていない」といった非効率的な永続化を回避するため。
  • 製品の反復新バージョンにおけるスコア向上は、「セッションをまたいだ経験の蓄積」によるものなのか、「基本モデルの強化」によるものなのかを区別し、持続機能が真に価値を生み出していることを確認する。