AB
AiBoss
project

HarnessEvalは、MirroS、清華大学、NVIDIAなどが共同で立ち上げたベンチマークシステムです。

HarnessEvalは、MirroSが清華大学、北京大学、バークレー、MIT、NVIDIAなどの機関と共同で開発した評価システムです。HarnessEvalは評価プロセスを自動化します。各ケースについて、システムはSから始まる評価パスを動的に計画します。

HarnessEvalとは何ですか?

HarnessEvalは、MirroSが清華大学、北京大学、カリフォルニア大学バークレー校、MIT、NVIDIAなどの機関と共同で開発した評価システムです。HarnessEvalは評価プロセスをエージェント化します。各ケースにおいて、システムは評価パスを動的に計画し、スキルライブラリから適用可能なスキルを選択し、検証可能なサブ問題に分解し、証拠を収集するためのツールを呼び出し、最終的に追跡可能な証拠ツリーを出力します。HarnessEvalは、従来の静的ベンチマークの限界を打破し、評価をブラックボックス型のスコアリングシステムから、解釈可能で再現可能なインテリジェントなワークフローへと変革します。最初に実装されたプロジェクトであるHarnessEval-Wは、インタラクティブな世界モデルの評価に使用されています。

HarnessEvalの主な機能

  • 動的評価計画各ケースの状況と目的を考慮した、個別の評価計画が自動的に作成されます。
  • スキルルーティング固定されたすべての指標を実行する代わりに、必要に応じてスキルライブラリから該当するスキルを選択してください。
  • 問題の内訳抽象的な評価問題を、測定可能で検証可能な下位問題に分解する。
  • 証拠収集サブエージェントと診断ツールを呼び出し、さまざまな視点から視覚的および論理的な証拠を収集します。
  • 証拠の検証主担当者は、結論の信頼性を確保するために、各部門における証拠の質と論理的な関連性を検証する。
  • 証拠ツリーの出力テスト内容、ツール呼び出し、推論チェーン、最終スコアを記録した完全なエビデンスツリーを出力します。
  • 拡張可能なスキルライブラリこのモデルには9つのコアスキルモジュールが組み込まれており、モデルの進化に合わせて新しいスキルを動的に追加できる機能も備えています。
  • 評価事例の自動生成システムは、シーン分類に基づいて初期世界、アクション、および検証を自動的に生成し、評価の品質を保証します。

HarnessEvalの技術的原理

  • 4層構造のエージェントワークフローHarnessEvalは、計画-ルーティング-分解-検証という4層構造のワークフローを採用しています。計画フェーズでは、ケースのコンテキストを理解し、カスタマイズされた評価計画を生成します。ルーティングフェーズでは、スキルライブラリから適用可能なスキルを動的に選択します。分解フェーズでは、上位レベルの問題を下位問題に分解し、それらをサブエージェントに委任します。検証フェーズでは、メインエージェントが証拠の質と論理的な関係性を検証し、最終的な結論を導き出します。
  • 階層型インテリジェントエージェントアーキテクチャ本システムは、全体的な計画と検証を行うメインのインテリジェントエージェントを採用し、各スキルエージェントは特定の評価を担当します。各スキルはさらに複数のサブエージェントに分割され、それぞれが特定のサブタスクを処理することで、階層的な評価実行構造を形成します。
  • 拡張可能なスキルライブラリこのフレームワークには、レンダリング品質、物理的合理性、状態変化の検証、ドリフト分析、再訪の一貫性、オフスクリーン進化といった側面を網羅する9つのコアスキルモジュールが組み込まれています。また、モデルの能力向上に合わせて新しいスキルを動的に追加することもサポートしており、評価機能を継続的に拡張できます。
  • 証拠ツリー出力メカニズム評価結果は階層的な証拠ツリー形式で提示され、テスト内容、ツール呼び出し、視覚的証拠、推論チェーンが完全に記録されるため、単一の数値スコアを出力するだけでなく、評価結果の検証可能性、再現性、説明責任が確保されます。

WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ

HarnessEvalの使い方

  • リポジトリのクローン作成HarnessEval-WのコードベースをGitHubから取得してください。
  • 環境づくり別々に作成する harnesseval-mainharnesseval-metrics そして harnesseval-pavrm 3つのconda環境。
  • 構成資格情報:コピー config/example.env のために harnesseval.env そして環境変数を読み込みます。
  • データの準備評価対象モデルによって生成された動画結果を、指定されたディレクトリに配置して準備してください。 manifest.json ファイル一覧を表示します。
  • 実行評価:走る harnesseval eval このコマンドは、モデルの結果、評価計画、および出力ディレクトリへのパスを指定します。
  • 検証結果:走る harnesseval verify run 評価結果が完全であるか、スコアが生成されているかを確認してください。
  • レポートを表示出力ディレクトリで表示 summary.jsonleaderboard_latest.csv そして LEADERBOARD.md 詳細な評価とランキングを入手できます。

HarnessEvalの主な利点

  • 動的評価計画固定されたプロセスを適用するのではなく、各事例の状況に基づいて、カスタマイズされた評価計画を自動的に生成します。
  • インテリジェントスキルルーティングすべてのケースで無関係な指標を実行することを避けるため、必要に応じてスキルライブラリから該当するスキルを選択してください。
  • 説明可能な証拠の連鎖各スコアの背後にあるツール呼び出し、視覚的証拠、および推論ロジックを追跡する完全な証拠ツリーを出力します。
  • 拡張可能なスキルライブラリスキルライブラリは、新しいスキルを動的に追加し、モデルの機能が進化するにつれて評価の次元を継続的に拡張することをサポートします。
  • 階層型エージェントコラボレーションメインのインテリジェントエージェントは計画と検証を調整し、サブエージェントはサブ問題を処理することで、複雑な評価タスクをより精緻に分解することを可能にする。
  • 評価データは自動的に生成されます。シーン分類に基づいて、システムは初期世界、アクション、および検証を自動的に構築し、評価事例の質と多様性を確保します。
  • 評価プロセスは透明性が高く、監査可能である。一連の論理的思考過程と証拠記録を完全に網羅することで、評価結果の検証可能性、再現性、および説明責任が確保される。
  • 人間のような評価方法これは、機械的な採点ではなく、「理解、計画、証拠収集、推論」を含む、人間の専門家による評価ワークフローをシミュレートするものです。

HarnessEvalのプロジェクトアドレス

  • プロジェクト公式サイト:https://mirros.ai/blog/harnesseval
  • GitHubリポジトリ:https://github.com/mirros-lab/harnesseval-w

HarnessEvalと類似製品との比較

比較対象寸法 HarnessEval VBench
評価対象 対話型世界モデル(アクション入力、状態遷移、物理的因果関係を含む) 動画生成モデル(単一シーン、対話型入力なし)
評価方法 エージェントの動的ワークフロー:計画 → ルート → 分解 → 検証 固定指標パイプライン:事前設定されたルーブリック+バッチ採点
スキル選択 ケースの状況に基づいて、スキルライブラリからスキルを動的にルーティングします。 すべてのケースで、同じ固定指標セットが実行されました。
問題の内訳 高レベルの評価問題を測定可能なサブ問題に分解し、それらをサブエージェントに委任する。 階層分解を行わずに指標を直接計算します。
出力形式 証拠ツリー:テスト内容、ツール使用、推論過程、採点基準を記録します。 各次元のスカラースコアと棒グラフ
説明可能性 各スコアについて追跡可能な、完全な推論の連鎖と視覚的証拠 単に点数を出力するだけでは、「なぜ点数が低かったのか」を説明することはできません。
拡張性 スキルライブラリは、新しいスキルを動的に追加することを可能にし、継続的な自己改善をサポートします。 指標は固定されているため、拡張するには全体的なフレームワークの変更が必要となる。
物理的因果関係 具体的には、国家の変遷の正確性、物理的な妥当性、および世界における連続性を評価する。 評価されるのは、画質と動きの滑らかさのみです。

HarnessEvalの応用シナリオ

  • インタラクティブワールドモデルの評価動作条件下におけるビデオ生成モデルの正確性、物理的妥当性、および世界連続性を評価する。
  • 身体化された知能とロボットシミュレーションこの評価は、仮想環境におけるロボットの操縦性、物理的な相互作用の因果関係、および長期的な状態の一貫性を評価することを目的としている。
  • 自動運転の世界モデル生成されたシーンにおいて、カメラの軌道追従性、オブジェクトの永続性、画面外での進化、および物理ダイナミクスの合理性を検証します。
  • ゲームと仮想世界の生成オープンワールドゲームにおけるシーンの一貫性、NPCの行動の因果関係、再訪の一貫性、および視覚的な品質を評価する。
  • 物理シミュレーションと科学計算生成された動画の物理法則と因果関係の正確性を検証する。
  • AI動画制作プラットフォームSeedance、Kling、Soraなどのモデルに対して、解釈可能な品質診断を提供し、特定の障害モード(追加イベント、ターゲットドリフト、物理的違反など)を特定します。