AB
AiBoss
project

One-Eval - 北京大学発のオープンソースの大規模モデル自動評価フレームワーク

One-Evalは、北京大学のOpenDCAIチームによって開発された、オープンソースのエージェント駆動型大規模モデル評価フレームワークです。DataFlowとLangGraphを基盤としており、NL2Eval(自然言語から評価へ)機能に重点を置いています。

One-Evalとは何ですか?

One-Evalは、北京大学のOpenDCAIチームが開発した、オープンソースの自動化されたエージェント駆動型大規模モデル評価フレームワークです。DataFlowとLangGraphを基盤として構築されており、主にNL2Eval(自然言語から評価へ)機能に重点を置いています。ユーザーは評価目標を自然言語で記述するだけで、システムがベンチマークの推奨、データのダウンロード、推論の実行、メトリックのマッチング、スコアリング、多次元レポートの生成を自動的に完了し、要件定義からレポート作成までエンドツーエンドの自動化を実現します。

One-Evalの主な機能

  • NL2Eval インテリジェント構文解析ユーザーが自然言語で要件を入力すると、エージェントが自動的に意図を解析し、評価パスを計画します。
  • ベンチギャラリーGSM8K、MATH、MMLU、C-Eval、IFEval、HumanEvalなどの主要な評価ベンチマーク向けに、メタデータ管理機能を内蔵しています。
  • エンドツーエンドの自動実行データのダウンロード、モデル推論、解答の採点、統計分析、レポート生成を自動的に完了します。
  • 人間と機械の協働介入重要なポイントでの中断、レビュー、編集、再実行をサポートし、評価戦略をリアルタイムで調整できます。
  • 異種データのための統一インターフェースDataFlowエンジンを使用して、異なるデータセットのフォーマットと列マッピングを標準化します。

One-Evalの技術原理

  • エージェントグラフオーケストレーションアーキテクチャLangGraphに基づいてステートマシンワークフローが構築され、評価はNL2Bench → BenchResolve → Metrics & Reportingの3つの主要な段階に分けられます。
  • データフローオペレータシステム基盤となるレイヤーは、データ準備とストリーミング計算を処理するためにDataFlowエンジンを使用し、異種データセットへの統一的なアクセスと変換を可能にします。
  • ローカルファースト + HuggingFace デュアルソース解析ローカルで事前に設定された設定の読み込みを優先します。設定が見つからない場合は、HuggingFaceツールを自動的に呼び出して、データセットのメタデータを検索、ダウンロード、構造化します。
  • 追跡可能な状態管理各ステップの実行状態は永続化され、ブレークポイントからの復旧、バックトラッキングと再実行、および障害データ分析をサポートします。

One-Evalの使い方

  • 環境準備Condaまたはuvを使用して仮想環境を作成および実行します。 pip install -e . 依存関係をインストールします。
  • バックエンドを開始します:走る uvicorn one_eval.server.app:app --host 0.0.0.0 --port 8000 FastAPIサービスを開始します。
  • フロントエンドを開始します:入力 one-eval-web ディレクトリ実行 npm install && npm run dev、アクセス localhost:5173
  • 設定パラメータウェブインターフェースでAPIキー、対象モデル、およびHuggingFaceトークンを設定すると、インタラクティブな評価を開始できます。
  • 評価を開始する入力ボックスに「数学的推論タスクにおけるモデルのパフォーマンスを評価する」など、ニーズを自然言語で記述してください。エージェントが自動的に実行し、レポートを生成します。
  • 開発者モード直接実行 python -m one_eval.graph.workflow_all "评测目标" コマンドラインからワークフロー全体を起動します。

One-Evalの主要情報と使用要件

  • 開発チーム北京大学 OpenDCAI ラボ。
  • オープンソースライセンスこれは完全にオープンソースであり、コードはGitHubでホストされており、直接入手できます。
  • テクノロジースタックバックエンドはPython 3.11とFastAPIをベースとし、フロントエンドはReact + Viteを使用し、コアワークフローはグラフオーケストレーションにLangGraphを利用し、基盤となるデータ処理はDataFlowオペレータシステムによって駆動されます。
  • サポートモデルOpenAI標準インターフェースを提供するあらゆるサービスプロバイダーと互換性があり、OpenRouter、Silicon Flow、Volcano Engine、および自己展開型vLLMなどが含まれます。
  • ハードウェア要件ローカル環境での操作には、標準的な開発マシン構成のみが必要です。実際の推論フェーズにおける計算とトークン消費は、ユーザーが選択した外部モデルAPIに完全に依存します。
  • 使用しきい値使用前に、モデル呼び出し用の有効なAPIキーを設定する必要があり、評価データセットの一部をダウンロードして読み込むにはHuggingFaceトークンが必要です。

One-Evalの主な利点

  • ゼロスクリプト評価手動でのデータダウンロードや設定ファイルの記述はもう不要です。自然言語でエンドツーエンドの評価を開始できます。
  • スケーラブルなアーキテクチャDataFlow演算子とLangGraph状態管理に基づいて、プライベートデータセットとカスタムメトリクスを容易に統合できます。
  • 人間と機械の閉ループ主要ノードは手動によるレビューと介入をサポートし、自動化と制御性のバランスを取っている。
  • 多次元レポートスコア統計、モデルランキング、失敗事例分析、および実行可能な提案を自動的に生成します。
  • エンドツーエンドのトレース評価プロセスは完全に追跡可能であり、各ノードの入力、出力、および状態変化は監査可能である。

One-Evalプロジェクトの住所

  • GitHubリポジトリ:https://github.com/OpenDCAI/One-Eval
  • arXiv技術論文:https://arxiv.org/pdf/2603.09821

One-Evalと類似の競合製品との比較

比較対象寸法 One-Eval OpenCompass EleutherAI LM Harness
開発チーム 北京大学OpenDCAIラボ 上海人工知能研究所 EleutherAIコミュニティ
コアポジショニング エージェント主導型、NL2Evalによる自動評価 主流の中国コミュニティと構成ドライバーの評価 確立された海外向けスクリプト評価ツール
使用方法 自然言語による説明 + Web UI操作 + コード呼び出し YAML設定ファイル+コマンドラインスクリプト Pythonスクリプト + CLIコマンドライン
参入障壁 低コスト。レビューはたった一文で開始できます。 この場合は、設定ファイルを作成する必要があります。 このプロセスでは、コードやスクリプトを作成する必要があります。
人間と機械の協働 サポート機能。主要なノードは、中断、レビュー、および介入が可能である。 サポート対象外、完全自動実行 サポート対象外、完全自動実行
フロントエンドインターフェース 組み込みのReact + Viteビジュアルワークフロー 結果表示ページはありますが、インタラクティブなフロントエンドはありません。 フロントエンドインターフェースなし
中国の生態学 C-Eval、CMMLUなどのネイティブサポート 非常に強力で、中国の主要指標を網羅的にカバーしています。 これは比較的脆弱です。中国語のデータセットは自分で設定する必要があります。
異種データサポート DataFlowオペレーターシステムへの統合アクセス 比較的完全 機能は比較的充実しているが、設定の複雑さが高い。
エージェント/サンドボックスレビュー 計画段階(SWE-benchの将来的なサポートなど) 部分的な支持 サポートされていません
適用可能なシナリオ 迅速な選考、プロジェクトの受諾、学術実験 高度なカスタマイズ、大規模なバッチ評価 英語ベンチマーク調査、柔軟なコードレベルのカスタマイズ

One-Evalの応用シナリオ

  • モデル選定の予備スクリーニング数学、推論、コード、指示への準拠といった側面から、複数の候補モデルのパフォーマンスを迅速に比較できます。
  • 民営化モデルの受容標準化された機能受入試験および回帰テストは、自己展開モデルまたは微調整済みモデルに対して実施される。
  • ベンチマークBench Galleryを使用すると、特定のタスクタイプに適した評価セットをすばやく検索して構成できます。
  • 学術研究これは、学位論文実験のための再現性と追跡可能性を備えた自動評価パイプラインを提供する。
  • エージェント能力評価LLMのツール呼び出し、計画、複雑なタスク実行におけるパフォーマンスを評価する(将来的にはSWE-benchなどのシナリオをサポートする予定)。