project
EdgeBench - ByteDanceのAI学習能力ベンチマークフレームワーク
EdgeBenchは、ByteDanceのSeedチームが開発したベンチマークフレームワークで、現実世界の環境における自律型AIエージェントの長期的な学習能力を評価するために用いられます。
EdgeBenchとは何ですか?
EdgeBenchは、ByteDanceのSeedチームが開発したベンチマークフレームワークで、実世界環境における自律型AIエージェントの長期的な学習能力を評価することを目的としています。このフレームワークには、科学計算、ソフトウェアエンジニアリング、組み合わせ最適化など、6つの主要分野を網羅する134の実世界タスクが含まれています。12~72時間にわたる連続運用を通じて、エージェントの試行・観察・吸収・改善という学習曲線を追跡し、環境からのAI学習における予測可能なスケーリングパターンを明らかにします。
EdgeBenchの主な機能
-
長期的な学習評価エージェントを実際の環境で12~72時間連続実行させて、学習曲線全体を追跡する。
-
マルチドメインタスクカバレッジ本書は、科学、工学、最適化を含む6つの主要カテゴリにわたる、134の実際のミッションを網羅している。
-
汚染防止設計51のタスクは公開され、83のタスクはベンチマークの汚染や過学習を防ぐために予約されている。
-
学習パターンの定量化エージェントのパフォーマンスは対数シグモイド型のスケーリングパターンに従い、学習速度は約3ヶ月ごとに倍増することが分かりました。
-
人間のベンチマーク比較これは、専門家や人間による作業完了時間の目安として57.2時間を示し、人間と機械の間のギャップを定量化している。
EdgeBenchの技術的原理
- 環境相互作用学習サイクルEdgeBenchは、試行→観察→吸収→改善という閉ループ評価フレームワークを構築します。エージェントは実際のタスク環境で行動し、環境からのフィードバックを受け取り、戦略を更新して再度試行することで、複雑なタスクにおける人間の漸進的な学習プロセスをシミュレートします。
- 時間区分によるパフォーマンス追跡このシステムは、長期運用を複数の段階に分割し、各時点におけるエージェントのパフォーマンススコアを継続的に記録し、定量化可能な学習曲線データを作成することで、長期学習ダイナミクスの詳細な分析を支援する。
- クロスドメインタスクモデリング科学計算から形式数学まで、認知的な難易度が異なる6種類のタスクに対応した統一的な評価プロトコルが設計され、評価フレームワークが現実世界の幅広い課題を網羅できるようにした。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
EdgeBenchの使い方
- リポジトリにアクセスするGitHub で検索
ByteDance-Seed/EdgeBenchリーダーボードと公開タスクリストを取得します。 - タスクを選択公開されている51のタスクの中から対象ドメインのタスクを選択し、それらの評価指標と環境構成を理解する。
- エージェントをデプロイするテスト対象のAIエージェントをタスク環境に接続し、12時間以上連続して実行されるように設定します。
- データ収集各時点におけるエージェントのパフォーマンススコアを記録し、学習曲線データを生成する。
- 評価を提出する結果は、ランキング上位のClaude Opus 4.8やGPT-5.5などのモデルと比較・分析された。
EdgeBenchの主な利点
-
実社会志向エージェントの実際の作業能力を、静的な質問応答ではなく、現実世界のタスクに基づいて評価する。
-
長期動的追跡単一推論評価の限界を打破し、長期運用におけるエージェントの継続的な改善軌跡を捉える。
-
予測可能なパターンAIの学習曲線は、非常に予測可能な対数シグモイドスケーリング関係に従うことがわかった(R² = 0.998)。
-
汚染防止機構残された83個のタスクは、モデルがベンチマークに対して過剰最適化することを効果的に防ぎます。
-
フロンティアモデルカバレッジClaude Opus 4.8、GPT-5.5、Gemini 2.5 Pro、o3、DeepSeek-V4-Proなどのトップモデルが評価されました。
EdgeBenchプロジェクトのアドレス
- プロジェクト公式サイト:https://edge-bench.org/
- GitHubリポジトリ:https://github.com/ByteDance-Seed/EdgeBench
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/ByteDance-Seed/EdgeBench
- 技術論文:https://edge-bench.org/paper.pdf
EdgeBenchの競合製品比較
| 寸法 | EdgeBench | SWE-bench |
|---|---|---|
| 評価目標 | 長期的な環境学習能力 | 単一コード修正機能 |
| タスクの種類 | 6つの主要分野、134の実際のタスク | ソフトウェアエンジニアリングのコードに関する問題 |
| ランタイム | 12~72時間の連続運転 | 単一の推論が即座に完了しました |
| フィードバック機構 | リアルタイムの環境フィードバックが改善を促進する | テストケースの合格/不合格 |
| 学習曲線 | 学習曲線全体を追跡する | 時間軸の評価なし |
EdgeBenchの応用シナリオ
-
一般情報調査「シードエッジ」などの汎用知能イニシアチブにおける長期的な学習能力を定量的に評価するための基準を提供する。
-
エージェント機能の反復これは、開発者が長時間実行されるタスク中にエージェントのボトルネックを特定し、モデル最適化の方向性を定めるのに役立ちます。
-
モデル選択リファレンス本研究では、リーダーボードを用いて、Claude、GPT、Geminiといったモデルの長期的な学習性能を様々な分野で比較する。
-
人間と機械の能力ベンチマーク熟練した人間の57.2時間という基準値を参考に、AIが人間レベルに近づくまでの進捗状況を測定する。
-
教育研修設計これは、AIの自律学習と継続的なアルゴリズム改善に関する研究のための標準化された評価環境を提供する。