AB
AiBoss
ニュース

テンセント・フンユアンは、インテリジェントエージェントを評価するためのベンチマークであるE-Benchを発表した。

テンセント渾源は、清華大学AIRおよび東南大学と共同で、インテリジェントエージェント評価ベンチマーク「E-Bench」を発表しました。Honor of Kings、QQ Music、Tencent Meetingなどのゲームをベースに、323の状態変更タスクと76,000行を超えるデータを持つ完全合成仮想環境を構築しています。情報ギャップとツールギャップ設計により、モデルがメモリに基づいて近道を取ることを防止しています。E-Benchは11の最先端モデルを評価し、平均成功率はわずか54.56%でした。最も強力なモデルであるAvg@3は73.79%を達成しましたが、Pass³は60%を下回りました。