project
WorkBuddy Bench - テンセントのオープンソースのコーディングインテリジェンス評価スイート
WorkBuddy Benchは、Tencentが提供するオープンソースのコーディング能力評価スイートで、コーディング、Web開発、オフィスワーク、セキュリティという4つの実世界のシナリオを網羅しています。タスクは、実際のコミット、プルリクエスト、ビジネスシナリオからリバースエンジニアリングされ、会話形式のリクエストに書き換えられます。
WorkBuddy Benchとは何ですか?
WorkBuddy Benchは、Tencentが提供するオープンソースのコーディング能力評価スイートで、コード、Web開発、オフィスワーク、セキュリティという4つの実世界のシナリオを網羅しています。タスクは、実際のコミット、プルリクエスト、ビジネスシナリオからリバースエンジニアリングされ、データ破損を防ぐために会話形式のリクエストに書き換えられます。260のタスクは、隔離されたサンドボックス内で、隠蔽テスト、ルールチェック、LLM評価を用いて多次元スコアリングを受け、デュアルフレームワークの下で相互検証されるため、オープンソースで再現可能かつ監査可能なエンドツーエンドの評価が実現します。
WorkBuddy Benchの主な機能
- コード倉庫レベルのソフトウェアエンジニアリングタスクは80種類あり、バグ修正、機能開発、インターフェース調整、アルゴリズム実装など18のカテゴリにまたがっています。リクエストは、開発者、アルゴリズムエンジニア、プロダクトマネージャー、品質保証担当者、運用保守担当者の5つの役割によって開始されます。
- ウェブ(ウェブページ)フロントエンド関連のタスクは70項目あり、ページ実装、インタラクションデザイン、データビジュアライゼーション、ビジュアルデザイン、コードテスト、ドキュメント変換の7つのカテゴリに分かれています。提出物は、対話テキストではなく、動作するフロントエンド成果物です。
- オフィスこのタスクには、50個の複数ファイルからなる業務プロセスが含まれます。インテリジェントエージェントは、スプレッドシート、ドキュメント、PDF、JSONなど、さまざまな形式のファイルを処理し、データ検証、レポート生成、ステータス更新などの引き継ぎタスクを完了する必要があります。
- 安全このテストは、脆弱性の発見と悪用、マルウェア分析、セキュリティ運用、AIエージェントのセキュリティ評価など、レッドチームとブルーチームによる60のセキュリティタスクで構成されていた。採点には決定論的なスクリプトが用いられ、LLM評価者は関与しなかった。
WorkBuddy Benchの技術的原理
- リバースエンジニアリングによる建設各タスクは、実際のコードコミット、プルリクエスト、CVE、またはビジネスシナリオからリバースエンジニアリングされ、検索エンジンでプロンプトが取得できないように、短い会話形式のロールプレイングリクエストに書き換えられます。
- 意図的に不十分な情報この要求では、意図と制約のみが示されており、対象ファイル、正確なインターフェース、境界処理などの詳細は省略されています。エージェントは、要件の曖昧さ解消と実装能力をテストするために、ワークスペースからコンテキストを独自に復元する必要があります。
- ラウンド後の評価隔離問題解決プロセス中、エージェントはタスクの指示とワークスペースを確認できます。スコアリングアセット(非公開テスト、スコアリングルールなど)は、スコアリング情報の漏洩を防ぐため、完了後にのみサンドボックスに導入されます。
- デュアルフレーム交差検証単一のフレームワークによる体系的な偏りを排除するため、すべてのタスクはCodeBuddy CodeとClaude Codeという2つのエージェントフレームワークの下で実行されます。
- 汚染防止機構これは、タスク構築のための閉鎖的で検索可能な経路と、データセットのバージョン管理システムへの定期的な更新に依存しており、従来の機密性の高い汚染防止ソリューションに取って代わるものです。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
WorkBuddy Benchの使い方
- タスクセットを取得しますGitHub にアクセスして、標準化されたタスク ディレクトリをダウンロードしてください。このディレクトリには、instruction.md、task.toml、environment/環境イメージ、およびtests/スコアリング アセットが含まれています。
- 運用評価エージェントはHarborスタイルのタスクディレクトリに接続され、隔離されたDockerサンドボックス内で実行されます。エージェントは自然言語によるリクエストを読み取り、ワークスペースを探索し、成果物を生成します。
- 結果を表示スコアラーはタスク完了時に自動的に実行されます。コードサブセットは非表示の単体テストを使用してスコアリングされ、WebページサブセットはルールベースのLLM/VLMとエージェントベースのスコアラーを使用してスコアリングされ、オフィスサブセットはルールベースのチェックと証拠駆動型のLLMスコアラーを使用してスコアリングされ、セキュリティサブセットは決定論的なscoring.pyファイルを使用してスコアリングされます。
- 独立監査第三者は単一のタスクをオフラインで再実行し、その内容を直接検査できるため、エンドツーエンドの再現性と監査可能性が実現される。
WorkBuddy Benchの主な利点
- 実際の仕事の分布課題のカテゴリ、モード、難易度はすべて、実務で使用されている内部分類システムに合わせて作成されており、公開されている問題集やチュートリアルに基づいて作成されたものではありません。
- 完全オープンソースで監査可能CursorBenchのようなベンダー限定のベンチマークとは異なり、タスクディレクトリ、環境イメージ、評価コード、スコアリングテスト、および参照解答はすべて一般公開されています。
- 多次元スコアリングシステムコードは隠蔽テストを使用し、ウェブページはルール、意味論、インタラクションの三重評価を使用し、オフィスはルールベースかつ証拠駆動型のLLM評価を使用し、セキュリティは決定論的スクリプトを使用します。スコアリングツールの各サブセットは独立して設計されています。
- 登場人物と場面の多様性コードサブセットでは5つの要求者役割が導入され、セキュリティサブセットではレッドチームとブルーチームの全範囲が網羅され、単一のタスクタイプによって引き起こされる評価の偏りが回避される。
- 効率と能力の分離リーダーボードには、トークンの消費量とラウンド効率も表示されます。GPT-5.5は最小限の出力予算で最高スコアを達成し、高スコアが必ずしも高消費を意味するわけではないことを証明しました。
WorkBuddy Benchのプロジェクト住所
- プロジェクト公式サイト:https://workbuddybench.com/
- GitHubリポジトリ:https://github.com/Tencent/workbuddy-bench
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/tencent/workbuddy-bench
- 技術論文:https://workbuddybench.com/report/main.pdf
WorkBuddyベンチの比較
| 寸法 | WorkBuddy Bench | SWE-bench |
|---|---|---|
| タスクソース | ビジネスシナリオの実際のコミットメント/PR/リバースエンジニアリング | 公開GitHubイシュー |
| 汚染防止方法 | ビルドレベルのクローズド検索パスとバージョン管理 | 出版時の斬新さによる |
| 対象地域 | 4つの分野:コード/ウェブ/オフィス/セキュリティ | コードの不具合修正のみ |
| オープンソースレベル | 課題、鏡像、評価、解答はすべて公開されています。 | 公開タスクセットとテスト |
| リクエストスタイル | 口語表現、ロールプレイング、情報不足 | 詳細な技術的問題の説明 |
| 評価フレームワーク | デュアルフレームワーク(CodeBuddy + Claude Code) | 単一フレームワーク |
WorkBuddy Benchの応用事例
- インテリジェントエージェント研究開発ベンチマークこれは、コード化されたインテリジェントエージェント、フロントエンドAIツール、オフィスオートメーションエージェント、およびセキュリティAIのための標準化された機能ベンチマークを提供する。
- モデル選択リファレンスクロスモデルリーダーボードは、Claude Opus 4.8、GPT-5.5、GLM-5.2、DeepSeek-V4といった主要なモデルを網羅しており、企業のモデル選定を支援します。
- 学術研究および比較完全にオープンソースのタスクセットとスコアリングプロトコルを備えており、第三者による再現、監査、改善をサポートし、ドメインベンチマークの反復を促進します。
- 製品の反復と最適化サブセットスコアとトークン効率データを分析することで、コードナビゲーション、フロントエンドの状態管理、ファイル間の一貫性といった特定の分野におけるインテリジェントエージェントの弱点を特定できます。
- セキュリティ機能評価別途用意されたセキュリティサブセットは、AIレッドチームとブルーチームの能力を定量的に評価できる攻撃および防御テスト環境を提供する。