project
AutoCodeBench - 大規模モデルのコード能力を評価するための、Tencent Hunyuanオープンソースデータセット。
AutoCodeBenchは、テンセント渾源が大規模プログラミングモデルのコーディング能力を評価するために特別に開発したベンチマークデータセットです。20種類のプログラミング言語に均等に分散された3920問で構成されています。このデータセットは、難易度、実用性、多様性に優れており、…
AutoCodeBenchとは何ですか?
AutoCodeBenchは、Tencent Hunyuanが大規模モデルのコーディング能力を評価するために開発したベンチマークデータセットです。20種類のプログラミング言語に均等に分散された3920問で構成されています。このデータセットは、難易度が高く、実用的で多様性に富み、多言語プログラミングタスクにおける大規模モデルのパフォーマンスを測定できます。ベンチマークデータセットは自動化されたワークフローを通じてデータを生成し、高い品質と網羅性を確保しています。また、簡略版(AutoCodeBench-Lite)と、基盤となるモデルを評価するためのバージョン(AutoCodeBench-Complete)も提供しています。
AutoCodeBenchの主な機能
- 多言語コーディング能力評価このツールは、20種類のプログラミング言語を網羅した3,920問の問題を提供し、大規模モデルの多言語コード生成能力を包括的に測定します。
- 高難易度ベンチマークテストこれは、非常に難易度の高い問題の設計を支援し、複雑なプログラミングタスクにおける大規模モデルの欠点を効果的に特定します。
- パフォーマンスの差が拡大AutoCodeBench-Liteは、異なるモデル間の性能差を増幅し、比較分析を容易にするために、選択問題に基づいて構築されています。
- 基本モデルの評価: 3ショットヒントを使用してAutoCodeBench-Completeを構築し、特に基本モデルのコード生成パフォーマンスを評価します。
- 自動コードデータ生成LLMに基づいてテスト入力を生成し、サンドボックスの助けを借りて出力を取得し、高品質な多言語コード生成データを合成する。
- 多言語コード実行検証30種類以上のプログラミング言語のコンパイルと実行をサポートし、生成されたコードの正しさを検証するMultiLanguageSandboxサービスを提供しています。
AutoCodeBenchの技術的原理
- 自動データ生成AutoCodeGenは、大規模言語モデル(LLM)を用いてテスト入力を生成し、サンドボックス環境に渡します。サンドボックス環境はコードを実行し、テスト出力を返して、高品質なテスト関数を構築します。プログラミング問題は逆順に構築されるため、生成される問題は非常に難易度が高く、多様性に富んでいます。生成されたデータは複数の戦略を用いてフィルタリングされ、高品質、高難易度、実用性がさらに保証されます。
- 多言語対応AutoCodeBenchに収録されている3920問の問題は、20種類のプログラミング言語に均等に分散されており、各言語に十分な評価問題が用意され、偏りのない分布を実現しています。MultiLanguageSandboxは30種類以上のプログラミング言語のコンパイルと実行をサポートし、異なる言語環境における生成コードの正しさとパフォーマンスを検証することで、複数の言語にわたるモデルのパフォーマンスを正確に評価できます。
- 難易度と実用性が高い逆順問題構築とポリシーフィルタリングに基づき、生成される問題は非常に難易度が高く、複雑なプログラミングタスクにおけるモデルのパフォーマンスを効果的に評価できます。生成された問題は難易度が高く、実用的な応用価値があり、現実世界のプログラミングシナリオにおける複雑な問題を反映しているため、モデルが実際のアプリケーションでより良く機能するのに役立ちます。
AutoCodeBenchプロジェクトのアドレス
- プロジェクト公式サイト:https://autocodebench.github.io/
- GitHubリポジトリ:https://github.com/Tencent-Hunyuan/AutoCodeBenchmark
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/tencent/AutoCodeBenchmark
- arXiv技術論文:https://arxiv.org/pdf/2508.09101
AutoCodeBenchの応用シナリオ
- モデル性能評価多言語プログラミングタスクにおける大規模モデルのコード生成能力を包括的に測定するために使用され、モデルの長所と短所を特定するのに役立ちます。
- データセットの構築と最適化高品質で難易度の高いコード生成データセットを生成し、カスタムデータセットの構築をサポートし、モデルのトレーニング性能を向上させます。
- 多言語能力の検証さまざまなプログラミング言語(低リソース言語を含む)における大規模モデルの性能を検証し、多言語プログラミング機能に関する研究を促進する。
- モデルのトレーニングと検証トレーニングデータの補足として、複雑なプログラミングタスクにおけるモデルのパフォーマンスを向上させ、トレーニング効果を定期的に検証します。
- 学術および産業用途これは、学術研究のための標準化されたベンチマークを提供し、産業現場におけるコード生成ツールの開発と最適化を支援する。