AB
AiBoss
project

FullStack Bench - ByteDanceとM-A-Pコミュニティによってオープンソース化された、新しいコード評価ベンチマーク。

FullStack Benchは、ByteDanceのDoubao Big ModelチームとM-A-Pコミュニティが共同で立ち上げた新しいコード評価ベンチマークで、フルスタックプログラミングと多言語プログラミングスキルを評価することに重点を置いています。FullStack Benchは、11種類以上の実際のプログラミング言語を網羅しています。

FullStack Benchとは何ですか?

FullStack Benchは、ByteDanceのDoubao大規模モデルチームとM-A-Pコミュニティが共同で立ち上げた新しいコード評価ベンチマークで、フルスタックプログラミングと多言語プログラミング能力の評価に重点を置いています。FullStack Benchは、11以上の実際のプログラミングシナリオを網羅し、3374問の設問と16のプログラミング言語を扱い、大規模モデルの実際のコード開発能力をより効果的に測定できます。実際のプログラミングアプリケーションをシミュレートすることに基づき、FullStack Benchは包括的かつマルチドメインな評価プラットフォームを提供し、コードインテリジェンス技術の発展に貢献します。

FullStack Benchの主な機能

  • 総合評価FullStack Benchは、基本的なプログラミング、データサイエンス、機械学習、その他の分野を含む、さまざまな実際のプログラミングシナリオにおいて、大規模言語モデル(LLM)の能力を評価することができます。
  • 多言語対応対象となるプログラミング言語は広く使われている16種類であり、評価結果の普遍性と実用性を高めている。
  • 実世界の応用シナリオシミュレーションStack Overflowなどのコミュニティから抽出した質問に基づいて、実際のプログラミング問題をシミュレートすることで、評価の妥当性と実用的な価値を確保します。
  • コード品質管理各問題には、問題の説明、解答例、および評価の正確性と信頼性を確保するための単体テストケースが含まれています。

FullStack Benchの技術的原理

  • データセットの構築私たちはStack Overflowなどの技術系コミュニティにおける質問の分布を分析し、一般的な実世界のプログラミング応用分野を抽出し、複数の質問を含むデータセットを構築しました。
  • 手動による注釈と検証手動による注釈付けと検証プロセスに基づき、問題の説明の正確性や参照ソリューションの正当性など、各問題の品質を保証します。
  • 単体テストケースモデルによって生成されたコードが期待どおりの性能を発揮するかどうかを自動的に検証するために、各問題に対する単体テストケースを設計します。
  • 多言語プログラミング能力評価実際の設計指示とそれに対応する単体テストケースに基づいて、さまざまなプログラミング言語におけるモデルのパフォーマンスを評価する。
  • サンドボックス実行環境SandboxFusionは、複数のプログラミング言語とパッケージをサポートするサンドボックス実行ツールであり、コード実行のための安全で隔離された環境を提供します。

FullStack Benchプロジェクトのアドレス

FullStack Benchの応用シナリオ

  • コードのインテリジェント評価FullStack Benchを使用して、コード生成、理解、デバッグなどのタスクにおける大規模言語モデルのパフォーマンスをテストおよび評価します。
  • 教育と訓練データセットから得られる実際のプログラミング問題を教材として活用することで、学生はプログラミングの概念を理解し、プログラミングスキルを練習することができる。
  • 研究開発これは、研究者に対し、コードに関連するAI技術を実験し、改良するための標準化されたテストプラットフォームを提供する。
  • ソフトウェア開発テストFullStack Bench を使用すると、ソフトウェア開発サイクル中にコード品質テストを自動化し、潜在的な欠陥を事前に特定できます。
  • 多言語プログラミング能力評価技術系人材の採用およびキャリア開発の一環として、開発者の様々なプログラミング言語における熟練度を評価する。