AB
AiBoss
project

CL-bench - テンセントの姚俊宇チームが開発した、モデル学習能力を評価するためのベンチマーク。

CL-benchは、テンセント渾源と復旦大学が共同で開発した、文脈学習能力を評価するベンチマークです。大規模な言語モデルが、新しい文脈情報から知識をリアルタイムで学習し、応用する能力を測定できます。

CL-benchとは何ですか?

テンセント渾源と復旦大学が共同で立ち上げたCL-benchは、文脈学習能力を評価するためのベンチマークです。これは、大規模言語モデルが全く新しい文脈情報からリアルタイムで知識を学習し適用する能力を測定します。CL-benchベンチマークには、専門家が綿密に構築した500の複雑なシナリオと1899のタスクが含まれており、ドメイン知識推論、ルールシステム適用、手続き型タスク実行、経験発見とシミュレーションの4つの主要カテゴリを網羅しています。テスト結果によると、最も強力なモデルであるGPT-5.1でも解決率はわずか23.7%にとどまり、現在のAIがリアルタイムで学習できないという根本的なボトルネックが明らかになり、モデル最適化の新たな方向性が示されました。

CL-benchの主な機能

  • リアルタイム学習能力評価これは、大規模言語モデルが新しい文脈情報から知識を学習し、リアルタイムで適用する能力を評価するのに役立ちます。
  • 大規模なテストセットの構築テストセットには、500の複雑なシナリオ、1899のタスク、および31607の検証基準が含まれており、ドメイン知識推論、ルールシステム適用、手続き型タスク実行、経験発見とシミュレーションという4種類の現実世界のシナリオを網羅しています。
  • 汚染のないデータ設計この設計では、データの新規性を確保するために汚染のないアプローチを採用し、架空の作成、既存コンテンツの修正、ニッチなコンテンツや新興コンテンツの統合を通じて、モデルがメモリベースの非学習的手法に依存して問題を解決することを防ぎます。
  • シリアル依存性検証この研究では、モデルがシーケンス依存型のタスクにおいて複数ラウンドの推論を実行できる能力を検証し、タスクの51.1%が以前の相互作用結果に基づいた後続の推論を必要とすることが明らかになった。
  • 多次元評価システムこのシステムは、タスクごとに平均16.6の評価基準を持つ多次元評価システムを提供し、複数の視点からモデルのコンテキスト理解度と適用精度を包括的に検証します。

CLベンチの技術原理

  • 自己完結型コンテキストCL-benchの中核技術は、完全に自己完結型のコンテキスト環境を構築することです。これにより、タスク解決に必要なすべての情報がコンテキスト内で明示的に提供され、外部からの情報取得や隠れた仮説のサポートは不要になります。モデルは事前学習段階で蓄積された内部知識に頼るのではなく、現在の入力に含まれる新しい情報から学習するように促されるため、モデルの記憶能力ではなく、コンテキスト学習能力を真に反映させることができます。
  • 三重の汚染ゼロ戦略汚染のない評価を実現するために、CL-benchは3つの技術戦略を採用しています。専門家が架空の国の完全な法制度を設計したり、独自の構文を持つ新しいプログラミング言語を作成したりするなど、完全に架空のコンテンツを作成します。歴史上の出来事を変更したり、科学的な定義を変更したり、技術文書を改訂したりするなど、現実世界のコンテンツを体系的に変更してバリエーションを作成します。最先端の研究結果や新しくリリースされた製品マニュアルなど、事前学習済みデータセットを代表するものではないニッチなコンテンツや最近登場したコンテンツを組み込みます。
  • 複雑性と検証可能な設計タスク設計において、CL-benchは高い複雑性と逐次的な依存関係を重視しています。タスクの51.1%は複数ラウンドのインタラクションメカニズムを伴い、後続タスクの解決策は以前のインタラクションの結果に依存するため、タスクの難易度が大幅に向上し、現実世界の作業シナリオをシミュレートしています。同時に、各タスクには完全に検証可能な評価基準があり、各コンテキストには平均63.2個の検証基準が関連付けられています。この多面的な評価により、モデルのパフォーマンスを包括的に評価することができ、単一の指標による評価バイアスを回避できます。

CL-benchプロジェクトのアドレス

  • プロジェクト公式サイト:https://www.clbench.com/
  • GitHubリポジトリ:https://github.com/Tencent-Hunyuan/CL-bench
  • ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/tencent/CL-bench

CL-benchの応用シナリオ

  • AIモデル能力評価これは、研究機関や企業に対し、文脈学習能力を評価し、実世界におけるモデルの欠点を正確に特定し、モデル最適化の方向性を導くための標準化されたツールを提供する。
  • 新モデルの開発と検証大規模言語モデルの開発における主要なテストコンポーネントとして、このテストは、単にパラメータの記憶能力を向上させただけでなく、新しいバージョンのモデルが動的情報からの学習という真のブレークスルーを備えているかどうかを検証します。
  • 業界ソリューションの選択これは、企業ユーザーが特定のビジネスシナリオにおけるさまざまな商用モデルのコンテキスト学習性能を評価するのに役立ち、ニーズに合ったAIソリューションを選択するための客観的な基準を提供する。
  • 教育・研修分野教育事例および実験プラットフォームとして、AIの実務家がコンテキスト学習とパラメータ学習の本質的な違いを理解するのに役立ち、現実世界の応用シナリオ向けにモデルを設計および最適化する能力を育成します。
  • 学術研究のベンチマーク学術界に対し、文脈学習に関する統一的な研究基準を提供し、関連分野における比較可能で再現可能な研究成果の形成を促進し、文脈学習の理論と技術の全体的な進歩を加速させることを目的とする。