AB
AiBoss
project

PlanningBench - TencentのHunyuanなどのオープンソースプラットフォームから提供される、大規模な計画策定能力評価フレームワーク。

PlanningBenchは、テンセント渾源チームが中国人民大学高陵人工知能学院をはじめとする複数の機関と共同で開発したオープンソースのフレームワークです。大規模言語モデルのプランニング能力の評価とトレーニングに重点を置いています。

PlanningBenchとは何ですか?

PlanningBenchは、テンセントのHunyuanチームが中国人民大学高嶺人工知能学院などの機関と共同で開発したオープンソースフレームワークです。大規模言語モデルのプランニング能力の評価とトレーニングに重点を置いています。このフレームワークは、現実世界のシナリオを基に、6つのカテゴリと30以上のプランニングタスクを網羅する検証可能なデータ生成システムを構築します。制約駆動型のクローズドループ合成プロセスを通じて、モデルプランニングの結果を、妥当に見えるものから真に実行可能なものへと進化させます。

PlanningBenchの主な機能

  • 現実世界のシナリオを網羅これは、スケジュール編成、資源配分、人員配置計画、ルート計画、生産運用、緊急サービスという6つの主要カテゴリにわたる30以上の具体的な計画タスクを網羅しています。
  • 3層制約システム計画の難易度は、基本的な制約、中程度の制約、難しい制約に分類され、タスクの難易度をより細かく制御することが可能になります。
  • 自動検証メカニズム各インスタンスには、平均合格率と全合格率の両方の評価指標をサポートする実行可能なチェックリストが付属しています。
  • 閉ループデータ生成このシステムは、閉ループプロセスを通じてデータの難易度を自動的に上げていきます。ジェネレーターが質問を生成し、レスポンダーがそれに答えようと試み、クリティックが回答を検証します。
  • トレーニング信号出力検証可能なサンプルは強化学習のトレーニングに直接使用でき、モデルの計画能力に対する安定した最適化シグナルを提供する。

PlanningBenchの技術原則

  • 実世界シーンの抽象化と制約システムの構築PlanningBenchは、経験豊富なアノテーターとアルゴリズム研究者の協力によって開発されます。個人の通勤、企業の生産スケジューリング、医療上の緊急事態といった現実世界のシナリオから、再利用可能な問題構造を抽象化し、最終的に6つの主要な計画タスクファミリーと30種類以上の具体的なタスクタイプを形成します。制約は、基本的な制約(時間枠、リソースの境界)、中程度の制約(多目的最適化、依存関係)、および困難な制約(異常復旧、目的の競合)の3つのレベルに分けられます。これにより、構造化された設計空間でタスクと制約を組み合わせるデータ生成が可能になります。
  • 制約駆動型閉ループ合成プロセスこのフレームワークの中核は、ジェネレーター、レスポンダー、クリティックという3つの役割が連携するクローズドループシステムです。ジェネレーターは、サンプリングされたタスクと制約に基づいて、自己完結型の計画問題とそれに対応する検証リストを生成します。レスポンダーモデルは、解決策の生成を試みます。クリティックは、チェックリストの各項目をチェックし、回答がすべての要件を満たしているかどうかを確認します。要件を満たしている場合は難易度を上げ、そうでない場合は、挑戦的なサンプルとして保持します。これにより、PlanningBenchは、モデルの能力の限界を積極的に見つけることができる動的なデータ生成システムとなります。
  • 3段階の難易度制限システムPlanningBenchは、計画の難易度をタスク構造、制約階層、リソース負荷、目標の競合、依存関係、異常処理などの要素に分解します。制約プールのサンプリング分布を制御することで、生成されるデータの難易度を調整します。基本的な制約はソリューションの整合性と実行可能性を保証し、中程度の制約は公平性と負荷分散の要件を導入し、難しい制約は実行不可能性の特定、最小限の変更による再計画、堅牢な設計におけるモデルの能力をテストし、難易度の上昇が計画推論の深さに真に影響を与えることを保証します。

PlanningBenchの使い方

  • リソースを入手するGitHubリポジトリにアクセスしてコードをクローンするか、HuggingFaceからデータセットをダウンロードしてください。
  • 運用評価PlanningBenchの評価セットを読み込み、モデルを呼び出して計画案を生成し、組み込みのチェックリストを使用して平均合格率と全合格率の指標を自動的に計算します。
  • カスタマイズされたデータを生成するタスクの種類と制約レベルを設定し、クローズドループ生成プロセスを実行し、必要に応じて特定の難易度とドメインの計画データとトレーニングデータを生成します。
  • トレーニングモデル生成された検証可能なサンプルは、強化学習を通じてターゲットモデルを訓練するための報酬信号として使用され、その後、下流の計画タスクに転送されます。

PlanningBenchの主な利点

  • 検証可能性自動チェックリストを使用して、ソリューションがグローバルに実行可能かどうかを正確に判断します。
  • 難易度は調整可能ですタスクの難易度は、単にプロンプトの長さを増やすのではなく、制約の階層に基づいて調整されるため、実際のプランニングの複雑さにより近いものとなっている。
  • 正確な診断平均合格率と全合格率のデュアル指標は、「部分的に正しいが、全体的には実行不可能な」モデル出力を特定することができる。
  • 研修の移転外部計画ベンチマークや一般的な指示遵守タスクにおけるモデルの性能を向上させるためのトレーニングには、わずか300個のサンプルで十分です。
  • リアルなシーンモデルが固定された問題バンクに過学習するのを避けるため、タスクは通勤、生産スケジューリング、医療派遣といった現実世界のシナリオから導き出されています。

PlanningBenchプロジェクトのアドレス

  • GitHubリポジトリ:https://github.com/Tencent-Hunyuan/PlanningBench
  • ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/tencent/PlanningBench
  • arXiv技術論文:https://arxiv.org/pdf/2605.20873

PlanningBenchと類似製品との比較

寸法 PlanningBench AgentBench
コアポジショニング 大型モデルに焦点を当てる計画能力評価と研修の枠組みは、「一見妥当に見える」ものから「真に実現可能な」ものへと移行することを重視します。 包括的な大型モデルインテリジェントエージェントの機能評価フレームワークは、推論、意思決定、ツールの使用、環境との相互作用など、複数の側面を網羅している。
タスク範囲 本書は、スケジュール編成、資源配分、人員配置計画、ルート配分、生産業務、緊急サービスなど、6つの主要カテゴリにわたる30以上の実際の計画タスクを網羅しています。 オペレーティングシステム、データベース、ナレッジグラフ、デジタルカード、水平思考、家族管理、オンラインショッピング、ウェブブラウジングなど、8つのインタラクティブな環境を網羅しています。
検証メカニズム 各インスタンスには構造化されたチェックリストが付属しており、制約条件の充足度を項目ごとに自動的に検証し、ソリューションがグローバルに実行可能かどうかを正確に判断します。 タスクの成功は、環境実行時のフィードバックと結果を照合することによって判断されます。異なる環境には、それぞれ独立した検証ロジックがあります。
評価指標 我々は、Avg-pass(局所的な制約充足率)とAll-pass(全体的な実行可能性率)という2つの指標を用いて、「局所的には正しいが、全体的には実行不可能な」出力を特定します。 成功率が主に用いられ、タスクの最終的な完了率を測定するために、8つの環境ごとに統計データが個別に収集される。
難易度調整 3層構造の制約システム(基本/中級/上級)と閉ループ型の難易度向上メカニズムにより、制約の結合度とリソース競合の強度が積極的に調整されます。 難易度は、複数回のインタラクション(5~50ラウンド)と段階的に増加する環境の複雑さによって高められ、制約の密度よりもインタラクションの深さに重点が置かれる。
環境との相互作用 静的プログラミング問題を解決する場合、このモデルは外部環境とリアルタイムでやり取りすることなく、明示的な入力に基づいて完全な解を生成します。 このモデルは、シミュレーション環境(bashターミナル、ブラウザ、データベースなど)とリアルタイムでやり取りし、動的にフィードバックを取得する必要があります。
トレーニングサポート 本システムはトレーニングをネイティブにサポートしており、検証可能なデータをGRPOなどの強化学習の報酬信号として直接使用したり、外部ベンチマークに転送したりすることができます。 主に評価目的で使用されるこのフレームワーク自体は、拡張可能なトレーニングデータ生成機能を直接提供するものではありません。

PlanningBenchの応用シナリオ

  • モデル機能診断制約推論、リソース割り当て、状態追跡などのコアプランニング機能における大規模モデルの欠点を正確に特定する。
  • エージェントトレーニングAIエージェントに検証可能な計画データとトレーニングデータを提供することで、スケジューリングや物流などのタスクにおける信頼性を向上させる。
  • 学術研究計画能力研究のためのベンチマークツールとして、再現性と拡張性のあるモデル比較実験をサポートします。
  • エンタープライズスケジューリング最適化このフレームワークは、特定のビジネスシナリオ(看護師の勤務スケジュール作成や生産スケジュール作成など)に関する評価データを生成し、モデル導入の実現可能性を評価する。
  • 教育グループ分けと資源配分複数の制約条件下におけるモデルの公平性と最適性は、生徒のグループ分けや教材の配布といった課題を用いて検証された。