project
General365は、Meituan LongCatチームがオープンソース化した汎用推論ベンチマークです。
General365は、Meituan LongCatチームがオープンソース化した汎用推論ベンチマークです。365のオリジナル問題と1095の拡張版問題が含まれており、推論課題の8つの側面を網羅しています。
General365とは何ですか?
General365は、MeituanのLongCatチームが開発したオープンソースの汎用推論ベンチマークです。365のオリジナルのシード問題と1095の拡張バリエーションが含まれており、推論課題の8つの側面を網羅しています。このベンチマークは、知識範囲をK-12レベルに厳密に限定し、大規模モデルの推論能力を専門知識への依存から切り離し、日常的なシナリオにおけるモデルの一般的な論理推論レベルを現実的に評価します。実際のテストでは、26の主流の大規模モデルのうち、Gemini 3 Proのみが62.8%の精度を達成し、大多数のモデルは合格点である60%に達しませんでした。
General365の主な機能
-
高度な多様性評価人間のエンジニアによって作成された365のオリジナル問題と、8つの次元(複雑な制約、分岐列挙、時空間推論、再帰的バックトラッキング、意味的干渉、暗黙の情報、最適戦略、確率的不確実性)を網羅する1095のバリエーション。
-
推論と知識の分離背景知識を小中高レベルに限定し、知識の想起能力ではなく、純粋に論理的推論能力を測定する。
-
ハイブリッド採点システムルールベースのスコアリングとモデルスコアリング(GPT-4.1)を組み合わせることで、手動検証スコアリングの精度は99.6%に達した。
-
公開サブセットと非公開テストセット全720問のうち、180問のシード問題とそのバリエーションが公開されました。残りの問題は、データ破損を防ぐための非公開テストセットとして使用されます。
-
マルチモデル横断評価OpenAI、Gemini、Anthropic、DeepSeek、Qwen、GLM、Kimi、LongCatなど、26種類以上のモデルの推論能力を標準化された方法で評価することをサポートします。
General365の技術原則
-
一般的な推論を分析するための8つの側面一般的な推論問題は8つの主要な課題タイプに分類され、各問題は少なくともそのうちの1つに対応しており、問題の約70%は2つ以上のカテゴリタグが付いています。
-
テンプレートや丸暗記は避けるt-SNE意味分布検証とGemini 3 Pro推論パス類似度スコアリングを用いることで、質問の論理的独立性を確保し、モデルが「テンプレートを記憶する」ことでスコアリングを行うことを防ぎます。
-
フィルタリングと手動レビューの難易度すべての問題は、難易度の絞り込み、多様性の拡大、モデルの拡張、および手動レビューを経て、最終的に1460の質の高い問題となりました。
-
ハイブリッド採点フレームワーク数値問題はmath-verifyツールを用いて分析・検証され、多肢選択問題とテキスト問題はGPT-4.1モデルを用いて採点された。
General365の主な利点
-
真の推論能力に焦点を当てるAIMEやIMOのような分野別競技とは異なり、General365は日常的な一般論理に焦点を当て、「高得点だが性能が低い」大規模モデルの欠点を浮き彫りにする。
-
高い差別最先端(SOTA)モデルはかろうじて合格点に達しており、既存のベンチマーク(BBHやBBEHなど)の性能飽和や識別不能の問題を回避している。
-
精査に耐えうる多様性意味分布は均等に分布しており、論理的独立性はBBHやBBEHよりもはるかに高い。
-
オープンソースで再現可能GitHubリポジトリには完全な評価コードが提供されており、コミュニティによる迅速な統合と再現を支援します。
General365のプロジェクトアドレス
- プロジェクト公式サイト:https://general365.github.io/
- GitHubリポジトリ:https://github.com/meituan-longcat/General365
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/meituan-longcat/General365_Public
- arXiv技術論文:https://arxiv.org/pdf/2604.11778
General365製品と類似競合製品との比較
| 寸法 | General365 | BBH (Big-Bench Hard) | BBEH (Big-Bench Extra Hard) |
|---|---|---|---|
| 評価の焦点 | 一般推論(K-12レベルの知識) | 統合タスク推論 | 難易度の高い総合的な課題 |
| 質問数 | 種子365種+変異種1095種 | 23のタスク | マルチタスク拡張機能 |
| 多様性 | 極めて高い(意味分布が均一で、論理的独立性が高い) | 低い(有意なクラスターが存在する) | 低(テンプレートを多用) |
| 難易度判別 | 高い(SOTAのみ62.8%) | 低(パフォーマンス飽和) | 中くらい |
| 採点方法 | ハイブリッドスコアリング(ルール+モデル、精度99.6%) | ルールに基づいた採点 | ルールに基づいた採点 |
| データ開示戦略 | 半公開(公開問題180問+非公開テストセット) | 完全に開いた状態 | 完全に開いた状態 |
General365のアプリケーションシナリオ
-
大規模モデルの開発と評価これは、モデル開発者が推論能力の弱点を特定し、複雑な制約、意味的干渉、最適戦略などの弱い側面を最適化するのに役立ちます。
-
モデル選択リファレンスこれは、企業ユーザーがより高度な推論能力を備えた商用モデルまたはオープンソースモデルを選択できるよう、客観的なデータサポートを提供する。
-
学術研究: 一般的な推論分野のための標準化された評価ツールを提供し、LLMが「主題専門家」から「一般的な推論者」へと進化することを促進する。
-
推論効率分析モデルの精度と出力トークン数の関係を分析し、推論効率を評価する機能をサポートしています。