project
PerceptionBench - 月の裏側発のオープンソース視覚認識診断ベンチマーク
PerceptionBenchは、Dark Side of the Moonが開発したオープンソースの視覚認識診断ベンチマークです。PerceptionBenchは、既存の42の評価セットにおける最先端モデルの失敗事例から10個の基本的な視覚認識能力を要約し、3.0...を構築します。
PerceptionBenchとは何ですか?
PerceptionBenchは、Dark Side of the Moonが開発したオープンソースの視覚認識診断ベンチマークです。PerceptionBenchは、既存の42のベンチマークセットにおける最先端モデルの失敗事例から、10の基本的な視覚認識能力を特定し、推論や外部知識を必要とせずに単一の認識能力のみをテストする3,000個の独立した検証問題を作成します。テスト結果によると、現在主流となっている16のマルチモーダルモデルはいずれも60%の精度を達成しておらず、基本的な視覚認識能力は業界において未解決の問題であることが明らかになりました。
PerceptionBenchの主な機能
-
原子能力診断視覚認識は、視覚的関係、計数、属性、奥行き、位置特定、組み合わせ、きめ細かい認識、文脈、OCR、錯覚など、10個の基本的な機能に分解され、モデルのブレークポイントを正確に特定します。
-
個別評価各問題は単一の原子の能力のみをテストするため、推論や知識による干渉を排除し、スコアが真の知覚レベルを反映するように設計されている。
-
失敗事例の帰属既存の42のベンチマークにおける失敗事例に基づき、1,800個の原子的なサブ問題が分解され、実際のエラーから評価次元が抽出された。
-
総合的な能力プロファイルリーダーボードには、モデルの10の機能に関する詳細なスコアが表示され、合計スコアは似通っているにもかかわらず、機能の分布が大きく異なることが明らかになります。
- オープンソースで再現可能完全なコード、ハグ顔データセット、および論文を提供し、コミュニティによる再現と拡張を支援します。
PerceptionBenchの技術原理
-
ボトムアップエラー分類42の既存ベンチマークにおける最先端MLLMの最も初期の故障点を診断することにより、エラー分類ツリーが構築され、知覚ブランチの10個の原子的な機能が抽出された。
-
難易度区分と能力バランス17,000件以上の検証サンプルからなる内部プールから、能力と難易度に基づいてバランスよく層別化された方法で3,000問が抽出されました。これらの質問のうち60%は不合格事例から派生したサブ質問であり、40%は補足画像に基づいて新たに作成された質問です。
-
簡潔な答えは、明確な設計です。評価の不確実性を減らし、自動評価の信頼性を高めるため、すべての質問には簡潔かつ明確な回答が必要です。
- 知覚と推論の分離問題設計は、推論の連鎖や専門知識ではなく、視覚的知覚そのものから課題が生じるようにすることで、測定知覚の限界を明確にする。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
PerceptionBenchの使い方
-
リポジトリのクローン作成GitHubから取得
MoonshotAI/PerceptionBenchオープンソースコード。 -
データセットをダウンロードHugging Faceから3,000件の検証質問とラベル付きデータを取得する。
-
アクセスモデル評価対象となるマルチモーダルモデルは評価フレームワークに接続され、その結果は標準フォーマットで出力されます。
-
運用評価評価スクリプトを実行して、10個の原子機能と全体的なモデル精度を自動的に計算します。
- 画像を表示モデルの性能をリーダーボードと比較することで、その欠点を特定し、その後のトレーニングと最適化の方向性を定めることができます。
PerceptionBenchの主な利点
-
一般的な得点ではなく、正確な位置取り知覚、推論、知識を混同する従来のベンチマークとは異なり、PerceptionBenchはモデルのどの知覚段階に不具合が生じているかを正確に診断できます。
-
真の失敗から成長するこの評価は、42の主要なベンチマークにおける実際の失敗事例に基づいており、評価結果が実際のモデルの弱点を的確に反映するようにしています。
-
隠れた能力ギャップを明らかにする総合スコアが似ているモデルでも、個々の機能(アトミック機能)は大きく異なる場合があり、PerceptionBenchの機能プロファイルは、総合スコアでは隠されているこうしたギャップを明らかにすることができます。
- まず認識力の発達を促進する業界の焦点を、スコア向上、記憶保持、および認識の基本から、より忠実で一貫性のある視覚的理解能力へと移す。
PerceptionBenchプロジェクトのアドレス
- プロジェクト公式サイト:https://www.kimi.com/blog/perception-bench
- GitHubリポジトリ:https://github.com/MoonshotAI/PerceptionBench
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/moonshotai/PerceptionBench
- 技術論文:https://github.com/MoonshotAI/PerceptionBench/blob/master/paper/PerceptionBench.pdf
PerceptionBenchと類似製品との比較
| 寸法 | PerceptionBench | MMMU / MMBenchなどの包括的なベンチマーク |
|---|---|---|
| 評価目標 | 原子レベルの視覚認知能力診断 | マルチモーダルな理解力と推論能力を統合する |
| 問題のサイズ | 3,000の検証質問 | MMMUは約11,500人、MMBeenは約3,200人以上です。 |
| 困難の原因 | 純粋な視覚知覚そのもの | 知覚、推論、および専門知識の融合 |
| 知識要件 | 外部の知識や複雑な推論は不要です。 | 大学レベルの専門知識と多段階の論理的思考能力が求められる。 |
| 質問設計 | それぞれの質問は、単一の原子の能力のみを抽出している。 | 複数の能力の組み合わせであり、包括的な評価が必要 |
| 質問の出典 | 42のベンチマーク失敗事例の内訳と新しいコンパイル | 大学の教科書、試験、オンラインリソース、ビデオなど |
| 回答形式 | 簡潔明瞭で、評価における曖昧さを軽減する | 選択式問題または記述式問題。中には複雑な導出を必要とするものもある。 |
| 出力値 | 知覚の分岐点を特定するための能力レベルの診断プロファイリング | 総合ランキング、総合レベルを測定 |
| 適用ステージ | モデル開発中の知覚モジュールの最適化 | モデルリリース後の包括的な能力評価 |
| 主な洞察 | 類似した総合得点モデルであっても、能力分布は大きく異なる可能性がある。 | 総合的なモデル性能ランキングとギャップの定量化 |
PerceptionBenchの応用シナリオ
-
モデル開発診断マルチモーダルチームは、トレーニング後にPerceptionBenchを使用してモデルの知覚的な弱点を特定し、それに応じてデータまたはアーキテクチャを最適化します。
-
モデル選択リファレンス企業ユーザーは、自社のビジネスに必要な特定の認識能力に基づいて、また能力プロファイルを参照することで、最適な商用モデルを選択できます。
-
学術研究のベンチマーク:マルチモーダル知覚に関する論文を標準的な評価ツールとして発表し、再現可能な実験環境を提供する。
-
業界の能力基準MLLMの視覚認識能力に関する詳細な業界標準を確立し、広範な「総合スコアランキング」文化に取って代わる。