AB
AiBoss
project

UNO-Bench - Meituan LongCatのフルモダリティ大規模モデル評価ベンチマーク

UNO-Benchは、MeituanのLongCatチームが開発した、フルモーダルな大規模モデル評価ベンチマークです。既存の評価システムの欠点を克服するため、UNO-Benchは高品質で多様なデータを用いて、モデルのシングルモーダル性能とフルモーダル性能を正確に測定します。

UNO-Benchとは何ですか?

UNO-Benchは、Meituan LongCatチームが開発したマルチモーダル大規模モデル評価ベンチマークです。既存の評価システムの欠点を克服するため、UNO-Benchは高品質で多様なデータ構築を通じて、モデルのシングルモーダルおよびマルチモーダルな能力を正確に測定します。このベンチマークは、マルチモーダル大規模モデルの「組み合わせ法則」を初めて検証し、シングルモーダル能力とマルチモーダル能力の複雑な関係性を明らかにします。UNO-Benchの革新的な多段階オープンエンド質問と効率的なデータ圧縮アルゴリズムは、評価の識別力と効率性を向上させ、マルチモーダル大規模モデルの開発を促進する科学的な評価ツールを提供します。

UNO-Benchの主な機能

  • 正確な評価モデル機能高品質で多様なデータセットを使用して、画像、音声、動画、テキストなどの単一モダリティおよびマルチモダリティのタスクにおけるモデルのパフォーマンスを測定します。
  • 能力の組み合わせの法則を明らかにする本研究は、フルモーダル大規模モデルの「組み合わせ法則」を検証した初めての研究であり、シングルモーダル機能とフルモーダル機能の複雑な関係を明らかにし、モデル最適化のための理論的根拠を提供するものである。
  • 革新的な評価方法複数ステップの自由回答式質問(MO)を導入することで、複雑な推論タスクにおけるモデルの能力低下を効果的に評価し、モデルの推論の深さを正確に区別することができる。
  • 効率的なデータ管理クラスター誘導型層化サンプリングを用いることで、モデルランキングの高い一貫性を維持しながら、評価コストを大幅に削減できる。
  • マルチモーダル融合研究を支援するこれは研究者に統一された評価フレームワークを提供し、マルチモーダルな大規模モデルの開発を促進し、将来的にさらに強力なモデルが出現する余地を残している。

UNOベンチの技術原理

  • 統合能力システムこのモデルの機能は、知覚層と推論層に分けられます。知覚層は基本的な認識機能と異種モダリティ間のアライメント機能を担い、推論層は空間推論や時間推論といった高次のタスクを担います。この二次元的なフレームワークは、データ構築とモデル評価のための明確な設計図となります。
  • 高品質なデータ構築
    • データ収集とラベル付け手作業による注釈付けと複数回にわたる品質チェックを通じて、データの高品質と多様性を確保しています。データの90%以上は独自のオリジナルデータであり、データの汚染を防いでいます。
    • クロスモーダルな解決可能性モーダルアブレーション実験を通して、問題の98%以上はマルチモーダル情報に頼ることでしか解決できないことを確認し、シングルモーダル情報の冗長性を回避します。
    • 視聴覚分離と再結合音声コンテンツを独自に設計し、それを視覚素材と手動で組み合わせることで、情報の冗長性を解消し、モデルに真のクロスモーダル融合を実行させる。
    • データ最適化と圧縮この手法は、クラスター誘導型層化サンプリングを用いて大規模データから代表的なサンプルを選択することで、モデルランキングの一貫性を維持しながら評価コストを削減する。
  • 革新的な評価方法このアプローチでは、複雑な推論タスクを複数のサブ質問に分解し、モデルに自由記述式のテキスト回答を要求します。専門家による加重スコアリングにより、モデルの推論能力を正確に評価します。質問タイプを細分化し、複数回の注釈反復を行うことで、さまざまな質問タイプに対して最大95%の精度で自動スコアリングを実現します。
  • 結合法則の検証回帰分析とアブレーション実験を通して、フルモーダル性能は単一モーダル性能の単純な線形重ね合わせではなく、べき乗則に基づく相乗効果原理に従うことが明らかになった。この非線形関係は、モデル融合効率を評価するための新たな分析パラダイムを提供する。

UNOベンチプロジェクトの住所

  • プロジェクト公式サイト:https://meituan-longcat.github.io/UNO-Bench/
  • GitHubリポジトリ:https://github.com/meituan-longcat/UNO-Bench
  • ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/meituan-longcat/UNO-Bench
  • arXiv技術論文:https://arxiv.org/pdf/2510.18915

UNO-Benchの応用シナリオ

  • モデル開発と最適化これは、開発者がモデルアーキテクチャを最適化し、マルチモーダル融合機能を向上させるのに役立つ標準化された評価ツールを提供する。
  • 産業応用評価これは、インテリジェントな顧客サービスや自動運転などの分野で、マルチモーダルなインタラクションシナリオにおけるモデルのパフォーマンスを評価し、ユーザーエクスペリエンスを最適化するために使用できます。
  • 学術研究と競争統一された学術評価基準として、モデル性能比較やマルチモーダル競争を支援し、技術的ブレークスルーを促進する。
  • 製品開発と市場評価これは企業が製品の機能性や市場競争力を評価するのに役立ち、マルチモーダル製品の開発のための科学的根拠を提供する。
  • クロスモーダルアプリケーション開発マルチメディアコンテンツの作成とインテリジェントなセキュリティをサポートし、マルチモーダルアプリケーションのパフォーマンスと信頼性を向上させます。