project
WorldSense ― 上海交通大学と共同で小紅書が立ち上げた、包括的なマルチモーダル評価のための新たなベンチマーク。
Xiaohongshuと上海交通大学が開発したWorldSenseは、実世界のシナリオにおける視覚、聴覚、テキスト入力のマルチモーダル大規模言語モデル(MLLM)の総合的な理解能力を評価するために使用されるベンチマークテストです。WorldSenseは…
WorldSenseとは何ですか?
シャオホンシュと上海交通大学が開発したWorldSenseは、現実世界のシナリオにおける視覚、聴覚、テキスト入力のマルチモーダル大規模言語モデル(MLLM)の総合的な理解能力を評価するためのベンチマークテストです。WorldSenseには、8つの主要ドメインと67のサブカテゴリを網羅する1662本の多様な音声・映像同期ビデオと、26種類の認知タスクを含む3172組の多肢選択式問題と解答が含まれています。WorldSenseは音声情報と映像情報の密接な連携を重視しており、すべての問題で正解にたどり着くには両方のモダリティが必要です。WorldSenseの高品質なアノテーションは、80名の専門アノテーターによって手作業で作成され、正確性と信頼性を確保するために複数回の検証を受けています。
WorldSenseの主な機能
- マルチモーダルな共同評価このアプローチは、音声情報と映像情報の密接な連携を重視し、正しく回答するために視覚情報と聴覚情報の両方を必要とする問題を設計します。また、マルチモーダル入力下でのモデルの理解能力を厳密にテストし、モデルが異なるモダリティからの情報を効果的に統合して正確な理解を実現できることを確認します。
- 多様なビデオとタスクの報道WorldSenseには、8つの主要分野と67のサブカテゴリを網羅する1,662本の多様な音声・映像同期動画と、26種類の認知課題を網羅する3,172組の多肢選択式問題と解答が含まれています。
- 高品質な注釈と検証すべての質問と回答のペアは、80名の専門アノテーターによって手動で注釈が付けられ、注釈の正確性と信頼性を確保するために、手動レビューや自動モデル検証を含む複数回の検証が行われました。
WorldSenseの技術的原理
- マルチモーダル入力処理WorldSenseでは、モデルが動画、音声、テキスト入力を同時に処理することが求められます。動画と音声の同期により、モデルは視覚情報と聴覚情報の相関関係を捉えることができ、シーンをより包括的に理解することが可能になります。マルチモーダル入力処理能力は、モデルが人間のように複雑な環境を処理できるかどうかを評価する上で重要な要素です。
- タスクの設計と注釈:綿密に設計された質問と回答のペアに基づき、各質問は正解にたどり着くためにマルチモーダル情報の統合を必要とします。注釈付けプロセスでは、質問の妥当性と注釈の正確性を確保するために、複数回の手動レビューと自動検証が行われます。
- マルチモーダル融合と推論本研究では、多様なタスク設計に基づき、基本的な知覚(音声要素や視覚要素の検出など)、理解(マルチモーダルな関係性の把握)、推論(因果推論や抽象的思考など)といった様々なレベルで、モデルのマルチモーダル理解能力を評価します。この多段階評価手法により、モデルのマルチモーダル融合能力と推論能力を包括的に検証します。
- データ収集とフィルタリングWorldSenseのデータ収集プロセスには、大規模なビデオデータセットから音声と映像の相関性が高いビデオクリップをフィルタリングすること、人間のレビューを通じてビデオコンテンツの品質と多様性を確保すること、そしてベンチマークが幅広い現実世界のシナリオを網羅することが含まれます。
WorldSenseプロジェクトの住所
- プロジェクト公式サイト:https://jaaackhongggg.github.io/WorldSense/
- GitHubリポジトリ:https://github.com/JaaackHongggg/WorldSense
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/honglyhly/WorldSense
- arXiv技術論文:https://arxiv.org/pdf/2502.04326
WorldSenseの応用シナリオ
- 自動運転これは、自動運転システムが交通環境における視覚情報と聴覚情報をより正確に理解するのに役立ち、意思決定の精度を向上させます。
- スマート教育教育ツールが教育ビデオコンテンツを理解し、個別学習を支援する能力を評価し、改善すること。
- インテリジェントモニタリング監視システムが動画内の視覚情報および音声情報を認識・理解する能力を高め、それによってセキュリティ検知の有効性を向上させる。
- インテリジェントな顧客サービスインテリジェントな顧客サービスシステムが、ユーザーの音声、表情、テキスト入力を理解する能力を評価し、インタラクティブな体験を最適化する。
- コンテンツ作成これは、マルチメディアコンテンツの作成および分析システムがビデオコンテンツをよりインテリジェントに理解するのに役立ち、作成と推薦の効率を向上させます。