AB
AiBoss
project

MMSI-Video-Bench - 上海AIラボが発表した空間インテリジェントビデオベンチマーク

MMSI-Video-Benchは、ビデオ空間インテリジェンスにおけるマルチモーダル大規模言語モデル(MLLM)の能力を評価するためのベンチマークツールです。上海人工知能研究所と複数の大学が共同開発したこのツールは、現実世界のシナリオにおけるモデルを包括的に評価します。

MMSI-Video-Benchとは何ですか?

MMSI-Video-Benchは、ビデオ空間インテリジェンスにおけるマルチモーダル大規模言語モデル(MLLM)の能力を評価するためのベンチマークツールです。上海人工知能研究所と複数の大学が共同で開発したこのツールは、現実の物理世界におけるモデルの空間理解と推論能力を包括的に評価します。ベンチマークには、25の公開データセットと1つの独自データセットから1278のビデオクリップが含まれており、屋内シーン、屋外の街路シーン、ロボット操作など、さまざまな複雑なシナリオを網羅しています。問題は、11人の3Dビジョン研究者によって綿密に設計され、高い難易度と精度が保証されています。MMSI-Video-Benchは、空間知覚、動きの理解、計画、予測、ビデオ間推論能力を含むマルチレベルのタスク設計を採用し、モデルのビデオ理解と意思決定能力を包括的に検証します。

MMSI-Video-Benchの主な機能

  • マルチモーダル能力評価これは、ビデオ空間インテリジェンスにおけるマルチモーダル大規模言語モデル(MLLM)の性能を評価するために特別に設計されたベンチマークツールであり、モデルのビデオコンテンツに対する理解力と推論能力を包括的に測定することができます。
  • 多様なデータセットこのデータセットには、25の公開データセットから抽出された1,278本のビデオクリップと、匿名化された140本の内部ビデオが含まれており、屋内シーン、屋外の街路シーン、ロボット操作など、さまざまな複雑なシナリオを網羅しているため、データの多様性と豊富さが保証されています。
  • 高品質な注釈すべての問題は3Dビジョン専門家によって設計および注釈付けされており、各問題には注釈の正確性と高品質を保証するための詳細な説明が付されています。
  • 包括的なタスク設計空間認識、動作理解、計画立案、予測、クロスビデオ推論などの機能を網羅する多層的なタスクフレームワークを通して、ビデオ空間インテリジェンスにおけるモデルの性能を包括的に検証する。
  • モデル性能測定本書は、25種類のオープンソースおよびプロプライエタリなMLLM(機械学習モデル)の詳細な評価結果を提供し、研究者や開発者がモデルの長所と短所を理解し、モデルの改善と最適化を導くのに役立ちます。

MMSIビデオベンチの技術原理

  • 現実世界のシナリオに基づいてこれは、現実世界の動的なビデオデータを使用することで、テンプレート生成への依存を排除し、不確実性と多様性に満ちたテスト環境を構築する。
  • マルチモーダル融合このモデルは、動画から得られる視覚情報、言語情報、その他のモダリティ情報を統合するため、時空間次元における主要なイベントの発生ノードと空間的関係を正確に捉える必要がある。
  • タスク設計知覚、計画、予測、およびビデオ間推論という4段階のフレームワークに基づいて、時間、視点、および対象物を横断する多次元推論タスクが設計された。
  • 専門家による注釈各問題は、正確性と明確性を確保するために、3Dビジョン専門家によって慎重に設計およびレビューされています。
  • 動的テスト環境現実世界のシナリオから自然な挙動や物理法則を導入して問題を生成することで、モデルはビデオ内の物体の空間的な関係、運動軌跡、そして根底にある因果関係を深く理解せざるを得なくなる。
  • きめ細かな注釈システム基本的な空間関係から高度な因果推論まで、多段階の認知タスクを網羅する、きめ細かな注釈システムが構築された。

MMSI-Video-Benchプロジェクトのアドレス

  • プロジェクト公式サイト:https://rbler1234.github.io/MMSI-VIdeo-Bench.github.io/
  • GitHubリポジトリ:https://github.com/InternRobotics/MMSI-Video-Bench
  • ハグフェイスモデルライブラリ:https://huggingface.co/datasets/rbler/MMSI-Video-Bench
  • arXiv技術論文:https://arxiv.org/pdf/2512.10863

MMSI-Video-Benchの応用シナリオ

  • モデル性能評価これは、動画理解タスクにおけるマルチモーダル大規模言語モデル(MLLM)の性能を包括的に評価するために使用され、研究者や開発者がモデルの長所と短所を理解するのに役立ちます。
  • 学術研究これは、学術コミュニティに対し、ビデオ空間インテリジェンスにおけるマルチモーダルモデルの性能を研究・向上させるための標準化されたテストプラットフォームを提供する。
  • 技術開発これは、開発者がマルチモーダルモデルを最適化および改善するのに役立ち、特に空間認識、動作理解、計画、予測といった主要な機能において効果を発揮します。
  • 産業用途テストこれは、自動運転、ロボットナビゲーション、インテリジェントモニタリングなどの分野に適しており、実際のアプリケーションシナリオにおけるモデルの性能をテストするために使用されます。
  • 教育と訓練教育リソースとして、学生や研究者がマルチモーダル動画理解技術をより深く理解し、実践するのに役立ちます。
  • モデル比較分析これは、さまざまなマルチモーダルモデルに対して統一されたテストベンチマークを提供し、横断的な比較や性能分析を容易にします。