project
WBench - Meituanのインタラクティブ動画ワールドモデル複数ラウンド評価ベンチマーク
Meituan傘下のLongCatチームが開発したWBenchは、インタラクティブなビデオワールドモデルを対象とした、初の体系的な複数ラウンド評価ベンチマークです。自然、都市、ファンタジーなど6つのテーマを網羅し、289のテストケースと1058のインタラクションラウンドが含まれています。
WBenchとは何ですか?
MeituanのLongCatチームが開発したWBenchは、インタラクティブなビデオワールドモデルを対象とした、初の体系的な複数ラウンド評価ベンチマークです。自然、都市、ファンタジーなど6つのシーンカテゴリと7つのアートスタイルを網羅し、289のテストケースと1058のインタラクションラウンドが含まれています。このベンチマークは、統一されたインタラクティブインターフェースを使用して20の最先端モデルを包括的に分析し、受動的な視聴から能動的なインタラクションまで、その能力の限界を正確に特定するとともに、複数ラウンドのインタラクション、ナビゲーション制御、視点切り替えなどの分野における現在のワールドモデルの根本的な欠点を明らかにします。
WBenchの主な機能
-
多次元世界の定義6種類のシーンタイプ(自然、都市、屋内、作業エリア、ファンタジー、スポーツ)、7種類のアートスタイル(写実主義、アニメーション、漫画、油絵、水墨画、フラットデザイン、スケッチ)、および一人称視点/三人称視点/一人称視点を含む3種類の視点をサポートしています。
-
4種類のコア相互作用ナビゲーション、メインアクション、イベント編集、視点切り替えという4つの操作方法を提供します。
-
統合インタラクションインターフェースAction Routerは、テキストコマンド、6DoF座標、キーボード操作を標準化された入力にマッピングし、さまざまなモデルのネイティブインターフェースに適応します。
-
5次元評価キット採点は、ビデオ品質、設定への準拠、インタラクションへの準拠、一貫性、物理的リアリズムという5つの側面に基づいており、NavScoreやGated Spatial Consistencyといった主要な指標も含まれています。
-
複数回の長期評価長期にわたるインタラクション後のモデルのパフォーマンス劣化を測定するために、継続的な複数ラウンドのインタラクティブテストをサポートします。
WBenchの技術原則
- 4つの主要要素の枠組みWBenchは、ワールド定義、命令セット、統合インタラクションインターフェース、評価スイートというフレームワークに基づいて設計されています。ワールド定義は多様なテスト環境の構築を担当し、命令セットは標準化されたアクション記述を提供します。統合インタラクションインターフェースは、異種入力をアクションルーターを介してモデルが理解できる信号に変換し、評価スイートは5つの次元から定量的な指標を出力して、完全な評価ループを形成します。
- シーンデザインとインタラクションデザインの分離このデザインは、舞台と脚本を分離するというコンセプトを採用しています。シーンとインタラクションは独立して設定でき、自由に組み合わせることができます。この分離により、評価において問題の根本原因を正確に特定することが可能になります。
- 多段階自己回帰フィードバック機構評価プロセスでは自己回帰アプローチを採用しています。各ラウンドの出力フレームが次のラウンドの入力として使用され、現実世界のインタラクションシナリオをシミュレートします。このようにして、WBenchは、複数ラウンド後にナビゲーション能力が平均33ポイント低下するなど、長期的なインタラクションにおけるモデルの累積的な誤差効果を検出できます。
WBenchの使い方
- リポジトリのクローン作成GitHubリポジトリにアクセスし、WBenchコードをローカルマシンにクローンしてから、Pythonの依存関係をインストールしてください。
- データセットをダウンロード289のテストケースと1058回のインタラクションラウンドを含む評価データセットは、HuggingFaceから取得した。
- アクセスモデルアクションルーターは、テスト対象モデルをWBenchの統合型対話型インターフェースに接続し、テキスト入力プロトコルまたはアクション入力プロトコルに対応します。
- シナリオを定義する設定ファイルで、シーンの種類、アートスタイル、メインオブジェクト、および視点を選択します。
- インタラクションを選択ナビゲーション、メインアクション、イベント編集、視点切り替えという4種類のインタラクションを組み合わせて、アクションをテストします。
- 寸法設定5つの次元の評価指標(ビデオ品質、設定準拠、インタラクション準拠、一貫性、物理的真正性)を有効にします。
- 単回テストモデルの基本能力スコアを取得するために、初期フレーム生成と単一ラウンドのインタラクションを実行します。
- 複数回のテスト自己回帰モードを開始し、前のラウンドの出力を次のラウンドの入力として使用し、長期的なパフォーマンスの劣化を測定します。
- バッチ比較複数のモデルを設定して同じテストケースを並行して実行し、横断的な比較データを生成します。
- レポートを表示評価が完了すると、各項目の強みと弱みの分布を直感的に表示するために、レーダーチャートとスコア表が自動的に生成されます。
WBenchの主な利点
-
最初の複数ラウンドの相互作用評価ベンチマーク従来の単発的な動画生成評価とは異なり、WBenchは連続的なインタラクションにおけるモデルのパフォーマンスを体系的に評価する初のツールであり、業界のギャップを埋めるものです。
-
包括的なカバレッジと分離289の事例は、6つの主要なシナリオ、7つのスタイル、5種類の対象を網羅しており、シナリオと相互作用を独立して構成することで、モデルの欠点を正確に特定することができる。
-
異種モデルに対応した統一インターフェースAction Router を介して、テキスト駆動型モデル (Kling 3.0 など) と専用ワールドモデル (HY-World 1.5 など) を適用することで、公平な比較を実現します。
-
業界の重要な洞察を明らかにするこの運転モデルは理解力に優れており、専用の世界モデルはナビゲーションに優れています。ビデオ品質はナビゲーション機能とはほとんど関係がありません。複数回のターン操作が主な課題です。
WBenchプロジェクトの住所
- プロジェクト公式サイト:https://meituan-longcat.github.io/WBench/
- GitHubリポジトリ:https://github.com/meituan-longcat/WBench
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/meituan-longcat/WBench
- 技術論文:https://huggingface.co/papers/2605.25874
WBenchと類似製品との比較
| 寸法 | WBench | WorldScore |
|---|---|---|
| 位置 | 複数ラウンドのインタラクティブビデオワールドモデル評価 | 世界統一評価基準 |
| リリース時間 | 2026-05 | 2025 |
| ケーススケール | 289件の事例、1058回の対話ラウンド | 3000件 |
| インタラクションの種類 | ナビゲーション、メインアクション、イベント編集、視点切り替え | 軌道条件制御、自由相互作用なし |
| 複数回の支援 | ネイティブな複数ラウンド自己回帰評価、長距離減衰分析をサポート | 単一シーン/複数シーンのシーケンス、非インタラクティブ |
| 統合インターフェース | アクションルーター(テキスト/6自由度/離散アクション) | グローバル標準(レイアウト+セマンティクス)を統一する |
| 評価項目 | 映像品質、設定の遵守、インタラクションの遵守、一貫性、物理的リアリズム | 制御性、品質、ダイナミズム |
| 主な機能 | 複数ラウンドの相互作用減衰診断、シーンと相互作用の分離 | 3D/4D/I2V/T2Vにわたる統一評価 |
| オンラインプラットフォーム | オフライン評価スイート + HuggingFaceデータセット | オフラインリーダーボード |
WBenchの応用シナリオ
-
ワールドモデル開発ビデオワールドモデル(Genie、Kling、Wanなど)の標準化された評価ツールを提供し、モデルの反復と最適化を支援します。
-
ナビゲーションと身体化された知能の評価これは、仮想環境におけるモデルのナビゲーションおよび制御能力を評価するために特別に設計されており、ロボット工学や自動運転などの具現化された知能分野に適用可能です。
-
複数ラウンドにわたるインタラクティブな製品テストこれは、仮想世界探索やAIゲームエンジンなど、AIビデオ/ゲーム製品の長期的なインタラクティブ体験を評価するのに役立ちます。
-
学術研究のベンチマーク世界モデルやインタラクティブビデオ生成に関する学術研究のための基本的な評価枠組みとして、この分野における標準化を促進する。
-
オープンソースモデルとクローズドソースモデルの選択これは、企業や開発者が特定のインタラクティブなタスク(ナビゲーションや編集など)に適したモデルソリューションを選択するのに役立つ客観的なデータを提供する。