project
Migician - 北京交通大学、清華大学、華中科技大学が共同開発したマルチモーダル視覚位置特定モデル
Migicianは、北京交通大学、華中科技大学、清華大学の研究チームが共同開発したマルチモーダル大規模言語モデル(MLLM)です。特に自由形式のマルチイメージグラウンディング(MIL)向けに設計されています。
ミジシャンとは何ですか?
Migicianは、北京交通大学、華中科技大学、清華大学の研究チームが共同開発したマルチモーダル大規模言語モデル(MLLM)です。自由形式のマルチイメージグラウンディング(MIG)タスク向けに特化して設計されており、大規模トレーニングデータセットMGrounding-630kを活用しています。テキストによる説明、画像、またはその両方の組み合わせといった自由形式のクエリに基づいて、複数の画像内の関連する視覚領域を識別し、正確に位置特定します。Migicianは、大規模インストラクションチューニングデータセットMGrounding-630kを用いて2段階のトレーニング手法で学習され、マルチイメージ理解とシングルイメージ位置特定機能を組み合わせることで、エンドツーエンドのマルチイメージ位置特定を実現しています。Migicianの設計とトレーニング手法は、複雑な視覚シーンにおけるマルチモーダルモデルの応用に関する新たな知見を提供し、マルチイメージ理解と高精度な視覚位置特定との統合を促進します。
ミジシャンの主な機能
- クロスイメージローカリゼーション複数の画像の中から、クエリに関連するオブジェクトや領域を見つけ出し、それらの正確な位置(座標ボックスなど)を指定します。
- 柔軟な入力方法クエリとして、テキスト、画像、またはその両方を組み合わせたものをサポートしています。例えば、「図2にあるオブジェクトのうち、図1にあるオブジェクトと似ているが色が異なるものを探す」といったクエリが可能です。
- マルチタスク対応複数の画像に関連する様々なタスク、例えば物体追跡、差分認識、共通物体の位置特定などを処理できます。
- 効率的な推論エンドツーエンドのモデル設計に基づき、複数画像シナリオにおいて推論を直接実行することで、従来の手法における多段階推論や誤差伝播の問題を回避します。
ミジシャンの技術原則
- エンドツーエンドの複数画像ローカライズフレームワークこのアプローチは、エンドツーエンドのモデルアーキテクチャに基づいて複数画像の位置特定タスクを直接処理するため、タスクを複数のサブタスクに分解する従来の手法(位置特定前にテキスト説明を生成するなど)の複雑さや効率性の問題を回避できます。複数の画像の内容を同時に理解し、クエリに基づいて対象オブジェクトの位置を直接出力します。
- 大規模命令チューニングデータセット(MGrounding-630k)このデータセットには、複数画像の位置特定タスクに関連する63万点以上のデータが含まれています。静的差分位置特定、共通オブジェクト位置特定、オブジェクトトラッキングなど、さまざまなタスクタイプを網羅しており、自由形式の指示と組み合わせることで、モデルは多様な位置特定能力を学習します。
- 2段階トレーニング方法:
- フェーズ1このモデルは、様々な複数画像タスクで学習され、基本的な複数画像理解能力と位置特定能力を習得します。
- フェーズ2自由形式の指示チューニングに基づいて、複雑なクエリを特定するモデルの能力を向上させ、多様なタスクへの適応性を維持する。
- マルチモーダル融合と推論これは、視覚情報と言語情報を組み合わせ、マルチモーダル融合に基づいて複雑なクエリを理解して特定し、比較、類似性、機能的関連性などを通じて対象物を特定するなど、抽象的な視覚的意味情報を処理します。
- モデル統合技術モデル統合技術に基づき、異なる学習段階の重みを平均化することで、全体的なパフォーマンスを最適化します。
ミジシャンのプロジェクトアドレス
- プロジェクト公式サイト:https://migician-vg.github.io/
- GitHubリポジトリ:https://github.com/thunlp/Migician
- ハギングフェイスモデルライブラリ:https://huggingface.co/Michael4933/Migician
- arXiv技術論文:https://arxiv.org/pdf/2501.05767
ミジシャンの応用シナリオ
- 自動運転車両周辺のターゲット(歩行者や障害物など)を迅速に特定でき、マルチビュー認識と動的なターゲット追跡をサポートする。
- セキュリティ監視複数カメラを連携させることで、異常な行動や対象物を識別し、群衆の集まりや急速な動きといった異常な状況を分析する。
- ロボットとのインタラクション対象物を正確に特定することで、ロボットは複雑な環境下でも把持やナビゲーションといった作業を実行できるようになる。
- 画像編集複数の画像の内容を分析し、オブジェクトの置換、削除、またはクリエイティブなコンテンツの生成を実現します。
- 医用画像複数の画像情報を統合することで、病変部位や異常組織を迅速に特定し、動的なモニタリングをサポートします。