AB
AiBoss
project

Molmo 2 - Ai2 オープンソース AI ビデオ分析モデル

Molmo 2は、アレン人工知能研究所(Ai2)が開発したオープンソースのビデオ分析モデルで、ビデオの理解、ポインティング、トラッキングに重点を置いています。Qwen 3とOlmoアーキテクチャに基づいており、強力なビデオ分析機能を備え、ビデオの認識、ポインティング、トラッキングを実行できます。

Molmo 2とは何ですか?

Molmo 2は、アレン人工知能研究所(Ai2)が開発したオープンソースのビデオ分析モデルで、ビデオの理解、ポインティング、トラッキングに重点を置いています。Qwen 3とOlmoのアーキテクチャをベースとしたこのモデルは、強力なビデオ分析機能を備え、イベントの正確な位置特定、複数のターゲットのトラッキング、ビデオ内の詳細なキャプション生成を実現します。Molmo 2は、ビデオトラッキングや質問応答タスクにおいて、Gemini 3などの複数のオープンソースおよびクローズドソースモデルを凌駕する性能を発揮するとともに、効率的な推論機能も提供します。このモデルは、さまざまなビデオおよび画像タスクを網羅する豊富なトレーニングデータセットを備えており、研究および教育用途をサポートし、マルチモーダルインテリジェンスの開発に貢献します。

Molmo 2の主な特徴

  • 動画の理解度確認と質疑応答動画コンテンツを深く理解し、説明問題や出来事の推論問題など、動画に関連する様々な質問に答えることができます。
  • ビデオのポインティングと位置決めこれは、動画内の特定のイベントやオブジェクトの正確な空間的および時間的位置を特定することを可能にし、「特定のイベントがいつ、どこで発生したか」といった質問に答えることができます。
  • 複数ターゲット追跡動画内の複数のターゲットを追跡し、ターゲットが遮蔽されたり、フレーム内に再び現れたりした場合でも、安定した追跡を維持します。
  • 高密度ビデオ字幕生成動画に詳細で分かりやすいキャプションを生成し、長尺動画向けの検索可能なナラティブコンテンツを提供します。
  • 異常およびアーティファクトの検出動画内の異常なイベントを検出したり、照明の不整合やオブジェクトの形状エラーなど、動画内にアーティファクトを生成します。
  • 複数画像入力に対応入力として単一画像、複数画像、および様々な長さのビデオクリップをサポートし、柔軟なマルチモーダル処理機能を提供します。
  • 異種感覚推論これは、視覚情報と言語情報を組み合わせて推論を行い、テキストによる説明に基づいて画像や動画を検索するなど、複雑なマルチモーダルタスクをサポートします。

Molmo 2の技術原理

  • モデルアーキテクチャMolmo 2のアーキテクチャは、ビジュアルエンコーダ、言語モデル(LLM)、およびコネクタで構成されています。ビジュアルエンコーダは、入力された画像またはビデオフレームをビジュアルタグに変換し、空間情報と時間情報を抽出します。Qwen 3またはOlmoをベースとした言語モデルは、ビジュアルタグとテキスト情報を処理して、クロスモーダル推論を可能にします。コネクタは、ビジュアルタグをタイムスタンプ、画像インデックス、およびテキストと組み合わせることで、モデルが空間情報、時間情報、および言語情報を統合的に処理できるようにします。
  • 2段階トレーニングMolmo 2は2段階のトレーニング手法を採用しています。第1段階では、画像キャプション生成と画像ポインティングタスクによる事前トレーニングを行い、視覚情報と言語情報のアライメントおよび位置特定能力を向上させます。第2段階では、画像、複数画像、動画、プレーンテキストといったマルチモーダルデータセットを用いて教師ありファインチューニングを行い、モデルの汎化能力をさらに向上させます。
  • データ処理とサンプリングMolmo 2は、ビデオ入力において、低フレームレート(≤2fps)で最大128フレームをサンプリングし、Vision Transformerを通してエンコードします。視覚マーカーは、時間ウィンドウ(例:3×3)ごとにプールされ、テキストや時間情報と交互に配置された後、言語モデルに入力され、フレーム間の視覚マーカーの相互作用をサポートします。
  • 最適化技術Molmo 2は、微調整段階でラベル重み付けスキームを採用し、異なるタスク間での学習のバランスを取り、マルチタスクシナリオにおけるモデルのパフォーマンスを向上させます。同時に、シーケンスパッキングとメッセージツリースケジューリングを導入してスループットを向上させ、視覚ラベル間の双方向アテンションメカニズムを通じて位置特定と追跡機能を強化します。
  • データセットとタスクの設計Molmo 2は、高密度キャプション生成、動画質問応答、位置特定、トラッキングなどのタスクを網羅する、900万件以上のサンプルを含むマルチモーダルデータセットを構築しました。トレーニングデータには、画像キャプション生成、動画質問応答、ポインティング、トラッキングといった様々なタスクが含まれており、複雑なシナリオにおけるモデルの適応性を向上させています。

モルモ2プロジェクトの住所

  • プロジェクト公式サイト:https://allenai.org/blog/molmo2
  • GitHubリポジトリhttps://github.com/allenai/molmo2
  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/allenai/molmo2
  • 技術論文:https://www.datocms-assets.com/64837/1765901660-molmo_v2_2026-techreport-3.pdf

Molmo 2の応用事例

  • 自動運転と交通監視Molmo 2は、交通流分析、事故検知および早期警報に利用でき、交通管理の改善、車両運行の安全性と効率性の向上に貢献します。
  • ロボット工学と自動化ロボットビジョンナビゲーションや産業オートメーション検査において、ロボットが環境をよりよく理解し、製品の品質問題を検出するのに役立ちます。
  • 科学研究と教育これは科学実験の分析や教育ツールの開発を支援し、研究者や学生に動的なプロセスの詳細な分析と理解を提供する。
  • コンテンツ制作とメディア動画の字幕を自動生成し、動画編集を支援することで、コンテンツ制作の効率性と利便性を向上させます。
  • セキュリティと監視セキュリティ監視における異常行動のリアルタイム検知と人員追跡は、公共の場所や特定の区域の安全を確保します。