AB
AiBoss
project

SenseNova-MARS - SenseTimeのオープンソースのマルチモーダル自律推論モデル

SenseNova-MARSは、SenseTime社が開発したオープンソースのマルチモーダル自律推論モデルで、8Bと32Bの2つのパラメータスケールを提供します。動的な視覚推論と画像/テキスト検索のディープフュージョンをサポートする初のエージェント型VLMとして、このモデルはインテリジェントエージェントのように機能します。

SenseNova-MARSとは何ですか?

SenseNova-MARSは、SenseTime社が提供するオープンソースのマルチモーダル自律推論モデルで、8Bと32Bの2つのパラメータスケールが用意されています。動的なビジュアル推論と画像テキスト検索の深い統合をサポートする初のエージェント型VLMとして、このモデルはインテリジェントエージェントのようにタスクステップを自律的に計画し、画像切り抜き、テキスト検索、画像検索という3つの主要ツールを柔軟に呼び出し、人間の介入なしに複雑なマルチホップ推論を完了できます。MMSearch、HR-MMSearch、FVQAを含む7つのベンチマークテストにおいて、SenseNova-MARS-32Bは平均スコア69.74を達成し、Gemini-3-Pro(69.06)とGPT-5.2(67.64)を上回り、オープンソースモデルの中で最先端(SOTA)レベルに達しました。これは、AIが「答えることができる」段階から「実行できる」段階へと大きく飛躍したことを示しています。

SenseNova-MARSの主な機能

  • マルチモーダル検索推論このモデルは、画像とテキストを統合して異種モダリティの情報検索を可能にし、複雑な知識推論を完了するためのツールの動的な呼び出しをサポートします。
  • 詳細な視覚分析4K/8Kの超高精細画像の処理に対応しており、画像全体の5%未満を占める微細な視覚的ディテールを正確に切り抜き、識別することができます。
  • 自律エージェントの実行このモデルは、タスクの手順を自律的に計画し、複数のツールとシームレスに連携して閉ループを形成し、人間の介入なしに複雑な問題を解決することができる。

SenseNova-MARSの技術原理

  • 2段階トレーニングアーキテクチャ第1段階では、約3,000件の高品質な複数ラウンドのインタラクション軌跡を用いたコールドスタート方式の教師ありファインチューニングを行い、モデルが基本的なツール使用パターンを習得できるようにします。第2段階では、BN-GSPO強化学習アルゴリズムを用いて、グループ内正規化とバッチ正規化によってトレーニングプロセスを安定化させ、複数のツールの協調呼び出しと推論意思決定能力を最適化します。
  • BN-GSPO強化学習アルゴリズムマルチツールシナリオにおける軌道長と報酬スケールの違いによって生じるトレーニングの不安定性に対処するため、このアルゴリズムはまず同じグループ内のサンプルに対してグループ正規化を実行して内部バイアスを排除し、次にバッチ全体を正規化して異なるタスクの学習信号をバランスさせることで、安定かつ効率的なマルチツール戦略の最適化を実現します。
  • 動作空間とツール設計モデルの各ラウンドでは、ユーザーはテキスト検索、画像検索、画像切り抜き、応答終了の4つのアクションから選択できます。画像切り抜きは、境界ボックスの座標を正規化することで、正確な局所拡大を実現します。すべてのツール呼び出しは、一貫した操作性を確保するために、厳密なJSON形式仕様に準拠しています。
  • 報酬モデルメカニズムこのモデルは評価器としてGPT-4oを使用し、回答の正確性とフォーマット準拠という2つの側面から疎な報酬を提供します。正確性報酬は、最終的な回答と正解との間の意味的な一致度を測定し、フォーマット報酬は、各出力ラウンドが準拠した思考プロセスとツール呼び出し構造を含んでいることを保証します。
  • 自動データ合成マルチモーダルなインテリジェントエージェントに基づいてデータエンジンが構築されます。このエンジンは、きめ細かな視覚的アンカーポイントの特定、マルチホップの深層関連付けの取得、および閉ループ自己整合性検証という3つのステップを経て、ウェブページ間のエンティティロジックを自動的にマイニングし、非常に複雑な推論リンクを構築すると同時に、偽データをフィルタリングしてトレーニングデータの品質を確保します。

SenseNova-MARSのプロジェクトアドレス

  • GitHubリポジトリ:https://github.com/OpenSenseNova/SenseNova-MARS
  • ハギングフェイスモデルライブラリ
    • https://huggingface.co/sensenova/SenseNova-MARS-32B
    • https://huggingface.co/sensenova/SenseNova-MARS-8B
  • arXiv技術論文:https://arxiv.org/pdf/2512.24330

SenseNova-MARSの応用シナリオ

  • スポーツ競技分析このモデルは、レーシングスーツに付けられた小さなロゴを識別し、関連する企業やドライバーの経歴情報を照会し、レースデータの検証を支援するためにタイム差を自動的に計算することができる。
  • ビジネスインテリジェンスマイニングサミットの写真から企業のロゴを特定することで、製品の仕様や資金調達情報を迅速に収集し、業界の競争環境の分析に役立てることができます。
  • ニュースファクトチェック高解像度のニュース画像を通して事件の背景や人物の身元を突き止め、ソーシャルメディア上で拡散されている情報の信憑性を検証する。
  • 学術研究と教育論文の図表に含まれるデータを自動的に分析し、関連する研究背景情報を取得することで、文献レビューと知識統合のプロセスを加速します。
  • 地理的な旅行探訪ランドマークや道路標識などの詳細情報を識別し、歴史的・文化的情報をリアルタイムで取得できるため、没入感のあるスマートツアーガイド体験を提供します。