AB
AiBoss
project

Mini-o3 - ByteDanceと香港大学が共同開発した視覚推論モデル

Mini-o3は、ByteDanceと香港大学が共同開発したオープンソースモデルで、複雑な視覚検索問題を解決するために特別に設計されています。強化学習と画像ベースのツールを通して、このモデルは深層かつ多段階の推論を実行でき、推論ラウンド数は調整可能です。

Mini-o3とは何ですか?

Mini-o3は、ByteDanceと香港大学が共同開発したオープンソースモデルで、複雑な視覚検索問題を解決するために特別に設計されています。強化学習と画像ベースのツールを用いることで、このモデルは深層マルチターン推論を実行でき、推論ラウンド数は数十回まで拡張可能です。Mini-o3は、難易度の高いデータセットの構築、反復的なデータ収集プロセスの採用、オーバーターンオクルージョン戦略の提案により、モデルの推論能力とインタラクションラウンドを大幅に向上させています。このモデルは、複数の視覚検索ベンチマークにおいて最先端の性能を達成しています。すべてのコード、モデル、データセットはオープンソースであり、再現性やさらなる研究を容易にします。

Mini-o3の主な機能

  • 複数ターンにわたる対話型推論このシステムは、複数回の対話ラウンドからなる高度な推論を実行でき、対話ラウンド数は数十回にまで拡張可能で、段階的な探索と試行錯誤を通して複雑な視覚探索問題を解決する。
  • 多様な推論パターン深さ優先探索、試行錯誤、目標維持など、複数の推論モードをサポートしています。
  • 視覚的な探索に挑戦する高解像度画像において、対象物が小さく、多くの妨害物体が存在する場合でも、対象物を正確に特定し識別することができる。
  • 優れたパフォーマンスVisualProbe、V* Bench、HR-Bench、MME-Realworldなど、複数のビジュアル検索ベンチマークにおいて最先端の結果を達成し、強力なビジュアル推論能力を実証しています。
  • オープンソースすべてのコード、モデル、データセットはオープンソースであるため、研究者は容易に再現してさらなる研究を行うことができ、関連技術の発展を促進する。

Mini-o3の技術原理

  • コールドスタート監視型ファインチューニング(SFT)少数の手作りの例を用いて、コンテキスト学習型視覚言語モデル(VLM)により、高品質で多様な複数ターンのインタラクション軌跡を生成します。
  • 強化学習(RL)反転マスキング戦略に基づいているため、インタラクションラウンドの制限を超えたことによるペナルティを回避でき、テスト中に自然に数十回のインタラクションラウンドに拡張することができます。
  • 画像ピクセル予算を削減する(最大ピクセル数を下げる)画像あたりの最大ピクセル数を減らすことで、1回のインタラクションで許容されるラウンド数が増加し、それによって長サイクル問題を解決する能力が向上する。
  • 難易度の高いデータセット(ビジュアルプローブデータセット): 探索的推論を促し、トレーニング中にモデルが複雑な推論パターンを学習できるように設計された、数千もの視覚的検索問題を含むデータセットを構築する。

Mini-o3プロジェクトの住所

  • プロジェクト公式サイト:https://mini-o3.github.io/
  • GitHubリポジトリ:https://github.com/Mini-o3/Mini-o3
  • ハギングフェイスモデルライブラリ:https://huggingface.co/Mini-o3/models
  • arXiv技術論文:https://arxiv.org/pdf/2509.07969

Mini-o3の応用事例

  • eコマースのシナリオこれにより、ユーザーは膨大な数の商品画像の中から目的の商品を素早く見つけることができます。アパレルECプラットフォームでは、ユーザーは画像をアップロードして類似のスタイルの服を検索できます。
  • スマートホームスマートホーム環境では、カメラが画像を撮影することで、鍵やリモコンなどの紛失物をユーザーが素早く見つけるのに役立ちます。
  • 監視ビデオ分析これにより、監視ビデオの中から特定の対象物を迅速に特定・識別することが可能になり、例えば、混雑した場所で特定の人物や物品を探し出すことができる。
  • 異常行動の検出侵入検知や異常行動認識など、複数の推論段階を経て、監視ビデオ内の異常な行動を分析する。
  • 複雑なシーンでのナビゲーション複雑な道路状況において、複数回の視覚的推論は、障害物や複雑な交通標識があるような状況でも、自動運転システムが経路をより適切に理解し、計画するのに役立ちます。