project
OpenVision - カリフォルニア大学が開発したオープンソースのビジュアルエンコーダー群
OpenVisionは、カリフォルニア大学サンタクルーズ校(UCSC)が開発した、完全にオープンで効率的かつ柔軟な高度なビジュアルエンコーダー群であり、マルチモーダル学習に重点を置いています。590万から6億3210万パラメータまでの様々なサイズのモデルを提供し、以下のような用途に適しています。
OpenVisionとは何ですか?
OpenVisionは、カリフォルニア大学サンタクルーズ校(UCSC)が開発した、マルチモーダル学習に特化した、完全オープンで効率的かつ柔軟な高度なビジュアルエンコーダー群です。590万から6億3210万パラメータまでの様々なサイズのモデルを提供し、エッジデバイスから高性能サーバーまで、多様なシナリオに対応します。OpenVisionは、段階的なマルチステージ解像度トレーニング戦略を採用し、同等の独自モデルと比較して2~3倍高速なトレーニング効率を実現しています。マルチモーダルベンチマークにおいて、OpenAIのCLIPおよびSigLIPモデルに匹敵する優れた性能を発揮します。OpenVisionは、8×8および16×16の可変サイズのパッチをサポートし、詳細な視覚理解や効率的な処理といったニーズに柔軟に対応します。
OpenVisionの主な機能
- 完全に開いた状態データセット、トレーニングレシピ、およびモデルのチェックポイントはすべて、Apache 2.0ライセンスの下で公開され、オープンソースとして提供されており、マルチモーダル研究における再現性と透明性を促進します。
- さまざまなサイズのモデル同社は、5.9Mから632.1Mまでのパラメータ範囲を持つビジュアルエンコーダを、合計26種類のモデルで提供しており、エッジデバイスから高性能サーバーまで、幅広い導入ニーズに対応しています。
- 優れたパフォーマンスマルチモーダルベンチマークにおいて、OpenVisionはOpenAIのCLIPやSigLIPといった独自のビジュアルエンコーダーと同等の性能を発揮し、場合によってはそれらを上回る性能を示す。
- 高いトレーニング効率OpenVisionは、段階的な多段階解像度トレーニング戦略により、トレーニング効率において競合他社の独自製品よりも2~3倍高速です。
- 柔軟な構成8×8および16×16の可変サイズパッチをサポートし、実際のニーズに応じて詳細な視覚的理解または効率的な処理をサポートします。
OpenVisionの技術原則
- 段階的解決トレーニング戦略OpenVisionは、低解像度(例:84×84)から始めて徐々に高解像度(例:336×336または384×384)へと上げていくトレーニング手法を採用しています。これにより、トレーニング効率が大幅に向上し、下流処理のパフォーマンスを損なうことなく、CLIPやSigLIPよりも2~3倍高速化されます。
- ビジュアルエンコーダーの事前学習事前学習段階では、各OpenVisionエンコーダーは3つの連続した解像度段階で学習されます。具体的には、モデルのサイズに応じて異なる解像度で学習されます。例えば、Large、SoViT-400M、Hugeの各バリアントは、それぞれ84×84、224×224、そして最後に336×336または384×384で学習されます。事前学習後、テキストタワーとデコーダーは破棄され、ビジュアルバックボーンのみが残ります。
- マルチモーダル学習アーキテクチャOpenVisionのモデルアーキテクチャは、主にビジュアルエンコーダーとテキストエンコーダーで構成されています。ビジュアルエンコーダーは画像から特徴を抽出する役割を担い、テキストエンコーダーは自然言語シーケンスから特徴を抽出します。トレーニング中、モデルは画像とテキストのペアを比較し、正例ペアの類似性を最大化し、負例ペアの類似性を最小化することで学習します。
- 軽量システムとエッジコンピューティングアプリケーションを最適化するOpenVisionは、小規模な言語モデルと効果的に組み合わせることで、パラメータ数の少ないマルチモーダルモデルを構築できます。
OpenVisionプロジェクトのアドレス
- プロジェクト公式サイト:https://ucsc-vlaa.github.io/OpenVision/
- GitHubリポジトリ:https://github.com/UCSC-VLAA/OpenVision
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/UCSC-VLAA/openvision
- arXiv技術論文:https://arxiv.org/pdf/2505.04601
OpenVisionの応用シナリオ
- マルチモーダル学習OpenVisionは、画像認識、ビデオ分析、自然言語処理などのタスクのために、LLaVAなどのマルチモーダルフレームワークに統合することができます。
- 工業試験OpenVisionの高解像度イメージセンサーと強力な処理能力は、欠陥検出や寸法測定などの産業検査に適しています。
- ロボットビジョンOpenVisionは、高性能イメージセンサーと処理チップを統合することで、ロボットにリアルタイムの視覚認識機能を提供し、経路計画や物体認識などのタスクをサポートする。
- 自動運転自動運転の分野において、OpenVisionは車載ビジョンシステムとして機能し、複数のカメラからの画像データを処理して環境認識と意思決定を行うことができる。
- 科学研究と教育OpenVisionはオープンソースであるため、研究者や教育機関がビジュアルコンピューティングの研究や教育を行うための理想的なプラットフォームとなっている。