AB
AiBoss
project

MobileCLIP2 - Appleのオープンソースのデバイス内マルチモーダルモデル

MobileCLIP2は、Appleの研究者によって開発された高性能なエッジマルチモーダルモデルであり、MobileCLIPのアップグレード版です。マルチモーダル強化学習における最適化が特徴で、DFNデータセットでの学習を通じてCLIPよりも優れたパフォーマンスを実現しています。

MobileCLIP2とは何ですか?

MobileCLIP2は、Appleの研究者によって開発された高性能エッジマルチモーダルモデルであり、MobileCLIPのアップグレード版です。DFNデータセットで、より高性能なCLIP教師モデルアンサンブルと改良された画像テキスト生成教師モデルをトレーニングすることで、マルチモーダル強化学習を最適化し、モデルのパフォーマンスをさらに向上させています。MobileCLIP2は、ゼロショット分類タスクで非常に優れたパフォーマンスを発揮し、ImageNet-1kでMobileCLIP-Bと比較して精度が2.2%向上しています。MobileCLIP2-S4は、SigLIP-SO400M/14と同等のパフォーマンスを維持しながら、モデルサイズが小さく、推論レイテンシが低くなっています。また、視覚言語モデルの評価や高密度予測タスクなど、さまざまな下流タスクでも優れたパフォーマンスを発揮します。MobileCLIP2は、画像検索、コンテンツモデレーション、スマートフォトアルバムなどのさまざまなアプリケーションに適しており、テキストの説明に基づいて関連画像を検索したり、画像とテキストの一貫性チェックを実行したり、自動画像分類を実行したりといった機能を実現します。

MobileCLIP2の主な機能

  • ゼロショット画像分類追加の学習データを必要とせずに、事前学習済みのマルチモーダル特徴量を使用して画像を直接分類でき、新しいタスクにも迅速に対応できます。
  • テキストから画像への検索入力されたテキストの説明に基づいて、システムは画像ライブラリから最も関連性の高い画像を取得し、正確な画像検索を実現します。
  • 画像からテキストへの変換入力された画像に基づいて説明文を生成し、コンテンツの理解と作成を支援するために、画像に適切なタイトルや説明を追加します。
  • 画像とテキストの一貫性の判断画像とテキスト説明の一致度を評価するもので、コンテンツモデレーションやインテリジェントなアルバム分類などのシナリオで、画像とテキストが一致していることを確認するために使用できます。
  • マルチモーダル特徴抽出画像とテキストから高品質なマルチモーダル特徴を抽出し、画像分類、物体検出、セマンティックセグメンテーションなどの下流タスクをサポートすることで、モデルのパフォーマンスを向上させます。

MobileCLIP2の技術原理

  • マルチモーダル強化訓練CLIP教師モデルアンサンブルと画像テキスト生成教師モデルのトレーニングを最適化することで、モデルが画像とテキストを同時に理解する能力が向上し、マルチモーダル特徴の表現が強化される。
  • 比較知識抽出比較知識抽出技術は、大規模な教師モデルから重要な情報を抽出し、それを小規模な生徒モデルに渡すことで、モデルのパフォーマンスと効率性のバランスを取るために使用されます。
  • 温度調節の最適化比較知識蒸留に温度調節機構を導入することで、モデルの学習プロセスが最適化され、異なるモードのデータに対するモデルの適応性と汎化能力が向上する。
  • 合成テキスト生成改良されたテキスト生成器は、高品質の合成テキストを生成し、トレーニングデータを充実させ、テキストの多様性に対するモデルの理解力と生成能力を向上させます。
  • 高効率モデルアーキテクチャMobileCLIP2-BやMobileCLIP2-S4などの軽量モデルアーキテクチャを設計することで、高いパフォーマンスを維持しながら計算の複雑さと推論の遅延を大幅に削減し、エッジ環境への展開に適したものにする。
  • 微調整と最適化多様で高品質な画像・テキストデータセットを用いた微調整により、特定のタスクにおけるモデルのパフォーマンスがさらに向上し、実用性と適応性が高まります。

MobileCLIP2プロジェクトのアドレス

  • GitHubリポジトリ:https://github.com/apple/ml-mobileclip
  • ハギングフェイスモデルライブラリ:https://huggingface.co/collections/apple/mobileclip2-68ac947dcb035c54bcd20c47

MobileCLIP2の応用シナリオ

  • モバイルアプリケーションこれは、拡張現実アプリケーション、パーソナルアシスタント、リアルタイム写真分類などに利用でき、モバイル端末がクラウドにデータを送信することなく、ローカルでデータ処理を完了することを可能にする。
  • エッジコンピューティングドローン、ロボット、リモートセンサーなど、帯域幅と処理能力が限られているエッジコンピューティング環境に適しており、モデルを使用して視覚認識タスクを実行し、リアルタイムの意思決定を実現できます。
  • モノのインターネット(IoT)デバイスこれは、セキュリティカメラやスマートホームアシスタントなどのIoT(モノのインターネット)デバイスに統合することができ、これらのシステムがローカルで画像認識を実行できるようにする。これにより、プライバシー保護、低遅延、不安定なインターネット接続環境での動作といった利点が得られる。
  • 画像分類軽量なゼロショット画像分類ソリューションとして、テキストによるカテゴリラベルが提供されていれば、モデルが特定の種類の画像をこれまで見たことがなくても、画像がどのカテゴリに属するかを判定できます。
  • 特徴抽出特徴抽出器として、画像とテキストから高品質なマルチモーダル特徴を抽出し、拡散モデル(例:Stable Diffusion)やマルチモーダル大規模言語モデル(例:LLaVA)などの下流タスクへの入力として使用できます。