AB
AiBoss
project

QLIP - NVIDIAのビジュアルトークン化手法

QLIP(Quantized Language-Image Pretraining)は、NVIDIAなどが開発したビジュアルトークン化手法で、高品質な画像再構成とゼロショット画像理解機能を組み合わせたものです。QLIPのバイナリ球面量子化(BSQ)は…

QLIPとは何ですか?

QLIP(Quantized Language-Image Pretraining)は、NVIDIAなどが開発したビジュアルトークン化手法で、高品質な画像再構成とゼロショット画像理解機能を兼ね備えています。QLIPは、バイナリ球面量子化(BSQ)オートエンコーダーを用いて学習を行い、再構成ターゲットと言語・画像アライメントターゲットを同時に最適化します。QLIPは、ビジュアルエンコーダーまたは画像トークナイザーとしてマルチモーダルモデルにシームレスに統合でき、理解タスクと生成タスクの両方で優れた性能を発揮します。QLIPは、統合型マルチモーダルモデルの開発に新たなアプローチを提供します。

QLIPの主な機能

  • 高画質画像再構成圧縮率を下げて、高画質の画像を復元します。
  • 強力な意味理解意味的に豊富なビジュアルタグの生成、ゼロショット画像分類、およびマルチモーダル理解タスクをサポートします。
  • マルチモーダルタスクサポートビジュアルエンコーダーまたは画像タグ付けツールとして、マルチモーダルモデルにシームレスに統合でき、テキストから画像への変換や画像からテキストへの変換といったタスクをサポートします。
  • 統一マルチモーダルモデル単一のモデルで、プレーンテキスト、画像からテキストへの変換、テキストから画像への変換を同時に処理できます。

QLIPの技術原則

  • 二値球面量子化(BSQ)バイナリ球面量子化(BSQ)は、画像を離散的な視覚マーカーに符号化するために使用されます。BSQは、高次元空間内の点を単位球上のバイナリコーナー点にマッピングすることで、効率的な量子化と圧縮を実現します。
  • 比較学習目標QLIPは、画像とテキストのアライメントに基づいた対照的な学習目標を導入し、視覚マーカーと言語埋め込みを整合させます。QLIPはInfoNCE損失関数を用いて、同じ画像とテキストのペアの埋め込みを近づけ、異なるペアの埋め込みを遠ざけるように学習します。このアライメントメカニズムにより、視覚マーカーは画像を再構築し、その意味内容を理解することが可能になります。
  • 2段階トレーニング
    • フェーズ1最適化は、再構成損失、量子化損失、コントラスト損失の加重和によって行われます。目標は、画像再構成の品質を維持しながら、意味的に豊かな視覚表現を学習することです。
    • フェーズ2第1段階を基盤として、この段階では量子化ボトルネックとビジュアルデコーダを微調整することで、高周波の詳細を復元し、再構成品質をさらに最適化します。また、この段階ではテキストエンコーダを破棄し、ビジュアルエンコーダを固定することで、大規模バッチ学習中の性能低下を防ぎます。
  • 動的平衡の喪失この手法では、コントラスト損失と再構成損失の競合に対処するため、それぞれの重みを動的に調整します。具体的には、損失値の逆数に基づいて重みを調整し、2つの目的関数の収束速度のバランスを取ります。
  • トレーニングの加速とより良い初期化事前学習済みのモデル(マスク画像モデリングやCLIPなど)からビジュアルエンコーダーとテキストエンコーダーを初期化することで、トレーニング効率を大幅に向上させ、トレーニングに必要なサンプル数を削減します。

QLIPプロジェクトの住所

QLIPの適用シナリオ

  • マルチモーダルな理解視覚的質問応答(VQA)および図解的質問応答(GQA)で使用され、モデルが画像を理解し、正確な回答を生成するのに役立ちます。
  • テキストから画像への生成テキストの説明に基づいて、意味内容により合致した詳細情報を含む高品質な画像を生成します。
  • 画像からテキストへの変換画像キャプションを生成し、より正確なテキストコンテンツを提供します。
  • 統一マルチモーダルモデルテキスト間変換、画像からテキストへの変換、テキストから画像への変換といったタスクを同時に処理できる単一のモデルをサポートしています。