project
PaliGemma 2 mix - Google DeepMindによる、アップグレードされた視覚言語モデル。
PaliGemma 2 Mixは、Google DeepMindが開発した最新のマルチタスク視覚言語モデル(VLM)です。様々な画像処理機能と言語処理機能を統合しており、画像記述、物体検出、画像セグメンテーション、OCR、文書理解などをサポートします。
PaliGemma 2ミックスとは何ですか?
PaliGemma 2 Mixは、Google DeepMindがリリースした最新のマルチタスク視覚言語モデル(VLM)です。さまざまな視覚処理と言語処理機能を統合し、画像記述、物体検出、画像セグメンテーション、OCR、文書理解などのタスクをサポートし、単一モデル内で異なる機能を柔軟に切り替えることができます。このモデルは、さまざまなシナリオのニーズを満たすために3つの異なるパラメータスケール(3B、10B、28B)を提供し、224ピクセルと448ピクセルの両方の解像度をサポートし、パフォーマンスとリソースのバランスを取っています。PaliGemma 2 Mixは、オープンソースフレームワーク(Hugging Face Transformers、Keras、PyTorchなど)に基づいて開発されているため、使いやすく拡張も容易です。開発者は、追加のモデルをロードすることなく、簡単なプロンプトでタスクを切り替えることができます。
PaliGemma 2ミックスの主な特徴
- 画像の説明正確かつ詳細な画像説明を生成し、短いテキスト説明と長いテキスト説明の両方をサポートします。
- 光学文字認識(OCR)画像内のテキストコンテンツを認識できるため、文書のデジタル化、歴史的文書のアーカイブ、自動データ抽出などに適しています。
- 物体検出と画像分割画像内の物体を検出・特定し、正確なセマンティックセグメンテーションを実行できます。
- 視覚的質問応答(VQA)ユーザーは画像をアップロードして質問をすることができ、モデルは画像を分析し、回答を提供する。
- 文書の理解文書画像の内容を理解・分析でき、グラフや図表の分析にも対応しています。
- 科学的な質問への回答複雑な科学的質問を理解し、回答することができる。
- テキスト関連のタスクこれには、テキスト検出、表構造認識、分子構造認識などが含まれます。
PaliGemma 2ミックスの技術的原理
- モデルアーキテクチャPaliGemma 2 Mixは、以下の3つの主要成分で構成されています。
- SigLIP画像エンコーダーSigLIP-So400m画像エンコーダは、コントラスト事前学習によって画像をトークンの系列に変換するために使用されます。このエンコーダは、複数の入力解像度(224px²、448px²、896px²など)をサポートしており、それぞれ256、1024、4096個のトークンを生成します。
- Gemma-2B言語モデルデコーダーとして、テキスト入力を処理し、出力を生成する役割を担います。SentencePieceトークナイザーを使用してテキストをトークンに変換し、それらを画像トークンと組み合わせます。
- 線形投影層SigLIPが出力する画像トークンは、Gemma-2Bの語彙トークンと同じ次元に投影されるため、両者を効果的に融合させることができる。
- トレーニング戦略PaliGemma 2 Mixのトレーニングは3つの段階で構成されています。
- フェーズ1:基本的なマルチモーダルタスクトレーニングこのアプローチでは、事前学習済みのSigLIPモデルとGemma-2Bモデルを組み合わせ、10億個のサンプルを含むマルチモーダルタスクデータセットで共同学習を実行します。目標は、224ピクセル²の学習解像度で、様々なタスクにおけるモデルの汎用性を向上させることです。
- フェーズ2:解像度を段階的に高めたトレーニングトレーニングは、それぞれ448ピクセルと896ピクセルの解像度で、5000万サンプルと1000万サンプルを用いて実施されました。高解像度タスクの重みが引き上げられ、長文テキストOCRなどの複雑なタスクをサポートするために出力シーケンス長が拡張されました。
- フェーズ3:特定のタスクへの微調整ステージ1またはステージ2のチェックポイントを、視覚的質問応答(VQA)、文書理解、長文説明生成などの特定のタスクに合わせて微調整します。
- マルチモーダル融合PaliGemma 2 Mixは、画像トークンとテキストトークンを組み合わせ、自己回帰生成のための言語モデルに入力します。画像トークンはタスクの手がかり(接頭辞)を「先読み」することができ、現在のタスクに合わせて表現を更新します。
PaliGemma 2 mixプロジェクトの住所
- プロジェクト公式サイト:https://developers.googleblog.com/en/introducing-paligemma-2-mix/
- GitHubリポジトリ:https://github.com/huggingface/blog/blob/main/paligemma2mix.md
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/google/paligemma-2-mix
PaliGemma 2 mixの応用シナリオ
- 文書の理解図表などの文書内容を理解することができ、複雑な文書分析タスクにも対応します。
- 科学的な質問への回答PaliGemma 2 Mixは複雑な科学的疑問を理解し、答えることができるため、教育や研究に適しています。
- Eコマースとコンテンツ生成このモデルは商品画像の説明文を自動的に生成できるため、ECプラットフォーム上の商品リストの魅力を高めることができます。
- テキスト関連のタスクテキスト検出、表構造認識、分子構造認識、楽譜認識などの機能を備えており、文書処理や科学研究において幅広く利用されている。