project
BLIP3-o - Salesforce Researchをはじめとする複数の組織によって開発されたマルチモーダルモデル。
BLIP3-oは、Salesforce Researchをはじめとする複数の機関が開発した革新的なマルチモーダルモデルであり、自己回帰モデルの推論機能と指示追従機能、そして拡散モデルの強力な生成機能を組み合わせたものです。このモデルは、豊富な拡散セマンティクスを持つCLIP画像に基づいています。
BLIP3-oとは何ですか?
BLIP3-oは、Salesforce Researchをはじめとする複数の機関によって開発された革新的なマルチモーダルモデルです。自己回帰モデルの推論機能と指示追従機能、そして拡散モデルの強力な生成機能を兼ね備えています。意味的に豊富なCLIP画像特徴量に基づいており、従来のVAE特徴量や生ピクセルに依存せず、画像理解と画像生成の両方において優れた性能を発揮します。BLIP3-oは、画像理解のための事前学習を先に行い、次に画像生成のための事前学習を行うという逐次的な事前学習戦略を採用しており、画像理解機能を維持しながら強力な画像生成能力を開発します。このモデルは、複数の画像理解および画像生成ベンチマークにおいて優れた結果を達成しており、コード、モデル重み、事前学習データセット、指示調整データセットなど、すべてオープンソースで公開されています。
BLIP3-oの主な機能
- テキストからテキストへ画像に関連する説明文を生成します。
- 画像からテキストへ入力画像を理解して説明文を生成することができ、視覚的質問応答(VQA)や画像分類など、さまざまな画像理解タスクをサポートします。
- テキストを画像に変換入力されたテキスト説明に基づいて、高品質な画像を生成します。
- 画像から画像へ入力画像を編集・修正して、新しい画像を生成します。
- ハイブリッドトレーニング画像生成タスクと画像理解タスクの両方に対応したハイブリッド学習をサポートし、モデル全体のパフォーマンスを向上させます。
BLIP3-oの技術原理
- 自己回帰モデルと拡散モデルの組み合わせ自己回帰モデルは、テキスト記述から意味情報を捉え、中間的な視覚的特徴を生成します。拡散モデルは最終画像を生成します。拡散モデルは、段階的なノイズ除去に基づいて画像を生成し、高品質で多様な画像を生み出します。
- クリップ機能の拡散CLIPモデルは、意味的に豊富な特徴ベクトルを生成するために画像エンコードに使用されます。これらの特徴ベクトルは、従来のVAE特徴よりもコンパクトで情報量が多いです。拡散モデルはCLIP特徴をモデル化するために使用され、ターゲット画像の特徴ベクトルに類似した特徴ベクトルを生成することで、高品質な画像生成を実現します。
- 逐次的な事前学習戦略まず、モデルが強力な画像理解能力を備えていることを確認するため、画像理解タスク向けに事前学習を行います。この事前学習に基づいて、自己回帰モデルの重みを固定し、拡散モデルのみを学習させることで、効率的な画像生成を実現します。
- ストリームマッチング損失関数フローマッチング損失関数を用いて拡散モデルを学習させることで、損失関数が画像特徴の分布をより適切に捉え、より高品質な画像を生成できるようになります。フローマッチング損失関数はランダム性を導入することで、モデルが単一の出力だけでなく、多様な画像を生成できるようにします。
- データセットを調整するための手順GPT-4oによって生成された多様な手がかりに基づいて、6万組の高品質な手がかり画像ペアを含むデータセットが作成され、モデルの微調整、指示への準拠性の向上、および視覚的な美的品質の向上に役立てられた。
BLIP3-oプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/JiuhaiChen/BLIP3o
- ハギングフェイスモデルライブラリ:https://huggingface.co/BLIP3o
- arXiv技術論文:https://arxiv.org/pdf/2505.09568
BLIP3-oの応用シナリオ
- 画像生成と編集テキストの説明に基づいて画像を生成または変更し、デザインやクリエイティブな作業を支援します。
- ビジュアルQ&A画像の内容を理解し、関連する質問に答えることができ、教育や高度な顧客サービスに活用できる。
- マルチモーダル対話画像とテキストを組み合わせた対話は、インタラクティブな体験を向上させる。
- 画像の注釈と分類画像タグを自動生成し、分類することで、画像管理を最適化します。
- 芸術と創造性芸術的なイメージを生み出し、創造性を刺激し、個々のニーズに応える。