project
北京大学が発表した、マルチモーダルな理解と生成のための統一モデル「VARGPT」
VARGPTは、視覚理解と生成タスクに特化した革新的なマルチモーダル大規模言語モデルです。自己回帰フレームワークに基づき、単一のモデル内で視覚生成と理解を統合し、タスク切り替えの複雑さを回避します。VARGPTはLLaVAアーキテクチャに基づいて構築されています。
VARGPTとは何ですか?
VARGPTは、視覚理解と視覚生成タスクに特化した革新的なマルチモーダル大規模言語モデルです。自己回帰フレームワークに基づき、単一のモデル内で視覚生成と理解を統合することで、タスク切り替えの複雑さを回避します。VARGPTはLLaVAアーキテクチャを拡張し、次トークン予測による視覚理解と次スケール予測による視覚生成を実現することで、混合モーダル入力と出力を効率的に処理します。VARGPTは3段階のトレーニング戦略を採用しています。事前トレーニング段階では言語と視覚の特徴を学習し、混合視覚指示の微調整段階では視覚とテキストの特徴をさらに整合させ、指示への準拠性を向上させます。これにより、視覚的な質問応答や推論などのタスクで優れたパフォーマンスを発揮するだけでなく、視覚生成タスクにおいても強力な能力を発揮し、高品質な画像を自然に生成します。
VARGPTの主な機能
- 視覚的理解と生成の統一VARGPTは、単一の自己回帰フレームワーク内で視覚理解と視覚生成を実現できるマルチモーダルな大規模言語モデルです。次トークン予測パラダイムを用いて視覚的質問応答や推論などの視覚理解タスクを実行し、次スケール予測パラダイムに基づいて視覚生成を実現します。
- 混合モード入力および出力VARGPTはテキストと画像の混合入力に対応しており、テキストと画像を同時に出力できます。複雑な画像認識・言語処理タスクにおいて、より柔軟かつ効率的に処理できます。
- 高効率な画像生成VARGPTは、高品質な画像生成のために20億個のパラメータを含む専用のビジュアルデコーダを搭載しています。テキストによる指示に基づいて画像を生成し、自己回帰プロセスを通じて画像コンテンツを段階的に構築していきます。
- マルチモーダルタスクの幅広い適用性VARGPTは、複数の視覚中枢にわたるベンチマークテストにおいて他のモデルを凌駕する性能を発揮し、指示から画像への合成を自然にサポートし、様々な視覚言語タスクに適している。
VARGPTの技術原理
- 統一自己回帰フレームワークVARGPTは、視覚理解と視覚生成のタスクを単一の自己回帰フレームワーク内で統合します。視覚理解においては、モデルは次トークン予測パラダイムを採用し、次のテキストトークンを予測して視覚的な質問応答や推論タスクを実行します。視覚生成においては、次スケール予測パラダイムを使用し、画像の次のスケール情報を段階的に予測します。これにより、モデルは単一のフレームワーク内で視覚タスクと言語タスクの両方を効率的に処理できます。
- ビジュアルデコーダーと特徴マッピングVARGPTは、高品質な画像生成のために20億個のパラメータを持つ専用のビジュアルデコーダを搭載しています。このデコーダは30個のTransformerブロックで構成され、各ブロックには幅1920の注意ヘッドが30個含まれており、適応型正規化(AdaLN)を採用しています。
- マルチスケールラベリング視覚生成をサポートするために、VARGPTはVARモデルと同様のマルチスケール変分オートエンコーダー(VAE)アーキテクチャを採用しています。このアーキテクチャは、4090の語彙サイズを持つマルチスケール量子化スキームによって画像を異なるスケールのラベルに分解し、OpenImagesデータセットをトレーニングに使用します。
- 混合モード入力および出力VARGPTはテキストと画像の混合入力に対応しており、テキストと画像を同時に出力できます。このモデルは、特殊なマーカーとキューフォーマットを用いてテキストとビジュアルのモダリティを柔軟に切り替え、混合モダリティによる生成を実現します。
- 3段階のトレーニング戦略
- 事前トレーニング段階テキストと視覚的特徴の間のマッピング関係を理解する。
- ハイブリッドビジョン指導の微調整段階視覚的に生成された指示データセットを構築し、それを複数ターンの対話型指示データセットと組み合わせてハイブリッド学習を行うことで、モデルの視覚的な質問応答および指示から画像への合成タスクにおける能力が向上する。
VARGPTプロジェクトの住所
- プロジェクト公式サイト:https://vargpt-1.github.io/
- GitHubリポジトリ:https://github.com/VARGPT-family/VARGPT
- arXiv技術論文:https://arxiv.org/pdf/2501.12327
VARGPTの応用シナリオ
- 視覚的な質問応答と推論VARGPTは、画像の内容を理解し、正確なテキスト応答を生成することで、複雑な視覚的質問応答タスクを処理できます。
- 画像生成の手順VARGPTは、テキストによる指示に基づいて高品質な画像を生成する機能をサポートしています。簡単なテキスト記述を用いて、特定のシーンの画像を生成できます。
- マルチモーダルコンテンツの作成VARGPTは、テキストと画像間のシームレスな切り替えをサポートする、混合モーダルな入出力に対応しています。テキストによる説明を入力すると、モデルは対応する画像を生成したり、画像に基づいて関連するテキストコンテンツを生成します。
- 創造性とエンターテイメントVARGPTの画像生成機能は、クリエイティブ分野やエンターテインメント分野に応用でき、パーソナライズされたアート作品、バーチャルキャラクターなどを生成することが可能です。