project
Manzano - Appleの画像理解および生成モデル
Manzanoは、Appleが開発した新しいマルチモーダル大規模言語モデル(LLM)で、画像理解と画像生成を同時に実現できます。このモデルは、ハイブリッドビジョントークナイザーを使用して画像を変換します。
マンサノとは何ですか?
Manzanoは、Appleが開発した新しいマルチモーダル大規模言語モデル(LLM)であり、画像理解と画像生成を統合的に実現します。このモデルは、ハイブリッドビジョントークナイザーを用いて、画像を理解タスク用の連続埋め込みベクトルと生成タスク用の離散画像タグに変換します。Manzanoの中核を成すのは、テキストタグと画像タグの両方を予測する自己回帰型LLMデコーダです。Manzanoは、生成された画像タグをピクセルレベルの画像に変換する拡散デコーダを備えています。これにより、Manzanoは理解タスクと生成タスクの両方で優れた性能を発揮し、モデルサイズが大きくなるにつれてパフォーマンスが向上します。
マンサーノの主な機能
-
画像理解このモデルは画像の内容を理解し、画像に関する質問に答えることができる。
-
画像生成テキストプロンプトに基づいて高品質な画像を生成します。このモデルは複雑なテキストコマンドにも対応しており、創造的で詳細な画像を生成できます。
-
画像編集テキストベースの画像編集に対応しており、スタイル転送、ローカル編集、コンテンツ拡張などの機能が含まれています。
-
マルチモーダルな相互作用テキスト情報と画像情報を組み合わせることで、質疑応答やテキストと画像を組み合わせたコンテンツ作成など、複雑なマルチモーダルタスクをサポートします。
マンサーノの技術原理
- ハイブリッドビジョントークナイザー:
- 連続埋め込み画像理解タスクで使用されるこの手法は、豊富な意味情報を保持しながら、画像を連続的な埋め込みベクトルにエンコードします。
- 離散ラベル画像生成タスクで使用されるこの手法は、画像を離散的なラベルにエンコードし、自己回帰的な生成を容易にする。
- 自己回帰LLMデコーダーこのモデルは、テキストタグと画像タグの処理を統合し、次のタグ(テキストか画像かを問わず)を予測します。また、マルチモーダルタスクの共同学習をサポートし、理解タスクと生成タスクの両方を同時に処理できます。
- 拡散デコーダーこのプロセスでは、生成された離散的な画像マーカーをピクセルレベルの画像に変換します。拡散モデルの強力な生成機能により、生成される画像の品質とディテールが保証されます。
- 統一トレーニングフレームワークこのモデルは、大規模なテキストデータと画像データを用いて事前学習を行い、一般的な言語表現と視覚表現を学習します。その後、高品質なデータサブセットを用いてさらに学習を行い、パフォーマンスを向上させます。最後に、タスク固有のデータを用いて微調整を行い、それぞれのタスクにおけるパフォーマンスを強化します。
マンサノのプロジェクト住所
- arXiv技術論文:https://arxiv.org/pdf/2509.16197
Manzanoの応用シナリオ
- 画像理解視覚的質問応答(VQA)タスクで使用されるこの技術は、医師が画像コンテンツを迅速かつ正確に理解し、関連する質問に答え、診断を支援するのに役立ちます。
- 画像生成クリエイティブデザインの分野では、デザイナーが提供するテキストによる説明に基づいて高品質な画像が生成され、広告デザイン、ゲームアートなどにインスピレーションや素材を提供します。
- 画像編集コンテンツ制作者にとって、このモデルは、スタイル転送や局所的な変更といったテキストコマンドに基づいて画像を編集し、創造的な効果を迅速に実現することを可能にします。
- 文書の理解文書処理のシナリオにおいて、このモデルは文書内の画像コンテンツを理解し、文書コンテンツの抽出、分析、および質問への回答を支援することで、オフィスの効率性を向上させることができます。
- マルチモーダルな相互作用高度な教育シナリオでは、テキスト情報と画像情報を組み合わせることで、複雑な科学的概念を画像を通して説明するなど、学生により直感的で鮮やかな学習体験を提供することができる。