PixArt-Σ - ファーウェイのテキストベースの画像モデルで、4K高解像度画像を生成可能
PixArt-Σは、ファーウェイ・ノアズアーク研究所、大連理工大学、香港大学の研究者によって開発されたテキストベースのグラフモデルです。拡散変換アーキテクチャ(DiT)に基づいており、プロンプトからテキストを抽出するために特別に設計されています。
PixArt-Σとは何ですか?
PixArt-Σは、ファーウェイ・ノアズアーク・ラボ、大連理工大学、香港大学の研究者によって開発された、拡散変換(DiT)アーキテクチャに基づくテキストから画像への変換モデルです。テキストプロンプトから最大4K解像度の高品質画像を直接生成するように特別に設計されています。PixArt-αをベースに、高度な要素を統合し、弱から強への学習方法を採用することで、生成画像の忠実度を向上させるだけでなく、画像とテキストプロンプトの整合性も高めた、より強力なモデルを実現しました。PixArt-Σで生成された画像は、DALL·E 3やMidjourney V6といったトップクラスのテキストから画像への変換製品に匹敵する美的品質を実現し、テキストプロンプトへの適合性にも優れています。
PixArt-Σ公式サイトのエントリー
- 公式プロジェクトホームページ:https://pixart-alpha.github.io/PixArt-sigma-project/
- GitHubリポジトリ:https://github.com/PixArt-alpha/PixArt-sigma(ソースコードとモデルは後日公開予定)
- arXivの研究論文:https://arxiv.org/abs/2403.04692
PixArt-Σの機能
- 4K解像度画像生成PixArt-Σは、テキストプロンプトから3840×2160の高解像度画像を直接生成でき、追加の処理や他のソフトウェアによる介入は不要です。
- 高精度なテキストから画像への変換画像を生成する際、このモデルはテキストの説明内容を正確に追従することができ、画像とテキスト間の高い一貫性を確保します。
- 高効率トレーニングPixArt-Σは「弱点から強点への学習」戦略を採用しており、高品質なデータと効率的なトークン圧縮技術を導入することで、学習効率を大幅に向上させています。
- 小型モデルサイズPixArt-Σは高解像度画像を生成できる一方で、モデルのパラメータ数が比較的少ない(0.6Bパラメータ)ため、モデルの効率性が高く、導入も容易である。
PixArt-Σの仕組み
PixArt-Σは、DiT(Diffusion Transformer)アーキテクチャに基づいて動作します。これは、拡散モデルとTransformerアーキテクチャを組み合わせた深層学習手法で、テキストによる説明を対応する画像に変換するために特別に設計されています。以下に、PixArt-Σの動作原理を詳しく説明します。
1. 事前トレーニング段階:
事前学習段階では、PixArt-Σは多数のテキストと画像のペアを使用して、テキストと画像間の関連性を学習します。このプロセスは通常、以下の手順で構成されます。
- テキストエンコーディングまず、入力されたテキスト記述は、テキストエンコーダ(Flan-T5など)を使用して、一連のトークンの埋め込み表現に変換されます。PixArt-Σでは、より複雑な記述を処理するために、テキストエンコーダのトークン長が約300語に拡張されています。
- 条件付き特徴抽出次に、これらのテキスト埋め込みと画像の条件付き特徴量が拡散モデルに入力されます。条件付き特徴抽出器は通常、テキスト埋め込みから画像生成に関連する特徴量を抽出するために使用される、事前学習済みのニューラルネットワークです。
- 拡散過程拡散モデルは、データ分布に徐々にノイズを加えていくプロセスをシミュレートすることで、データの分布を学習します。学習過程において、モデルはノイズの多いデータから鮮明な画像を復元する方法を習得します。
- 反復的な改良このモデルは、反復的なプロセスを通して、テキストによる説明に基づいて高品質な画像を生成する方法を徐々に学習していきます。このプロセスでは、生成される画像が実際の画像にますます近づくように、モデルのパラメータを調整していきます。
2. 弱者から強者へのトレーニング:
PixArt-Σは、弱データから強データへと段階的に学習を進める「弱データから強データへ」の学習戦略を採用しています。つまり、まず低品質のデータセットでモデルを学習させ、その後、より高品質なデータセットとより複雑な学習戦略を徐々に導入していくということです。このアプローチにより、限られたリソースの中で、モデルは新しいデータとアルゴリズムを効果的に活用し、パフォーマンスを向上させることができます。
3. 高品質のトレーニングデータセット(Internal-Σ):
PixArt-Σは、高解像度画像と詳細かつ正確な説明を含む、新しい高品質のデータセットを使用します。このデータは、モデルに豊富な視覚情報とテキスト情報を提供し、生成される画像の品質向上とテキスト説明との整合性の向上に役立ちます。
4. 効率的なトークン圧縮と重み初期化:
高解像度画像を生成するために、PixArt-Σはキーバリュー型トークン圧縮技術と特別に設計された重み初期化方式を採用しています。これらの技術により、モデルは計算リソースの必要量を削減しながら、高解像度画像の生成を効率的に処理できます。
5. 微調整テクニック:
微調整段階では、PixArt-Σは、より強力な変分オートエンコーダー(VAE)に置き換え、低解像度から高解像度へと拡張し、KV圧縮を使用しない状態からKV圧縮を使用する状態へとモデルを進化させることで、モデルのパフォーマンスをさらに向上させた。
6. 生成フェーズ:
生成段階では、ユーザーがテキストによる説明を入力すると、モデルは学習済みのテキストと画像の関連付けに基づいて、説明に一致する画像を繰り返し生成します。生成された画像は、テキストの説明の内容、スタイル、詳細に合わせて調整され、最終的な出力画像が美的にも美しく、かつテキストの意図を正確に反映するようにします。