project
Hunyuan-DiT - テンセントHunyuanのオープンソーステキストベースグラフ拡散モデル Hunyuan-DiT
Hunyuan-DiTは、テンセントのHunyuanチームが開発した高性能なテキストから画像への拡散変換モデルです。中国語と英語の理解能力に優れ、テキストプロンプトに基づいて複数の解像度の画像を生成できます。
Hunyuan DiTとは何ですか?
Hunyuan-DiTは、TencentのHunyuanチームがオープンソース化した、高性能なテキストから画像への拡散型Transformerモデルです。中国語と英語の理解能力に優れ、テキストプロンプトに基づいて複数の解像度で高品質な画像を生成できます。Hunyuan-DiTは、バイリンガルCLIPとマルチリンガルT5エンコーダーを組み合わせた革新的なネットワークアーキテクチャを採用しています。綿密に設計されたデータパイプラインを通じて学習および最適化されており、複数ターンの対話に対応し、文脈に基づいて画像を生成および洗練できます。中国語から画像への生成分野において、Hunyuan-DiTはオープンソースモデルの中でもトップレベルの性能を実現しています。
Hunyuan DiTの主な機能
- バイリンガルテキストから画像への生成Hunyuan DiTは中国語または英語のテキストプロンプトに基づいて画像を生成できるため、多言語画像生成タスクにおいて有望なツールとなる。
- 中国の要素に関する詳細な理解このモデルは中国語に特化して最適化されており、古代中国の詩、伝統的な中国の衣服、中国の祭りなど、中国の伝統文化に関連する要素をよりよく理解し、生成できるようになっています。
- 長文処理機能最大256個のタグを含むテキスト入力をサポートしており、DiTは複雑で長いテキスト説明を理解し、それに合った画像を生成できます。
- 複数サイズの画像生成Hunyuan-DiTは、ソーシャルメディアへの投稿から大判印刷まで、さまざまな用途のニーズを満たすために、さまざまなスケールで高品質の画像を生成できます。
- 複数ターンの対話と文脈理解Hunyuan DiTは、ユーザーとの複数回の対話を行うことで、対話履歴や文脈情報に基づいて画像を生成・反復することができ、インタラクティブ性と創造性を向上させます。
- 画像とテキスト間の高い一貫性Hunyuan-DiTによって生成される画像は、内容の面で入力されたテキストプロンプトと非常に高い一致性を示し、画像がテキストの意図と詳細を正確に反映することを保証します。
- 芸術的で創造的Hunyuan DiTは、一般的な画像を生成するだけでなく、テキスト内の創造的な説明を捉えて、芸術的で創造的な画像作品を生成することもできます。
Hunyuan DiTの公式サイトへの入り口
- 公式プロジェクトホームページ:https://dit.hunyuan.tencent.com/
- ハグ顔モデル:https://huggingface.co/Tencent-Hunyuan/HunyuanDiT
- GitHubのソースコード:https://github.com/Tencent/HunyuanDiT
- 技術報告書:https://tencent.github.io/HunyuanDiT/asset/Hunyuan_DiT_Tech_Report_05140553.pdf
Hunyuan DiTの技術アーキテクチャ
- デュアルテキストエンコーダハイブリッドDiTは、バイリンガルCLIPエンコーダとマルチリンガルT5エンコーダを組み合わせることで、入力テキストの理解とエンコード能力を向上させます。CLIPモデルは画像とテキストの相関性が高いことから、T5モデルは多言語およびテキスト理解能力が高いことからそれぞれ選定されました。
- 変分オートエンコーダー(VAE)事前学習済みのVAEを用いて画像を低次元の潜在空間に圧縮することで、拡散モデルがデータ分布を学習しやすくなります。VAEの潜在空間は、生成品質に大きな影響を与えます。
- 拡散モデル拡散トランスフォーマーをベースにしたHunyuan DiTは、拡散モデルを用いてデータ分布を学習します。このモデルは、クロスアテンション機構を通して、テキスト条件と拡散モデルを組み合わせます。
- 改良型発電機Diffusion Transformerは、ベースラインのDiTに比べていくつかの改良が加えられており、例えば、Adaptive Layer Normalization(AdaNorm)を使用して、きめ細かいテキスト条件の実行を強化しています。
- ロケーションコーディングMixed-Yuan DiTは、回転位置埋め込み(RoPE)を使用して絶対位置と相対位置の依存関係を同時にエンコードし、マルチ解像度のトレーニングと推論をサポートします。
- マルチモーダル大規模言語モデル(MLLM)画像とテキストのペアの元のキャプションを再構築し、データ品質を向上させるために使用されます。MLLMは、世界に関する知識を取り入れた構造化されたキャプションを生成するように微調整されています。
- データパイプラインこれには、データの取得、解釈、分類、および適用が含まれます。新しいデータの妥当性は、「データフリート」と呼ばれる反復プロセスを通じて検証されます。
- トレーニング後の最適化推論フェーズでは、ONNXグラフの最適化、カーネルの最適化、演算の融合など、展開コストを削減するための最適化が行われます。
ハイブリッドDiTと他のテキストベースグラフモデルとの比較
HunyuanDiTの生成能力を他のモデルと包括的に比較するために、Hunyuanチームは4つの側面を持つテストセットを作成し、テキストと画像の整合性、AIアーティファクトの除去、被写体の明瞭さ、美観といった項目について50人以上の専門評価者による評価を行った。
| モデル | オープンソース | テキストと画像の整合性(%) | AIアーティファクトを除外(%) | 主題の明瞭度(%) | 美的評価(%) | 総合得点(%) |
|---|---|---|---|---|---|---|
| SDXL | ✔ | 64.3 | 60.6 | 91.1 | 76.3 | 42.7 |
| PixArt-α | ✔ | 68.3 | 60.9 | 93.2 | 77.5 | 45.5 |
| Playground 2.5 | ✔ | 71.9 | 70.8 | 94.9 | 83.3 | 54.3 |
| SD 3 | ✘ | 77.1 | 69.3 | 94.6 | 82.5 | 56.7 |
| Midjourney v6 | ✘ | 73.5 | 80.2 | 93.5 | 87.2 | 63.3 |
| DALL-E 3 | ✘ | 83.9 | 80.3 | 96.5 | 89.4 | 71.0 |
| Hunyuan-DiT | ✔ | 74.2 | 74.3 | 95.4 | 86.6 | 59.0 |