AB
AiBoss
project

GLM-Image - ZhipuとHuaweiが共同開発したマルチモーダル画像生成モデル

GLM-Imageは、ZhipuがHuaweiと共同でオープンソース化した、新世代のマルチモーダル画像生成モデルです。Ascend Atlas 800T A2デバイスとAscend MindSporeフレームワーク上で学習されており、国内生産チップのみで完全に学習された初の最先端モデルです。

GLM-Imageとは何ですか?

GLM-Imageは、ZhipuがHuaweiと共同でオープンソース化した次世代マルチモーダル画像生成モデルです。Ascend Atlas 800T A2デバイスとAscend MindSporeフレームワークでトレーニングされており、国内生産チップのみでトレーニングされた初の最先端(SOTA)モデルです。このモデルは、「自己回帰+拡散デコーダ」のハイブリッドアーキテクチャを採用し、9Bの自己回帰モデルと7Bの拡散デコーダを組み合わせることで、グローバルな意味理解と高周波の詳細生成のバランスを取り、テキストレンダリングや知識集約型のシーンに特に優れています。CVTG-2KおよびLongText-Benchのリーダーボードでオープンソースモデルの中で1位を獲得し、複数の解像度での画像生成をサポートし、高いコストパフォーマンスとスピードを誇り、国内のオープンソース画像生成モデルの開発にとって重要な参考資料となっています。

GLM-Imageの主な機能

  • 高品質な画像生成このモデルは、肖像画、風景画、静物画など、さまざまなシーンに対応した高解像度画像(最大2048×2048ピクセル)を生成できます。
  • 複雑なテキストレンダリングGLM-Imageは、画像内に複雑なテキストコンテンツを生成することに優れており、複数領域にわたるテキスト生成をサポートし、ポスター、プレゼンテーション資料、科学イラストなどの知識集約型のシナリオに適しています。
  • マルチタスク対応GLM-Imageは、画像編集、スタイル転送、複数被写体の一貫性生成など、さまざまな画像間タスクをサポートしています。
  • マルチ解像度適応型このモデルは、再学習なしで様々な解像度の画像生成タスクに適応的に対応でき、非常に柔軟性が高い。

GLMイメージングの技術的原理

  • 自己回帰モジュール:モデル9Bパラメータに基づく自己回帰モデルは、画像の全体的な意味理解と低周波レイアウト情報を担当する。テキストから画像への変換と画像から画像への変換を組み合わせたトレーニングを通して、複雑な指示を理解する能力を高める。このモデルは、位置埋め込みとしてMRoPE(多次元RoPE)を使用し、画像とテキストのインターリーブ生成をサポートしています。
  • 拡散デコーダ:モデル7Bパラメータに基づくDiT(拡散変換器)構造は、画像中の文字のストロークや細かいテクスチャなどの高周波のディテールを生成することに重点を置いています。このモデルは、意味的なVQ(ベクトル量子化)トークンとVAE(変分オートエンコーダー)の潜在表現を組み合わせることで、意味情報と高頻度の詳細の融合を実現します。Glyph-byT5モデルは、テキスト領域の文字レベル符号化を実行するために導入され、それによってテキスト生成の精度を向上させます。
  • トレーニングと最適化高性能モデル学習における国産チップの利用可能性を検証するため、Ascend MindSporeフレームワークをベースとしたAscend Atlas 800T A2デバイス上で全工程を完了した。(モデル)トレーニングの効率とパフォーマンスを向上させるために、動的グラフ多段階パイプライン最適化とマルチストリーム並列戦略が採用されています。強化学習最適化モジュールは、自己回帰生成器と拡散デコーダをそれぞれ最適化し、意味の一貫性と視覚的な詳細品質を向上させます。

GLM-Imageプロジェクトのアドレス

  • プロジェクト公式サイト:https://z.ai/blog/glm-image
  • GitHubリポジトリ:https://github.com/zai-org/GLM-Image
  • ハギングフェイスモデルライブラリ:https://huggingface.co/zai-org/GLM-Image

GLM-Imageの応用シナリオ

  • 科学イラストと教育GLM-Imageは、複雑な論理や文章による説明を含む科学イラストを生成することができ、教育コンテンツをより直感的に提示するのに役立ちます。
  • 複数コマのイラストと漫画このモデルは、一貫したスタイルを維持しながら複数のテキスト要素を正確に生成することで、eコマース画像、漫画、その他の複数パネルのグラフィックを生成するのに適しています。
  • ソーシャルメディアとコンテンツ制作このモデルは、ソーシャルメディアのカバー画像や広告用クリエイティブ画像などを迅速に生成でき、複雑なグラフィックやテキストのレイアウトにも対応しているため、コンテンツの魅力を高めることができます。
  • 商業ポスターと広告このモデルは、優れたデザインセンスと正確なテキスト埋め込みにより、ブランドプロモーションのニーズを満たす商業ポスターやホリデープロモーション画像を生成できます。
  • 写実的な写真と芸術的な創作GLM-Imageは、肖像画、風景画、静物画などのリアルな画像を生成することに優れており、クリエイティブなニーズを満たすためのカスタマイズされた芸術スタイルにも対応しています。