Nano Bananaに代わる国内発のオープンソース代替ツール。GLM-Imageを検証する10件の事例研究付き。
Zhipuは、最新のマルチモーダルモデルであるGLM-Imageをリリースし、オープンソース化しました。このモデルはテキスト精度0.9116を達成し、現時点で最も高精度なオープンソースのテキストレンダリングモデルとなっています。NED指標も非常に優れており、プロンプトへの高い準拠性とスペルミスの最小化を実現しています。
Nano Banana Proはインターネット上で爆発的な人気を博し、様々なインフォグラフィック、ポスター、知識カードがソーシャルメディアに溢れかえっています。しかし、実際に日々の業務で使用すると、次のような問題に直面することがよくあります。テキスト量が多い場合、生成される画像に歪んだり乱雑になったりした中国語の文字が含まれることが多いのです。レイアウト自体は一部問題ない場合もありますが、テキスト情報が非常に不正確なため、使い物になりません。
クリエイターや一般労働者を長年悩ませてきたこの問題点は、ついに国産モデルによって解決された。
志普リリースとオープンソースすでに最新ののマルチモーダルGLM-Imageモデルは0.9116というテキスト精度を達成しており、現在利用可能なテキストレンダリングモデルの中で最も精度が高い。オープンソースモデル。NED指標も最高レベルです。プロンプトワード遵守率は非常に高く、誤字脱字や漏れも少ない。
これは本当に目を引きました。早速一緒に試してみましょう。
現在、GLM-Imageは、BigModelでオンライン利用する方法、またはAPI呼び出し方法の3つの方法で利用できます。いずれの方法も画像1枚あたり0.1元で、1024×1024から2048×2048までのあらゆるサイズの画像に対応しています。
オンラインジェネレーターはサイズ変更や拡大縮小をサポートしていません。常に1280×1280の固定画像が出力されます。
公式サイト:
https://bigmodel.cn/trialcenter/modeltrial/image
Zhipu Qingyan APPまたはWebバージョンAI描画知的体、 また無料GLM-Imageを体験してください。
公式サイト:
https://chatglm.cn/main/gdetail/65a232c082ff90a2ad2f15e2
私は推薦するみんな Claude コードを介してAPIを使用すると、より良い結果が得られ、カスタムサイズにも対応します。
Claude コードの設定手順については、こちらのチュートリアルを参照してください。GLM-4.5電源を接続するための手順ガイド。 Claude Code:オープンソース究極のモデル構成ガイド
リクエスト例(APIキーは適宜置き換えてください)。プロンプトワード(および画像サイズ):
curl -X POST "https://open.bigmodel.cn/api/paas/v4/images/generations" \ -H "Authorization: Bearer YOU-API-KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "glm-image", "prompt": "图像提示词", "size": "1056 × 1408" }'
事例1:科学普及のためのイラスト
プロンプトワード教育目的の水彩画風手描き模型構造図。左右対称のレイアウト。ベージュのアンティーク調水彩紙を背景に、自然なぼかしとコーヒー染み効果を施し、柔らかく半透明な手描きの雰囲気を醸し出している。
左側 – 拡散アーキテクチャ(全体的に徐々に明確化):タイトル「拡散アーキテクチャ(全体的に徐々に明確化)」が上部に配置されています。
縦に並べられた、段階的に重ねられた3枚の水彩画を展示します。
抽象的でカラフルな水彩画風のノイズの塊で、色の混ざり方が不規則。「ランダムノイズ入力」とラベル付けされている。
画像内の水彩画のブロックはいくつかの主要な領域に収束し始め、全体的なノイズが大幅に減少し、画面全体に散らばっていた斑点が消えた。地面と空の区別、彩度の低いぼやけた木の影、遠くに見える家々のブロックなど、大まかな構図の方向性が漠然と浮かび上がってきた。しかし、すべての要素はぼやけた色域としてのみ存在し、明確な輪郭、シャープな輪郭線、識別可能なディテールを欠いていた。
「輪郭が見え始めている」と記されている。木々、家々、空など、細部まで丁寧に描かれた、明瞭で完成度の高い水彩画の田園風景。「画像がはっきりと形作られている」と記されている。
右側 – 自己回帰アーキテクチャ(ブロックごとの連結):タイトル「自己回帰アーキテクチャ(ブロックごとの連結)」が上部に表示されます。
3つのモジュールユニットを垂直に配置して組み立てる工程を示します。
左上隅に、小さな水彩画の花の四角形が、完全で明確な形で表示され、「最初に部分的に形成された」とラベル付けされている。
最初のステップから花の位置、サイズ、形状はそのままにして、花の横に水彩絵の具で葉と茎のブロックを追加します。新しい要素は、元の花と自然に馴染むようにしてください。既存の花を移動、拡大縮小、または描き直さないでください。「既存の結果に基づいて生成を続ける」にチェックを入れてください。
最初の2つの手順で設定したすべての要素を元の位置のままにして、新しい花、緑の葉、蝶を追加し続け、最終的に「徐々に組み合わせて完成形を形成する」とラベル付けされた完全なブーケの画像を作成します。
全体的なスタイル要件:水彩画風の手描き教科書イラストスタイルで、柔らかく自然な色調を用いる。すべてのテキストラベルには手書き風の中国語フォントを使用する。水彩画の輪郭は自然にぼかし、線は完全に閉じずに、工業的またはデジタル的な印象を避け、温かく親しみやすい科学普及の雰囲気を維持する。
ケース2:小紅書カバー
プロンプトワード通勤時のOOTD(今日のコーディネート)をテーマにした小紅書(小紅書)のノートカバーを作成し、内容として「OOTD:1週間分のコーディネートを重複なく」と記述してください。
プロンプトワード賃貸アパートのリノベーションVlogをテーマにした小紅書(小紅書)のノートカバーを3:4のアスペクト比で作成し、内容は「500元で古くてボロボロだった賃貸アパートを可愛くて風変わりな家に変身させました。大家さんにも引っ越したのかと聞かれました!」とします。
ケース3のコミック
プロンプトワード人間の少女と擬人化されたイタチが登場する、ユーモラスな民話風の漫画イラスト(4コマ構成)を作成してください。全体的なスタイルは軽快で面白く、中国の民話の要素が少し含まれています。画風は漫画的ですが、キャラクターの表情は誇張されていて分かりやすいです。
フレーム1
夜の狭い道で、ある光景が繰り広げられる。背中に鞄を背負った少女が歩いていると、突然、直立歩行するイタチが道を塞ぎ、真剣で神秘的な表情を浮かべる。
(吹き出し)イタチは言った、「私が人間に見えるか?」
2番目の正方形
少女は立ち止まり、考え込むように首を傾げ、何気ない様子だった。
(吹き出し)少女は「あなたは玉皇大帝のように見えます」と言います。
3番目の正方形
イタチの瞳孔は瞬時に開き、極度の恐怖に顔を歪め、冷や汗が背中を伝った。言葉によるやり取りはなく、感情表現は誇張されていた。
4番目の正方形
イタチは突然前に飛び出し、少女の口を塞ぎ、低い声で神経質に唸った。
(吹き出し)イタチが「お姉ちゃん、新しいアカウント作っちゃダメだよ!」と言います。
全体的なスタイル要件:
中国の民俗習慣と現代のジョークを組み合わせる
大げさな表情と明らかな体の動き
会話はすべて中国語です。
映像は鮮明で、漫画のコマ割りも分かりやすい。
雰囲気はユーモア、意外な展開、そしてインターネットミームに傾いている。
ホラー要素はなく、軽妙なコメディ寄り。
事例4:小紅書からの画像
プロンプトワード小紅書(小紅書)風のインフォグラフィック。漫画風のスタイル、手描き風のテキスト、オフホワイトの背景。
画像の中心には、脳と絵筆を組み合わせた漫画風のイラストがあり、認知と生成を象徴している。その隣には、付箋に「GLM-Image」という文字が手書きで書かれている。
上部に手書きの見出し:「国産チップが好調…」オープンソース画像SOTA
以下の字幕:Zhipu × Huawei | GLM-Image
漫画風のチップやサーバー、キラキラのステッカーなどを加えることで、全体的なビジュアルは未来的でありながらも可愛らしい雰囲気を醸し出している。
全体的なスタイル:手描き風で、新鮮かつ未来的な漫画調。余白をたっぷりと使い、明確な焦点を絞っている。画像とテキストはすべて手描きで、写実的な要素は一切ない。
右下隅の透かし:「K-Sister Research Society」
プロンプトワードこのインフォグラフィックは、漫画風の絵柄、手描きの文字、淡いミントグリーンの背景が特徴で、『小紅書』のスタイルを踏襲している。
画面の左右構造図:
左側には、「自己回帰モデル|指示の理解|全体構成」とラベル付けされた、漫画風の「吹き出し+脳」が描かれている。
右側には、「描画ブラシ+テキストストローク」という漫画風の画像があり、「拡散デコーダー|詳細描写|テキストストローク」というラベルが付けられています。
手描きの矢印が2つの部分をつないでおり、その上に「指示を理解して正しい単語を書きなさい」というタイトルが書かれています。
蛍光ペンで下線を引くことで、「認知生成」と「知識+推論」というキーワードを強調している。
全体的なスタイル:手描き風で可愛らしく、明瞭で分かりやすく、簡潔な情報と十分な余白が特徴。
右下隅の透かし:「K-Sister Research Society」
事例5:情報ラベリング
プロンプトワード中国のSNSプラットフォーム「小紅書」風の、リアルな撮影クオリティと縦構図の寝室インテリア紹介画像を制作してください。画像は、温かく落ち着いた雰囲気の小さな寝室を描いており、和風で可愛らしいスタイルを基調としています。片側には、緑のシーツと白いベッドカバーがかかったシングルベッドがあり、ベッドの上にはテディベアやクッションが置かれています。ベッドの横には、可愛らしい牛柄と柔らかな色合いの漫画風ラグが敷かれています。
部屋の中央には白い机があり、その上には色鮮やかなイラストが表示されたノートパソコンが置かれている。机の上には文房具、水グラス、小さな装飾品も並んでいる。机の後ろには白い薄手のカーテンが垂れ下がった窓があり、夜になると街の明かりがちらりと見える。窓際と机の上には温かみのある黄色のデスクランプとナイトライトが置かれ、柔らかな夜の雰囲気を醸し出している。左側には多段式の収納棚と本棚があり、本、収納ボックス、おもちゃ、ナイトライト、日用品などがぎっしりと詰まっている。物が多いものの、空間全体は整然としており、どこか生活感のある、本物の雰囲気を漂わせている。
画像には、中国のソーシャルメディアプラットフォームである小紅書の商品推薦画像で使用されているものと同様のスタイルの複数の商品タグが重ねて表示されています。タグのテキストは黄色または薄黄色で、わずかに輪郭と影が付けられており、読みやすさを確保しています。各タグは対応するアイテムの近くに固定され、不規則に配置され、商品名と価格情報が含まれています。例えば、「装飾絵画 💰25」、「牛柄ラグ 💰45」、「ナイトライト 💰29.9」、「カーテン 💰52」、「テディベア 💰107」など、主要な視覚要素を覆い隠すことなく、部屋の家具にかかる費用の完全なリストを作成します。
ケース6のレシピ
プロンプトワード「豚肉とピーマンの炒め物」の手順を追ったレシピ情報を含むインフォグラフィックを作成してください。要件:
上からの眺め、ミニマルスタイル、白い背景
料理の中国語名は上部中央に表示されている。
すべての材料に中国語名、分量、カロリーを明記してください。
調理手順は、点線とアイコンを使って図示してください。
完成品のプレゼンテーションは下部に表示されます。
この料理の伝統的な作り方によると、自動適切なマッチング:
1. 原材料リスト(正確な分量とカロリー含有量を含む)
2. 調理手順を示すアイコン(例:野菜を切る、炒める、味付けをするなど)
3. 最終プレゼンテーションのスタイル
ケース7のインフォグラフィック
プロンプトワード商品写真風の、高級感のある白菜のクローズアップポスターを作成してください。構図は中央に配置し、新鮮でふっくらとした白菜をメイン被写体としています。葉は層状になっており、外側の葉は淡い緑色、内側の芯は淡い黄色です。葉脈がはっきりと見え、表面は自然でみずみずしく、しっとりとした質感です。全体的に、白菜は清潔で柔らかく、しっかりとした印象を与えます。
背景は清潔感のある淡いグレーで、余計なものや模様がなく、食材そのものの形や質感を際立たせている。
照明には、側面と正面から当たる柔らかな自然光を使用し、葉が均一に照らされ、はっきりとした層が浮かび上がるようにしています。下部と背面にはわずかに柔らかな影ができ、過度なコントラストを生み出すことなく立体感を高め、すっきりとした洗練された画像に仕上がっています。
上部のテキストレイアウト
画面上部中央にテキストを配置:
メインタイトル「白菜」は、自然で気取らない手書き風のスタイルで書かれています。フォントの色は、白菜の外側の葉の鮮やかな淡い緑色から取られており、柔らかな筆致が親しみやすく自然な印象を与えます。
副題/コピー:「熱を冷ましイライラを和らげ、乾燥を潤し便通を促進し、脾臓を強化し胃を養う」というコピーは、伝統的な中国医学の食事療法の概念に基づいて作成されており、白菜の保湿効果と整体効果を強調しています。
サブタイトルのフォント:手書き風で、温かみのある茶色。メインタイトルの下に配置され、柔らかく控えめな視覚効果を生み出している。
下部コンテンツエリア(調理方法の実演)
画面下部には、白菜に適した3つの調理法が横一列に並んでいます。それぞれの調理法には、完成品の小さな写真と中国語の説明文が添えられており、統一感のある簡潔な文体で書かれています。
添付の写真は、強火でさっと炒めた白菜です。茎はシャキシャキとして柔らかく、葉はつややかで、家庭的な素朴な味わいが楽しめます。
写真には、キャベツと豆腐を一緒に煮込んだスープが写っています。スープの色は淡く、そのまろやかで滋養のある性質を反映しており、一年を通して美味しく召し上がっていただけます。
酢で炒めたキャベツは、薄切りにしたキャベツを軽く焦げ目がつくまでさっと炒めたもので、爽やかな色合いと、食欲をそそる酸味と旨味が際立っています。
全体的なスタイル要件:
全体的なスタイルはミニマルな製品広告で、余白をたっぷりと使い、情報を控えめにすることで、食材の自然な形状と健康効果を強調しています。高級感があり、清潔感があり、控えめな美学は、健康的な食生活、生鮮食品ブランド、またはウェルネス関連のビジュアルコンテンツに適しています。イラストや漫画のような雰囲気は一切なく、リアルな写真品質と高解像度を特徴としており、ポスター、ECサイトのメイン画像、健康教育の展示などに最適です。
ケース8ポスター
プロンプトワードこのモダンでクリエイティブなポスターは、澄み切った青空を背景に、口元をピンクで縁取って笑顔を作ったロバのクローズアップが特徴です。画像の上部には、ピンク色のアーティスティックなフォントで「こんにちは、働く人たち!」と書かれています。左側には、働く人々の生活の様々な側面を描いた白いテキストが並んでいます(例:「仕事のプレッシャーは山より重く、財布は紙より軽い」「慌ただしい仕事だが、給料はわずか」「仕事に行くのは葬式に行くようなもので、仕事を終えるのはディスコに行くようなもの」「コーヒーは毎日私を支えてくれるが、給料は毎年なくなっていく」「ハゲるまで残業し、貯金は二桁にまで減ってしまった」)。配色は主に青と茶色で、明るく対照的な色が使われています。クローズアップの構図はロバの顔と創造的な笑顔を強調し、働く人々の日常生活を風刺したユーモラスで軽快な雰囲気を作り出しています。
ケース9 映画ポスター
プロンプトワードこちらは「海辺の夕日」と題されたレトロ調の映画ポスターです。海に沈むオレンジがかった赤い夕日を背景に、ビーチベンチに座る男女のシルエットが、穏やかな雰囲気を醸し出しています。ポスターは蛍光グリーンとオレンジレッドのコントラストの効いた配色を用い、手書き風の「海辺の夕日」の文字が印象的です。「都会の午後4時の夕日に飽きた? 時には海辺の夕日が見たい」というキャッチフレーズと相まって、自然とロマンスへの憧れを表現しています。下部に配置されたレトロな要素(「2025」という年号、ブランドロゴ「cc ORIGINAL POSTER」など)がノスタルジックな雰囲気を高め、芸術的でありながらレトロシックな雰囲気に満ちた、洗練されたスタイルに仕上がっています。
ケース10 パッケージデザイン
プロンプトワードこれは、リアルな3Dトマトのパッケージボックスです。メインデザインは、本物のトマトの皮の黄色い斑点や質感を再現した赤い紙素材で作られた、独創的なトマトの形です。上部には緑色の模造茎が配置されています。ボックスには穴の開いた窓があり、中にはふっくらとした丸いミニトマトが何個も重ねて入っています。前面の白いラベルには「トマト」の文字がはっきりと表示されています。ボックスには「K-Sister Research Society」のブランドロゴと、「自然でおいしい果実」「甘くて爽やか」「弾けるような果汁」「自然熟成」といった製品情報も記載されています。パッケージにはリサイクルマークもはっきりと表示されています。実用的このデザインは、セクシーさと環境保護というコンセプトを体現しています。純白の背景に、水平な視点を用いることで、トマトの光沢のある質感、紙の質感、精緻に印刷されたロゴなど、立体的な形状と素材の豊かなディテールを際立たせています。赤、白、緑を基調としたシンプルでフレッシュなデザインスタイルは、自然で健康的なブランドイメージを伝え、創造的で環境に優しい食品パッケージデザインを成功させています。画像は高精細で、細部まで鮮明に表現されています。
今回、Zhipuは主流の拡散アーキテクチャを引き続き使用するのではなく、自社開発の自己回帰+拡散エンコーダーのハイブリッドアーキテクチャを採用した。
拡散アーキテクチャは、本質的には非常に混沌としたノイズを徐々に明確化していくプロセスであり、目を細めてからはっきりと画像を見るようになるプロセスによく似ている。
Diffusionアーキテクチャによって生成されたモデルは、強い統一感と一貫したスタイルを備えているため、ポスターやイラストに非常に適しています。Nano Banana Pro、MidjourneySeedream 4.5などは、拡散アーキテクチャモデルの典型的な例である。
拡散生成プロセスにおいて、テキストは復元すべき複雑な形状として扱われます。テキスト密度が高い場合、拡散プロセス中に文字が伸びたり歪んだりしやすく、その結果、よく見られる「引っかき傷のような文字」が発生しやすくなります。
自己回帰(AR)生成は、段階的に進められるシーケンシャルなプロセスであり、各ステップでは以前に生成されたコンテンツをコンテキストとして参照します。モデルはまず文字を生成し、次にその文字を使用して次の文字を決定することで、前後のコンテンツ間の強い相関関係を確保します。
GLM-Imageのハイブリッドアーキテクチャでは、まず自己回帰メカニズムが介入し、以下の役割を担います。プロンプトワードテキストの内容は正しい順序で記述され、その後、拡散エンコーダーが画像の詳細と全体的な視覚表現を完成させます。テキストの精度が向上し、画像全体に質感とスタイルが維持されます。
総合的に見て、GLM-Imageは優れた中国語コマンド理解能力と高いテキスト生成精度を誇ります。また、情報密度が高い場合でも、文字化けは最小限に抑えられます。テキストに引用符を追加することで、精度はさらに向上します。コンテンツ制作者にとって、まさに生産性向上ツールと言えるでしょう。
Huawei A2チップとMindSpeedトレーニングフレームワークをベースとしたGLM-Imageは、データ前処理から…までの全プロセスを正常に完了しました。大型モデルこの一連の研修プロセスは、国内で開発されたフルスタックコンピューティングプラットフォームの最先端の能力を明確に示している。マルチモーダルこのモデルは、現実世界で完全に学習され、継続的に反復されるという道筋も備えているため、もはや外部の計算能力に依存しない。
GLM-Imageは、使いやすく、操作も簡単なだけでなく、非常にコスト効率にも優れています。現在 GLM-Imageは、1枚あたりわずか0.1元で画像を生成します。Nano Banana Proは1枚あたり約1元で、これは10倍の価格だ。
GLM-Imageの価値は、その機能だけでなく、再現可能な技術的道筋を実証し、将来の進歩への道を開く点にもある。マルチモーダルこのモデルは、参照となる工学的パラダイムを提供する。
国内の技術システムにおいては、最先端モデルの開発経路は実現可能であるだけでなく、着実に発展し始めている。