project
ERNIE-Image - Baidu Wenxinがオープンソース化したテキストベースの画像モデル。
ERNIE-Imageは、Baidu Wenxinチームが開発したオープンソースの8Bパラメータテキストベース画像モデルです。拡散トランスフォーマーアーキテクチャに基づいており、長文テキストの高い制御性と正確なレンダリングに重点を置いています。
ERNIE-Imageとは何ですか?
ERNIE-Imageは、Baidu Wenxinチームが開発したオープンソースの80億パラメータのテキスト画像変換モデルです。拡散トランスフォーマーアーキテクチャに基づいており、高い制御性と長文テキストの正確なレンダリングを重視しています。このモデルは、中国語と英語のバイリンガルポスター、漫画、インフォグラフィックなどの複雑なビジュアルコンテンツを正確に生成でき、テキストがぼやけて見える問題を解決します。ERNIE-Imageには、標準バージョン(高品質50ステップ)とターボバージョン(高速8ステップ)の2つのバージョンがあります。必要なビデオメモリはわずか24GBで、ローカルで実行できるため、デザイナーや開発者はすぐに使える中国語シーン画像生成ソリューションを利用できます。
ERNIE-Imageの主な機能
- 高度に制御可能な発電このモデルは複雑な構造のレイアウト制御をサポートし、複数のオブジェクト間の空間的な関係を正確に配置することができ、GENEvalベンチマークテストで0.8856という高いスコアを達成しました。
- 長文レンダリング特に、画像内の長文の二言語(中国語と英語)テキストを正確にレンダリングするために最適化されており、LongTextBenchテストで0.9733というスコアを達成したため、ポスターや漫画の制作に特に適しています。
- デュアルバージョンモード本ソフトウェアは、綿密な制作ニーズと迅速な反復作業ニーズに対応するため、標準バージョン(50ステップの高品質レンダリング)とターボバージョン(8ステップの高速抽出)の2つの推論モードを提供します。
- エンドツーエンド処理画像処理ワークフロー全体が内蔵されており、生成、編集、合成、拡大の4つの段階を網羅し、スケッチから完成品までのエンドツーエンドの制作をサポートします。
- 強化されたインテリジェントプロンプト軽量なプロンプトエンハンサーモジュールを搭載しており、短いユーザー入力を自動的に構造化された詳細な説明文に変換できます。
ERNIE-Imageの技術原理
- シングルストリームDiTアーキテクチャ拡散トランスフォーマーを採用してテキスト信号と画像信号を均一に符号化し、8Bパラメータスケールでクロスモーダル深度アライメントを実現することで、生成の一貫性と複雑なシーンを理解する能力を向上させています。
- 中国語のタイポグラフィ最適化これは中国語の文字構造と組版ロジックに特化して訓練されており、注意機構と位置符号化を改善し、従来の拡散モデルにおけるテキストの錯覚、曖昧さ、構造エラーの問題を解決します。
- 蒸留加速技術Turboバージョンは、知識蒸留によって教師モデルの機能を軽量な8ステップの生徒モデルに移行することで、実用的な品質を維持しながら推論速度を大幅に向上させています。
- 消費者向けハードウェアへの適応ローカルで動作させるには24GBのビデオメモリしか必要とせず、1024×1024の解像度をネイティブでサポートしているため、導入のハードルが低くなります。
ERNIE-Imageの使い方
- 環境準備ローカル環境に24GB以上のビデオメモリを搭載したNVIDIAグラフィックカードが搭載されていること、およびPython 3.8以降がインストールされ、適切に設定されていることを確認してください。
transformers>=4.50.0、torch、diffusers依存ライブラリなど - 標準バージョンモデルをロードします:合格
DiffusionPipeline.from_pretrained("Baidu/ERNIE-Image", torch_dtype=torch.float16, trust_remote_code=True)8Bパラメータモデルをロードし、50ステップの高品質生成シナリオのためにCUDAデバイスに移動します。 - ターボバージョンモデルをロード:合格
DiffusionPipeline.from_pretrained("Baidu/ERNIE-Image-Turbo", torch_dtype=torch.float16, trust_remote_code=True)ドラフト反復のニーズを満たすために、8段階の迅速な推論をサポートする、モデルの簡略版をロードします。 - 基本的なテキストベースの図の実行: 電話
pipe(prompt="描述文本", num_inference_steps=50, guidance_scale=7.5, height=1024, width=1024)テキストプロンプトとパラメータを渡し、返された画像オブジェクトを呼び出します。.images[0]結果を取得して保存します。 - インテリジェントなプロンプトで強化システムに内蔵されたプロンプトエンハンサーは、短い入力を自動的に構造化された説明に展開し、複雑なプロンプトを手動で作成する必要なく、生成品質を向上させます。
- 画像編集機能を呼び出す:使用
pipe.edit(prompt="修改指令", image=原图, mask=遮罩)このAPIは、指定された領域の部分的な再描画を実行し、マスクに基づいてコンテンツを正確に変更することを可能にします。 - 低ビデオメモリモードを有効にするビデオメモリが24GB未満の場合に追記してください。
device_map="auto"または電話pipe.enable_sequential_cpu_offload()実装レイヤーはオフロードされ、推論は一般消費者向けグラフィックカード上で実行される。
ERNIE-Imageの主要情報と使用要件
-
基本仕様8Bパラメータのシングルストリーム拡散トランスフォーマーアーキテクチャに基づいており、1024×1024解像度の画像生成をサポートします。
-
デュアルバージョンデザイン標準バージョンは、最終的な高品質レンダリングのための50ステップのSFTモデルです。ターボバージョンは、迅速なドラフト反復のための8ステップの蒸留モデルです。
-
中核となる能力長文のバイリンガルテキストを正確にレンダリングし(LongTextBenchスコア0.9733)、レイアウト生成を高度に制御でき(GENEvalスコア0.8856)、生成/編集/合成/拡大の4段階ワークフローをサポートします。
-
オープンソースライセンスApache-2.0ライセンスを使用し、商用アプリケーションや二次開発をサポートしており、一般消費者向けグラフィックカード(24GBのビデオメモリ)を使用してローカル環境に展開できます。
-
ハードウェア構成8Bパラメータモデルの推論要件を満たすには、24GB以上のビデオメモリを搭載したグラフィックカード(RTX 4090など)が必要です。
-
ソフトウェア環境Python 3.8以降とインストールが必要です。
transformers>=4.50.0、torch、diffusersコア依存ライブラリなど
ERNIE-Imageの主な利点
-
中国語の長文テキストを正確に翻訳する特に、画像内の長文の二言語(中国語と英語)テキストを正確にレンダリングするために最適化されており、LongTextBenchスコアは0.9733を達成しています。従来の拡散モデルにおけるテキストのぼやけや構造的な錯覚といった問題を完全に解決するため、ポスター、漫画、インフォグラフィックなど、精密なレイアウトが求められるクリエイティブな場面に特に適しています。
-
高度に制御可能な構造化生成複雑なページレイアウトや複数のオブジェクト間の空間的な関係を精密に制御でき、GENEvalベンチマークスコアは0.8856を達成しています。構造化された記述に基づいて要素の位置を正確に配置し、指示に厳密に従った複数オブジェクトの組み合わせを生成できます。
-
デュアルバージョンへの柔軟な適応最終的な高品質レンダリングのための標準バージョン(50ステップSFT)と、迅速なドラフト反復のためのターボバージョン(8ステップ蒸留)が用意されています。ユーザーは、品質または速度の要件に応じて、推論モードを柔軟に選択できます。
-
消費者向けハードウェアを導入できます80億個のパラメータモデルを単一のコンシューマー向けグラフィックカード(RTX 4090など)上でローカルに実行するために必要なビデオメモリはわずか24GBで済み、レイヤーアンロードなどの最適化ソリューションを提供することで、企業レベルのテキスト生成機能への参入障壁を大幅に低減します。
ERNIE-Imageプロジェクトのアドレス
- プロジェクト公式サイト:https://ernie.baidu.com/blog/posts/ernie-image/
- ハギングフェイスモデルライブラリ:
- https://huggingface.co/baidu/ERNIE-Image
- https://huggingface.co/Baidu/ERNIE-Image-Turbo
ERNIE-Image製品と類似競合製品との比較
| 比較対象寸法 | ERNIE-Image | FLUX | Stable Diffusion |
|---|---|---|---|
| モデルサイズ | 8Bパラメータ | 12Bパラメータ(開発版) | 2B-8B仕様(SDXL/SD3) |
| 建築 | シングルストリームDiT | マルチストリームDiT | U-Net / DiT (SD3) |
| 中国語の長文 | LongTextBench 0.9733、正確なレンダリング | 多言語対応だが、中国語の組版精度は限定的である。 | 元の英語の最適化により、中国語の文字がしばしば文字化けします。 |
| レイアウトの制御性 | GENEval 0.8856、ネイティブ構造制御 | ControlNetプラグインが必要です | ControlNetとLoRAの組み合わせが必要です。 |
| 推論ステップ数 | 標準50ステップ/ターボ8ステップ | 通常20~50歩 | 通常20~50歩 |
| オープンソースライセンス | Apache 2.0(完全に商用化可能) | 一部のバージョンは商業的に適していません。 | Apache-2.0 / OpenRAIL-M |
| ビデオメモリの要件 | 24GB(レイヤーアンロード最適化に対応) | 24GB+ | 8GB~24GB(バージョンによる) |
| 組み込みワークフロー | 4つの段階:生成/編集/合成/拡大 | 基本的なテキストイラスト | プラグインのリンクは手動で設定する必要があります。 |
| 強化されたプロンプト | 内蔵プロンプトエンハンサー | なし | いいえ(外部ツールに依存します) |
ERNIE-Imageの応用シナリオ
-
商業用ポスターデザイン高精度な長文レンダリング機能を備え、ブランドスローガン、販促情報、製品仕様などを記載した中国語と英語のポスターを生成します。ECサイト、イベント、屋外広告など、様々な場面に適しています。テキストは鮮明で読みやすく、後処理は不要です。
-
漫画とイラストの制作複雑なコマ割りレイアウトや複数キャラクターのシーン制御に対応し、吹き出し、ナレーション、擬音語を含む漫画ページを生成できるため、下書きから完成版までワンストップで制作できます。
-
インフォグラフィックとデータビジュアライゼーション構造化データの説明を、グラフ、ラベル、説明文を含む視覚的なインフォグラフィックに変換します。これは、レポートの表紙、教材、長文のソーシャルメディア投稿、その他のコンテンツの作成に適しています。
-
Eコマース商品画像高い制御性により、製品本体、背景要素、価格タグ、セールスポイントコピーなどの空間的な位置を正確に配置でき、プラットフォームの仕様に準拠した製品のメイン画像や詳細ページを迅速に生成できます。
-
出版・印刷資材正確な中国語文字レンダリングにより、書籍の表紙、雑誌のページ、パンフレットなどの印刷物上のテキストが正確になり、従来のAI生成画像に見られる文字の判読不能といった問題を回避できます。