project
HiDream-O1-Image - Zhixiang Futureがオープンソース化した、ネイティブな統合画像生成モデル。
HiDream-O1-Imageは、Zhixiang Futureが開発したオープンソースの8ビットピクセルレベルネイティブ統合画像生成モデルです。世界初のUiTアーキテクチャを採用しており、VAEや別途テキストエンコーダを必要とせず、単一のトークン空間内で直接生成が可能です。
HiDream-O1-Imageとは何ですか?
HiDream-O1-Imageは、Zhixiang Futureが開発したオープンソースの80億ピクセルレベルのネイティブ統合画像生成モデルです。世界初のUiTアーキテクチャを採用し、VAEや独立したテキストエンコーダーを使用せずに、単一のトークン空間で2048×2048の高解像度画像を直接生成できます。GenEvalやHPSv3を含む6つのベンチマークテストでFLUX.2、Qwen-Image、GPT Image 2を凌駕し、人工知能によるテキストから画像への変換分野において、オープンソースの加重モデルとして最高位を獲得しました。
HiDream-O1-Imageの主な機能
- テキストベースの画像生成最大2048×2048のネイティブ解像度でのエンドツーエンド生成をサポートし、多段階の超解像処理を必要とせずに映画品質の画像を出力します。
- 指示主導型編集:合格
--ref_images参照画像を入力し、自然言語コマンドを使用することで、オブジェクトの削除やスタイルの転送など、精密な編集が可能になります。 - テーマ別パーソナライゼーション同一被写体の参照画像を2枚以上入力することで、モデルは全く新しいシーンにおいても人物や物体の同一性を維持することができる。
- 長文レンダリングCVTG-2KとLongText-Benchの両方において、長文の二言語(英語と中国語)テキストのレンダリング精度は0.97以上に達し、主流のモデルよりも大幅に優れている。
- ストーリーボード作成連続する複数のフレームの生成をサポートし、キャラクターやシーン間の一貫性を維持し、映画やテレビの絵コンテ作成のニーズを満たします。
- 推論駆動型プロンプトエージェント内蔵の「思考」エージェントは、生成前に暗黙の知識、空間レイアウト、およびテキスト書式設定ロジックを自動的に解析します。
HiDream-O1-Imageの技術原理
-
UiT統合アーキテクチャHiDream-O1-Imageは、世界初のUiT(Unified Transformer)統合アーキテクチャを採用しており、従来の拡散モデルでは別々に扱われていたVAE、テキストエンコーダ、拡散ネットワークを単一のエンドツーエンドのTransformerに統合しています。
-
三段階パイプラインの革命従来のStable DiffusionやFLUXの「VAE圧縮+独立テキストエンコーダ+潜在空間拡散」という3段階パイプラインとは異なり、UiTは潜在空間圧縮や外部エンコーダ処理を必要とせず、元のピクセル空間で直接拡散ノイズ除去を実行します。
-
単一の共有トークン空間UiTは、画像ピクセルブロック、テキストトークン、タスク条件トークンを同じ共有表現空間にマッピングし、自己注意機構を使用して、テキストの意味を各元のピクセルブロックの位置と色値に直接関連付けます。
-
ピクセルレベルのネイティブ生成VAEを除去することで、このモデルは圧縮再構成によって引き起こされるディテールの損失、色境界のアーティファクト、解像度の上限を回避し、超解像後処理なしでネイティブの2048×2048解像度でのエンドツーエンド生成をサポートします。
-
異種モダリティ間の直接的な整合統一されたアテンション空間では、テキストトークンは任意のピクセルブロックの座標に直接注意を向けることができ、ピクセルブロックもテキスト指示の意味情報を逆方向に参照できるため、基となる表現空間の直接的なクロスモーダルアライメントが実現されます。
-
ガイダンス蒸留加速開発版では、知識蒸留技術であるガイダンス蒸留を用いて、教師モデルとして完全版を学習します。28ステップ以内でCFG強化分布を直接学習するため、推論時にデュアルパスCFG計算を行う必要がありません。
-
切り替えなしのマルチタスクこのモデルは、タスク条件トークンによって、テキストから画像への変換、指示の編集、主題のパーソナライズ、ストーリーボードの生成といったタスクを区別します。すべてのモードは同じ8Bパラメータ重みセットを共有するため、LoRAやControlNetをロードすることなく、ゼロスイッチングが可能です。
HiDream-O1-Imageの使い方
-
環境準備GitHubリポジトリをクローンし、依存関係をインストールしてください。その際、CUDAをサポートするGPUが搭載されていることを確認してください(8Bモデルはシングルカードで動作します)。
-
ダウンロード重量ハグフェイスから引っ張る
HiDream-ai/HiDream-O1-Image(完全版)またはHiDream-O1-Image-Dev(簡易版) -
文生図の推論公式のサンプルスクリプトを実行し、テキストプロンプトに入力して、50ステップ(フル)または28ステップ(Dev)を設定すると、2048×2048ピクセルの画像が直接出力されます。
-
コマンド編集コマンドラインに追加
--ref_images input.jpg編集コマンドと併用すると、"remove the earphones"これにより、サンプル数をゼロに抑えた画像修正が可能になります。 -
パーソナライズされた主題同一人物または同一物体の参照画像を2枚以上入力すると、モデルが自動的に識別特徴を抽出し、新しいシーンに埋め込みます。
-
APIとローコード統合MITライセンスの下で提供されるコードライブラリを通じて、このモデルを独自のインテリジェントエージェントやローコードプラットフォームに統合することができ、バッチ呼び出しやローカルでのプライベート展開をサポートします。
HiDream-O1-Imageの主な利点
-
建築上の革新性、高効率なパラメータ8Bパラメータは、GenEval(0.90)、DPG-Bench(89.83)、HPSv3(10.37)を含む6つのベンチマークにおいて、56B FLUX.2 Devおよび27B Qwen-Imageを上回り、パラメータ効率が3~7倍向上しました。
-
ピクセルネイティブ、ロスレス生成VAEを除去することで、ピクセル空間で直接動作し、圧縮や再構成のエラーを回避し、2048×2048のネイティブ高解像度出力をサポートします。
-
長文テキストと多言語対応をリードするLongText-Benchは中国語で0.979、英語で0.978のスコアを獲得し、CVTG-2Kは複雑なビジュアルテキスト生成で0.9128のスコアを獲得しており、どちらも世界トップクラスの性能を誇っています。
-
統一された重み付け、複数のタスク間の切り替えなしテキスト生成、指示編集、パーソナライゼーション、およびストーリーボード生成は同じ重みセットを共有するため、LoRAやControlNetをロードすることなくタスクを切り替えることができます。
-
商用利用向けのオープンソース、エコシステムに優しいコードと重み付けデータはMITライセンスで公開されており、ローカル環境でのデプロイ、ローコード統合、商用利用に対応しています。また、Hugging FaceとGitHubでも入手可能です。
HiDream-O1-Imageプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/HiDream-ai/HiDream-O1-Image
- ハギングフェイスモデルライブラリ:https://huggingface.co/HiDream-ai/HiDream-O1-Image
- 技術論文:https://github.com/HiDream-ai/HiDream-O1-Image/blob/main/assets/HiDream-O1-Image.pdf
HiDream-O1-Imageと類似競合製品との比較
| 寸法 | HiDream-O1-Image | Stable Diffusion 3.5 | Ideogram 3.0 |
|---|---|---|---|
| 開発者 | HiDream.ai | Stability AI | Ideogram |
| モデルタイプ | オープンソースの画像生成 | オープンソースの画像生成 | クローズドソースの画像生成 |
| パラメータサイズ | 8B(単一統一モデル) | について 8B(MM-DiT) | 非公開 |
| コアアーキテクチャ | UiTは、VAEや個別のテキストエンコーダーを使用せず、ピクセルレベルの統合型Transformerを使用しています。 | 潜在空間MM-DiT、VAE圧縮・解凍テキストエンコーダを使用 | VAE圧縮を利用した潜在空間トランスフォーマー |
| 画像忠実度 | ピクセルレベルのネイティブ生成圧縮再構成エラーなし、鮮明なディテール | 潜在空間生成、VAE再構成損失における高周波ディテール | 潜在空間生成は全体的に高い画像品質をもたらすが、圧縮パイプラインによって制限される。 |
| 最大ネイティブ解像度 | 2048×2048 エンドツーエンド過剰な解像度での後処理は不要です | 通常は、超解像モデルまたはブロック生成と組み合わせて使用する必要があります。 | 通常は、超解像モデルと組み合わせて使用する必要がある。 |
| 長文レンダリング | LongText-Bench(英語) 0.979中国語 0.978 | 長文の処理能力は中程度だが、複雑な書式設定ではエラーが発生しやすい。 | 世界最強複雑なポスターレベルのタイポグラフィにおける業界標準を確立する |
| CVTG-2K(複雑な視覚テキスト) | 0.9128 | 約0.85 | 0.95+ |
| オープンソースライセンス | MITライセンス(商用利用可能、改変可能) | オープンライセンス(商用利用可) | クローズドソース、API/サブスクリプションのみ |
| ローカル展開 | 1枚のカードで8Bの均一な重み付けを実行できます。 | シングルカードで実行可能ハードウェアの導入障壁が低い | サポートされていませんクラウド専用アクセス |
| 生態学と制御可能性 | 単一のウェイトで、LoRAを必要とせずに、テキストのレンダリング、編集、パーソナライズ、ストーリーボード作成が可能です。 | 最大の生態系LoRA、ControlNet、IPAdapterなど、豊富なプラグインが用意されています。 | エコシステムプラグインは使用せず、公式の機能反復に依存します。 |
| 推論効率 | ステップ28~50、開発版ではCFGデュアルパス計算は不要です | 20~50ステップ、CFGとマルチモジュールローディングが必要 | クラウドベースの推論速度は、サーバーの負荷に依存します。 |
| 中核的な利点 | 極めて高いパラメータ効率、ネイティブピクセルの高忠実度、複数のタスク間の切り替えが不要な統合アーキテクチャ | 最も成熟したオープンソースのエコシステム、最も完全で制御しやすいツールチェーン、そして最も豊富なコミュニティリソース。 | 長文テキストとタイポグラフィにおいて世界最高水準を誇り、常に高品質で美的に優れた成果物を提供します。 |
HiDream-O1-Imageの応用事例
-
プロフェッショナルな映画・テレビ制作映画のような映像品質とキャラクターの一貫性を活用することで、クリエイティブな構想や絵コンテ作成から最終出力まで、AIを活用したエンドツーエンドの映画・テレビ制作サポートをプロのチームに提供します。
-
越境ECマーケティングHiBurstのようなプラットフォームを利用して商品画像やマーケティング動画を一括生成することで、販売者はビジュアルコンテンツの制作コストを大幅に削減し、海外でのコンバージョン率を向上させることができます。
-
ソーシャルメディアコンテンツ制作Vivagoなどのツールを活用することで、セカンドレベルの特殊効果生成やエンドツーエンドのショートビデオ制作が可能になり、セルフメディアやMCNエージェンシーのコンテンツ制作効率を大幅に向上させることができます。
-
ローカライズされたデザインワークフロー8Bパラメータスケールは、一般消費者向けグラフィックカードでのローカル展開に最適化されており、デザイナーはプライベートな環境で高解像度のポスター、イラスト、ブランド素材を生成できます。
-
多言語ビジュアル出版中国語と英語の両方で長文を正確にレンダリングできる能力を備えているため、書籍の表紙、雑誌のレイアウト、教育用教材など、複雑なテキストと画像のレイアウトを必要とする専門的な出版シーンに適しています。