project
Boogu-Image-0.1 - Booguのオープンソース統合画像生成・編集モデル
Boogu-Image-0.1 は、Boogu チームによる統一された画像生成および編集モデルのオープンソースファミリーです。このモデルは、テキストから画像への生成、命令型画像編集、および同じアーキテクチャ内でのバイリンガル (中国語と英語) テキストレンダリングをサポートしています。このファミリーには、Base、Edit、...
Boogu-Image-0.1とは何ですか?
Boogu-Image-0.1は、Booguチームが開発した、画像生成と編集を統合したオープンソースモデル群です。このモデル群は、テキストから画像への生成、命令型画像編集、そして中国語と英語のバイリンガルテキストレンダリングを同一アーキテクチャ内でサポートしています。このファミリーには、Base、Edit、Turboの3つのバリアントがあります。数千語のプロンプト単語を用いたBoogu Arena ELOベンチマークにおいて、このシリーズは参加したすべてのオープンソースおよびクローズドソースシステムの中で上位にランクインし、Qwen-Image-Benchではオープンソースモデルの中で1位を獲得しました。
Boogu-Image-0.1の主な機能
-
テキストベースの画像生成写真撮影に関する指示を正確に理解し、自然な光、調和のとれた構図、忠実なディテールを備えた高品質な画像を生成し、複雑でリアルなシーンをサポートします。
-
教育用画像編集オブジェクトの挿入、置換、削除、属性やマテリアルの変更、背景やシーンの置換、アートスタイルの移行をサポートしつつ、元の被写体や構図との一貫性を維持します。
-
中国語と英語の二言語テキスト表示ポスター、切手、文書、インターフェース、ブランドガイドなど、テキストを多用するビジュアルデザインをサポートし、読みやすい構造と安定したレイアウトを実現します。
-
様式化生成伝統的な中国風デザイン、ピクセルアート、絵本、製品レベルのレンダリングなど、さまざまなスタイルに対応しており、プロンプトに敏感に反応し、安定した出力を提供します。
-
ポスターおよび製品画像の最適化一貫したブランドスタイル、洗練されたタイポグラフィ、プロフェッショナルな照明構成を用いて、パーソナライズされたポスターや製品ビジュアライゼーションを作成します。
-
画像テキスト編集中国語と英語の文字の置換、追加、削除に対応しており、フォント、太さ、色、レイアウトを柔軟に調整できます。
Boogu-Image-0.1の技術的原理
- 統合マルチモーダルアーキテクチャBoogu-Image-0.1は、視覚理解と画像生成機能を単一のモデルフレームワークに統合した、統一されたマルチモーダル理解・生成アーキテクチャを採用しています。これにより、モデルは画像を同時に理解・生成することが可能になり、編集作業のための意味論的レベルの制御基盤を提供します。
- 蒸留は推論を加速させるTurboバージョンは蒸留技術に基づいて構築されており、Baseと同じ数のパラメータで推論パスを圧縮します。通常、3~4ステップで高品質でリアルな写真画像を出力でき、同時にバイリンガルテキストレンダリング機能とキューワード準拠性も維持します。
- 指示の配置編集編集バリアント(10Bパラメータ)は、統一されたアーキテクチャ上での画像編集タスクに特化して最適化されています。命令アライメントメカニズムによってきめ細かな局所的な変更を実現し、元の被写体と構図との一貫性を維持しながら、スタイル間の移行とコンテンツの置換を完了します。
- バイリンガルテキストレンダリングこのモデルは、統一されたアーキテクチャ内で構造化された中国語と英語の文字を理解および生成する機能を統合し、レイアウト認識メカニズムを通じて、ポスターやブランド資料などのテキスト量の多いシナリオにおいて、読みやすいレイアウトと安定したレンダリングを保証します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Boogu-Image-0.1 の使い方
-
オンライン体験ModelScope(https://modelscope.cn/studios/Boogu/boogu-image-edit-gradio)にアクセスして画像を直接アップロードし、編集コマンドを入力してください。ローカル環境へのデプロイは不要です。
-
モデルのダウンロードBase、Edit、Turboの各バリアントの重みは、ModelScope組織ページ(https://modelscope.cn/organization/Boogu)から取得できます。
-
ローカル展開GitHubリポジトリをクローンしてトレーニングおよび推論コードを取得し、READMEに従って環境を設定してから、モデルをロードして生成または編集します。
Boogu-Image-0.1の主な利点
-
統合アーキテクチャ同一のモデルファミリーで、生成、編集、テキストレンダリングという3つの主要なタスクをカバーできるため、用途に応じて個別のモデルを切り替える必要がなくなります。
-
スピード推論Turbo版はわずか3~4ステップで高品質なデータを生成でき、その推論効率は一部のクローズドソースソリューションと同等か、あるいはそれを凌駕する。
-
バイリンガルテキストの利点中国語と英語のテキスト表示において安定した性能を発揮するため、中国語のポスターやブランド素材など、現地のデザイン用途に特に適しています。
-
編集の一貫性編集バリアントは、コンテンツを変更する際に元の被写体と構図の高さの一貫性を維持し、従来の編集モデルでよく見られる全体的な再描画の歪みを回避します。
Boogu-Image-0.1 のプロジェクトアドレス
- プロジェクト公式サイト:https://boogu.org/
- GitHubリポジトリ:https://github.com/boogu-project/Boogu-Image
- ハギングフェイスモデルライブラリ:https://huggingface.co/Boogu
Boogu-Image-0.1と類似の競合製品との比較
| 寸法 | Boogu-Image-0.1 | Qwen-Image-2.0 |
|---|---|---|
| 出版社 | ブーグチーム | アリババ同義チーム |
| リリース時間 | 2026年6月 | 2026年2月 |
| オープンソースライセンス | Apache-2.0 | Apache-2.0 |
| モデルパラメータ | 編集バリアント10B;Base/Turboパラメータの数はBaseと同じです(具体的な値は非公開)。 | 拡散デコーダは7Bビット、Qwen3-VLエンコーダは8Bビットで、合計すると約15Bレベルになります。 |
| コアアーキテクチャ | 視覚理解と画像生成を単一のフレームワークに統合した、統一されたマルチモーダル理解・生成アーキテクチャ。 | デュアルコンポーネントアーキテクチャ:8B Qwen3-VL視覚言語エンコーダ → 7B MMDiT拡散デコーダ |
| 統合機能 | テキストベースの画像編集、指示ベースの画像編集、および中国語と英語の二言語テキストレンダリングの3つの機能を1つに統合したシステム。 | 画像処理、画像編集、テキストレンダリングはすべて、単一の7Bモデルの下に統合されています。 |
| 最大解像度 | 例として挙げられているのは主に1024×1024ピクセルの解像度です(より高解像度にも対応していますが、上限は明記されていません)。 | ネイティブ解像度2048×2048(2K)、アップサンプリング不要 |
| プロンプト単語の長さ | 開示に関する明確な上限はない | 最大1000トークン |
| テキストレンダリング | 中国語と英語のバイリンガルで、超高密度テキスト、ポスター、ブランド素材などの複雑なレイアウトに対応します。 | 中国語と英語のバイリンガルで、インフォグラフィック、PowerPointプレゼンテーション、ポスター、書道などをサポートし、素材の適応と構造的な整合性を重視します。 |
| 推論効率 | ターボ版は、わずか3~4ステップで高品質な製品を生成することができます。 | 最適化ステップの数は明記されていませんが、7B軽量アーキテクチャによりメモリ要件が削減されます。 |
| ローカル展開 | サポート対象です。重みとコードはGitHubおよびModelScopeから入手できます。 | DiffSynth-StudioはGitHubで公開されているオープンソースソフトウェアで、4GBのVRAMレイヤードアンロードをサポートしています。 |
Boogu-Image-0.1の応用シナリオ
-
eコマースデザイン製品のメイン画像、詳細ページポスター、多言語対応の販促資料を迅速に作成し、スタイルの統一や参照画像に基づく部分的な修正をサポートします。
-
広告とマーケティングブランドガイドラインに基づいて、中国語と英語の二言語対応ポスターやソーシャルメディア用画像を生成し、既存の素材のテキスト置換やレイアウト調整にも対応します。
-
コンテンツ作成このソフトウェアは、短編動画やソーシャルメディア向けのスタイリッシュなイラスト、コミック風のストーリーボード、ミーム生成機能を提供し、画像内のテキストの精密な編集にも対応しています。
-
出版と印刷書籍の表紙、雑誌のレイアウト、切手、文書のインターフェースデザインを生成し、テキストの読みやすさとレイアウトの安定性を確保します。