project
SeFi-Image - 意味優先拡散に基づくオープンソースのテキスト画像変換モデル。
SeFi-Imageは、セマンティックファースト拡散に基づくテキストから画像への変換モデルであり、1B、2B、5Bの仕様を提供します。このモデルは、高レベルのセマンティック構造とテクスチャの詳細を分離することで、セマンティックストリームの事前ノイズ除去を可能にし、テクスチャ生成のための明確な構造を提供します。
SeFi-Imageとは何ですか?
SeFi-Imageは、セマンティックファースト拡散に基づいたテキストから画像への変換モデルで、1B、2B、5Bの仕様を提供します。このモデルは、高レベルのセマンティック構造をテクスチャの詳細から分離することで、セマンティックフローの事前ノイズ除去を可能にし、テクスチャ生成のための明確な構造的アンカーを提供します。125K A800 GPUで数時間かけてトレーニングされた5Bモデルは、GenEval、LongTextBench、CVTG-2K、OneIGなどのベンチマークで優れたパフォーマンスを発揮し、シーン合成、リッチテキストレイアウト、アニメキャラクター、多様なスタイル、ポートレート生成をサポートします。
SeFi-Imageの主な機能
-
テキストから画像への生成テキストプロンプトに基づいて高品質な画像を生成し、自然言語による説明にも対応しています。
-
マルチ仕様モデル異なる計算能力要件に対応するため、1B、2B、5Bの3つのパラメータスケールを提供します。
-
意味的優先順位の拡散意味構造とテクスチャの詳細を分離することで、より明確な幾何学的および構成的な制御が可能になる。
-
マルチドメイン対応シーン合成、リッチテキストレイアウト、アニメキャラクター、様式化されたアート、ポートレート生成などを網羅しています。
-
長文レンダリング中国語と英語の両方で長文入力に対応しており、LongTextBenchで最高のパフォーマンスを発揮します。
SeFi-Imageの技術原理
-
セマンティックテクスチャ分離アーキテクチャSeFi-Imageは、セマンティックファーストの拡散アーキテクチャを採用しており、画像生成プロセスをセマンティックストリームとテクスチャストリームという2つの独立したノイズ除去経路に分割します。
-
タイミングオフセット機構このモデルは時間オフセット機構を導入しており、これにより意味の流れが1ステップ先からノイズ除去を開始できるようになり、テクスチャ生成のための明確な構造的アンカーが提供される。
-
3段階の生成プロセス生成プロセス全体は3つの段階に分かれています。第1段階は意味の初期化、第2段階は意味とテクスチャの非同期的な共同ノイズ除去、第3段階はテクスチャの精緻化と復元です。
-
再建・世代間の均衡このアーキテクチャは、テクスチャ再構成の忠実度を向上させると同時に、拡散モデルの学習難易度を高めることで、再構成と生成の間の効果的なバランスを実現しています。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
SeFi-Imageの使い方
-
リソースを入手するSeFi-ImageのウェブサイトまたはarXivページにアクセスして、対応する仕様の論文、オープンソースコード、およびモデル重みファイルをダウンロードしてください。
-
環境設定ローカルサーバーまたはワークステーションにPyTorchなどのディープラーニング関連の依存関係をインストールし、モデルサイズに合ったGPUメモリリソースを準備してください。
-
モデルダウンロードした1B、2B、または5Bモデルのチェックポイントを推論フレームワークにロードし、重みの初期化とパラメータ設定を完了します。
-
入力プロンプト中国語と英語の両方で、場面描写、スタイル要件、またはテキスト内容を含むテキストプロンプトを作成し、長文や複雑な描写の組み合わせに対応できるようにします。
-
実行生成セマンティック優先の拡散サンプリング処理が実行されます。モデルはまずセマンティック構造のノイズ除去を行い、次にセマンティックアンカーに基づいてテクスチャの詳細を生成します。
-
出力画像最終的にノイズ除去された潜在変数は、デコーダによってピクセル画像に変換され、必要な解像度と形式で出力ファイルとして保存されます。
SeFi-Imageの主な利点
-
精密な構造制御意味的優先順位付けメカニズムにより、モデルは複雑な空間的組み合わせやテキストレイアウトに対して、より精密な構造制御を実現できる。
-
トレーニング費用が低い5Bパラメータモデルは、わずか12万5千時間のA800 GPUを使用してトレーニングされ、比較的低い計算コストで最高レベルの生成性能を実現しました。
-
長文が優先されます長文レンダリングのベンチマークにおいて、SeFi-ImageはLongTextBenchで0.978というスコアを達成し、競合製品を大幅に上回りました。
-
視覚テキストの正確性このモデルは、CVTG-2K文字レベル視覚テキスト生成テストにおいて0.895の精度を達成し、生成されたポスターやラベルは非常に読みやすかった。
-
マルチベンチマークファーストSeFi-Imageは、GenEvalやOneIG-ENといった権威あるベンチマークテストで複数回1位を獲得しており、その包括的な画像生成能力を実証しています。
SeFi-Imageプロジェクトのアドレス
- プロジェクト公式サイト:https://jmliu206.github.io/sefi-web/
- GitHubリポジトリ:https://github.com/jmliu206/SeFi-Image
- ハギングフェイスモデルライブラリ:https://huggingface.co/SeFi-Image
- arXiv技術論文:https://arxiv.org/pdf/2606.22568
SeFi-Imageと類似競合製品との比較
| 比較対象寸法 | SeFi-Image-5B | Qwen-Image |
|---|---|---|
| 建築的特徴 | 意味的優先順位に基づく拡散、意味の流れとテクスチャの流れの分離、および時間的オフセット機構の導入。 | 従来の拡散型または自己回帰型のアーキテクチャは、意味テクスチャ分離メカニズムを明示的に採用していません。 |
| GenEval | 0.88(初め) | 0.87 |
| LongTextBench | 0.978(初め) | 0.945 |
| CVTG-2K | 0.895(初め) | 0.829 |
| DPG-Bench | 87.27 | 88.32(初め) |
| OneIG-EN | 0.5606(初め) | 0.5390 |
| OneIG-ZH | 0.5379 | 0.5480(初め) |
SeFi-Imageの応用シナリオ
-
広告ポスターデザイン広告やポスターデザインの分野において、SeFi-Imageは、明瞭で読みやすいテキストを使用したブランドポスター、商品メニュー、商品ラベルなどを生成できます。
-
アニメキャラクター作成アニメやキャラクター制作において、このモデルはアニメキャラクター、ファンタジーシーン、全身ショットやクローズアップショットなど、様々な構図の生成をサポートしています。
-
自然なシーン生成自然の風景や情景を生成するという点において、SeFi-Imageは、天気、都市、動物、風景などの画像を、アスペクト比を自由に設定して作成できます。
-
芸術的スタイルの創造このモデルは、イラスト、水墨画、ぬいぐるみ、ステッカー、スケッチなど、さまざまなアートスタイルに対応しており、様式化されたビジュアルコンテンツの作成に適しています。
-
ポートレート撮影アシスタントポートレートや写真撮影支援のシナリオにおいて、SeFi-Imageは、多様な照明、ポーズ、素材を用いたポートレートや環境ポートレートを生成できます。