project
Image-to-LoRA-V2 - Modaコミュニティによる、オープンソースでトレーニング不要のスタイル転送ツール。
Image-to-LoRA-V2 (i2L-V2) は、Moda コミュニティが開発したオープンソースのトレーニング不要のスタイル変換ツールです。1~8 枚のスタイル画像をアップロードし、単一の推論で生画像モデルの LoRA ウェイトを予測できます。
Image-to-LoRA-V2とは何ですか?
Image-to-LoRA-V2 (i2L-V2) は、Moda コミュニティが開発したオープンソースのトレーニング不要のスタイル転送ツールです。ユーザーは 1 ~ 8 枚のスタイル画像をアップロードし、単一の推論で生の画像モデルに対する LoRA 重みを予測できます。このツールは、Z-Image、FLUX.2、Hidream-O1 の 3 つの主要フレームワークをサポートしており、IP-Adapter などの手法よりも優れたスタイル忠実度を提供します。LoRA 画像はエクスポートして再利用でき、マルチスタイル融合と構造制御のための ControlNet 統合もサポートしています。
Image-to-LoRA-V2の主な機能
-
トレーニング不要のLoRA生成一貫したスタイルの画像を1~8枚アップロードし、単一の順方向推論から直接、ダウンロード可能なLoRA重みファイルを出力します。
-
マルチベースモデルの適応Z-Image、FLUX.2、Hidream-O1という3つの主要なテキストベースの画像ベースモデルをネイティブにサポートしています。
-
モジュール式の組み合わせ機能生成された明示的なLoRAは、標準インターフェースを介して、ControlNet、AttriCtrl、Inpaintingなどのモジュールと組み合わせて使用できます。
-
マルチスタイル融合異なるスタイルの複数の参照画像から単一のLoRAを予測することで、生成された画像が複数の視覚的属性を同時に継承することが可能になる。
-
ワンクリックでアップロードとエクスポート生成されたLoRAファイルは、ワンクリックでModaコミュニティにアップロードしたり、ダウンロードしてAIGCセクションやその他のツールで使用したりできます。
Image-to-LoRA-V2の技術原理
- 構造化LoRAクエリ最新の拡散トランスフォーマーは、適応させるべき全結合層が多数あるのに対し、参照信号は少数の画像のみで構成されているため、スケールミスマッチが大きくなります。i2L は、単一のプーリングベクトルからすべての重みを生成するのではなく、各 LoRA クエリが LoRA 行列の行または列に対応します。各適応層について、k 個のクエリが行列 A の行を生成し、k 個のクエリが行列 B の列を生成するため、合計 2kL 個のクエリが生成されます。参照画像は SigLIP2 エンコーダによって画像トークンにエンコードされ、LoRA クエリと連結されて、集約のために単一ストリームのトランスフォーマーに入力されます。最後に、各層の独立した圧縮線形デコーダが LoRA 行列を再構築します。
- スタイルとコンテンツの分離:通常の画像とテキストのペアでも、モデルに参照意味をLoRAにエンコードさせることができます(例えば、猫の参照画像があると、生成された犬にも猫の特徴が備わります)。i2LはMegaStyle-1Mで学習され、スタイルは一貫しているが内容が異なる学習タプルを構築します。プロンプトは参照画像ではなくターゲットコンテンツのみを説明するため、損失報酬はスタイルと一貫しており、オブジェクトやアイデンティティをショートカットとしてコピーすることを抑制します。
- 非対称LoRA誘導:参照スタイルのLoRAはCFGの正の分岐に適用され、同じi2Lネットワークによって純粋なグレーマップから予測された中立的なLoRAは負の分岐に適用される。2つの分岐は同様にパラメータ化されており、その違いは主に参照マップによってもたらされるスタイル更新を反映しており、誘導方向がスタイル関連の効果を増幅することを可能にする。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Image-to-LoRA-V2の使い方
-
参考画像をアップロードしてくださいModa Creative Spaceに、目標とするスタイルの画像を1~8枚アップロードしてください。異なるテーマを組み合わせることで、一般化能力の向上に役立ちます。
-
LoRAモデルを生成する「生成」ボタンをクリックすると、モデルは1回の順方向推論によってLoRAの重みを予測し、出力します。
.safetensors書類。 -
入力プロンプトワードターゲットコンテンツのプロンプトを入力し、画像の高さ、幅、LoRA強度などの生成パラメータを設定します。
-
画像を生成する選択された台座モデルと予測されたLoRAに基づいて、様式化された画像がリアルタイムで生成され、その効果がプレビューされます。
-
エクスポートして再利用するLoRAファイルをワンクリックでModaコミュニティにアップロードするか、ダウンロードしてAIGC ZoneやComfyUIなどのツールで使用できます。
Image-to-LoRA-V2の主な利点
-
トレーニングなしですぐに使用可能GPU上で数百、数千ものトレーニングステップを実行する必要はありません。1回の推論で、すぐに使用できるLoRAデータセットを生成できます。
-
スタイルの忠実性においてトップこれは、CLIP-Style、Aesthetic、PickScore、HPSv2/v3など、複数の指標において、IP-AdapterやInstantStyleといった基準値を上回ります。
-
コンテンツの一貫性が高いCLIP-Textは34.71という最高得点を獲得し、LoRAの予測がスタイルを適用しながらもプロンプトコンテンツの制御性を効果的に維持していることを示している。
-
モジュール式で再利用可能一時的な条件特性ではなく、明示的なLoRAを出力する。これにより、保存、補間、再利用が可能になり、標準のLoRAインターフェースを介して他の制御モジュールと組み合わせることができる。
-
オープンソースのエコシステムの改善モデルの重みとコードは完全にオープンソースであり、ユーザーはクリエイティブスペースでオンラインで直接体験できます。生成された結果は、Moda AIGC Zoneにシームレスに統合できます。
Image-to-LoRA-V2プロジェクトのアドレス
- モデルの重み:https://modelscope.cn/collections/DiffSynth-Studio/Image-to-LoRA-V2
- クリエイティブスペース:
- Zイメージバージョン:https://modelscope.cn/models/DiffSynth-Studio/ZImage-i2L-v2
- FLUX.2 バージョン:https://modelscope.cn/models/DiffSynth-Studio/KleinBase4B-i2L-v2
- Hidream-O1バージョン:https://modelscope.cn/models/DiffSynth-Studio/HidreamO1-i2L-v2
画像とLoRA-V2の比較(類似製品との比較)
| 寸法 | Image-to-LoRA-V2 | InstantStyle |
|---|---|---|
| テクニカルルート | LoRAの重みを直接予測する(重みレベルの内在化) | 画像機能挿入アダプタ(条件付き外部化) |
| トレーニング要件 | ユーザー側でのトレーニングは不要で、順方向推論を1回行うだけです。 | ユーザー側でのトレーニングは不要で、順方向推論を1回行うだけです。 |
| 出力形式 | 明示的なLoRAファイル(保存、再利用、補間、エクスポートが可能) | 一時的な条件付き特徴量(推論試行ごとに再計算され、再利用できません)。 |
| スタイルオーセンティック | ハイ(CLIPスタイル 25.57) | ミディアムサイズ(CLIPスタイル 22.65) |
| コンテンツの一貫性 | 高(CLIP-Text 33.58) | 中 (CLIP-Text 30.90) |
| 美的品質 | 高い(美的感覚 6.36) | 中程度(美的評価 6.08) |
| 人間の好み | 高(ピックスコア 21.57 / HPSv3 6.03) | 中程度(PickScore 20.70 / HPSv3 3.71) |
| 組み合わせ能力 | ControlNet/Inpainting/AttriCtrlに対応した強力な標準LoRAインターフェース | 弱く、外部条件としてのみ注入され、モジュール式に組み合わせることはできない。 |
| 基本支援 | Z-Image、FLUX.2、Hidream-O1 | 主に安定拡散シリーズをサポートします。 |
Image-to-LoRA-V2の応用シナリオ
- ブランドの視覚的な統一性ブランドデザインの参考画像を素早く抽出し、一連のマーケティング資料やソーシャルメディア画像を生成することで、すべてのチャネルで一貫したビジュアルトーンを確保します。
- イラストスタイルの移行アーティストの参考作品のスタイルを再利用可能なLoRAに変換し、同じスタイルの商用イラストをバッチ処理で生成することで、手描きによる1枚ずつの描画や繰り返し学習を回避します。
- ゲームアセット生成ゲームプロジェクト用のスタイルライブラリを構築し、LoRAとControlNetを組み合わせて使用することで、キャラクターやシーンの構造を正確に制御し、コンセプトデザインとアセットの反復作業を加速します。
- Eコマースのデザイン効率改善商品参考画像に基づいて、一貫性のある詳細ページ背景、ポスター、装飾要素を生成することで、デザインコストを削減し、出品効率を向上させます。