project
JoyAI-Image-Edit - JD.comのオープンソースの指示型画像編集モデル
JoyAI-Image-Editは、JD.comが開発したオープンソースのコマンド誘導型画像編集モデルで、JoyAI-Imageマルチモーダルベースモデルをベースに構築されています。このモデルは、自然言語コマンドによる正確かつ制御可能な空間操作とインテリジェントな画像修正をサポートします。
JoyAI Image Editとは何ですか?
JoyAI-Image-Editは、JD.comが開発したオープンソースのコマンドガイド型画像編集モデルで、JoyAI-Imageマルチモーダルモデルをベースに構築されています。このモデルは、自然言語コマンドによる正確かつ制御可能な空間操作とインテリジェントな画像修正をサポートします。マルチモーダル理解機能を備え、テキストコマンドを正確に解析し、画像の一部または全体を編集できます。JoyAI-Image-Editは、主にECサイトの商品画像最適化やマーケティング資料の調整といったシナリオを対象としており、従来のPhotoshopワークフローを簡素化します。このモデルはHuggingFaceで公開されており、開発者はAPIを直接呼び出すか、ローカル環境にデプロイすることで、「ワンライン画像編集」のようなAI画像編集体験を実現できます。
JoyAI-Image-Editの主な機能
- 指示に基づいた編集従来のPhotoshopの操作を必要とせず、「赤を青に変更する」や「ロゴを追加する」といった自然言語コマンドを使用して画像を直接編集できます。
- 精密な空間制御画像内の特定領域の正確な位置決めと編集をサポートし、ピクセルレベルでの制御可能な変更を可能にします。
- マルチモーダルな理解テキストによる指示と視覚的なコンテンツを同時に理解し、編集意図をインテリジェントに判断して、対応する操作を実行できます。
JoyAI-Image-Editの使い方
-
必要な依存関係をインストールしますローカル環境に、モデルをサポートする深層学習フレームワークと関連するPythonライブラリを事前にインストールしてください。
-
事前学習済みモデルを読み込んでいますHuggingFace Hubから引用
jdopensource/JoyAI-Image-Editモデルの重みを設定し、初期設定を完了します。 -
元の画像を準備する編集が必要なローカル画像ファイルまたは画像データを、入力ソースとしてモデルインターフェースに渡します。
-
自然言語で指示を書く編集に関する具体的なご要望を中国語または英語で明確にご説明ください。例えば、「背景をビーチの夕日の風景に差し替えてください」などです。
-
画像生成推論を実行するモデルの画像編集インターフェースを呼び出し、指示に従ってモデルが元の画像の意味理解とコンテンツの再描画を実行できるようにします。
-
編集強度パラメータを調整する編集範囲は、制御パラメータを設定することで調整できます。値が大きいほど、元の画像が保持される部分が少なくなり、変更幅が大きくなります。
-
ビデオメモリとパフォーマンスを最適化ハードウェアリソースが限られている場合でも推論を成功させるために、低スペックデバイスではモデルのアンロードを有効にするか、精度モードを下げてください。
JoyAI-Image-Editプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/jd-opensource/JoyAI-Image
- ハギングフェイスモデルライブラリ:https://huggingface.co/jdopensource/JoyAI-Image-Edit
JoyAI-Image-Editの重要な情報と使用要件
- モデルの位置特定JD.comのオープンソースの指示型画像編集モデルは、JoyAI-Imageのマルチモーダルベースモデルに基づいて構築されています。
- 中核となる能力自然言語コマンドによる正確な空間操作を可能にし、オブジェクトの追加や削除、属性の変更、背景の置換、レイアウトの再配置といった編集作業をサポートします。
- 適用可能なシナリオEコマース商品の画像最適化、マーケティング資料の調整、クリエイティブデザインのサポートなど。
- ハードウェア構成
- GPU推奨要件:16GB以上のビデオメモリ(FP16半精度モード)。NVIDIAグラフィックカードに対応。
- CPU実行は可能ですが、推論速度は著しく低下します。
- メモリモデルの読み込みには、32GB以上のシステムメモリを使用することをお勧めします。
JoyAI-Image-Editの主な利点
- 自然言語による指示ドライバーPhotoshopなどの専門的なスキルは必要ありません。複雑な編集もテキストによる説明(「背景をビーチに変更する」や「赤いドレスを青に変更する」など)で完了でき、「一文で画像編集」が可能です。
- 精密な空間制御能力ピクセルレベルでの位置決めと編集をサポートしており、画像内の特定領域を正確に操作することで、オブジェクトの追加や削除、ローカル属性の変更、レイアウトの再配置といった、きめ細かな操作を実現できます。
- eコマースシナリオの徹底的な最適化JD.comのAIGCプラットフォーム(14万以上の加盟店にサービスを提供)での実践経験に基づき、商品画像の背景置換、ディテールの強調、表示の最適化といった、高頻度なeコマースのニーズに特化して最適化を行い、商用アプリケーションの標準規格により合致した出力を実現しました。
- オープンソースエコシステムのサポートこのモデルは完全なオープンソースであり、HuggingFaceでホストされています。開発者はAPIを直接呼び出すことも、ローカル環境にデプロイすることも可能です。JoyAI-Imageの基本モデル機能と組み合わせることで、柔軟な二次開発とビジネス統合をサポートします。
JoyAI-Image-Editと類似競合製品との比較
| 比較対象寸法 | JoyAI-Image-Edit | InstructPix2Pix | UltraEdit |
|---|---|---|---|
| テクニカルルート | 独自開発のマルチモーダルベースを基盤としており、コマンドによる精密なローカル制御と、追加モジュールを必要とせずにエンドツーエンドのワンクリック編集を可能にします。 | 安定拡散をベースとしており、直接的な微調整機能とグローバルな再描画メカニズムを備えているが、領域レベルでの精密な制御機能は備えていない。 | SAM+Grounding DINOに基づいてピクセルレベルの自動領域選択を実現するには、X-Plannerを使用して複雑な命令を分解する必要がある。 |
| 指示の理解 | 中国の電子商取引環境に最適化されており、コマンド解析機能を内蔵しているため、商品属性を変更しようとする意図を正確に理解します。 | 学術的なベンチマークモデルは、複雑な中国語の電子商取引コマンドを解析する能力が限られており、編集が対象領域以外に容易に拡散する可能性がある。 | MLLMは意味理解を向上させることができる一方で、複雑な命令を処理するために外部のプランナーに依存するため、処理チェーンが長くなる。 |
| シーンの脚色 | 14万社以上の販売業者へのサービス提供実績に基づき、当社はeコマースの商品画像の最適化に注力し、プラットフォームのメイン画像仕様に準拠した出力を提供します。 | 一般的な学術モデルは、eコマースデータによる事前学習が不足しているため、商業写真の基準から逸脱した結果を生み出すことが多い。 | 学術的な検証機能と一般的な編集機能を重視しており、汎用性も高いが、商業分野への最適化が不足している。 |
| 展開しきい値 | HuggingFaceは箱から出してすぐに使用でき、FP16モードで16GBのVRAMをサポートし、エンジニアリングによる導入のハードルが低い。 | コミュニティは非常に成熟しているが、ユーザーは自身の環境を設定する必要があり、編集や配信に関する問題は後で手動で修正する必要がある。 | これは高い計算リソースを消費し、複数のモジュール(SAM+プランナー)の連携を必要とし、導入の複雑さも高い。 |
| 中核的な利点 | Eコマースにおけるクローズドループ統合(編集から出品まで)、正確な中国語理解、そして簡素化されたエンドツーエンドのユーザーエクスペリエンス。 | 豊富なオープンソースのエコシステムと包括的なドキュメントを備えているため、学術研究に適しています。 | きめ細かな領域制御における高い精度、学術的なベンチマークテストにおける優れた実績、そして高い推論効率。 |
| 主な欠点 | この技術が一般的な編集シナリオに適用できるかどうかはまだ検証されておらず、学術的なベンチマークデータの公開も限られている。 | グローバルな再描画は編集不可能な領域を破壊するため、電子商取引シナリオへの適応性が低下する。 | 複雑なアーキテクチャは複数のコンポーネント間の連携を必要とするため、企業レベルのビジネスアプリケーションの統合コストが高くなる。 |
JoyAI-Image-Editの応用シナリオ
-
Eコマース製品の最適化販売者は、自然言語コマンドを使用して、メインの商品画像の背景をすばやく変更したり、モデルの服装を変更したり、軽微な欠陥を修正したり、複数のSKUバリエーションの画像を一括生成したりできます。
-
マーケティング資料の改変運用チームは、ポスターの背景雰囲気を迅速に調整し、地域に合わせた視覚要素を置き換え、さまざまなマーケティングキャンペーンのテーマに基づいてA/Bテスト素材の複数のバージョンを生成することで、国境を越えたシナリオにおいて、モデルやスタイルの地域的なインテリジェントな適応を実現できます。
-
クリエイティブデザイン支援デザイナーは、テキストコマンドを使ってコンセプトスケッチを完成作品に仕上げたり、元の写真の光と影を再現したり、色調を統一したりすることができます。また、グラフィックレイアウトのインテリジェントな再配置や、著作権で保護された素材の二次的なクリエイティブな翻案にも対応しています。
-
コンテンツ制作の効率化新しいメディア運営者は、ソーシャルメディア上の画像の焦点と構図を迅速に最適化し、商品詳細ページ上の複数の画像の一貫性を自動的に維持することができます。