AB
AiBoss
project

PhotoDoodle - ByteDanceがシンガポール国立大学およびその他の機関と共同で開発した、芸術的な画像編集フレームワーク。

PhotoDoodleは、シンガポール国立大学、上海交通大学、北京郵電大学、ByteDance、およびTiamatチームが共同開発した芸術的な画像編集フレームワークです。少数のサンプルに基づいてアーティスト独自のスタイルを学習し、…

PhotoDoodleとは何ですか?

PhotoDoodleは、シンガポール国立大学、上海交通大学、北京郵電大学、ByteDance、およびTiamatチームが共同開発した、芸術的な画像編集フレームワークです。少数のサンプルに基づいてアーティスト独自のスタイルを学習し、写真の落書きを実現します。PhotoDoodleは2段階のトレーニング戦略を採用しています。まず、汎用画像編集モデルOmniEditorを大規模データで事前学習し、次に、アーティストが選択した少数の編集前後の画像ペアで微調整を行い、特定の編集スタイルを捉えます。PhotoDoodleは、位置エンコーディング再利用メカニズムとノイズのない条件付きパラダイムを導入し、生成された結果と背景とのシームレスな統合と一貫性を保証します。PhotoDoodleは、6つのスタイルと300を超えるサンプルを含む高品質のデータセットを公開し、関連研究のベンチマークを提供します。

PhotoDoodleの主な機能

  • 芸術様式の学習と再現アーティストが提供する少数のサンプルから独自の編集スタイルを学び、それを新しい画像編集作業に応用してみましょう。
  • 装飾要素の生成手描きの線、カラーブロック、装飾模様などの装飾要素を写真に追加することができ、これらの要素が背景に自然に溶け込むように配慮されています。
  • 背景の一貫性を維持する編集作業においては、背景の歪みやスタイルの喪失を防ぐため、元の写真の背景内容を厳密に保持する必要がある。
  • 指示主導型編集自然言語コマンドに基づいて画像編集コンテンツを制御し、正確な局所的な修正やスタイル設定を可能にします。
  • 高効率なスタイルカスタマイズ低ランク適応(LoRA)技術を用いることで、わずか30~50組のサンプルで様々なアーティストのスタイルに迅速に適応できるため、トレーニングコストを削減できる。

PhotoDoodleの技術的原理

  • OmniEditorの事前トレーニング本論文では、大規模な画像編集データセットを用いて事前学習済みのDiTモデルを微調整し、汎用画像エディタ(OmniEditor)へと進化させる。編集プロセスにおける空間的一貫性と背景の保持を確保するため、位置符号化クローニング機構とノイズフリー条件付きパラダイムを導入する。テキストコマンドと画像条件をマルチモーダルアテンション(MMA)機構を用いて組み合わせることで、高精度な画像編集を実現する。
  • EditLoRAの微調整事前学習済みのOmniEditorをベースに、少数のアーティストから提供されたビフォーアフター画像ペアを用いて、低ランク適応(LoRA)による微調整を行います。モデルの重みは、低ランク分解行列に基づいて適応的に調整され、事前学習済みモデルの一般的な機能を維持しながら、特定のアーティストの編集スタイルを捉えます。
  • 位置情報エンコード型クローニング機構生成された結果の空間的な一貫性を確保し、背景と装飾要素間の位置ずれを回避するために、ソース画像とターゲット画像の間で同じ位置符号化が共有されます。
  • ノイズのない条件付きパラダイム生成プロセスでは、ソース画像のノイズのない状態が維持され、反復的なノイズ除去中に背景コンテンツが破壊されるのを防ぎ、元の画像のディテールとテクスチャが保持されます。
  • 条件付きフローマッチング損失関数: 条件付きフローマッチング損失関数を最適化して、モデルがノイズからターゲット画像への生成パスを学習するように誘導し、編集効果をさらに向上させます。

PhotoDoodleプロジェクトの住所

PhotoDoodleの応用事例

  • デジタルアート制作写真に芸術的なスタイルを加え、クリエイティブな作品を素早く作成しましょう。
  • 商業デザインブランドスタイルに合ったデザイン画像を迅速に生成し、デザイン効率を向上させます。
  • ソーシャルメディア共有コンテンツの魅力を高めるために、個人の写真に装飾効果を追加しましょう。
  • 芸術教育授業を支援し、学生がさまざまな美術様式を理解し、実践できるよう手助けする。
  • エンターテイメントと交流インタラクティブな体験を向上させるため、リアルタイムで芸術的な画像を生成します。