AB
AiBoss
project

ICEdit - 浙江大学とハーバード大学が共同開発した、命令ベースの画像編集フレームワーク

ICEdit(In-Context Edit)は、浙江大学とハーバード大学が共同開発した、命令ベースの画像編集フレームワークです。Massive Diffusion Transformerの強力な生成機能とコンテキスト認識機能を活用しています。

ICEditとは何ですか?

ICEdit(In-Context Edit)は、浙江大学とハーバード大学が共同開発した、指示ベースの画像編集フレームワークです。Massive Diffusion Transformerの強力な生成機能とコンテキスト認識機能を活用することで、自然言語コマンドによる高精度な画像編集を実現します。ICEditは、従来の手法に比べてトレーニングデータのわずか0.1%、トレーニング可能なパラメータの1%しか必要としないため、リソース消費を大幅に削減できます。また、複数ラウンドおよび複数タスクの編集において優れたパフォーマンスを発揮します。オープンソースであること、低コストであること、高速であること(画像1枚あたり約9秒)などの利点を誇り、幅広いアプリケーションに適しています。

ICEditの主な機能

  • 指示主導型画像編集背景の変更、テキストの追加、人物の服装の変更など、自然言語によるコマンドに基づいて画像を正確に修正することが可能です。
  • 複数回の編集複数の連続編集をサポートし、各編集は前回の結果に基づいて行われるため、複雑なクリエイティブニーズに適しています。
  • スタイル変換水彩画や漫画など、さまざまなアートスタイルに画像を変換する機能をサポートしています。
  • オブジェクトの置換と追加画像内のオブジェクトを置き換えたり、新しい要素を追加したりします。例えば、人物を漫画のキャラクターに置き換えるといったことが可能です。
  • 高効率処理処理速度が速い(画像1枚あたり約9秒)ため、迅速な生成と反復処理に適している。

ICEditの技術原則

  • コンテキスト内編集フレームワーク「コンテキスト内プロンプト」に基づき、編集指示は生成プロンプトに組み込まれ、モデルは処理されたプロンプトに基づいて編集済み画像を生成します。これにより、モデルアーキテクチャの変更が不要となり、従来の手法で必要だった複雑な構造調整を回避できます。コンテキスト理解に基づき、モデルは指示に準拠した編集結果を直接生成します。
  • LoRA-MoEハイブリッド微調整戦略このアプローチは、パラメータ効率の高いLoRA(低ランク適応)アダプタと、動的なエキスパートルーティング(エキスパート混合モデル、MoE)システムを組み合わせたものです。LoRAは、低ランク行列分解に基づいて、モデルパラメータを効率的に調整し、さまざまな編集タスクに適応します。MoEは、現在のタスクに最適なエキスパートモジュールを動的に選択することで、編集品質と柔軟性をさらに向上させます。微調整に必要なデータ量はわずか(5万サンプル)で済むため、編集成功率が大幅に向上します。
  • 早期フィルタ推論時間スケーリング推論フェーズでは、システムは視覚言語モデル(VLM)に基づいて初期に生成されたノイズサンプルを評価し、編集指示に最も適合する初期ノイズを選択します。編集効果は数ステップ(例えば4ステップ)で評価され、最適な初期ノイズが迅速に選択されて編集品質がさらに向上します。

ICEditプロジェクトのアドレス

ICEditの応用シナリオ

  • クリエイティブデザイン写真を(水彩画のような)芸術的なスタイルに変換したり、デザインや広告に使用できるクリエイティブな要素を追加したりできます。
  • 映画およびテレビ制作映画やテレビ番組の制作初期段階を支援するため、キャラクターデザインやシーンコンセプトアートを迅速に作成します。
  • ソーシャルメディア個人的な写真を編集(背景の変更やエフェクトの追加など)して、魅力的なソーシャルメディアコンテンツを作成しましょう。
  • 教育教育用画像を作成する。例えば、歴史上の人物を漫画風に変換するなどして、教育を支援する。
  • コマーシャル背景の変更やブランドロゴの追加など、製品プロモーション用の画像を素早く作成できます。