project
Insert Anything - 浙江大学、ハーバード大学、南洋理工大学が共同開発した画像挿入フレームワーク。
Insert Anythingは、浙江大学、ハーバード大学、南洋理工大学の研究者らが共同開発した、コンテキスト編集に基づく画像挿入フレームワークです。このフレームワークは、参照画像からターゲットシーンにオブジェクトをシームレスに挿入します。
挿入可能なものとは何ですか?
Insert Anythingは、浙江大学、ハーバード大学、南洋理工大学の研究者らが共同開発した、コンテキスト編集に基づく画像挿入フレームワークです。このフレームワークは、参照画像からターゲットシーンにオブジェクトをシームレスに挿入し、芸術作品の制作、実写顔合成、映画シーンの合成、バーチャル試着、アクセサリーのカスタマイズ、デジタル小道具の置換など、さまざまな実用的なアプリケーションをサポートします。12万組のキュー画像ペアを含むAnyInsertionデータセットで学習されたInsert Anythingは、さまざまな挿入シナリオに柔軟に対応でき、クリエイティブコンテンツの生成やバーチャル試着に強力な技術サポートを提供します。
Insert Anythingの主な機能
- マルチシナリオ対応人物挿入、物体挿入、衣服挿入など、さまざまな画像挿入タスクの処理をサポートしています。
- 柔軟なユーザーコントロールマスクガイド制御モードとテキストガイド制御モードの両方をサポートしています。ユーザーは、手動で描画したマスクまたは入力したテキスト説明に基づいて、挿入領域と内容を指定できます。
- 高品質な出力挿入された要素のディテールとスタイルの一貫性を維持しながら、高品質で高解像度の画像を生成することをサポートします。
何でも挿入する技術原理
- AnyInsertionデータセットこのフレームワークは、12万組のキュー画像ペアを含む大規模データセットAnyInsertionでトレーニングされており、人物、物体、衣服の挿入など、さまざまな挿入タスクを網羅しています。
- 拡散変換器(DiT)この技術は、DiT(Direcise-Intactic:デジタル画像技術)に基づくマルチモーダルな注意機構を利用して、テキストと画像の入力を同時に処理します。DiTは、テキスト、マスク、画像パッチ間の関係を統合的にモデル化できるため、柔軟な編集制御が可能になります。
- コンテキスト編集メカニズム多面体フォーマット(マスク誘導二面体やテキスト誘導三面体など)に基づいて、参照画像が対象シーンと組み合わされ、モデルが文脈情報を捉え、自然な挿入効果を実現できるようになります。
- 意味的ガイダンス画像エンコーダー(CLIPなど)とテキストエンコーダーを組み合わせて意味情報を抽出することで、編集プロセスに対する高度なガイダンスが提供され、挿入された要素が対象シーンのスタイルと意味に合致することが保証されます。
- 適応型剪定戦略小さな対象物を扱う場合、編集領域が十分な注意を払い、十分な文脈情報を保持し、高品質なディテール保持を実現できるよう、トリミング領域が動的に調整されます。
Insert Anythingのプロジェクトアドレス
- プロジェクト公式サイト:https://song-wensong.github.io/insert-anything/
- GitHubリポジトリ:https://github.com/song-wensong/insert-anything
- arXiv技術論文:https://arxiv.org/pdf/2504.15009
Insert Anythingのアプリケーションシナリオ
- 芸術創作さまざまな要素を素早く組み合わせて、創造的なアイデアを刺激しましょう。
- バーチャル試着消費者が服の外観を事前に確認できるようにすることで、ショッピング体験が向上する。
- 映画やテレビの特殊効果仮想要素をシームレスに挿入することで、撮影コストを削減できます。
- 広告デザイン魅力を高めるために、多様でクリエイティブな広告を迅速に作成します。
- 文化遺産の修復文化遺産や建築物の細部を仮想的に復元することは、研究や展示に役立つ。