project
ACE++ - Alitongyiが発表した、アップグレードされた画像生成・編集モデル
ACE++は、アリババ同義研究所が開発した高度な画像生成・編集ツールです。命令ベースかつコンテキスト認識型のコンテンツ補完技術により、高品質な画像作成・編集機能を実現しています。
ACE++とは何ですか?
ACE++は、アリババ傘下のTongyi Labが開発した高度な画像生成・編集ツールです。教育的かつ文脈認識型のコンテンツ補完技術により、高品質な画像作成・編集機能を実現しています。ACE++は、さまざまなタスクに対応する複数のモデルを提供しています。ACE++ Portraitは一貫性のあるポートレートを生成し、ACE++ Subjectは異なるシーン間で被写体の一貫性を維持し、ACE++ LocalEditingは画像の元の構造を維持しながら特定の領域を再描画します。近日公開予定のACE++ Fullyでは、さらに多くの教育的編集および参照生成タスクをサポートする予定です。
ACE++の主な機能
- 画像生成
- ポートレート生成:合格 ACE++ Portrait このモデルは、ユーザーの入力に基づいて高品質な肖像画を生成し、顔の特徴やスタイルの一貫性を維持することができる。
- トピック生成:ACE++ Subject このモデルは、看板や物体をさまざまな背景に配置するなど、さまざまなシナリオにおいて特定のテーマを持つ画像を生成できます。
- 画像編集
- 部分的な編集:ACE++ LocalEditing このモデルでは、元の画像の構造とスタイルを維持しながら、画像の特定領域を再描画または修正することができます。例えば、人物の衣服、背景、特定の物体の外観などを変更することが可能です。
- 様式化された編集ユーザーはコマンドを使用して画像をスタイル化することができ、例えば、普通の写真を芸術的なスタイルや特定の視覚効果に変換することができます。
- コンテキストに応じたコンテンツ入力画像のコンテキスト情報に基づいて、欠落部分や修正部分をインテリジェントに補完することで、生成される画像が視覚的に自然で一貫性のあるものとなるようにする。
- 指示主導型のインタラクションユーザーは、簡単な自然言語コマンドを使って画像の生成と編集プロセスを制御できます。例えば、特定のスタイルでポートレートを生成するように指定したり、画像内の特定の要素の追加、削除、または変更を要求したりできます。
- マルチタスク対応ACE++は、以下を含む(ただしこれらに限定されない)さまざまな画像処理タスクをサポートしています。
- バーチャル試着:合格 ACE++ Subject このモデルは、仮想的な試着効果を実現します。
- 看板ステッカーロゴやブランド要素を、さまざまなアイテムや場面に配置する。
- 写真修復破損した写真やぼやけた写真を修復・補正します。
- 映画ポスター編集登場人物やシーン間の整合性を保ちながら、映画ポスターを作成または修正する。
ACE++の技術的原理
- 改良版ロングコンテキスト条件ユニット(LCU++)ACE++は、従来のシーケンス連結方式とは異なり、入力画像、マスク、ノイズをチャネル次元に沿って連結して条件付きユニット(CU)特徴マップを形成するLCU++入力パラダイムを提案しています。この改良により、コンテキスト認識フレームワークからの干渉が軽減され、モデルの適応コストが低減されます。LCU++入力フォーマットは、0参照タスクとN参照タスクの両方に拡張できるため、モデルのさまざまなタスクへの適応性が向上します。
- 2段階のトレーニングプログラムACE++は2段階のトレーニング手法を採用しています。第1段階では、テキストから画像への変換モデルに基づいて事前学習を行い、参照なしタスクに特化しつつ、ベースモデルの生成能力を活用して条件付き入力に迅速に対応します。第2段階では、すべてのデータを用いてモデルを微調整し、一般的な指示に対応しながら、入力参照画像の再構築とターゲット画像の生成能力を最適化します。
- モデルアーキテクチャACE++の全体的なアーキテクチャはLCU++パラダイムを統合しており、CU特徴マップをx-embedレイヤーを介してシリアル化されたマーカーにマッピングし、それがTransformerレイヤーへの入力として機能します。モデルのトレーニング目標は、予測速度と実際の速度との間の平均二乗誤差を最小化することであり、これによりモデルにコンテキスト認識型の生成機能が付与されます。
- タスクサポートとモデル最適化ACE++は、ポートレートの一貫性、被写体の一貫性、局所的な編集など、さまざまな画像編集および生成タスクをサポートするツールキットを提供します。一般的なアプリケーションシナリオ向けに、ACE++はLoRA戦略などの軽量でドメイン安定性の高いファインチューニングモデルをトレーニングし、特定のタスクにおけるモデルのパフォーマンスを向上させます。
ACE++プロジェクトのアドレス
- プロジェクト公式サイト:https://ali-vilab.github.io/ACE_plus
- GitHubリポジトリ:https://github.com/ali-vilab/ACE_plus
- ハギングフェイスモデルライブラリ:https://huggingface.co/ali-vilab/ACE_Plus
- arXiv技術論文:https://arxiv.org/pdf/2501.02487
ACE++の応用シナリオ
- バーチャル試着ACE++の被験者モデルを使用することで、ユーザーはさまざまなキャラクターモデルに衣服やアクセサリーを配置し、仮想的な試着効果を実現できます。さまざまな服装スタイルや組み合わせを仮想キャラクターに表示できるため、デザイナーはデザインの効果を迅速に評価したり、eコマースプラットフォームはパーソナライズされた試着体験を提供したりできます。
- ブランドロゴステッカー製品設計や広告制作において、ACE++の主題モデルは、ブランドロゴやデザイン要素をさまざまな背景やオブジェクトに埋め込むことができます。
- 写真編集ACE++は、スタイル変換、要素の追加や削除、背景の置き換えなど、既存の写真に対するさまざまな編集操作をサポートしています。
- 映画ポスター編集ACE++ポートレートモデルは、映画ポスターにおける肖像画の様式化や修正を可能にします。表情や服装の調整、特定の芸術的効果の追加などにより、多様な映画プロモーションのニーズに対応できます。
- 部分的な編集:ACE++のローカル編集モデルは、元の画像の構造とスタイルを維持しながら、画像の特定領域を再描画または修正することができます。写真の傷や汚れを修復したり、人物画像の特定部分を強調したりするのに使用できます。
- 芸術的な創造とデザインアーティストやデザイナーは、ACE++の生成機能と編集機能を活用することで、創造的なアイデアを迅速に実現できます。テキストによる説明に基づいて初期デザインスケッチを作成したり、既存のデザインをスタイリッシュにアレンジしたりすることで、制作効率を向上させることができます。