project
Qwen-Image-Layered - アリババのAI画像編集モデル
Qwen-Image-Layeredは、アリババが開発したAI画像編集モデルです。通常の画像を自動的に独立したRGB透明レイヤーに分割し、Photoshopと同様のレイヤー編集機能を実現します。これは、アテンションメカニズムと位置エンコーディングによって実現されています。
Qwen-Image-Layeredとは何ですか?
Qwen-Image-Layeredは、アリババが開発したAI画像編集モデルです。通常の画像を自動的に独立したRGB透明レイヤーに分割し、Photoshopと同様のレイヤー編集機能を実現します。アテンションメカニズムと位置エンコーディングにより、レイヤーを動的に分割し、3~10レイヤーの柔軟な分解をサポートします。これにより、他の部分に影響を与えることなく、個々のレイヤーに対して拡大縮小、着色などの操作を行うことができます。従来のAI画像レタッチにおける「万能型」の問題に対し、このモデルはオープンソースのHugging Faceテストにおいて、色再現誤差がわずか0.0033、透明度精度が0.916と非常に高い値を示し、既存の技術を大幅に上回る性能を発揮します。
Qwen-Image-Layeredの主な機能
-
画像レイヤリングこの手法では、単一のRGB画像を複数のRGBAレイヤーに分解し、各レイヤーは独立した意味を持つため、後続の編集が容易になります。
-
独立系編集者各レイヤーは、サイズ変更、位置変更、色変更など、他のレイヤーに影響を与えることなく個別に操作できます。
-
高忠実度オペレーションオブジェクトの完全削除、ロスレスサイズ変更、オブジェクトの自由移動など、高精度な基本操作をサポートします。
-
柔軟な分解レイヤー分解の回数を可変にサポートし、再帰的に分解することで無限分解を実現できるため、さまざまな編集ニーズに対応できます。
-
データパイプライン高品質な多層構造のトレーニングデータが不足している現状に対処するため、Photoshopドキュメントから多層構造の画像を抽出するパイプラインを構築する。
Qwen-Image-Layeredの技術的原理
-
RGBA-VAEこれは、RGB画像とRGBA画像の潜在表現を統合することにより、多層画像の生成と分解のための基礎的な枠組みを提供する。
-
VLD-MMDiTアーキテクチャこのシステムは、可変レイヤー分解機能を備えたMMDiTアーキテクチャを採用しており、画像を柔軟に異なる数のレイヤーに分解することができます。
-
多段階トレーニング戦略事前学習済みの画像生成モデルと多段階学習を組み合わせることで、多層画像分解タスクに適応させることができ、モデルの性能を向上させることができる。
-
データパイプラインPhotoshopドキュメントから多層画像を抽出し、注釈を付けることで、高品質なトレーニングデータセットを構築し、データ不足の問題を解決する。
-
拡散モデル拡散モデル生成メカニズムに基づき、ノイズから画像の多層表現を段階的に再構築することで、高品質な層分解を実現する。
Qwen-Image-Layeredプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/QwenLM/Qwen-Image-Layered
- ハギングフェイスモデルライブラリ:https://huggingface.co/Qwen/Qwen-Image-Layered
- arXiv技術論文:https://arxiv.org/pdf/2512.15603
- オンラインでデモを体験してください:https://huggingface.co/spaces/Qwen/Qwen-Image-Layered
Qwen-Image-Layered の応用シナリオ
-
広告デザイン画像を複数のレイヤーに素早く分解できるため、背景の変更や商品の位置調整など、広告内の要素を個別に簡単に編集できます。
-
映画やテレビ番組のポストプロダクションこの機能により、映画やテレビの映像において、キャラクター、小道具、その他の要素を重ね合わせることができ、特殊効果の追加、色補正、その他の操作が容易になります。
-
クリエイティブデザインデザイナーは、クリエイティブな画像を簡単に分解し、さまざまな要素を個別に変更することで、より創造的なアイデアを生み出すことができます。
-
画像復元画像を分解した後、損傷した層を他の部分に影響を与えることなく個別に修復できるため、修復効率が向上します。
-
教育的なデモンストレーション授業では、複雑な画像を単純なレイヤーに分解することで、学生が画像の構成と編集の原理をよりよく理解できるようにしている。