AB
AiBoss
project

UniWorld V2 - RabbitShow Intelligenceと北京大学が共同開発した画像編集モデル

UniWorld V2は、RabbitShow Intelligenceと北京大学のUniWorldチームが開発した次世代画像編集モデルです。革新的なUniWorld-R1トレーニングフレームワークを採用し、DiffucuTenを通して強化学習ポリシー最適化を画像編集に適用した最初のモデルです。

UniWorld V2とは何ですか?

UniWorld V2は、RabbitShow Intelligenceと北京大学のUniWorldチームが共同開発した次世代画像編集モデルです。革新的なUniWorld-R1トレーニングフレームワークを採用し、画像編集に初めて強化学習戦略を適用し、DiffusionNFT技術によって効率的なトレーニングを実現しています。報酬モデルとしてマルチモーダル大規模言語モデルを使用し、安定したきめ細やかなフィードバックを提供するとともに、低分散グループフィルタリング機構を導入することでトレーニングの安定性を向上させています。複雑な中国語フォントを正確に認識・レンダリングし、フレームによる編集領域の指定など、きめ細かな空間制御をサポートし、より自然で調和のとれた画像を実現するグローバルなライティングとシャドウブレンドを実現しています。GEdit-BenchやImgEditなどの業界ベンチマークテストで優れた結果を達成し、既存の公開モデルを総合的に凌駕しています。

UniWorld V2の主な機能

  • 中国語フォントの正確なレンダリング「月満中秋節」のような複雑な芸術的な中国語フォントを、鮮明な効果と正確な意味表現で理解し、生成することができます。テキストの変更は、簡単なコマンドだけで実行できます。
  • 洗練された空間制御フレームを通して編集領域を指定する機能をサポートしており、「鳥を赤いフレームの外に移動させる」といった操作が可能です。このモデルは空間制約を厳密に遵守し、非常に困難な操作も実行できます。
  • グローバルライティングブレンド「シーンの照明を調整する」といった照明指示を深く理解することで、被写体がシーンに自然に溶け込み、光と影の調和が高度に保たれ、統一感のある調和のとれた画像が得られる。
  • 指示の整合性と画像品質の向上命令の整合性や画質の面で優れた性能を発揮し、特に命令への準拠性という点で、ユーザーはその出力結果を高く評価している。
  • 複数モデルへの適用可能性このフレームワークはモデルに依存せず、Qwen-Image-EditやFLUX-Kontextなどの様々な基本モデルに適用でき、これらのモデルのパフォーマンスを大幅に向上させます。

UniWorld V2の技術的原理

  • 革新的なトレーニングフレームワーク本研究は、UniWorld-R1トレーニングフレームワークを用いて、強化学習による方策最適化を画像編集に適用した初の研究である。拡散ネガティブ認識ファインチューニング(DiffusionNFT)技術により、尤度推定を用いずに方策最適化を実現し、トレーニング効率を向上させている。
  • マルチモーダル報酬モデルマルチモーダル大規模言語モデル(MLLM)を報酬モデルとして使用することで、その出力の対数値を直接使用してきめ細かなフィードバックを提供することができ、複雑な推論やサンプリングによって引き起こされる計算上のオーバーヘッドやバイアスを回避できます。
  • 低分散グループフィルタリング機構報酬正規化における低分散グループの問題に対処するため、報酬の平均値と分散に基づいたフィルタリング戦略を設計し、平均値が高く分散が低いサンプルグループを除去することで、トレーニングプロセスを安定化させた。
  • モデル独立性このフレームワークはモデルに依存しないように設計されており、Qwen-Image-EditやFLUX-Kontextなどの様々な基本的な画像編集モデルに適用できるため、幅広い用途に対応できます。

UniWorld V2プロジェクトの住所

  • GitHubリポジトリ:https://github.com/PKU-YuanGroup/Uniworld
  • arXiv技術論文:https://arxiv.org/pdf/2510.16888

UniWorld V2の応用シナリオ

  • 画像編集とデザインユーザーの指示に基づいて、画像内のテキストの変更、オブジェクトの位置調整、シーンの照明や影の変更など、画像を正確に編集できます。ポスターデザイン、広告制作、ビジュアルアートなどの分野に適しています。
  • コンテンツの作成と生成クリエイターが特定の要件を満たす画像コンテンツを迅速に生成できるよう支援し、制作効率を向上させます。ビデオ制作、アニメーションデザイン、ゲーム開発など、大量の画像素材が必要とされる場面に適しています。
  • 製品の展示とマーケティング特殊効果の追加、背景の調整、照明や影の最適化など、画像編集によって製品の魅力を高め、プレゼンテーションを向上させます。これは、ECサイトの商品表示やブランドプロモーションに最適です。
  • 教育と訓練教育ツールとして、学生や学習者が画像編集スキルをより深く理解し、習得するのに役立ちます。また、教科書の挿絵や教材など、教育用画像資料の作成にも活用できます。
  • 科学研究と実験科学研究の分野では、実験設計や結果発表を支援するためのシミュレーション画像データの生成に利用でき、例えば、医用画像処理や環境科学などの分野において、特定の条件下で画像サンプルを生成するのに用いられる。