AB
AiBoss
project

OmniGen2 - 北京人工知能研究院が開発したオープンソースのマルチモーダル生成モデル

OmniGen2は、北京人工知能研究院が開発したオープンソースのマルチモーダル生成モデルです。テキストプロンプトに基づいて高品質な画像を生成でき、背景や顔の特徴の変更など、指示に基づいた画像編集をサポートしています。OmniGen2は…

OmniGen2とは何ですか?

OmniGen2は、北京人工知能研究院が開発したオープンソースのマルチモーダル生成モデルです。テキストプロンプトに基づいて高品質な画像を生成でき、背景や顔の特徴の変更など、指示に基づいた画像編集にも対応しています。OmniGen2は、視覚言語モデル(VLM)と拡散モデルを組み合わせたデュアルコンポーネントアーキテクチャを採用し、様々な生成タスクを統合的に処理します。オープンソースで無料であること、高性能であること、そして強力なコンテキスト生成機能を備えていることが特長で、商用、クリエイティブデザイン、研究開発など幅広い用途に適しています。

OmniGen2の主な機能

  • テキストから画像への生成テキストプロンプトに基づいて、高精細で美しい画像を生成できます。GenEvalとDPG-Benchでそれぞれ0.86と83.57のスコアを記録するなど、複数のベンチマークテストで優れた性能を発揮します。
  • 指示に従って画像を編集するOmniGen2は、複雑なコマンド駆動型の画像編集に対応しており、衣服の色変更などの部分的な変更から、写真のアニメ風への変換などの全体的なスタイル変換まで、幅広い編集が可能です。画像編集タスクにおいて、OmniGen2は複数のベンチマークで編集精度と画像忠実度のバランスを実現しています。
  • コンテキスト生成OmniGen2は、人物、参照オブジェクト、シーンなど、さまざまな入力を柔軟に処理・組み合わせることで、斬新で一貫性のある視覚的出力を生成できます。OmniContextベンチマークにおいて、OmniGen2は既存のオープンソースモデルを視覚的一貫性の指標で15%以上上回る性能を発揮します。
  • 視覚的理解Qwen-VL-2.5基本モデルの強力な画像コンテンツ解析機能を継承しています。

OmniGen2 の技術原則

  • デュアルパスアーキテクチャOmniGen2は、テキストと画像のデコード経路を別々に採用し、テキストと画像のモダリティを個別に処理します。テキスト生成部分はQwen2.5-VL-3Bマルチモーダル言語モデル(MLLM)に基づいており、画像生成は独立した拡散トランスフォーマーモジュールによって行われます。これにより、テキスト生成が画像品質に及ぼす悪影響を回避します。
  • 拡散トランス画像生成部では、隠れ次元2520、パラメータ総数約40億の32層拡散トランスフォーマーを採用しています。このモジュールは、効率的な画像生成のために整流流法を使用しています。
  • オムニロープ位置エンコーディングOmniGen2は、位置情報をシーケンス識別子、モード識別子、2次元高さ座標、および幅座標に分解する、新しいマルチモーダル回転位置埋め込み(Omni-RoPE)を導入しています。これにより、画像内の各位置の情報を正確にエンコードできるだけでなく、複数画像の空間位置特定と識別も可能です。
  • 反射機構OmniGen2は、生成される画像の品質と一貫性を向上させるために、専用の反射メカニズムを採用しています。このモデルは、自身の出力を自己評価し、複数回の処理を経て改善を重ねることができます。
  • トレーニング戦略OmniGen2は段階的なトレーニング手法を採用しています。まず、テキストから画像への変換タスクで拡散モデルを事前学習し、次に混合タスクのトレーニングを導入し、最後に反射機能のエンドツーエンドのトレーニングを実行します。
  • データ処理トレーニングデータは動画から抽出され、データ品質を確保するために、DINO類似性フィルタリングやVLM一貫性チェックなど、複数のフィルタリング処理が施されます。

OmniGen2プロジェクトの住所

  • プロジェクト公式サイト:https://vectorspacelab.github.io/OmniGen2/
  • GitHubリポジトリ:https://github.com/VectorSpaceLab/OmniGen2
  • arXiv技術論文:https://arxiv.org/pdf/2506.18871

OmniGen2の応用シナリオ

  • デザインコンセプトの創出デザイナーは、簡単なテキスト記述を用いて、デザインコンセプト図やスケッチを素早く作成できます。
  • ストーリー作成支援コンテンツ制作者は、物語の筋書きや登場人物の説明に基づいて、対応するシーンやキャラクターの画像を生成できます。
  • 動画制作素材の生成クリエイターは、さまざまなシーン、キャラクターのアクション、特殊効果画像を生成し、それらをビデオ編集ソフトウェアにインポートして、アニメーション、特殊効果ビデオ、または実写ビデオの補助素材を作成できます。
  • ゲームシーンとキャラクター生成開発者はテキストによる説明を用いて、ゲームのシーンやキャラクターを素早く生成できる。
  • 教育リソースの作成教育者は、授業内容に基づいて関連する画像や図を作成することができます。例えば、歴史上の出来事を説明する際には、古代の戦争場面や歴史上の人物の画像を作成することができます。