project
Nexus-Gen - Modaが華東師範大学などの機関と協力してオープンソース化した、マルチモーダル画像生成モデル。
Nexus-Genは、Modaチーム、華東師範大学、およびその他の機関によって開発されたオープンソースの総合的な画像生成モデルです。画像の理解、生成、編集を同時にサポートします。Nexus-Genは、言語モデルと拡散モデルの強力な機能を組み合わせています。
Nexus-Genとは何ですか?
Nexus-Genは、Modaチーム、華東師範大学、およびその他の機関によって開発された、オープンソースの総合的な画像生成モデルです。画像理解、生成、編集のタスクを同時にサポートします。Nexus-Genは、言語モデルと拡散モデルの強力な機能を統合し、事前入力自己回帰戦略に基づいて、従来の手法における画像埋め込みエラーの蓄積という問題を解決します。このモデルは、GPT-4oに匹敵する画像品質と編集能力を実現し、マルチモーダルモデル分野の発展を牽引しています。
Nexus-Genの主な機能
- 画像理解画像コンテンツを分析し、説明文を生成し、画像に関する質問に回答する。
- 画像生成テキストによる説明に基づいて高品質な画像を生成し、複雑なシーンやスタイルにも対応します。
- 画像編集色調整、オブジェクトの追加/削除、スタイル変換など、さまざまな編集機能を提供します。
Nexus-Genの技術原理
- 建築設計入力テキストと画像は、それぞれテキストトークナイザーとビジョンエンコーダーを用いて埋め込みベクトルに変換されます。これらのベクトルは自己回帰トランスフォーマーに入力され、出力テキストトークンと画像埋め込みが生成されます。画像埋め込みは、ビジョンプロジェクターを用いて入力と同じ特徴空間に位置合わせされ、拡散モデル(ビジョンデコーダー)を用いてピクセルレベルの画像にデコードされます。
- 事前入力済みの自己回帰戦略事前充填型自己回帰戦略が導入される。学習時には、モデルは画像埋め込み位置に学習可能な特殊トークンを充填する。推論時には、モデルは予測された画像開始トークン(BOI)に基づいて特殊トークンを直接事前充填することで、学習と推論の動作を統一し、エラーの蓄積を回避する。
- 統一タスク表現統一されたタスク表現フォーマットに基づき、画像理解、画像生成、画像編集の各タスクが単一のフレームワークに統合されます。すべてのタスクのデータは同様のメッセージフォーマットを使用して整理され、モデルは異なるタスク間の相乗効果を学習することで、マルチモーダルタスクの処理能力を向上させます。
- 2段階アライメントトレーニング
- 自己回帰トランスフォーマーのトレーニングこのモデルは、3段階のトレーニングを通して徐々に画像生成および編集機能を習得し、最終的に高品質のデータを用いて生成品質を向上させます。
- 拡散モデルのトレーニング単段階の学習に基づいて、入力条件をテキストから画像埋め込みに変更することで、高品質な画像再構成を実現します。
Nexus-Genプロジェクトの住所
- GitHubリポジトリ:https://github.com/modelscope/Nexus-Gen
- ハギングフェイスモデルライブラリ:https://huggingface.co/modelscope/Nexus-Gen
- arXiv技術論文:https://arxiv.org/pdf/2504.21356
Nexus-Genの応用シナリオ
- クリエイティブデザインアートワーク、イラスト、コンセプトアートを迅速に生成し、スタイル変換をサポートし、クリエイティブな効率性を向上させます。
- コンテンツ作成記事用の画像や動画素材を作成し、コンテンツのテーマに合わせて画像を編集する。
- 広告とマーケティングブランドスタイルに合った広告素材を作成し、商品展示画像を迅速に生成します。
- 教育と学習学習の直感性を高めるために、歴史的、科学的、または文学的な場面の画像を生成する。
- ゲーム開発仮想現実(VR)および拡張現実(AR)アプリケーションに対応したゲームシーン、キャラクター、アイテムを迅速に生成します。