project
XVerse - ByteDanceが開発した、複数被写体制御型画像生成モデル
XVerseは、ByteDanceのインテリジェントクリエーションチームが開発した、マルチエージェント制御による新しい画像生成モデルです。このモデルは、テキストから画像を生成する領域において、複数の被写体のアイデンティティや意味的属性(ポーズ、スタイル、照明など)をきめ細かく制御します。
XVerseとは何ですか?
XVerseは、ByteDanceのインテリジェントクリエーションチームが開発した、複数の被写体を制御できる革新的な画像生成モデルです。テキストから画像を生成する領域において、このモデルは、生成される画像の品質と一貫性を維持しながら、複数の被写体のアイデンティティと意味属性(ポーズ、スタイル、照明など)をきめ細かく制御します。XVerseは、参照画像をタグ固有のテキストストリーム変調オフセットに変換することで、潜在的な画像変数や特徴に干渉することなく、特定の被写体を正確かつ独立して制御することを可能にします。このモデルは、VAEエンコードされた画像特徴モジュールと正則化技術を組み込むことで、ディテールの保持と生成品質を向上させています。XVerseは、複数の被写体を制御できる画像合成において、高い忠実度と編集性を提供し、個々の被写体の特徴と意味属性を強力に制御できます。
XVerseの主な機能
- 複数エンティティの制御XVerseは、複数の被写体のアイデンティティと意味属性を同時に制御できます。例えば、画像内の複数の人物のアイデンティティ、姿勢、スタイルなどを同時に制御することで、複雑なシーン生成を実現できます。
- 高忠実度画像合成生成された画像は忠実度が高く、テキスト記述の詳細や意味情報を正確に反映しつつ、画像全体の品質と一貫性を維持している。
- 意味属性制御ポーズ、スタイル、照明などの意味属性をきめ細かく制御できるため、画像のスタイルや雰囲気を柔軟に調整できます。
- 強力な編集機能ユーザーは、簡単なテキストプロンプトに基づいて生成された画像を編集および調整することができ、パーソナライズされた画像を作成できます。
- アーティファクトと歪みを軽減しますXVerseは、VAEエンコードされた画像特徴モジュールと正則化技術を導入することで、生成画像におけるアーティファクトや歪みを大幅に低減し、画像の自然さと視覚効果を向上させることができます。
XVerseの技術的原則
- テキストストリーム変調メカニズムこの手法では、参照画像をマーカー固有のテキストストリーム変調オフセットに変換することで、特定の対象を精密に制御できます。このオフセットはモデルのテキスト埋め込みに追加され、画像の潜在変数や特徴に影響を与えることなく、生成される画像をきめ細かく制御することが可能になります。
- VAEエンコード画像特徴モジュール生成画像のディテール保持能力を向上させるため、XVerseはVAEエンコードされた画像特徴モジュールを導入しました。このモジュールは補助モジュールとして機能し、モデルがより多くのディテールを保持し、生成時のアーティファクトや歪みを軽減するのに役立ちます。
- 正則化手法ランダムに片側を保持する変調注入に基づいて、モデルは非変調領域で一貫性を維持するように強制されます。正規化された被験者固有の特徴は、複数被験者データセットのデータ拡張戦略として使用され、複数被験者シナリオにおける被験者の特徴を識別および保持するモデルの能力を向上させます。変調モデルと参照T2Iブランチ間のテキスト-画像クロスアテンションマップのL2損失を計算することで、変調モデルがT2Iブランチと同じアテンションパターンを保持し、意味的相互作用の一貫性と編集可能性を維持することが保証されます。
- トレーニングデータXVerseは、高品質なマルチエージェント制御トレーニングデータセットを使用して学習されています。このデータセットは、画像キャプション生成とフレーズ位置特定にFlorence2、高精度な顔抽出にSAM2を使用し、様々な被写体やシーンを網羅した高品質なトレーニングデータセットを構築しています。トレーニングデータは、人間と物体の相互作用、人間と動物の組み合わせ、複雑な複数人シーンなど、多様なシナリオをカバーしており、モデルの汎化能力を高めています。
XVerseのプロジェクトアドレス
- プロジェクト公式サイト:https://bytedance.github.io/XVerse/
- GitHubリポジトリ:https://github.com/bytedance/XVerse
- ハギングフェイスモデルライブラリ:https://huggingface.co/ByteDance/XVerse
- arXiv技術論文:https://arxiv.org/pdf/2506.21416
XVerseの応用シナリオ
- Eコマース広告生成同じ製品を様々な人が使用している広告画像を迅速に生成し、ECサイトのプロモーション活動に活用することで、ブランドのパーソナライズされたニーズに応えることができます。
- ゲームキャラクターデザインゲームデザイナーの説明に基づいて、それぞれ異なる外見とスキルを持つ複数のキャラクターコンセプトアートを生成し、キャラクターデザインプロセスを加速させる。
- 医学教育イラスト人体の詳細な解剖学的・生理学的図を作成し、医学生が人体の構造と機能をより深く理解するのに役立ちます。
- 仮想ソーシャルプラットフォーム上での個人アバターのカスタマイズユーザーが入力した説明に基づいて、パーソナライズされた仮想アバターが生成されます。このアバターは、仮想ソーシャルプラットフォーム上のアバターとして、または仮想現実における個人画像として使用できます。
- 都市計画案のプレゼンテーション都市公園の仮想レンダリングを作成することで、市民が都市計画担当者の設計案をよりよく理解できるようにする。