AB
AiBoss
project

WeGen - 中国科学技術大学と上海交通大学が共同開発した、統合型マルチモーダル生成モデル。

WeGenは、中国科学技術大学が上海交通大学、WeChatチーム、中国科学院、その他の機関と共同で開発した、統一されたマルチモーダル生成モデルです。自然な対話に基づいた多様な視覚生成タスクを可能にします。WeGenはマルチモーダルな要素を組み合わせ、...

WeGenとは何ですか?

WeGenは、中国科学技術大学が上海交通大学、WeChatチーム、中国科学院と共同で開発した、統合されたマルチモーダル生成モデルです。自然な対話に基づいて、多様なビジュアル生成タスクを実現します。WeGenは、マルチモーダル大規模言語モデル(MLLM)と拡散モデルを組み合わせることで、テキストから画像への生成、条件付き生成、画像編集、スタイル転送など、さまざまなタスクを処理します。WeGenの最大の強みは、ユーザーの指示が曖昧な場合でも多様なクリエイティブな出力を提供できること、そしてユーザーが特定のニーズを持っている場合でも、生成された結果と指示や参照画像との一貫性を維持できることです。動的インスタンス一貫性(DIIC)データパイプラインとプロンプト自己書き換え(PSR)メカニズムに基づき、WeGenはインスタンスの同一性の一貫性と生成の多様性という2つの主要な課題に取り組み、ユーザーフレンドリーなデザインアシスタントとしての可能性を示しています。

WeGenの主な機能

  • テキストから画像への生成テキストの説明に基づいて、高品質な画像を生成します。
  • 条件駆動型生成特定の条件(エッジマップ、深度マップ、ポーズマップなど)に基づいて画像を生成する。
  • 画像編集と修復既存の画像を修正、修復、または拡張する。
  • スタイル転送ある画像のスタイルを別の画像に適用する。
  • 複数被験者の生成画像生成時に、複数の参照オブジェクトの主要な特徴を保持する。
  • インタラクティブな生成自然な対話とユーザーとのやり取りに基づいて、生成された結果が段階的に最適化されます。
  • クリエイティブデザイン支援ユーザーに多様な生成オプションを提供し、創造性を刺激します。

WeGenの技術原則

  • マルチモーダル大規模言語モデル(MLLM)と拡散モデルの組み合わせCLIPは、画像を意味的特徴量に変換するビジュアルエンコーダーとして使用され、拡散モデル(SDXLなど)は、高品質な画像を生成するデコーダーとして使用されます。LLM(LLaMAなど)は、自然言語による指示を処理し、テキスト情報と視覚情報の融合を実現します。
  • 動的インスタンス一貫性(DIIC)DIICデータパイプラインは、ビデオシーケンスを用いてオブジェクトの自然な変化を追跡し、その同一性の一貫性を維持します。これにより、インスタンスの同一性を維持するという従来の手法の欠点を克服し、画像が変更された場合でもモデルが重要な特徴を保持できるようになります。
  • ヒント自己書き換え(PSR)メカニズムPSRは言語モデルに基づいてテキストプロンプトを書き換え、ランダム性を導入することで多様な画像を生成します。離散的なテキストサンプリングを用いることで、意味的な一貫性を維持しながら、モデルが様々な解釈を探求できるようにします。
  • 統一されたフレームワークとインタラクティブな生成WeGenは、自然な対話とユーザーインタラクションに基づいて、複数の視覚生成タスクを単一のフレームワークに統合し、ユーザーを満足させる部分を保持しながら、生成される結果を段階的に最適化します。
  • 大規模データセットのサポートWeGenは、インターネット動画から抽出された大規模なデータセットで学習されています。このデータセットには、物体の動態に関する詳細な記述と、自動的にラベル付けされた記述が含まれており、モデルが一貫性と多様性を学習するのに役立ちます。

WeGenのプロジェクトアドレス

WeGenの応用シナリオ

  • クリエイティブデザインこれはデザイナーが創造的なコンセプトスケッチを素早く作成し、創造性を刺激するのに役立ち、広告、パッケージ、建築などの分野に適用できます。
  • コンテンツ作成映画、ゲーム、アニメーション業界向けに、シーン、キャラクター、小道具などのコンセプトアートを作成し、制作プロセスを加速させます。
  • 教育支援授業内容に関連した画像を生成することで、学生が抽象的な概念をより直感的に理解できるようにする。
  • パーソナライズされたカスタマイズユーザーのニーズに基づき、衣料品やインテリアなど、カスタマイズされたデザインソリューションを生成します。
  • 仮想空間での社会的交流とエンターテイメント仮想アバター、シーン、または小道具を生成して、仮想空間での社会的交流やゲーム体験を向上させます。