project
Mogao - ByteDanceのSeedチームが発表した、マルチモーダルな理解と生成のための統合アーキテクチャ。
Mogaoは、ByteDanceのSeedチームが開発した本格的なインターリーブ型マルチモーダル生成モデルです。そのアーキテクチャは、変分オートエンコーダー(VAE)とビジュアルトランスフォーマー(ViT)を組み合わせたデュアルビジュアルエンコーダーを採用しており、より優れた視覚理解を可能にします。
莫高窟とは何ですか?
Mogaoは、ByteDanceのSeedチームが開発した、包括的なインターリーブ型マルチモーダル生成モデルです。そのアーキテクチャは、変分オートエンコーダー(VAE)とビジュアルトランスフォーマー(ViT)を組み合わせたデュアルビジュアルエンコーダーを採用し、画像生成における視覚的理解とコンテキストアライメントを向上させています。Mogaoは、インターリーブ回転位置埋め込み(IL-RoPE)を導入し、画像の2次元空間位置情報とマルチモーダルデータの時間的位置関係を捉えることで、マルチモーダル分類器不要のガイダンス技術により、生成品質と一貫性をさらに高めています。
莫高の主な機能
- マルチモーダルな理解と生成Mogaoは、テキストと画像が交互に並んだシーケンスを処理することで、高品質なマルチモーダル理解と生成を実現します。テキストによる説明から高品質な画像を生成したり、画像から関連するテキストコンテンツを生成したりできます。マルチモーダル理解タスクでは、テキストタグ付けにおいて、画像コンテンツをより深く理解するために、ビジュアルトランスフォーマー(ViT)タグと履歴シーケンス内のテキストタグに重点を置きます。
- ゼロショット画像編集と合成生成Mogaoは、追加のトレーニングなしで画像の編集や修正を可能にする、強力なゼロショット画像編集機能を備えています。また、さまざまな要素を組み合わせて、高い一貫性と整合性を持つ新しい画像を生成する組み合わせ生成機能も備えています。
- 高品質な画像生成Mogaoは画像生成において卓越した性能を発揮し、写実主義、グラフィックデザイン、アニメーション、イラストレーションなど、幅広いスタイルカテゴリーで優れたパフォーマンスを実現します。最大2K解像度の画像生成に対応し、高精細で高品質な画像を生成します。
- テキストレンダリング機能Mogaoはテキストレンダリングを大幅に改善し、テキストの可読率は最大94%に達し、従来の画像生成における中国語文字のレンダリング問題を効果的に解決しました。
莫高の技術原理
- デュアルビジョンエンコーダMogaoは、変分オートエンコーダー(VAE)とビジュアルトランスフォーマー(ViT)をビジュアルエンコーダーとして使用します。画像が条件付き入力として使用される際、VAEとViTの両方からビジュアル特徴が抽出され、履歴シーケンスに追加されます。マルチモーダル理解タスクでは、テキストタグ付けはViTタグとテキストタグのみに焦点を当てます。マルチモーダル生成タスクでは、ノイズ付きVAEタグは履歴シーケンス内のすべてのタグに焦点を当てます。
- 高度に統合されたアーキテクチャMogaoは、事前学習済みの大規模言語モデル(LLM)に基づいて、統一された自己注意層を使用して視覚シーケンスとテキストシーケンスを同時に処理し、フィードフォワードネットワーク(FFN)内の異なる多層パーセプトロン(MLP)を使用して視覚モダリティとテキストモダリティを個別に処理します。
- インターリーブ回転位置埋め込み(IL-RoPE)このモデルは、画像の二次元空間位置情報と、マルチモーダルデータの時間的位置関係を捉えるために使用されます。テキストと画像が交互に並んだシーケンスをより適切に処理できます。
- 混合解像度トレーニング事前学習と微調整は、低解像度(例:256²)から高解像度(例:2048²)まで、異なるアスペクト比と解像度の画像に対して実行され、モデルが目標解像度を認識できるようにサイズ埋め込みが導入されます。
- クロスモーダルRoPEテキストトークンを2次元トークンとして扱い、2次元RoPEを適用することで、ビジュアルトークンとテキストトークンの整合性がさらに向上します。
- トレーニング後の段階これには、モデルの性能と制御性を向上させるための継続的トレーニング(CT)、教師あり微調整(SFT)、人間からのフィードバック調整(RLHF)、およびキューイングエンジニアリング(PE)が含まれます。
- 欠陥を意識したトレーニングパラダイム欠陥領域を正確に特定するために欠陥検出器が導入され、マスク潜在空間最適化によってトレーニングデータセットが効果的に拡張される。
- Hyper-SDとRayFlow: 生成パスを最適化し、各データポイントを特定のインスタンスの目標分布に誘導し、パスの衝突を減らし、生成の安定性とサンプルの多様性を向上させます。
- 重要度サンプリングメカニズム学習プロセスは、トレーニング中の最も重要な時間ステップに焦点を当て、生成品質に影響を与えることなく、効率的な低ステップサンプリングをサポートします。
莫高のプロジェクト住所
- arXiv技術論文:https://arxiv.org/pdf/2505.05472
莫高窟の応用事例
- コンテンツ作成Mogaoはテキストの説明から高品質な画像を生成できるだけでなく、画像から関連するテキストの説明を生成することもできます。
- スマートアシスタントMogaoは、音声、画像、テキストといった複数のモダリティを組み合わせることで、より自然で知的な人間とコンピュータのインタラクションを実現できる。
- 画像とテキストの相互検索ユーザーはテキストによる説明を入力することで関連画像を検索したり、画像をアップロードすることで関連テキストによる説明を取得したりできます。
- 仮想現実と拡張現実Mogaoは、仮想環境やインタラクティブな要素を生成するために使用でき、仮想現実や拡張現実のユーザーエクスペリエンスを向上させる。
- 医用画像解析Mogaoは、MRI、CT、超音波などの様々なモダリティによる医用画像とテキストによる説明を組み合わせることで、疾患診断の精度と早期発見能力を向上させることができる。