project
MMaDA - ByteDanceがプリンストン大学などと共同で開発したマルチモーダル拡散モデル。
MMaDA(Multimodal Large Diffusion Language Models)は、プリンストン大学、清華大学、北京大学、ByteDanceによって開発されたマルチモーダル拡散モデルです。テキスト間推論、マルチモーダル理解、テキスト...
MMaDAとは何ですか?
MMaDA(Multimodal Large Diffusion Language Models)は、プリンストン大学、清華大学、北京大学、ByteDanceが共同開発したマルチモーダル拡散モデルです。クロステキスト推論、マルチモーダル理解、テキストから画像への生成など、複数の領域で優れたパフォーマンスを発揮します。このモデルは、モダリティに依存しない設計の統一拡散アーキテクチャを採用しており、特定のモダリティコンポーネントを必要としません。ハイブリッド長鎖推論(CoT)ファインチューニング戦略を導入し、クロスモーダルCoTフォーマットを統一するとともに、拡散ベースモデル用の統一ポリシー勾配強化学習アルゴリズムであるUniGRPOを導入しています。多様な報酬モデリングに基づき、推論タスクと生成タスクのポストトレーニングを統一することで、一貫したパフォーマンス向上を実現しています。MMaDAは、複数のタスクにおいて既存モデルを上回るパフォーマンスを発揮し、マルチモーダルAI開発の新たな方向性を示しています。
MMaDAの主な機能
- テキスト生成シンプルなテキスト説明から複雑な推論タスクまで、あらゆるものに対応し、高品質なテキストコンテンツを生成できます。
- マルチモーダルな理解テキストと画像の組み合わせを理解・処理し、画像コンテンツの詳細な説明や画像ベースの質問応答をサポートします。
- テキストから画像への生成テキストによる説明に基づいて対応する画像を生成し、抽象的な概念から具体的な場面までの生成をサポートします。
- 複雑な推論タスク数学の問題や論理的推論といった複雑なタスクの処理をサポートし、詳細な推論プロセスと正確な解答を提供します。
- 異種モダリティ協働学習統一されたアーキテクチャとトレーニング戦略に基づき、テキストと画像という2つのモダリティ間での協調学習と最適化を可能にする。
MMaDAの技術的原理
- 統一拡散アーキテクチャ共通の確率式とモダリティに依存しない設計に基づいた統一的な拡散アーキテクチャを採用することで、モダリティ固有のコンポーネントは不要になります。このモデルは、テキストデータと画像データをシームレスに処理できます。事前学習段階では、マスクされたラベル予測タスクに基づいて、テキストと画像のモダリティでモデルが共同で学習されます。モデルは、ノイズの多いデータから元のデータを復元する方法を学習します。
- 混合型ロングチェーンオブソート(CoT)微調整戦略このアプローチでは、統一されたCoTフォーマットを使用して、さまざまなタスクにわたる推論プロセスを整合させます。CoTフォーマットには、段階的な推論経路と最終結果が含まれており、モデルが詳細な推論プロセスを生成できるようにします。微調整は、数学的問題、論理的推論、マルチモーダル推論タスクなど、多様な推論データを使用して実行されます。これにより、モデルは複雑なタスクの処理に優れた性能を発揮します。
- 統一ポリシー勾配強化学習アルゴリズム(UniGRPO)UniGRPOは、多様な報酬モデルに基づいており、生成タスクにおける推論と事後学習を統合しています。報酬関数には、正しさ、フォーマット、CLIPスコアが含まれており、様々なタスクにおいて優れたモデル性能を保証します。UniGRPOはマルチステップノイズ除去学習を採用しており、部分的にノイズを含むデータからモデルを学習させ、拡散モデルのマルチステップ生成機能をより効果的に活用できます。
MMaDAのプロジェクト住所
- GitHubリポジトリ:https://github.com/Gen-Verse/MMaDA
- ハギングフェイスモデルライブラリ:https://huggingface.co/Gen-Verse/MMaDA
- arXiv技術論文:https://arxiv.org/pdf/2505.15809
- オンラインでデモを体験してください:https://huggingface.co/spaces/Gen-Verse/MMaDA
MMaDAの応用シナリオ
- コンテンツ作成文章作成、デザイン、芸術制作のためのテキストと画像を生成します。
- 教育支援個別学習教材と詳細な問題解決手順を提供し、教育を支援します。
- インテリジェントな顧客サービステキストと画像によるインタラクションに基づいて、ユーザーの質問に答え、サービス体験を向上させます。
- 健康管理医療画像の解析を支援し、健康に関するアドバイスを提供し、医療上の意思決定をサポートします。
- エンターテイメントゲームエンターテインメントとインタラクションを豊かにするゲームコンテンツと拡張現実体験を生成する。