project
MindOmni - テンセントが清華大学をはじめとする複数の機関と共同で開発した、マルチモーダルな大規模言語モデル。
MindOmniは、Tencent ARC Labが清華大学深圳国際大学院、香港中文大学、香港大学と共同で開発したマルチモーダル大規模言語モデルです。強化学習アルゴリズム(RGPO)に基づいており、視覚言語モデルを大幅に改善します。
MindOmniとは何ですか?
MindOmniは、Tencent ARC Labが清華大学深圳国際大学院、香港中文大学、香港大学と共同で開発したマルチモーダル大規模言語モデルです。強化学習アルゴリズム(RGPO)に基づき、視覚言語モデルの推論能力と生成能力を大幅に向上させています。このモデルは3段階の学習戦略を採用しています。まず、統一された視覚言語モデルを構築し、次にChained Thinking(CoT)データを用いて教師あり微調整を行い、最後にRGPOアルゴリズムを用いて推論生成を最適化します。MindOmniは、マルチモーダルな理解と生成タスクにおいて優れた性能を発揮し、数学的推論などの複雑なシナリオにおいて強力な推論能力と生成能力を示し、マルチモーダルAI開発の新たな道を切り開きます。
MindOmniの主な機能
- 視覚的理解画像コンテンツの理解と解釈、および画像関連の質問への回答を支援します。
- テキストから画像への生成テキストの説明に基づいて、高品質な画像を生成します。
- 推論生成複雑な論理推論を実行し、推論プロセスを含む画像を生成できる。
- ビジュアル編集既存の画像を編集します。例えば、画像内の要素を追加、削除、または変更するなどです。
- マルチモーダル入力処理テキストと画像の同時入力処理をサポートし、対応する出力を生成します。
MindOmniの技術原則
- モデルアーキテクチャ:
- ビジュアル言語モデル(VLM)画像の特徴は、事前学習済みのViT(Vision Transformer)に基づいて抽出され、テキスト入力はテキストエンコーダを使用して個別のテキストタグに変換されます。
- 軽量コネクタVLMと拡散デコーダを接続し、異なるモジュール間での効果的な機能転送を保証するために使用されます。
- テキストヘッダーテキスト入力を処理し、テキスト出力を生成します。
- デコーダ拡散モジュール画像生成を担当し、ノイズ除去処理に基づいて潜在的なノイズを実際の画像に変換します。
- 3段階のトレーニング戦略:
- フェーズ1事前学習により、モデルは基本的なテキストから画像への生成および編集機能を備えることができます。画像とテキストのペア、およびX2Iデータペアを使用してコネクタを学習させることで、拡散デコーダがVLMのセマンティック表現をシームレスに処理できるようになります。最適化の目的関数として、拡散損失とKLダイバージェンス損失が使用されます。
- フェーズ2本モデルは、連鎖思考(CoT)の指示データに基づいてさらに最適化され、論理的推論プロセスを生成する。粗密なCoT指示データ系列が構築され、その指示データを用いてモデルが監視され、微調整される。
- フェーズ3本研究は、強化学習に基づきモデルの推論および生成能力をさらに強化し、生成コンテンツの品質と精度を確保することを目的としています。画像やテキストの特徴を含むマルチモーダルなフィードバック信号を用いてポリシーの更新を誘導する推論生成ポリシー最適化(RGPO)アルゴリズムを導入しています。また、視覚と言語の整合性を評価するために、フォーマット報酬関数と一貫性報酬関数を導入しています。さらに、KLダイバージェンス正則化を用いて学習プロセスを安定化させ、知識忘却を防止しています。
MindOmniのプロジェクトアドレス
- プロジェクト公式サイト:https://mindomni.github.io/
- GitHubリポジトリ:https://github.com/TencentARC/MindOmni
- arXiv技術論文:https://arxiv.org/pdf/2505.13031
- オンラインでデモを体験してください:https://huggingface.co/spaces/stevengrove/MindOmni
MindOmniアプリケーションシナリオ
- コンテンツ作成テキストの説明に基づいて高品質な画像を生成し、広告、ゲーム、映画などの業界におけるビジュアルコンテンツ制作に活用することで、クリエイティブなデザインプロセスを加速させます。
- 教育授業内容に関連する画像や説明を作成し、授業を支援し、学生が複雑な概念をよりよく理解し記憶できるようにし、学習成果を向上させる。
- エンターテインメント業界ゲーム開発においてキャラクター、シーン、小道具を生成し、開発プロセスを加速させる。映画やテレビ番組制作において、ストーリーボードやコンセプトアートを提供し、創造的な表現を豊かにする。
- 広告業界広告効果を高めるために、魅力的な広告画像や動画を作成する。
- スマートアシスタント音声、テキスト、画像入力を組み合わせることで、より自然でインテリジェントな対話体験を提供し、多様なユーザーニーズに対応します。