project
OneCAT - Meituanと上海交通大学が共同で立ち上げた統合型マルチモーダルモデル
OneCATは、美団が発表した新しい統合型マルチモーダルモデルです。純粋なデコーダーアーキテクチャを採用し、マルチモーダル理解、テキストから画像への変換、画像編集機能をシームレスに統合しています。このモデルは、従来のマルチモーダルモデルにおける外部視覚への依存を解消しています。
OneCATとは何ですか?
OneCATは、Meituanが新たに開発した統合型マルチモーダルモデルです。純粋なデコーダーアーキテクチャを採用し、マルチモーダル理解、テキストから画像への変換、画像編集機能をシームレスに統合しています。従来のマルチモーダルモデル設計では外部のビジュアルエンコーダーやワードセグメンターに依存していましたが、OneCATはそれらを廃止し、モーダル固有のエキスパート混合(MoE)構造とマルチスケール自己回帰メカニズムによって効率的なマルチモーダル処理を実現しています。高解像度画像の入出力処理において特に優れた性能を発揮します。革新的なスケール認識アダプタとマルチモーダル多機能アテンションメカニズムにより、ビジュアル生成機能とクロスモーダルアライメント機能をさらに強化しています。
OneCATの主な機能
-
マルチモーダルな理解外部のビジュアルエンコーダや単語分割器を必要とせずに、画像とテキストのマルチモーダル理解タスクを効率的に処理でき、純粋なデコーダアーキテクチャで画像とテキストの内容を直接深く理解することができます。
-
テキストから画像への生成このシステムは、テキスト記述に基づいて高品質な画像を生成し、マルチスケール自己回帰メカニズムを通して、低解像度から高解像度へと段階的に視覚ラベルを予測します。生成プロセスは効率的で、優れた結果が得られます。
-
画像編集命令ベースの画像編集をサポートし、参照画像と編集命令に条件付きで視覚生成プロセスを適用します。これにより、追加のアーキテクチャ変更を必要とせずに強力な条件付き生成機能を実現し、画像に対する正確な局所的および全体的な調整が可能になります。
OneCATの技術原則
-
純粋なデコーダーアーキテクチャOneCATは、純粋なデコーダー自己回帰型Transformerモデルを採用しているため、ビジュアルトランスフォーマー(ViT)やビジュアルタガーといった外部の画像処理コンポーネントが不要です。これにより、モデル構造が大幅に簡素化され、計算負荷が軽減されるため、特に高解像度入力の処理において、効率面で大きなメリットが得られます。
-
モダリティ特化型エキスパートハイブリッド(MoE)構造このモデルは、言語理解、マルチモーダル理解、画像合成のために、テキストトークン、連続ビジュアルトークン、離散ビジュアルトークンをそれぞれ処理する3つの専用フィードフォワードネットワーク(FFN)エキスパートを組み込んでいます。すべてのクエリ、キーバリューペア(QKV)、およびアテンションレイヤーは、異なるモダリティとタスク間で共有されるため、パラメータ効率が向上し、クロスモーダルアライメント機能が強化されます。
-
マルチスケール視覚自己回帰メカニズム大規模言語モデル(LLM)に導入されたこの手法は、粗密な階層構造で画像を生成し、視覚トークンを最低解像度から最高解像度へと段階的に予測することで、最先端の性能を維持しながらデコード手順を大幅に削減します。
-
マルチモーダル多機能アテンションメカニズムPyTorch FlexAttentionをベースとしたこのモデルは、複数のモダリティとタスクに柔軟に対応できます。テキストラベル付けには因果的アテンションを使用し、連続的なビジュアルラベルはフルアテンションで処理され、マルチスケールの離散的なビジュアルラベルはブロックベースの因果的アテンションで処理されます。
OneCATのプロジェクトアドレス
- プロジェクト公式サイト:https://onecat-ai.github.io/
- GitHubリポジトリ:https://github.com/onecat-ai/onecat
- ハギングフェイスモデルライブラリ:https://huggingface.co/onecat-ai/OneCAT-3B
- arXiv技術論文:https://arxiv.org/pdf/2509.03498
OneCATのアプリケーションシナリオ
-
インテリジェントな顧客サービスとコンテンツモデレーションOneCATのマルチモーダル理解機能は、画像とテキストコンテンツを効率的に処理できます。インテリジェントな顧客サービスシステムでは、ユーザーがアップロードした画像やテキスト情報を理解し、正確な応答を提供するのに活用できます。また、コンテンツモデレーションの分野では、違法な画像やテキストコンテンツを自動的に識別してフィルタリングするのにも利用できます。
-
クリエイティブデザインとデジタルコンテンツ制作そのテキストから画像を生成する機能は、テキストの説明に基づいて高品質な画像を生成し、デザイナーやクリエイターに創造的なインスピレーションを与え、ニーズに合った画像コンテンツを迅速に作成できます。広告デザイン、映画やテレビの特殊効果制作、ゲーム開発などの分野における初期コンセプトデザインに活用できます。
-
広告デザインとマーケティング広告デザインにおいて、OneCATは広告コピーに基づいて対応する画像アセットを迅速に生成できるため、デザイン効率が向上します。また、パーソナライズされた広告コンテンツの生成にも利用でき、さまざまなターゲット層の好みに合わせた広告画像を制作できます。
-
映画・テレビのポストプロダクションOneCATの画像編集機能は、映画やテレビのポストプロダクションにおける画像修復、スタイル変換、特殊効果の追加といった作業に利用でき、映画やテレビのプロデューサーが創造的な効果を迅速に実現し、制作効率を向上させるのに役立ちます。
-
教育と学習教育分野において、OneCATは授業内容に関連した画像を生成し、生徒が知識をより深く理解し記憶するのを支援することができます。例えば、科学的概念に基づいた図を生成したり、歴史的出来事の説明に基づいた関連シーン画像を生成したりすることが可能です。