project
UniToken - 復旦大学が美団(Meituan)をはじめとする複数の機関と共同で立ち上げた、統一されたビジュアルコーディングフレームワーク。
UniTokenは、マルチモーダルな理解と生成タスク向けに設計された、斬新な自己回帰型生成モデルです。離散的および連続的な視覚表現を組み合わせることで、画像の高レベルな意味を同時に捉えることができる統一的な視覚符号化フレームワークを構築します。
UniTokenとは何ですか?
UniTokenは、マルチモーダルな理解と生成タスクのために特別に設計された、斬新な自己回帰型生成モデルです。離散的および連続的な視覚表現を組み合わせることで、画像の高レベルな意味情報と低レベルな詳細情報の両方を同時に捉えることができる、統一された視覚エンコーディングフレームワークを構築します。これにより、UniTokenは視覚理解と画像生成タスクをシームレスにサポートし、さまざまなタスクに対して多次元的な情報を提供できます。
UniTokenの主な機能
- 図解解説UniTokenは、画像キャプション生成や視覚的質問応答(VQA)など、画像とテキストの理解タスクを効率的に処理できます。
- 画像生成UniTokenは、テキスト記述からの画像生成、画像編集、ストーリー生成など、高品質な画像生成タスクをサポートしています。
- マルチモーダル対話マルチモーダルな対話シナリオにおいて、UniTokenは入力されたテキストと画像情報に基づいて自然言語による応答を生成し、画像コンテンツの解釈や、画像とテキストの指示に基づく新しい画像の生成など、より複雑な対話型タスクをサポートする。
- 複雑な指示に従うUniTokenは、指示による微調整機能を強化し、テキストの説明と画像に基づいて特定のレイアウトを持つ画像を生成するなど、複雑なマルチモーダル指示をより適切に理解し実行できるようにします。
- きめ細かい視覚タスクUniTokenは、AnyResやViTといったエンドツーエンドの微調整技術を活用することで、高解像度画像の処理、画像の詳細認識能力の向上を実現し、高精度な画像処理を必要とするタスクに適しています。
- タスクの多様性UniTokenは、マルチモーダルな理解と生成タスクをシームレスに統合することができ、テキストや画像の理解、画像生成、画像編集、ストーリー生成など、さまざまな複雑なタスクをサポートし、強力な汎用生成機能を発揮します。
UniTokenの技術原則
- 統一ビジュアルコーディングUniTokenは、連続エンコーダと離散エンコーダからなるデュアルエンコーダを採用しており、VQ-GANの離散エンコーディングとSigLIPの連続表現を組み合わせることで、高レベルのセマンティクスと低レベルの詳細情報の両方を備えたビジュアルエンコーディングを生成し、マルチモーダルな大規模モデルに完全なビジュアル情報を提供します。
- 多段階トレーニング
- 視覚的意味空間のアライメントChameleonをベースに、言語モデル(LLM)は固定され、連続的な視覚エンコーディングを言語空間に合わせるために、SigLIP ViTとAdapterのみがトレーニングされます。
- マルチタスク共同訓練大規模な画像理解データセットと画像生成データセットを共同で学習させ、データ比率を制御することで、理解タスクと生成タスクの両方におけるモデルのパフォーマンスをバランスよく向上させることができる。
- より詳細な調整を行うための手順高品質なマルチモーダル対話と洗練された画像生成データを導入することで、モデルが複雑な指示に従う能力がさらに向上する。
- きめ細かな視覚的強調UniTokenは、AnyResやViTなどのエンドツーエンドの微調整技術をサポートしており、モデルのクラッシュを回避し、幅広いタスクシナリオに適応しながら、高解像度画像のきめ細かな認識を向上させます。
UniTokenのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/SxJyJay/UniToken
- arXiv技術論文:https://arxiv.org/pdf/2504.04423
UniTokenのアプリケーションシナリオ
- コンテンツの作成とデザインUniTokenはテキストの説明に基づいて高品質な画像を生成できるため、デザイナーは創造的なスケッチやコンセプト図を素早く作成でき、デザインの時間と労力を節約できます。
- インテリジェントな顧客サービスとバーチャルアシスタントマルチモーダル対話シナリオにおいて、UniTokenはユーザーが入力したテキスト情報と画像情報を理解し、自然言語による応答を生成することができます。
- 教育と学習UniTokensは、教育現場で生徒が複雑な概念をより深く理解し、学習するのに役立つツールとして活用できます。例えば、科学実験、歴史的出来事、文学作品などに関連する画像を生成することで、UniTokensは生徒の視覚的な記憶力と理解力を向上させることができます。
- 医療と健康医療分野では、UniTokenは医療画像の生成や医療画像の解釈に利用できます。
- 自動運転と交通管理UniTokenは、自動運転シナリオにおける視覚的質問応答(VQA)タスクに利用できます。例えば、車両は道路画像をリアルタイムでアップロードし、UniTokenを使用して道路状況、交通標識、その他の情報を自然言語で記述することで、自動運転システムがより正確な判断を下せるように支援できます。