project
UniTok - ByteDance、香港大学、華中科技大学が共同で開発した、統合型ビジュアル単語分割ツール。
UniTokは、ByteDanceが香港大学および華中科技大学と共同開発した統合型ビジュアル単語分割器です。ビジュアル生成と理解の両方のタスクをサポートします。マルチコードブック量子化技術に基づいて、ビジュアル特徴を複数の小さなブロックに分割し、各ブロックは...
UniTokとは何ですか?
UniTokは、ByteDanceが香港大学および華中科技大学と共同開発した統合型ビジュアル単語セグメンテーションツールです。ビジュアル生成と理解の両方のタスクをサポートします。マルチコードブック量子化技術に基づき、ビジュアル特徴を複数の小さなブロックに分割し、それぞれを独立したサブコードブックで量子化することで、離散単語分割の表現力を大幅に向上させ、従来の単語セグメンテーションツールにおける詳細の捉え方と意味理解の矛盾を解消します。UniTokはImageNetにおいて、ゼロショット分類精度78.6%、再構成品質指標(rFID)わずか0.38を達成し、既存の単語セグメンテーションツールを大きく上回ります。UniTokを基盤とするマルチモーダル大規模言語モデル(MLLM)は、ビジュアル質問応答および画像生成タスクにおいて優れた性能を発揮し、マルチモーダルタスクにおける強力な可能性を示しています。
UniTokの主な機能
- 統一された視覚表現画像を個別の視覚トークンにエンコードします。これらのトークンは、画像生成タスク(テキストから画像への変換など)だけでなく、視覚理解タスク(視覚的な質問応答など)にも使用できます。
- 高画質画像再構成画像の詳細を保持しながら、効率的な画像再構成を実現します。
- 意味的アライメント対照学習と再構成損失を組み合わせることで、生成された視覚トークンがテキストの説明と一致するようにし、それによって視覚的理解能力を向上させます。
- マルチモーダル大規模言語モデル(MLLM)をサポートします。マルチモーダルな大規模言語モデルのための視覚入力モジュールとして、マルチモーダルタスクにおけるモデルの統一的な処理と生成をサポートします。
UniTokの技術原則
- マルチコードブック量子化UniTokは、視覚トークンを複数の小さなブロックに分割し、それぞれを独立したサブコードブックを用いて量子化します。例えば、64次元の視覚特徴ベクトルは8次元のブロック8つに分割され、それぞれが4096個のコードワードからなるサブコードブックに基づいて量子化されます。このようにして、UniTokの理論的語彙は指数関数的に増加し、離散トークンの表現力を大幅に拡張することができます。
- アテンション分解UniTokは、トークン分解において従来の線形射影層をマルチヘッドアテンションモジュールに置き換えることで、元のトークンに含まれる意味情報をより良く保持し、分解された特徴の表現力を向上させています。また、UniTokは因果アテンションを用いて、自己回帰生成タスクとの互換性を確保しています。
- 統一された訓練目標VQVAEベースの再構成損失は、画像の詳細を正確に再構成することを保証します。この損失には、ピクセルレベルの再構成誤差、知覚損失、識別損失、およびベクトル量子化損失が含まれます。UniTokは、生成されたビジュアルトークンがテキストの説明と一致するように、CLIPに似たコントラスト損失を導入し、視覚的理解を向上させます。最終的な合計損失は、再構成損失とコントラスト損失の加重和です。このアプローチに基づき、UniTokは生成タスクと理解タスクの両方を同時に最適化できます。
- マルチモーダル大規模言語モデル群(MLLM)生成されたビジュアルトークンは、MLP射影層に基づくマルチモーダル大規模言語モデルのトークン空間にマッピングされ、視覚と言語の統合処理を実現します。MLLMへの入力を簡素化するため、UniTokは複数のサブコードブックで生成されたトークンを単一のビジュアルトークンに統合し、それをMLLMに入力します。ビジュアルトークンの予測が必要な場合、MLLMは次の位置に対応する複数のサブコードブックトークンを自己回帰的に予測し、効率的なビジュアル生成を実現します。
UniTokのプロジェクトアドレス
- プロジェクト公式サイト:https://foundationvision.github.io/UniTok/
- GitHubリポジトリ:https://github.com/FoundationVision/UniTok
- ハギングフェイスモデルライブラリ:https://huggingface.co/FoundationVision/unitok_tokenizer
- arXiv技術論文:https://arxiv.org/pdf/2502.20321
UniTokのアプリケーションシナリオ
- マルチモーダルモデルのための視覚入力マルチモーダルな大規模言語モデルの視覚モジュールとして、テキスト情報と画像情報を同時に処理するのに役立ち、全体的なパフォーマンスを向上させます。
- 高品質な画像生成テキストによる説明に基づいて非常に詳細な画像を生成するため、クリエイティブデザイン、広告制作、その他の分野に適しています。
- 視覚的な質問応答と理解これは、モデルが画像の内容を理解し、視覚関連の質問に答えるのを支援し、教育、医療画像解析、その他の分野で使用できます。
- マルチモーダルコンテンツの作成ニュース記事やソーシャルメディアなどで使用する画像やテキストコンテンツを迅速に生成し、制作効率を向上させます。
- クロスモーダル検索と推薦テキストや画像に基づいた検索やレコメンデーションを実行することで、eコマースプラットフォームやマルチメディアプラットフォームのユーザーエクスペリエンスを向上させる。