project
T5Gemma 2 - Googleのオープンソース長コンテキストエンコーダー・デコーダーモデル
T5Gemma 2は、Googleが開発した新しいオープンソースのエッジサイドマルチモーダル長コンテキストエンコーダー・デコーダーモデルです。このモデルは、回帰によって従来のTransformerアーキテクチャを最適化し、バインドワード埋め込みやマージドアテンションメカニズムなどの革新的な機能を導入し、パラメータスケーリング機能も備えています。
T5Gemma 2とは何ですか?
T5Gemma 2は、Googleが開発した新しいオープンソースのエッジサイドマルチモーダル長コンテキストエンコーダー・デコーダーモデルです。このモデルは、回帰分析によって従来のTransformerアーキテクチャを最適化し、バインドワード埋め込みやマージドアテンションメカニズムなどの革新的な機能を導入しています。270M-270M、1B-1B、4B-4Bなど、複数のパラメータサイズで利用可能です。マルチモーダル性能、長コンテキスト処理、汎用性において、対応するGemma 3を凌駕しています。140以上の言語をサポートし、モバイルデバイスでの迅速な実験と展開に適しており、エッジAIアプリケーションの新たな可能性を切り開きます。
T5Gemma 2の主な機能
- マルチモーダルな理解と生成 テキスト情報と画像情報を同時に処理し、視覚的な質問応答やマルチモーダル推論などのタスクを実行できます。例えば、画像の内容に基づいて関連する質問に答えたり、画像情報とテキストの説明を組み合わせて結果を生成したりできます。
- 長時間のコンテキスト処理 最大12万8千個のタグを含むコンテキストウィンドウを処理できる強力な長文コンテキスト機能を備えているため、長文文書の要約や長編物語の継続など、長文テキストの理解と生成を必要とするシナリオに適しています。
- エンコード・デコード機能 エンコーダー・デコーダーモデルとして、入力されたテキストや画像をベクトルにエンコードし、デコーダーを通してターゲットテキストを生成します。これは、翻訳、テキスト書き換え、要約など、さまざまな自然言語処理タスクに使用できます。
- 多言語対応 140以上の言語をサポートしており、多様な言語環境におけるアプリケーションのニーズを満たし、多言語間のテキスト処理と生成を可能にします。
- エッジにおける効率的な展開 モデルのパラメータはコンパクトなため、モバイルデバイス、ブラウザ、その他のエッジデバイスへの迅速な展開と運用に適しており、エッジアプリケーション向けに強力なAI機能を提供します。
T5Gemma 2の技術原理
- エンコーダ・デコーダアーキテクチャT5Gemma 2は、古典的なエンコーダー・デコーダーアーキテクチャを採用しています。エンコーダーは入力(テキストや画像など)を処理して意味ベクトルを生成し、デコーダーはそれらのベクトルに基づいて目標出力(テキストの説明など)を生成します。
- マルチモーダル機能T5Gemma 2は、画像を256個の埋め込みベクトルに変換する高効率なビジュアルエンコーダ(SigLIPなど)を統合しており、これらのベクトルは視覚的理解のためにエンコーダに入力されます。ビジュアル特徴とテキスト特徴を融合することで、このモデルはテキスト情報と画像情報を同時に処理でき、ビジュアル質問応答(VQA)や画像キャプション生成などのマルチモーダルタスクをサポートします。
- 長時間のコンテキスト処理T5Gemma 2は、局所的および全体的なアテンション機構を交互に用いることで、最大128Kのコンテキストウィンドウを処理できるようになり、長いコンテキストタスクにおけるパフォーマンスを大幅に向上させています。位置エンコーディングの頻度を調整することで、長いシーケンスを処理する際に、局所的および全体的な情報をより適切に捉えることができます。
- モデル適応技術T5Gemma 2のパラメータは、事前学習済みの純粋なデコーダーモデル(Gemma 3など)から初期化され、UL2事前学習目標を通じて適応され、事前学習済みモデルの言語理解能力を継承します。この適応戦略は、テキストタスクだけでなく、マルチモーダルタスクや長文コンテキストタスクにも適用可能であり、その汎用性と効率性を示しています。
- 効率最適化T5Gemma 2は、エンコーダーとデコーダーの単語埋め込み層を結合し、パラメータを共有することで、モデルパラメータの総数を大幅に削減し、モデル効率を向上させます。また、デコーダー内の自己注意機構と相互注意機構を統合モジュールにすることで、モデルパラメータとアーキテクチャの複雑さを軽減しつつ、推論効率を向上させます。
T5Gemma 2プロジェクトの住所
- プロジェクト公式サイト:https://blog.google/technology/developers/t5gemma-2/
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/google/t5gemma-2
- arXiv技術論文:https://arxiv.org/pdf/2512.14856
T5Gemma 2の応用シナリオ
-
ビジュアルQ&A画像情報とテキスト情報を組み合わせることで、ユーザーに正確な視覚的な質疑応答サービスを提供し、教育やインテリジェントな顧客サービスなどの分野に応用可能です。
-
画像の説明生成画像の説明文を自動生成することで、ユーザーが画像コンテンツを素早く理解できるようにし、ソーシャルメディアや視覚障害者の支援にも利用できます。
-
マルチモーダル推論この技術は画像とテキストを組み合わせて推論を行い、シーンが説明と一致するかどうかを判断するもので、インテリジェントセキュリティや自動運転などの分野に応用できる。
-
異言語翻訳翻訳とは、ある言語のテキストを別の言語に翻訳するプロセスであり、オンライン翻訳サービスや国際的なビジネスコミュニケーションにおいて広く利用されている。
-
モバイル音声アシスタント携帯電話上で動作し、音声対話機能を提供し、音声検索と音声コマンド実行をサポートします。