AB
AiBoss
project

Gemma 3n - GoogleのエッジベースマルチモーダルAIモデル

Gemma 3nは、Google I/Oで発表されたエッジベースのマルチモーダルAIモデルです。Gemini Nanoアーキテクチャをベースに、レイヤーごとの埋め込み技術を採用することで、メモリ使用量を2~4Bパラメータモデルのレベルまで圧縮しています。モデルパラメータの数は...

Gemma 3nとは何ですか?

Gemma 3nは、Google I/Oで発表されたエッジベースのマルチモーダルAIモデルです。Gemini Nanoアーキテクチャをベースに、レイヤーごとの埋め込み技術を採用することで、メモリ使用量を2~4Bパラメータモデルと同等のレベルに圧縮しています。モデルパラメータはそれぞれ5Bと8Bですが、メモリ使用量は2Bと4Bモデルと同等です。Gemma 3nは、テキスト、画像、ショートビデオ、音声の入力に対応し、構造化されたテキスト出力を生成できます。新たに追加された音声処理機能により、音声のリアルタイム文字起こし、背景雑音の認識、音声感情の分析などが可能です。Google AI Studioを介してブラウザ上で直接使用できます。

Gemma 3nの主な機能

  • エッジのパフォーマンスと効率を最適化Gemma 3nは、Gemma 3 4Bと比較してモバイルデバイスでの応答時間が約1.5倍高速化され、Per-Layer Embedding(PLE)、KVC共有、Advanced Activation Quantizationなどの技術によりメモリ使用量を削減しています。
  • マルチモーダル入力のサポートテキスト、画像、音声、動画の理解と処理をサポートし、複雑なマルチモーダルなインタラクションにも対応できます。
  • プライバシーの優先とオフラインでの利用可能性すべての計算はインターネット接続を必要とせず、ローカルデバイス上で実行され、データはデバイスから外部に送信されることはないため、ユーザーのプライバシーが保護されます。
  • 柔軟なモデルアーキテクチャMatFormerアーキテクチャをベースに、必要に応じてパフォーマンスと品質を動的に切り替えることができる高度な2Bサブモデルを組み込んでいます。
  • 多言語対応140以上の言語に対応しており、日本語、ドイツ語、韓国語、スペイン語、フランス語などの言語では優れた性能を発揮します。
  • 32Kトークンコンテキストウィンドウ最大32,000語または記号の入力を処理できるため、長文の処理に適しています。

ジェマ3nの技術原理

  • Gemini Nanoアーキテクチャに基づくGemma 3nは、Gemini Nanoの軽量アーキテクチャを継承し、モバイルデバイス向けに最適化されています。知識蒸留と量子化対応トレーニング(QAT)により、高いパフォーマンスを維持しながら、リソース要件を大幅に削減します。
  • 層ごとの埋め込み技術層ごとの埋め込み(PLE)技術を採用することで、モデルのメモリ要件を大幅に削減できます。モデルの元のパラメータ数はそれぞれ5Bと8Bですが、メモリ使用量は2Bと4Bのモデルと同等で、実行に必要な動的メモリはわずか2GBまたは3GBです。
  • マルチモーダル融合Gemini 2.0の単語分割機能と強化されたデータ混合機能を組み合わせ、140以上の言語でのテキストおよび画像処理をサポートし、世界中のユーザーのニーズに対応します。
  • ローカル/グローバルレイヤーの千鳥配置設計ローカル層とグローバル層のインターリーブ機構は5:1の比率で採用されており、5つのローカル層の後に1つのグローバル層が続きます。計算はモデルの最初の層であるローカル層から開始されます。これにより、長いコンテキストにおけるキーバリューキャッシュの爆発的増加問題を軽減できます。

ジェマ3nプロジェクトの住所

Gemma 3nの応用シナリオ

  • 音声の文字起こしと感情分析リアルタイムで音声を文字起こししたり、背景雑音を認識したり、音声の感情を分析したりできるため、音声アシスタントやアクセシビリティアプリケーションに適している。
  • コンテンツ生成このアプリは、携帯電話上で画像の説明文、動画の要約、音声の文字起こしを生成する機能をサポートしており、コンテンツ制作者が短い動画やソーシャルメディア用の素材を素早く編集するのに適しています。
  • 学術課題のカスタマイズ開発者は、Gemma 3nの微調整機能を利用して、実験画像の分析や講義音声の書き起こしなど、Colab上での学術的なタスクに合わせてモデルをカスタマイズできます。
  • 低資源機器低スペック端末向けに設計されており、スマートフォン、タブレット、ノートパソコンでスムーズに動作させるには、わずか2GBのRAMしか必要としません。