AB
AiBoss
project

Gemma 3 - Googleの最新オープンソースマルチモーダルAIモデル

Gemma 3は、Googleが開発した最新のオープンソース人工知能モデルで、複数のデバイスに対応したAIアプリケーション開発を支援するために開発者向けに設計されています。35以上の言語に対応し、テキスト、画像、短い動画などを分析する機能を備えています。

ジェマ3とは何ですか?

Gemma 3は、Googleが新たに開発したオープンソースのAIモデルで、複数のデバイスにわたるAIアプリケーション開発をサポートするために開発者向けに設計されています。35以上の言語に対応し、テキスト、画像、短い動画を分析する機能を備え、さまざまなハードウェアやパフォーマンス要件に対応するため、1B、4B、12B、27Bの4種類のモデルサイズを提供しています。Gemma 3は、単一のGPUまたはTPU上で、Llama、DeepSeek、OpenAIのo3-miniといった他の類似モデルを凌駕する性能を発揮します。また、危険なコンテンツを検出してラベル付けできる画像安全分類器ShieldGemma 2も搭載しています。開発者は、Google AI Studioですぐに試用できるほか、Hugging FaceやKaggleなどのプラットフォームからモデルをダウンロードして、微調整やデプロイを行うことができます。

Gemma 3の主な特徴

  • マルチモーダル処理機能Gemma 3は、テキスト、画像、短い動画の混合入力をサポートしており、画像による質問応答や動画コンテンツ分析といった複雑なマルチモーダルタスクを処理できます。
  • 高解像度画像のサポート本システムは、動的な画像スライス技術とフレームサンプリングおよびオプティカルフロー解析の組み合わせを採用し、高解像度画像や非正方形画像に対応しており、1時間の動画からキーフレームを20秒で抽出できます。
  • 多言語対応140以上の言語での事前学習をサポートし、35以上の言語を直接サポートしています。
  • シングルGPU最適化Gemma 3は「世界で最も強力なシングルアクセラレータモデル」として知られており、シングルGPUまたはTPU環境において、他の類似モデルを大幅に凌駕する性能を発揮します。
  • 推論速度の向上短い動画コンテンツを処理する際の推論速度は47%向上した。
  • ハードウェア適応NVIDIA製GPUとGoogle Cloud TPU向けに徹底的に最適化されており、様々なハードウェアプラットフォーム上で効率的な動作を保証します。
  • 複数のモデルサイズハードウェアや性能に関する様々な要件に対応するため、1B、4B、12B、27Bの4種類のサイズモデルを提供しています。
  • 開発ツールのサポートHugging Face Transformers、Ollama、JAX、Keras、PyTorchなど、さまざまな開発ツールやフレームワークをサポートしています。
  • さまざまな導入オプションGoogle AI Studio、Vertex AI、Cloud Run、ローカル環境など、複数のデプロイオプションをサポートしています。

Gemma 3の技術的原理

  • 画像セキュリティ分類器ShieldGemma 2画像セキュリティ分類器を搭載しており、危険なコンテンツ、ポルノコンテンツ、暴力的なコンテンツを検知して分類できるため、モデルのセキュリティがさらに強化されます。
  • トレーニングと微調整Gemma 3は、知識抽出、強化学習(人間と機械のフィードバックを含む)、モデル統合などの技術を用いて、数学、コーディング、指示追従におけるモデルの能力を向上させています。また、より柔軟な微調整ツールを提供することで、開発者がそれぞれのニーズに合わせてモデルをカスタマイズできるようにしています。

ジェマ3プロジェクトの住所

Gemma 3の応用シナリオ

  • 顔認識画像中の顔の特徴を識別することができ、本人確認、セキュリティ監視、その他の用途に利用できる。
  • 物体検出画像内の物体を検出し、その種類を識別することができ、例えば工業生産における製品の品質問題の検出などに活用できる。
  • スマートアシスタントとチャットボットGemma 3は複数の言語で自然言語コマンドを理解し、自然で流暢な応答を生成することで、ユーザーにインテリジェントな対話体験を提供します。
  • テキスト分類と感情分析テキストを正確に分類し、コメントが肯定的か否定的かといった感情を判断できる。
  • 短編動画コンテンツ分析短い動画コンテンツを処理し、キーフレームを抽出し、動画内のシーンやイベントを分析することができます。