project
DiffusionGemma - Googleのオープンソース実験的テキスト拡散モデル
DiffusionGemmaは、Google DeepMindが公開した実験的なオープンソースのテキスト拡散モデルです。このモデルは、Gemma 4アーキテクチャとGemini Diffusionの研究に基づいて構築されており、26B MoE設計を採用し、並列拡散を利用しています。
DiffusionGemmaとは何ですか?
DiffusionGemmaは、Google DeepMindが公開した実験的なオープンソースのテキスト拡散モデルです。Gemma 4アーキテクチャとGemini Diffusionの研究に基づいて構築されており、26ビットのMoE設計を採用し、256トークンのテキストブロックを並列にノイズ除去することで、単一のNVIDIA H100 GPU上で毎秒1000トークンを超える生成速度を実現しています。これは、従来の自己回帰モデルよりも約4倍高速です。このモデルは双方向アテンションとリアルタイム自己修正をサポートしており、量子化後、コンシューマーグレードのGPU上でローカルに実行するために必要なVRAMはわずか18GBです。
DiffusionGemmaの主な機能
- 並列テキスト生成各順伝播処理では同時に256個のトークンのノイズを除去するため、単語ごとの出力ではなく、テキストブロック全体を並列に生成することが可能になります。
- 双方向の文脈推論生成プロセスにおいて、各トークンは同じブロック内の他のすべてのトークンに続くことができ、コード入力やインライン編集などの非線形テキストタスクをサポートします。
- リアルタイム自己修正トークンの信頼度が低下した場合、サンプラーはそれを再ノイズし、後続のステップで修正を置き換えることができる。
- マルチモーダル入力処理テキスト、画像、動画の混在入力に対応し、テキスト出力を生成し、最大256Kトークンのコンテキストウィンドウを備えています。
- 長シーケンスブロックレベル生成このアルゴリズムは、ブロック自己回帰拡散メカニズムを使用して、ノイズ除去された256トークンのブロックをKVキャッシュに送信し、並列処理速度とシーケンスの安定性のバランスを取りながら、次のブロックの生成を続行します。
拡散ジェンマの技術的原理
- 均一状態拡散DiffusionGemmaのコアメカニズムは、画像拡散モデルを応用しています。ランダムなプレースホルダーで埋め尽くされた256トークンのキャンバスから始まり、複数のノイズ除去処理を繰り返すことで、信頼性の高いトークンを徐々に固定していきます。固定されたトークンは、隣接する位置を解析するための文脈上の手がかりとして使用され、最終的にシーケンス全体が整合性のあるテキストへと収束します。順伝播処理ごとに約15~20トークンが固定され、並列処理によってスループットが大幅に向上します。
- ハードウェアのボトルネックのシフト従来の自己回帰モデルは、シングルユーザー環境でのローカル推論時にメモリ帯域幅によって制限され、GPUコンピューティングユニットが大量にアイドル状態になるという問題がありました。DiffusionGemmaは、このボトルネックをメモリ帯域幅から計算側へと移行させます。テンソルコアに大規模な並列ノイズ除去ワークロードを提供することで、ローカル推論シナリオにおいてGPUの高い利用率を維持し、単一のH100で1秒あたり1000トークン以上、RTX 5090で1秒あたり700トークン以上を実現しています。
- ハイブリッドアテンションアーキテクチャ推論プロセスは、2つのアテンションモードを交互に切り替えます。プリフィルフェーズでは、因果的アテンションを使用して入力キューを処理し、キーバリューキャッシュに書き込みます。ノイズ除去フェーズでは、双方向アテンションに切り替わり、キャンバス内の各トークンが他のすべてのトークンに同時に注意を向けられるようになります。このアーキテクチャにより、モデルは制約の多いタスクを処理できます。
DiffusionGemmaの使い方
- vLLMのローカル展開vLLMのOpenAI互換サーバーを使用してモデルを起動し、拡散サンプラーと256トークンキャンバスのパラメータを設定した後、外部ユーザーに推論サービスを提供できます。
- ハグフェイスのダウンロード重量モデルの重みファイルを入手するには、Hugging Faceリポジトリにアクセスしてください。これらのファイルはApache 2.0ライセンスの下でオープンソースとして公開されています。
- 主流の推論フレームワークが実行中このモデルは、Hugging Face Transformers、SGLang、MLXなどのフレームワークからの直接的な読み込みと推論をネイティブにサポートしています。
- ハッキング可能な拡散微調整GoogleのオープンソースのJAX研究ツールキットと公式のトレーニングレシピを使用することで、特定のタスクに合わせて迅速に実験や微調整を行うことができます。
DiffusionGemmaの主な利点
- 極めて高速なローカル推論シングルユーザーのローカル環境では、同じ仕様の自己回帰モデルと比較して約4倍高速です。H100テストの結果では1秒あたり1000トークン以上を記録しており、対話型開発ツールのレイテンシを大幅に削減します。
- 消費者向けハードウェアは、量子化処理後、必要なVRAMはわずか18GBで済み、RTX 4090/5090やDGX Sparkデスクトップワークステーションなどの一般消費者向けグラフィックカードをサポートし、サーバーレベルのクラスタは不要です。
- オープンソースエコシステムに対するゼロデイサポートvLLM、Hugging Face Transformers、MLX、Unslothといった主流のツールチェーンと最初から互換性があり、統合コストを削減できます。
- 非線形テキストタスクの専門知識双方向アテンション機構により、コード補完、構造化出力、アミノ酸配列、数式グラフなど、グローバルな制約を必要とするタスクにおいて、従来の自己回帰モデルを凌駕する性能を発揮します。
DiffusionGemmaのプロジェクトアドレス
- プロジェクト公式サイト:https://developers.googleblog.com/diffusiongemma-the-developer-guide/
- ハギングフェイスモデルライブラリ:https://huggingface.co/google/diffusiongemma-26B-A4B-it
DiffusionGemmaと類似製品との比較
| 寸法 | DiffusionGemma | 標準ジェマ4(自己回帰) |
|---|---|---|
| 生成方法 | 離散テキスト拡散、256トークン並列ノイズ除去 | 自己回帰、左から右への単語ごとの生成 |
| 推論のボトルネック | 計算バウンド | メモリに制約される |
| 注意機構 | 双方向の注意(下記参照) | 因果的注意(前述のテキストのみ閲覧可能) |
| 自己修正 | 信頼性の低いトークンに対する再現可能なノイズ補正をサポートします。 | サポートされていません。トークンは一度生成されると永久に固定されます。 |
| シングルユーザー向けローカル速度 | H100: 1000トークン/秒以上、RTX 5090: 700トークン/秒以上 | 同じハードウェアを使用した場合、約3~4倍遅くなる。 |
| 出力品質 | ジェマ4未満の解像度では、最高品質が求められる制作現場には適していません。 | さらに高いレベルを、Googleは実運用レベルのアプリケーションに推奨しています。 |
| 最良のシナリオ | ローカル環境における低並行性、対話型、速度重視のワークフロー | 高並行性クラウドサービス、品質重視のタスク |
| モデル仕様 | 26B MoE(アクティベーション3.8B) | 同シリーズのMoEアーキテクチャ |
DiffusionGemmaの応用事例
-
リアルタイムのコード支援IDE内で低遅延のインライン補完、コードブロックの自動入力、およびMarkdownフォーマット機能を提供し、開発者ツールが求める即時フィードバックのニーズを満たします。
-
対話型テキスト編集既存の段落にコンテンツを挿入したり、テキストの一部を書き換えたりする際に、双方向の注意機能を使用して、変更内容が周囲のテキストと一貫性を保つようにします。
-
制約集約型生成これは、数独の解法、数学的グラフの構築、アミノ酸配列の設計など、複数の変数が同時に厳しい制約を満たす必要があるタスクを処理するために使用されます。
-
構造化データ入力テーブル、設定ファイル、またはテンプレート化されたドキュメントを並列に生成し、ブロック全体のノイズ除去機能を使用して、複数の関連フィールドを一度に特定します。
-
ローカルのプライバシーに配慮したワークフロー市販のGPU上でオフラインで動作するため、データがローカルマシンから外部に持ち出されてはならない文書分析や機密性の高いテキスト処理の要件を満たします。