project
Granite 4.0 Tiny Preview - IBMの言語モデル
Granite 4.0 Tiny Preview は、IBM の Granite 4.0 言語モデルファミリーの中で最小のモデルのプレビュー版です。Granite 4.0 Tiny Preview は、非常に高い計算効率とコンパクトなモデル構造を提供し、...
Granite 4.0 Tiny Previewとは何ですか?
Granite 4.0 Tiny Previewは、IBMのGranite 4.0言語モデルファミリーの中で最小のモデルのプレビュー版です。極めて高い計算効率とコンパクトなモデル構造を特徴とするGranite 4.0 Tiny Previewは、コンシューマー向けGPU上で複数の長いコンテキスト(128K)タスクを実行でき、Granite 3.3 2B Instructに近いパフォーマンスを実現しながら、メモリ要件を約72%削減します。このモデルは、Mambaの効率性とTransformerの精度を組み合わせた革新的なハイブリッドMamba-2/Transformerアーキテクチャを採用し、位置レスエンコーディング(NoPE)をサポートし、極めて長いコンテキスト長にも対応できます。
Granite 4.0 Tiny Previewの主な機能
- 高効率運転コンシューマー向けGPUでは、複数のロングコンテキスト(128K)タスクを同時に実行できるため、リソースが限られている開発者にも適しています。
- メモリ要件が低いメモリ要件は約72%削減され、推論中にアクティブになるパラメータは(合計70億個のパラメータのうち)わずか10億個のみとなるため、ハードウェア要件が大幅に削減されます。
- 長時間のコンテキスト処理位置指定なしエンコーディング(NoPE)をサポートしており、少なくとも128Kの長いコンテキストを処理できることが検証済みです。
- 推論効率推論中は一部の専門家のみが活性化されるため、効率が向上し、遅延が短縮されます。
Granite 4.0 Tiny Previewの技術的原理
- ハイブリッドアーキテクチャこのモデルは、Mambaの線形計算複雑性(長いシーケンスに適している)とTransformerの精密な自己注意機構を組み合わせたものです。このモデルでは、9つのMambaブロックが1つのTransformerブロックに対応します。Mambaブロックはグローバルコンテキストを効率的に捉える役割を担い、Transformerブロックはローカルコンテキストを解析するために使用されます。
- ハイブリッド専門家(教育省)このモデルは70億個のパラメータを含み、64人の専門家に分割されています。推論時にアクティブ化されるパラメータは10億個のみであるため、計算リソースの消費量を大幅に削減できます。
- 位置エンコーディングなし(NoPE)): 従来の位置符号化技術を放棄し、位置符号化によって引き起こされる計算負荷と長いシーケンスに対する制限を回避し、長いコンテキストのパフォーマンスを維持する。
- 長文コンテキスト最適化Mambaは線形スケーラビリティとコンパクトなモデル設計に基づいており、非常に長いコンテキスト長をサポートし、理論的にはハードウェアの限界まで拡張可能です。
Granite 4.0 Tiny Preview プロジェクトアドレス
- プロジェクト公式サイト:https://www.ibm.com/new/announcements/ibm-granite-4-0-tiny-preview
- ハギングフェイスモデルライブラリ:https://huggingface.co/ibm-granite/granite-4.0-tiny-preview
Granite 4.0 Tiny Preview のアプリケーションシナリオ
- エッジデバイスの展開リソースが限られたエッジデバイスや一般消費者向けハードウェア上で、軽量なテキスト処理タスクを実行するのに適しています。
- 長文分析12万8千トークンという長いテキストも処理できるため、長文の生成、分析、要約に適しています。
- マルチタスク並列同じハードウェア上で複数のインスタンスを同時に実行できるため、バッチ処理やマルチユーザー環境に適しています。
- エンタープライズアプリケーション開発これは、インテリジェントな顧客サービスや文書処理といった企業レベルのタスクで使用され、効率的な言語モデルのサポートを提供します。
- 低コストの研究開発オープンソースであり、一般消費者向けハードウェアをサポートしているため、開発者は低コストで実験やイノベーションを容易に行うことができます。