AB
AiBoss
project

Granite 4.0 Tiny Preview - IBMの言語モデル

Granite 4.0 Tiny Preview は、IBM の Granite 4.0 言語モデルファミリーの中で最小のモデルのプレビュー版です。Granite 4.0 Tiny Preview は、非常に高い計算効率とコンパクトなモデル構造を提供し、...

Granite 4.0 Tiny Previewとは何ですか?

Granite 4.0 Tiny Previewは、IBMのGranite 4.0言語モデルファミリーの中で最小のモデルのプレビュー版です。極めて高い計算効率とコンパクトなモデル構造を特徴とするGranite 4.0 Tiny Previewは、コンシューマー向けGPU上で複数の長いコンテキスト(128K)タスクを実行でき、Granite 3.3 2B Instructに近いパフォーマンスを実現しながら、メモリ要件を約72%削減します。このモデルは、Mambaの効率性とTransformerの精度を組み合わせた革新的なハイブリッドMamba-2/Transformerアーキテクチャを採用し、位置レスエンコーディング(NoPE)をサポートし、極めて長いコンテキスト長にも対応できます。

Granite 4.0 Tiny Previewの主な機能

  • 高効率運転コンシューマー向けGPUでは、複数のロングコンテキスト(128K)タスクを同時に実行できるため、リソースが限られている開発者にも適しています。
  • メモリ要件が低いメモリ要件は約72%削減され、推論中にアクティブになるパラメータは(合計70億個のパラメータのうち)わずか10億個のみとなるため、ハードウェア要件が大幅に削減されます。
  • 長時間のコンテキスト処理位置指定なしエンコーディング(NoPE)をサポートしており、少なくとも128Kの長いコンテキストを処理できることが検証済みです。
  • 推論効率推論中は一部の専門家のみが活性化されるため、効率が向上し、遅延が短縮されます。

Granite 4.0 Tiny Previewの技術的原理

  • ハイブリッドアーキテクチャこのモデルは、Mambaの線形計算複雑性(長いシーケンスに適している)とTransformerの精密な自己注意機構を組み合わせたものです。このモデルでは、9つのMambaブロックが1つのTransformerブロックに対応します。Mambaブロックはグローバルコンテキストを効率的に捉える役割を担い、Transformerブロックはローカルコンテキストを解析するために使用されます。
  • ハイブリッド専門家(教育省)このモデルは70億個のパラメータを含み、64人の専門家に分割されています。推論時にアクティブ化されるパラメータは10億個のみであるため、計算リソースの消費量を大幅に削減できます。
  • 位置エンコーディングなし(NoPE)): 従来の位置符号化技術を放棄し、位置符号化によって引き起こされる計算負荷と長いシーケンスに対する制限を回避し、長いコンテキストのパフォーマンスを維持する。
  • 長文コンテキスト最適化Mambaは線形スケーラビリティとコンパクトなモデル設計に基づいており、非常に長いコンテキスト長をサポートし、理論的にはハードウェアの限界まで拡張可能です。

Granite 4.0 Tiny Preview プロジェクトアドレス

Granite 4.0 Tiny Preview のアプリケーションシナリオ

  • エッジデバイスの展開リソースが限られたエッジデバイスや一般消費者向けハードウェア上で、軽量なテキスト処理タスクを実行するのに適しています。
  • 長文分析12万8千トークンという長いテキストも処理できるため、長文の生成、分析、要約に適しています。
  • マルチタスク並列同じハードウェア上で複数のインスタンスを同時に実行できるため、バッチ処理やマルチユーザー環境に適しています。
  • エンタープライズアプリケーション開発これは、インテリジェントな顧客サービスや文書処理といった企業レベルのタスクで使用され、効率的な言語モデルのサポートを提供します。
  • 低コストの研究開発オープンソースであり、一般消費者向けハードウェアをサポートしているため、開発者は低コストで実験やイノベーションを容易に行うことができます。