AB
AiBoss
project

エングラム - DeepSeekと北京大学が共同開発した条件付き記憶モジュール

DeepSeekチームが北京大学と共同開発した条件付きメモリモジュールであるEngramは、大規模言語モデル(LLM)のパフォーマンスを向上させます。Engramは、最新のグラム埋め込みテーブルを導入することで、静的な知識を専用メモリに格納します。

エングラムとは何ですか?

DeepSeekチームが北京大学と共同開発した条件付きメモリモジュールであるEngramは、大規模言語モデル(LLM)の性能を向上させます。最新のk-gram埋め込みテーブルを導入することで、Engramは静的知識を独立したメモリに格納し、スパース検索とコンテキスト認識型ゲーティング技術を用いて効率的な知識検索を実現します。ハイブリッドエキスパートモデル(MoE)を補完するEngramは、計算コストを増加させることなく、知識集約型タスク、長時間のコンテキスト処理、および推論能力におけるモデル性能を大幅に向上させます。また、GPUメモリの制限を克服し、大規模なパラメータ拡張にも対応します。

エングラムの主な機能

  • 知識検索静的に埋め込まれたテーブルを通して固定知識を迅速に検索できるため、コンピューティングリソースへの依存度を低減できます。
  • 長時間のコンテキスト処理これにより、アテンションメカニズムの処理能力が解放され、グローバルな文脈に焦点を当てることが可能になり、長文テキストに対する推論能力が向上します。
  • 計算とストレージの分離ホストメモリからのデータの非同期プリフェッチをサポートすることで、GPUメモリの制限を克服し、大規模なパラメータ拡張を可能にします。
  • パフォーマンスの向上計算コストを増加させることなく、知識集約型タスク、一般的な推論、コーディング、および数学的タスクにおけるモデルのパフォーマンスを大幅に向上させる。

エングラムの技術原則

  • 単語分割器の圧縮元のトークンIDは、事前に計算された全射関数によって正規化されたIDにマッピングされ、語彙の冗長性を減らし、-gramのカバレッジ効率を向上させます。
  • マルチヘッドハッシュ検索グラムの組み合わせを直接パラメータ化する問題は、ハッシュ法とマルチヘッドメカニズムを使用してローカルコンテキストを埋め込みテーブルにマッピングすることによって解決されます。
  • コンテキスト認識型ゲーティング現在の隠れ状態を動的クエリとして使用し、取得した埋め込みをキーと値として使用します。意味的な一貫性を確保するため、ゲーティング機構によってノイズを抑制します。
  • スパース割り当てパラメータ予算が与えられた場合、MoEエキスパートパラメータはエングラムメモリに再割り当てされ、計算とメモリの間のU字型のトレードオフを発見し、最適な割り当て比率を見つけます。
  • システム実装エングラムの決定論的な検索特性を活用することで、計算とストレージが分離され、プリフェッチとオーバーラップのメカニズムによってデータ伝送の遅延が隠蔽されるため、GPUメモリの制限を克服できます。

エングラムのプロジェクトアドレス

  • 技術論文:https://github.com/deepseek-ai/Engram/blob/main/Engram_paper.pdf

エングラムの適用シナリオ

  • 知識に関するQ&Aエングラムは知識ベースから事実情報を迅速に取得できるため、質問応答システムの応答速度と精度が向上する。
  • テキスト生成エングラムは効率的な知識検索を通じて、テキスト生成における固定フレーズやパターンを迅速に照合することができ、生成効率を向上させる。
  • 長文処理Engramは、長文の文脈モデリングを最適化し、長文テキストに対するモデルの推論能力を向上させることができるため、法律や学術などの分野における長文テキスト分析に適している。
  • コード支援エングラムはコード内の一般的なパターンや構造を迅速に抽出できるため、コードの生成、補完、理解の効率が向上します。
  • 数学的推論エングラムは数学の公式や定理を素早く検索することができ、数学の問題解決や推論効率の向上に役立つ。