project
REFRAG - Metaが発表した高効率デコードフレームワーク
REFRAGは、Meta Super Intelligence Labが開発した、検索強化生成(RAG)タスク向けの高効率デコードフレームワークです。「圧縮、感知、拡張」プロセスを通じて、大規模な言語処理を最適化します。
REFRAGとは何ですか?
Meta Superintendent Labsが開発したREFRAGは、検索拡張(RAG)タスク向けの高効率デコーディングフレームワークです。「圧縮、認識、拡張」プロセスを通じて、大規模言語モデル(LLM)が外部知識を処理する方法を最適化します。REFRAGは、取得した長いテキストを複数の「ブロック」に分割し、各ブロックに対してコンパクトなベクトル表現を生成することで、入力シーケンスの長さを短縮し、計算コストを削減します。このモデルは、強化学習戦略を用いて重要な情報をインテリジェントに識別し、重要なブロックの元のテキストを保持します。このフレームワークは、フルコンテキストモデルと同等のパフォーマンスを維持しながら、最初の文字生成のレイテンシを大幅に改善(最大30倍の高速化)し、長いコンテキストを扱う大規模モデルの効率性の問題を効果的に解決します。
REFRAGの主な機能
- リード獲得までの遅延時間(TTFT)を大幅に短縮します。REFRAGはデコード処理を最適化することで、最初の文字生成の遅延を最大30倍短縮し、システムのリアルタイム対話性能を大幅に向上させることができます。
- 生成されたコンテンツの品質を維持または向上させるREFRAGは高速化を実現しながらも、完全なコンテキストを使用するベースラインモデルと比較して、さまざまな下流タスクにおけるパープレキシティと精度において性能低下を起こさず、一部のタスクではむしろ優れた性能を発揮します。
- 拡張コンテキストウィンドウREFRAGは圧縮技術を用いることで、同じ計算リソースでより多くのコンテキスト情報を処理できるようにしています。コンテキストウィンドウは実質的に16倍に拡張され、長いコンテキスト情報を必要とするタスクにおけるモデルのパフォーマンス向上に貢献します。
- 様々なアプリケーションシナリオに対応可能REFRAGはRAGタスクに適しており、複数ターンの対話や長文文書の要約など、長い文脈情報の処理を必要とする他のタスクにも適用できるため、幅広い用途に利用できます。
REFRAGの技術原則
-
圧縮取得した長文の参照データは複数の「チャンク」に分割され、各「チャンク」に対してコンパクトなベクトル表現である「チャンク埋め込み」が生成されます。これにより、入力シーケンスの長さが短縮され、後続の計算量が削減され、繰り返し行われる符号化計算が回避されます。
-
知覚(感覚)強化学習(RL)に基づくポリシーネットワークを訓練することで、すべての「ブロック埋め込み」とユーザーの質問を分析し、どのテキストブロックに最も重要な情報が含まれており、圧縮によって重要な情報が失われないように、元のテキスト形式でLLMに提示する必要があるかを判断します。
-
拡大するメインのLLMへの最終入力は、コンテキストの大部分を「ブロック埋め込み」で表現したものと、重要と判断された少数の「生テキストブロック」を含む混合シーケンスです。LLMは、最適化された入力データに基づいて回答を生成し、重要な情報を保持しつつ計算負荷を最小限に抑えます。
-
注意機構の疎性を利用するREFRAGは、RAGタスクにおけるモデルのアテンションメカニズムが「ブロック対角線」型の疎なパターンを示すことを観察しました。これは、モデルのアテンションが主に単一ドキュメントの内部構造と、ドキュメントとユーザーの質問との関連性に集中していることを意味します。REFRAGは、コンテキストを選択的に圧縮および拡張することで効率を向上させ、不要な計算を削減します。
REFRAGのプロジェクト住所
- arXiv技術論文:https://arxiv.org/pdf/2509.01092
REFRAGの適用シナリオ
- 検索強化生成(RAG)タスクデコード処理を最適化することで、最初の文字を生成するまでの遅延が大幅に短縮され、インテリジェントな顧客サービスやオンラインの質疑応答システムなど、迅速かつ正確な回答が求められるシナリオに適しています。
- 複数ターン対話システム複数ターンにわたる対話において、長い対話履歴を効率的に処理し、対話の一貫性と正確性を維持し、ユーザーエクスペリエンスを向上させます。
- 長文の要約REFRAGは長文文書を効率的に処理し、質の高い要約を生成できるため、ニュース記事や学術論文などの長文テキストの自動要約に適しています。
- 知識グラフ質問応答これは知識グラフを組み合わせることで、関連する知識を迅速に検索し、正確な回答を生成するため、知識グラフ駆動型のインテリジェントな質問応答システムに適しています。
- コンテンツ作成支援これにより、コンテンツ制作の場面で創造的なテキストを迅速に生成することが可能になり、著者が記事や物語などを素早く構想・執筆するのに役立ち、ひいては創作効率が向上します。