AB
AiBoss
project

FastMTP - テンセントが開発した、大規模言語モデルの推論を高速化するためのオープンソース技術。

FastMTPは、テンセントが独自開発した大規模言語モデル(LLM)推論高速化技術です。マルチラベル予測(MTP)技術を最適化し、従来の複数の独立したモジュールを重みを共有する単一のMTPヘッドに置き換え、言語認識型語彙圧縮と自己調整を組み合わせています。

FastMTPとは何ですか?

FastMTPは、テンセントが独自開発した大規模言語モデル(LLM)推論高速化技術です。マルチラベル予測(MTP)技術を最適化し、従来の複数の独立したモジュールを重みを共有する単一のMTPヘッドに置き換えることで、言語認識型語彙圧縮と自己蒸留学習を組み合わせ、LLMの推論速度を大幅に向上させ、平均で最大2.03倍の高速化を実現しながら、ロスレス出力品質を維持します。FastMTPはメインモデル構造を変更せず、既存のフレームワークへの統合が容易で、数学的推論やコード生成などの構造化タスクに適しており、LLMの効率的な展開のための実用的なソリューションを提供します。

FastMTPの主な機能

  • LLM推論を大幅に高速化しますFastMTPは、マルチラベル予測(MTP)技術を最適化することで、出力品質を損なうことなく、大規模言語モデル(LLM)の推論速度を平均2.03倍向上させ、モデルがコンテンツを生成する時間を大幅に短縮し、アプリケーションの応答速度を向上させることができます。
  • ロスレス出力品質を維持するFastMTPは推論を高速化しながらも、モデル出力の品質が従来の自己回帰生成手法と完全に一致すること、そして高速化によって生成されるコンテンツの精度や論理性が低下しないことを保証します。
  • 統合と展開が容易FastMTPは、メインモデル構造に変更を加える必要がなく、小さなモジュールを微調整するだけで済みます。既存のLLM推論フレームワーク(SGLangなど)とシームレスに統合できるため、導入コストと難易度を大幅に削減し、実世界のシナリオへの迅速な適用を可能にします。
  • ハードウェアリソースの消費を削減する重みを共有する単一のMTPヘッドは、複数の独立したモジュールを置き換えることで、メモリ使用量を大幅に削減します。同時に、言語認識型字句圧縮により計算負荷がさらに軽減され、LLMは一般消費者向けGPU上でより効率的に動作し、ハードウェアリソースの要件も低減されます。

FastMTPの技術原理

  • 推測的解読「ドラフト+検証」戦略を採用することで、高速ドラフトモデルから複数の候補タグを生成し、メインモデルを使用してバッチ検証を実行することで、並列処理を実現し、推論効率を向上させます。
  • 共有加重シングルMTPヘッダー従来のMTPの複数の独立モジュール設計とは異なり、共有重みMTPヘッドを使用して複数のタグを再帰的に生成することで、メモリ使用量を削減し、モデルに長距離の依存関係を学習させ、ドラフトの品質を向上させます。
  • 自己蒸留トレーニングMTPヘッドは、メインモデルによって生成されたデータを使用して学習されます。指数関数的に減衰する重み付き交差エントロピー損失関数を用いることで、MTPヘッドはメインモデルのスタイルとロジックに合致するドラフトの生成を優先することができ、それによってドラフトの承認率が向上します。
  • 言語知覚語彙圧縮草稿生成段階では、入力コンテキストに基づいて言語が決定され、計算量を削減するために高頻度語のロジットのみが計算されます。検証段階では、出力品質に影響がないことを確認するために、全語彙が使用されます。

FastMTPプロジェクトのアドレス

  • GitHubリポジトリ:https://github.com/Tencent-BAC/FastMTP
  • ハギングフェイスモデルライブラリ:https://huggingface.co/TencentBAC/FastMTP
  • 技術論文:https://github.com/Tencent-BAC/FastMTP/blob/main/FastMTP_technical_report.pdf

FastMTPの応用シナリオ

  • 数学的推論数学的な問題解決の場面では、迅速に解決手順を生成し、問題入力から解答出力までの時間を大幅に短縮し、数学的補助ツールの応答速度を向上させることができます。
  • コード生成プログラミング支援アプリケーションの場合、FastMTPはコードスニペットを迅速に生成できるため、開発者はより速くコードを作成し、開発効率を向上させることができます。
  • 長文要約ニュースや記事などの長文要約タスクを処理する際、重要な情報を迅速に抽出し、質の高い要約コンテンツを生成することで、ユーザーの読書時間を節約できます。
  • 複数回の対話高度な顧客サービスやチャットボットにおいては、対話生成の高速化とミリ秒単位の応答速度の実現が、ユーザーエクスペリエンスとインタラクションの円滑性を向上させる。