AB
AiBoss
project

AngelSlim - テンセント・フンユアンのオープンソース・マルチモーダル大規模モデル圧縮ツールキット

AngelSlimは、TencentのHunyuanチームによって開発され、オープンソース化されたマルチモーダル大規模モデル圧縮ツールキットです。量子化、投機的サンプリング、スパース化、蒸留などの技術を用いて、大規模言語モデル(LLM)、視覚言語モデル(VLM)、音声モデルなどを圧縮します。

AngelSlimとは何ですか?

AngelSlimは、TencentのHunyuanチームが独自開発したオープンソースのフルモーダル大規模モデル圧縮ツールキットです。量子化、スペキュラティブサンプリング、スパース化、蒸留などの技術により、大規模言語モデル(LLM)、ビジュアル言語モデル(VLM)、音声モデル向けに効率的で使いやすい圧縮および高速化ソリューションを提供します。このツールは、FP8/INT8/INT4量子化、GPTQ、AWQなどの主流の圧縮戦略を統合し、ワンクリック呼び出しとエンドツーエンドの展開をサポートし、学習済みモデルはvLLMやSglangなどの推論フレームワークとシームレスに統合できます。AngelSlimは、スペキュラティブサンプリング学習フレームワークを大幅にアップグレードし、Eagle3アーキテクチャを先駆的に採用することで、スペキュラティブサンプリング技術を初めてフルモーダルシナリオに拡張しました。これにより、より小さなモデルが、より大きなモデル向けのマルチステップ候補トークンをドラフトすることを学習し、それらを並列で検証することが可能になります。実際のテストでは、推論速度が最大1.4~1.9倍向上することが示されています。現在、Hunyuan、DeepSeek、Qwenシリーズなどの主流モデルの圧縮最適化をサポートしています。開発者はこれを使用して… pip install angelslim インストールと使用が簡単です。

AngelSlimの主な機能

  • 多倍長量子化圧縮FP8、INT8、INT4などの複数の高精度量子化方式をサポートし、GPTQやAWQといった主流の量子化アルゴリズムを統合することで、モデルのストレージ容量と計算オーバーヘッドを大幅に削減します。
  • 投機的サンプリングの加速Eagle3は、小規模モデルが大規模モデル向けの複数ステップの候補トークンを作成し、それを大規模モデルが並列に検証することを可能にする、Eagle3トレーニングアーキテクチャの先駆けとなった。これにより、推論速度が最大1.4~1.9倍向上した。
  • あらゆるモードのカバー範囲をサポート本システムは、大規模言語モデル(LLM)、視覚言語モデル(VLM)、音声モデル(ASR/TTS)の圧縮と高速化をサポートし、初めてあらゆるモダリティのシナリオにおいて推測的サンプリングの適用を実現します。
  • 希釈と蒸留構造化/非構造化スパース性、知識蒸留、その他の技術を統合することで、パフォーマンスを維持しながらモデルサイズをさらに圧縮します。
  • ワンクリック圧縮呼び出し高度に統合されたAPIインターフェースを提供することで、主流の圧縮アルゴリズムの呼び出しプロセスを簡素化し、開発者が利用する際のハードルを下げます。
  • エンドツーエンドの導入と統合学習済みのモデルは、vLLMやSglangといった主流の推論フレームワークで直接使用でき、圧縮から展開へのシームレスな移行を実現します。
  • マルチモデルエコシステムの互換性既にHunyuan、DeepSeek、Qwen、Qwen2.5VL、Qwen3-Omniといった主要なオープンソースモデルの圧縮最適化をサポートしています。

AngelSlimの技術原則

  • 量子化圧縮原理モデルの重みを高精度浮動小数点数(FP16/FP32)から低精度整数(INT8/INT4)またはFP8形式にマッピングすることで、ストレージと計算量を削減できます。同時に、GPTQ(Ground-by-Ground Quantization Optimization)やAWQ(Activation-Aware Weight Quantization)などのアルゴリズムを使用して、精度損失を最小限に抑えます。
  • 推測的解読原理このシステムは、まず小型のドラフトモデルを訓練して複数の候補トークンを事前に生成し、次に大型のターゲットモデルでそれらを並行して検証します。有効なトークンは受け入れ、不正なトークンは拒否し、修正のためにロールバックします。「小型モデルによるドラフト生成+大型モデルによる監視」という協調的なメカニズムにより、逐次デコードのボトルネックを解消します。
  • Eagle3アーキテクチャの原則標準的な推測サンプリングに基づき、「将来を見据えた」トレーニング戦略を導入することで、ドラフトモデルが将来の複数ステップにおけるトークンの分布特性を学習・予測し、候補シーケンスの品質を向上させ、大規模モデルの受理長を(最大1.8~3.5倍)増加させ、より高い高速化率を実現します。
  • 知識抽出原理大規模モデル(教師モデル)の出力分布と中間層の特徴は、小規模モデル(生徒モデル)に転送されます。ソフトラベル監視と特徴アライメントにより、小規模モデルは大規模モデルの機能を継承しつつ、サイズを圧縮することができます。
  • スパース性原理冗長な重み接続(非構造的スパース性)またはニューロン全体/アテンションヘッド(構造的スパース性)を剪定することにより、モデルの計算密度が低減され、ハードウェアアクセラレーションと相まって推論速度が向上します。
  • 完全モード統一フレームワーク原理テキスト、画像、音声といった異なるモダリティ間でモデルアーキテクチャに違いが生じることに対処するため、量子化や推測的サンプリングなどの技術をモダリティ間で再利用できるように、統一された圧縮インターフェースとモダリティ適応レイヤーが設計されています。

AngelSlimのプロジェクトアドレス

  • GitHubリポジトリ:https://github.com/Tencent/AngelSlim
  • ハグ顔モデルライブラリ:https://huggingface.co/collections/AngelSlim

AngelSlimの応用事例

  • クラウドにおける大規模モデル推論の高速化これは、Hunyuan、DeepSeek、Qwenなどの数百億個の要素を持つ大規模モデルに対して、量子化圧縮と投機的サンプリングの高速化を提供し、GPUメモリの使用量と計算遅延を削減し、高並列処理シナリオにおけるサービススループットを向上させます。
  • エッジモデルの展開最適化INT4/INT8量子化により、大規模なモデルを携帯電話、タブレット、IoTデバイスで実行可能なサイズに圧縮し、オフライン推論やプライバシー保護のシナリオをサポートします。
  • マルチモーダルAIアプリケーションの加速これは、画像とテキストによる視覚言語モデル(VLM)の理解、および音声モデル(ASR/TTS)のリアルタイム文字起こしと合成のための、フルモーダル圧縮ソリューションを提供し、インテリジェントな顧客サービス、コンテンツモデレーション、リアルタイム翻訳などのアプリケーションを高速化します。
  • AIGCコンテンツ生成効率の改善AIによる文章作成、コード生成、画像記述などの生成シナリオにおいて、投機的サンプリング技術は、最初のトークンのレイテンシと全体の生成時間を大幅に短縮し、ユーザーエクスペリエンスを向上させることができます。
  • 企業民営化の導入によりコストが削減されるこれは、企業が大規模なオープンソースモデルを圧縮し、プライベートクラウドやローカルサーバーに展開するのに役立ち、コンピューティング能力の調達コストを削減し、費用対効果の高いAIプラットフォームの構築を実現します。