project
AngelSpec - TencentのHunyuanチームがオープンソース化した、エンドツーエンドの推論デコード学習フレームワーク。
AngelSpecは、TencentのHunyuanチームが開発したオープンソースのエンドツーエンド投機的デコーディング学習フレームワークです。TorchSpecをベースに構築されており、MTP自己回帰やDFlyブロック並列処理を含む6つのドラフトアーキテクチャをサポートしています。推論と学習は分離されており、推論エンジンは...
AngelSpecとは何ですか?
AngelSpecは、TencentのHunyuanチームが開発したオープンソースのエンドツーエンド投機的デコーディング学習フレームワークです。TorchSpecをベースに構築されており、MTP自己回帰やDFlyブロック並列処理など、6つのドラフトアーキテクチャをサポートしています。推論と学習は分離されており、推論エンジンはMooncake/RDMAを介して隠れ状態を学習ワーカーにストリーミングします。Hy3-A21Bでは、DFlyはDFlashと比較してエンドツーエンドで1.98~2.40倍の高速化を実現し、スループットは10.5~11.8%向上しています。
AngelSpecの主な機能
- 6つの草案枠組みに関する統一研修DFly、DFlash、DFLare、Eagle3、DSpark、およびMTPは単一のトレーニングパイプラインを共有しており、これらの切り替えには設定変更のみが必要です。
- MTP訓練とTTT配備これは、多重深度自己回帰展開によるトレーニングをサポートし、メモリ使用量は単一の因果順伝播とほぼ同等であり、Ulyssesシーケンス並列処理により最大128kのコンテキストをサポートします。
- 受入率に沿った目的関数CE、トップk KL、LK損失、D-PACE加重、エンドツーエンドTV損失をサポートしており、設定により自由に組み合わせることができます。
- ドキュメント認識型シーケンスパッケージングMegatronスタイルの固定長パッケージングで、ドキュメント間の厳格な分離を実現しつつ、DFlashおよびMTPパスにも対応しています。
- オンライン実地評価トレーニング中は、vLLMなどのエンジンを使用して現実的な投機的復号が実行され、平均受理長とビットごとの受理率がリアルタイムで報告されます。
- マルチ推論バックエンドのサポートvLLM、SGLang、HuggingFaceといった主流の推論エンジンと互換性があります。
AngelSpecの技術原則
- 推測的解読の基礎AngelSpecは、投機的なデコードメカニズムに基づいて構築されています。軽量なドラフトモデルが複数の将来のトークンを並行して提案し、ターゲットモデルは拒否サンプリングを用いた単一の順伝播によってバッチ検証を実行します。これにより、ターゲット分布を変更することなく、シングルステップのデコードがマルチステップの進行へと拡張されます。AngelSpecの核心的な課題は、ドラフトの承認率と検証オーバーヘッドのトレードオフにあり、AngelSpecはこの問題をトレーニング、アーキテクチャ、推論の3つのレベルから体系的に解決します。
- ワークロードの異質性モデリングAngelSpecは、設計において現実世界のワークロードの多様性を最優先事項としています。オンラインリクエストは、オープンエンドな対話、コード生成、数学的推論、ツール呼び出しなど多岐にわたり、条件付きエントロピーと継続構造に大きな違いが見られます。エントロピーの高い対話シナリオでは、受け入れ率が深さとともに急速に低下するため、短いシーケンスの自己回帰ドラフトに適しています。一方、コードと数学のシナリオは、長く予測可能なスパンを持つため、ブロック並列拡散ドラフトに適しています。そのため、AngelSpecは、単一の汎用モデルを追求するのではなく、対話データ用のMTPとコードおよび数学データ用のDFlyという、補完的な専用ドラフト作成ツールをトレーニングします。
- 共有パラメータ多深度MTPトレーニングMTP ドラフターは、共有パラメータを用いたマルチ深度トレーニング方式を採用しています。すべての論理予測深度は同じ物理 MTP モジュールを再利用し、トレーニング中に自己回帰的な拡張を行います。深度 k+1 は深度 k の argmax 予測を受け取り、段階的に増加するドラフトキーバリューキャッシュと対角線アテンションマスクを維持します。トレーニング時テスト (TTT) メカニズムは、推論中に遭遇する自己生成軌跡分布をドラフターに提示することで、教師の強制による露出バイアスを排除し、2 番目と 3 番目のドラフト位置の受諾率を大幅に向上させます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
AngelSpecの使い方
- 環境インスタレーション:埋め込む
pip install -e ".[vllm]"そしてpip install mooncake-transfer-engineフレームワークとvLLMバックエンドをインストールしてください。 - シングルノード高速起動8つのGPUが割り当てられ、そのうち4つは推論用、残りの4つはトレーニング用に割り当てられています。
./examples/qwen3-8b-dfly/run.shそうすれば、生産ライン全体を稼働させることができる。 - 構成カバレッジ: CLI を介して YAML 設定項目を直接上書きします。例:
training.learning_rate=5e-5 training.num_train_steps=500。 - Conda環境のセットアップ:走る
./tools/build_conda.sh 1 vllmワンクリックでMooncakeを含む隔離環境を作成でき、アクティベーション後すぐに使用できます。 - マルチノード展開推論コントローラとトレーニングコントローラをRay経由でスケジューリングし、それをMooncakeの隠れ状態ストレージと組み合わせることで、ノード間分離型トレーニングが実現されます。
AngelSpecの主な利点
- 業務量の専門化MTPはエントロピーの高い対話シナリオ向けに最適化されている一方、DFlyはコードや数学的な長さを伴う予測可能なシナリオ向けに強化されており、すべてのドメインで単一のドラフトモデルが持つ平凡なパフォーマンスを回避します。
- DFlyアーキテクチャーイノベーションハイブリッドターゲット条件バックボーンは、レイヤーごとのターゲットビューと前駆条件自己回帰ヘッドと組み合わせることで、並列生成機能を維持しながら、ブロック内依存関係のモデリングを改善します。
- Dカット動的検証ターゲット検証を共有バッチレベルのリソースとして扱い、プレフィックスの信頼度と実行時コストモデルに基づいて検証深度を適応的に調整することで、高並行処理下でも追加負荷を継続的にスループットに変換します。
- 分離独立展開推論用GPUプールとトレーニング用GPUプールはMooncakeストレージによって分離されており、それぞれが負荷に応じて独立してスケールアップおよびスケールダウンできるため、統一された並列戦略における最適とは言えない問題を回避できます。
- オープンソースの完全キット同時に、フレームワークコード、Hy3-A21B/Qwen3-8B MTPおよびDFlyドラフトウェイト、トレーニング構成、技術レポートがリリースされるため、すぐに使用できます。
AngelSpecのプロジェクトアドレス
- プロジェクト公式サイト:https://angelspec.readthedocs.io/
- GitHubリポジトリ:https://github.com/Tencent/AngelSpec
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/AngelSlim/angelspec
- arXiv技術論文:https://arxiv.org/pdf/2607.25852
AngelSpecの競合製品比較
| 比較対象寸法 | AngelSpec | SpecForge |
|---|---|---|
| プロデューサー | テンセント渾源チーム | SGLang / Meituan およびその他のコミュニティ チーム |
| コアポジショニング | 統合型MTP + ブロック並列推論デコードトレーニングフレームワーク | EAGLE-3向けの生産グレードの訓練フレームワーク |
| 草案構造 | 6種類(DFly、DFlash、DFlare、Eagle3、DSpark、MTP) | EAGLE-3をベースとしており、主流のオープンソースモデルをサポートしています。 |
| 建築上の特徴 | DFlyハイブリッドターゲット条件 + 前駆体自己回帰ヘッド + D-Cut動的検証 | 目的:分離型ドラフト作成とハイブリッド並列処理+TTTスパースツリーアテンション最適化 |
| 別デザイン | 推論と学習は完全に分離されており、隠れ状態はMooncake/RDMAストリームを介して送信されます。 | SGLangバックエンドを介して統合され、同一マシン上での共存とノード間の分離をサポートします。 |
| トレーニングの最適化 | 受入率目標の整合(TV/LK/D-PACE)+文書認識型パッケージ | FlexAttentionのスパースマスクとインプレース勾配カーネルにより、メモリ使用量が93.5%削減されました。 |
| オープンソースモデル | Hy3-A21BおよびQwen3-8BのMTP/DFly重量 | SpecBundle(Llama、Qwen、Kimi、DeepSeekなど、EAGLE-3ドラフト) |
| パフォーマンスデータ | Hy3-A21Bは、DFlashよりも1.98~2.40倍の高速化を実現し、これはDFlashよりも10.5~11.8%高い値です。 | Qwen3-235Bの学習速度は9.99倍、推論速度は最大4.48倍向上しました。 |
| 推論バックエンド | vLLM、SGLang、HuggingFace | SGLang、HuggingFace、カスタムバックエンド |
AngelSpecの応用シナリオ
-
大規模モデルにおけるオンライン推論の高速化自己回帰デコーディングの遅延を削減するために、混合型のHy3、Qwen3、およびその他のMoE/高密度モデル向けに、投機的なデコーディングドラフトを展開します。
-
高並行性対話サービスDカット動的リソース割り当てを利用することで、4~64の同時接続数範囲において最高の平均スループットを維持するため、顧客サービスやアシスタントのシナリオに適しています。
-
コード生成と数学的推論: DFlyブロック並列ドラフトを使用して、長くて予測可能なスパンをキャプチャすることで、IDE補完や問題解決エンジンなどの構造化された出力タスクを高速化します。
-
長文コンテキストのトレーニングと推論Ulyssesのシーケンス並列処理は128kコンテキストをサポートしており、文書分析やコードリポジトリの取得といった長いシーケンスのシナリオに対応できます。