project
Qwen3.8-27B-DFlash2 - Inco AIのオープンソース投機的デコードドラフトモデル
Qwen3.8-27B-DFlash2は、Inco AIが開発したオープンソースの投機的復号ドラフトモデルで、Qwen3.8-27B向けに特別に設計されています。このモデルはわずか192万個のパラメータしか持たず、ブロックレベルの並列予測、軽量パスセレクタ、デュアルタップ動的畳み込みによってこれを実現しています。
Qwen3.8-27B-DFlash2とは何ですか?
Qwen3.8-27B-DFlash2は、Inco AIが開発したオープンソースの投機的トークン復号ドラフトモデルで、Qwen3.8-27B向けに特別に設計されています。わずか192万個のパラメータで、ブロックレベルの並列予測、軽量パスセレクタ、デュアルタップ動的畳み込みにより、単一の順伝播中にトークンドラフト全体を並列に生成します。単一のH200カードと単一並列SGLangで、平均受容長4.80で自己回帰復号の2.7~3.4倍のスループットを実現し、ネイティブMTPやコミュニティ開発のDSparkを凌駕しながら、ロスレス復号結果を維持します。
Qwen3.8-27B-DFlash2の主な機能
- 並列ドラフト生成Qwen3.8-27B向けの投機的デコードドラフトモデルとして、従来のトークンごとの自己回帰ドラフト生成に代わり、単一の順伝播でトークン全体を並列に予測することができます。
- インテリジェントな経路選択軽量パスセレクタは、各位置の上位16個の候補の中から一貫性のあるパスをトレースすることで、並列予測によって引き起こされる不自然なトークン接続の問題を解決します。
- ローカル依存性モデリングモジュール内の隣接する位置間の局所的な依存関係を具体的に構築するためにデュアルタップ動的畳み込みを使用することで、ブロックの末尾における「接尾辞の減衰」現象を大幅に軽減できます。
- ロスレス推論の高速化SGLang、vLLM、llama.cppなどの主流エンジンにおいて、自己回帰復号の2.7~3.4倍のスループットを実現しつつ、ロスレス復号出力を厳密に保証します。
Qwen3.8-27B-DFlash2の技術的原理
-
ブロックレベルの並列ドラフト生成従来の投機的復号ドラフトモデルでは、トークンを1つずつ自己回帰的に生成する必要があります。DFlashはドラフト生成プロセスを非自己回帰的なものに変更し、単一の順伝播によってブロック内のすべての位置のトークンを並列に予測します。
-
軽量パスセレクター各位置で独立して予測された上位1候補は互いに整合性がない可能性があるため、セレクタは各位置で上位16候補を保持し、隣接するすべての候補ペアを並行してスコアリングします(低ランク双線形アテンションとコンテキストゲーティングに基づく)。貪欲法またはサンプリングにより、最後に検証されたトークンから始まる最適な後継パスを追跡します。200万個のパラメータを追加するだけで、受理長を約0.4トークン増加させることができます。
-
デュアルタップ動的畳み込みブロック間の依存関係に対するディープアテンションの入力が継続的に低下していることに着目した研究チームは、アテンション層とMLPサブレイヤーの前後に、コンテンツ適応型のデュアルタップ動的ディープ畳み込みを挿入しました。各位置では、自身の表現を先行する表現と混合し、ブロック内でのローカルモデリングに極めて低いコスト(パラメータ+3%、レイテンシ+0.7%)を使用することで、コンテキストの読み取りにアテンションが戻り、Transformerレイヤーを10層追加したのとほぼ同等の効果が得られました。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Qwen3.8-27B-DFlash2 の使い方
- モデルの準備ModelScopeを使用して、Qwen3.8-27BターゲットモデルとQwen3.8-27B-DFlash2ドラフトモデルをローカルマシンにダウンロードしてください。
- SGLangの導入sglangをインストールした後、以下を実行してください...
sglang.launch_server、 特定--speculative-algorithm DFLASHドラフトモデルへのパスを指定するだけで、アクセラレーションサービスを開始できます。 - vLLMの展開対応するバージョンのvLLMをインストールした後に使用してください。
vllm serve、存在する--speculative-configメソッドは次のように設定されていますdflashそして、ドラフトモデルの名前を入力してください。 - llama.cpp をデプロイしていますDFlashをサポートするPRブランチをプルしてコンパイルし、ターゲットモデルとドラフトモデルのGGUFファイルをそれぞれロードします。
--spec-type draft-dflashサーバーを起動します。 - Apple SiliconoMLXのプリコンパイル済みパッケージを使用して、モデルマネージャで対象モデルのDFlashを有効にし、ドラフトモデルを指定し、検証モードをdflashに設定します。
- コマンドラインツール:インストール
dflash梱包後、直接アクセスできます...dflash generateコマンドは、トランスフォーマー、MLX、またはOpenAI互換のバックエンドと組み合わせて、推論と評価を実行するために使用できます。
Qwen3.8-27B-DFlash2の主な利点
- 極めて小さな容量パラメータ数がわずか19.2億(約3.85GB)のドラフトモデルでも、27億のターゲットモデルに対して大幅な高速化を実現でき、導入コストも極めて低く抑えられます。
- 並行ドラフト従来の自己回帰型ドラフトの限界を打破し、単一の順伝播中にトークン全体を並列に生成することで、ドラフト段階における遅延を大幅に削減します。
- 損失のない加速単一のH200カード上で、自己回帰復号の2.7~3.4倍のスループットを実現し、厳密な検証によって完全なロスレス出力結果を保証します。
- 精密な選択わずか200万個のパラメータと0.6%のレイテンシーオーバーヘッドを持つ軽量パスセレクタは、上位16個の候補から一貫性のあるパスを追跡し、ドラフトの承認率を大幅に向上させる。
- ローカルモデリングデュアルタップ動的畳み込みは、パラメータの3%を使用してモジュール内の依存関係を構築し、深い位置での「サフィックス減衰」を効果的に軽減し、10個のTransformerレイヤーを追加した場合と同等の結果を実現します。
- 環境に優しいSGLang、vLLM、llama.cpp、oMLXといった主流の推論エンジンをネイティブに統合しており、NVIDIAやApple Siliconを含む複数のプラットフォームへの展開をサポートしています。
Qwen3.8-27B-DFlash2 プロジェクトアドレス
- プロジェクト公式サイト:https://inco.ai/blog/dflash2/
- GitHubリポジトリ:https://github.com/z-lab/dflash
Qwen3.8-27B-DFlash2と類似の競合製品との比較
| 比較対象寸法 | Qwen3.8-27B-DFlash2 | DSpark(コミュニティドラフトモデル) |
|---|---|---|
| 平均受入長 | 4.80 | 3.62 |
| GSM8K | 5.46 | 4.36 |
| MATH-500 | 5.28 | 3.92 |
| HumanEval | 4.39 | 3.30 |
| MBPP | 4.79 | 3.51 |
| MT-Bench | 4.10 | 3.01 |
| ドラフト生成方法 | 1回限りのフォワード、ブロック並列予測 | 自己回帰的、トークンごとの生成 |
| コヒーレンス補正機構 | 軽量パスセレクター(上位16候補ルート) | 語彙分布全体の逐次ヘッド書き換え |
| 追加のパラメータオーバーヘッド | +200万(セレクタ)/ +1650万(畳み込み) | +77.8M |
| サイクル遅延オーバーヘッド | +1.3% | +9.6% |
| 単一同時スループット | 自己回帰デコーディング 2.7–3.4× | DFlash 2以下(許容される長さに大きな違いがある) |
| 出力の一貫性 | 厳密に非破壊的 | 厳密に非破壊的 |
Qwen3.8-27B-DFlash2のアプリケーションシナリオ
-
AIエージェントサービス長時間実行されるエージェント操作中のトークンごとのデコードコストを大幅に削減し、ツールの呼び出しやタスク計画などの高スループット実行プロセスをサポートします。
-
リアルタイム対話システムシングルスレッドによる並行処理は2.7~3.4倍高速で、応答遅延を大幅に削減し、チャットボットやカスタマーサービスアシスタントの対話型エクスペリエンスを向上させます。
-
コード生成アシスタントHumanEvalおよびMBPPベンチマークにおいて、業界トップクラスの承認長を誇り、IDEプラグインやプログラミングCopilotなど、迅速な完了が求められるシナリオに適しています。
-
長文作成承認期間が長くなることで、各検証でより多くのトークンを生成できるようになり、記事、レポート、マーケティングコピーなどの長文ドキュメントの生成が加速されます。
-
デバイス側でのローカル展開その1.92Bという小さなサイズに加え、oMLXとllama.cppのサポートにより、Apple Silicon搭載ノートパソコンなどのデバイス上で効率的なローカル推論が可能になります。