AB
AiBoss
project

DSparkは、DeepSeekと北京大学が共同開発したオープンソースの投機的復号化アクセラレーションフレームワークです。

DSparkは、DeepSeekが北京大学と共同開発したオープンソースの投機的デコーディング高速化フレームワークです。大規模モデルの低速かつ漸進的な自己回帰生成という課題に特化して取り組んでいます。半自己回帰生成アーキテクチャを採用し、軽量なマルコフヘッダーを利用しています。

DSparkとは何ですか?

DSparkは、DeepSeekが北京大学と共同開発したオープンソースの投機的デコード高速化フレームワークです。大規模モデルにおける低速で漸進的な自己回帰生成という課題に特化して取り組んでいます。半自己回帰生成アーキテクチャを採用し、軽量なマルコフヘッドを用いてトークンの依存関係をモデル化することで、並列ドラフトの速度と一貫性のバランスを取っています。また、信頼度に基づくスケジューリング検証を導入し、システム負荷に基づいて検証リソースを動的に割り当てます。このフレームワークはDeepSeek-V4-Flash/Proの運用環境に導入され、ユーザーあたりの生成速度を57%~85%向上させ、スループットを最大400%向上させています。このプロジェクトはMITライセンスの下でオープンソースとして公開されており、QwenやGemmaなどの主流モデルと互換性があり、大規模モデルの効率的な推論のための実用的なエンジニアリングソリューションを提供します。

DSparkの主な機能

  • 半自己回帰ドラフト生成このモデルは、並列ドラフトモデルの高速性を維持しつつ、軽量なマルコフヘッド(またはRNNヘッド)を追加して隣接するトークンの依存関係をモデル化することで、従来の並列方式における接尾辞の減衰問題を軽減し、候補シーケンスの一貫性を高めます。
  • 信頼度スコア予測各候補トークンの信頼度スコアを出力し、そのトークンがターゲットモデルに受け入れられる確率をリアルタイムで推定することで、その後のスケジューリング決定の基礎情報を提供する。
  • ハードウェアを考慮したプレフィックススケジューリングシステムの同時負荷、候補の信頼度、およびエンジンのスループット曲線に基づいて、各リクエストで検証すべきトークン長が動的に決定されます。システムがアイドル状態のときはより多くの検証が実行され、システムがビジー状態のときは信頼度の低いリクエストが効率化されます。
  • 実運用レベルの推論アクセラレーションDeepSeek-V4-Flash/Proオンラインサービスに統合され、シングルユーザー生成速度が57%~85%向上し、実際の高同時トラフィック下では総スループットが最大400%向上しました。
  • 複数機種互換性サポートDeepSeekは自社開発モデルに加え、QwenやGemmaといった主流のオープンソース大規模モデルとも互換性があります。
  • フルスタックのオープンソース完全なコード、論文、トレーニングスクリプト、およびモデルのチェックポイントはMITライセンスの下でオープンソース化されており、開発者にとっての参入障壁が低くなっています。

DSparkの使い方

  • クローンプロジェクトDeepSpecのオープンソースリポジトリをクローンし、関連する依存関係をインストールしてランタイム環境を構成します。
  • モデルをダウンロード対象モデル(DeepSeek-V4、Qwen3、Gemma4など)と、それに対応するDSparkドラフトモデルのチェックポイントをダウンロードしてください。
  • 必要に応じて依存モジュールを選択してください。半自己回帰ドラフトモデルをロードし、必要に応じて、逐次依存モジュールとしてマルコフヘッドまたはRNNヘッドのいずれかを選択します。
  • スケジュール確認信頼度に基づくスケジューリング検証を有効にし、ハードウェア認識型のプレフィックススケジューラを設定して、GPUクラスタの現在の同時負荷とスループット曲線に適応させます。
  • 統合エンジンDSparkを既存の推論エンジン(vLLMや独自開発のサービスフレームワークなど)に統合し、従来のMTP-1や標準的な自己回帰デコーディング処理を置き換える。
  • リクエストを開始する:APIまたはコマンドライン経由でリクエストを開始すると、システムは自動的に「ドラフト生成 → 信頼性評価 → 動的検証 → 結果返却」という高速推論プロセスを実行します。

DSparkの公式ウェブサイトアドレス

  • GitHubアドレス:https://github.com/deepseek-ai/DeepSpec
  • Hugging Face:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-DSpark
  • 技術論文:https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

DSparkの主な利点

  • 速度と一貫性のバランスを取る半自己回帰型アーキテクチャこの手法は、並列ドラフトモデルの高いスループットという利点を維持しつつ、軽量なマルコフヘッド(またはRNNヘッド)を介してトークン間の依存関係をモデル化することで、従来の並列方式における接尾辞の劣化問題を効果的に軽減し、より一貫性のあるドラフトと高い承認率を実現します。
  • 信頼度に基づく動的スケジューリングにより、よりスマートなリソース利用が可能になります。このシステムは、信頼度スコア予測とハードウェア認識型プレフィックススケジューラを導入し、システムの同時負荷、候補の生存確率、およびエンジンのスループット曲線に基づいて検証期間を動的に調整します。システムがアイドル状態のときはより多くの検証が実行され、システムがビジー状態のときは信頼度の低い要求が効率化されるため、バッチ処理能力の無駄を回避できます。
  • 生産グレードの性能が大幅に向上DeepSeek-V4-Flash/Proオンラインサービスに導入され、実際の高同時接続トラフィック下において、シングルユーザー生成速度の向上を実現しました。 57%–85%総処理能力の最大増加 400%。
  • 幅広いモデル互換性DeepSeekが独自開発したモデルをサポートするだけでなく、QwenやGemmaといった主流のオープンソース大規模モデルとも互換性があり、様々なシナリオに適しています。
  • フルスタックのオープンソース、参入障壁が低い完全なコード、論文、トレーニングスクリプト、およびモデルチェックポイントはMITライセンスの下でオープンソース化されており、開発者はこれらをvLLMまたは独自の推論エンジンに迅速に統合できます。
  • 質量損失ゼロの加速投機的復号メカニズムに基づき、ターゲットモデルの出力分布は変化せず、生成コンテンツの精度と品質を損なうことなく、大幅な高速化を実現します。

DSparkと類似の競合製品との比較

比較対象寸法 DSpark(DeepSeek) Eagle3(草案の代表例) DFlash(並行して作成された草案の代表例)
テクニカルルート 半自己回帰生成+信頼度に基づくスケジューリング検証 純粋自己回帰ドラフトモデル 純粋平行ドラフトモデル
ドラフト生成方法 並列ブロック高速生成 + Markov/RNN ヘッドモジュールの依存関係 ドラフトはトークンごとに順番に生成されます。 候補ブロック全体を一度に並列生成する
モデリング能力への依存 強力: 軽量シーケンスモジュールを使用して、隣接するトークンの遷移関係を明示的にモデル化する 強力自己回帰的な依存関係を自然に完全に保持し、文脈的な一貫性を維持します。 弱いブロック内のトークン間に順序的な依存関係がない場合、矛盾した組み合わせが発生しやすくなります。
検証戦略 動的スケジューリング:検証時間は、信頼度スコアとシステム負荷に基づいてリアルタイムで調整されます。 固定またはヒューリスティックな検証長さ 通常、候補ブロック全体が検証されます。
スピード vs. 一貫性 考慮に入れる並列バックボーンは速度を確保し、シーケンシャルモジュールはサフィックスの劣化を軽減する。 一貫性は高いが、ドラフト段階自体が遅く、候補者の期間が長くなるほど不利になる。 速度は速いが、接尾辞が長くなるにつれて著しく劣化し、受理率は低下する。
生産環境への適応 ハードウェア認識型プレフィックススケジューラは、同時負荷に基づいてバッチ容量を動的に割り当てます。 高並行スケジューリングに対応するためには、さらなる最適化が必要である。 無駄なバッチ処理能力。信頼性の低いトークンの検証。
標準的なパフォーマンス Eagle3と比較して、平均レシーブ距離が向上している。 26.7%–30.9%DFlashと比較すると、改善点が見られます。 16.3%–18.4% 中程度の長さの配列を受け入れますが、短い配列の方がパフォーマンスが向上します。 許容される長さは最初は長いが、急速に減少する。配列が長くなるほど効率は低下する。

DSparkの応用シナリオ

  • リアルタイムチャットおよび対話システム高度なインタラクティブなシナリオにおける低遅延要件に対して、DSparkはシングルユーザー生成速度を大幅に向上させ、対話の流暢性を高め、ユーザーエクスペリエンスを改善することができます。
  • コードアシスタントとプログラミングツールコード生成タスクにおける候補トークンの承認率は高く(平均承認長は5.12)、DSparkはコード補完、自動エラー修正、および複数ファイル生成を高速化できます。
  • 複数ラウンドのエージェントワークフロー複数の呼び出しラウンドと相互接続されたツールチェーンを含む複雑なタスクでは、各ラウンドでの応答遅延を削減し、各ラウンドで遅延が蓄積および増幅されるのを防ぎます。
  • 数学的推論とオンライン教育数学的課題(GSM8K、MATH、AIMEなど)は、候補者の受諾率が最も高く(平均5.57)、長い推論ステップと強固な構造を持つ問題解決シナリオに適しています。
  • 高並行性クラウドAPIサービスハードウェア認識型プレフィックススケジューラによってGPU負荷を動的に調整することで、実際の高同時トラフィック下においてスループットを最大400%向上させ、リクエストあたりのコストを削減できます。
  • オープンソースモデルのローカル展開QwenやGemmaといった主流のモデルと互換性があり、MITライセンスの下でオープンソースとして公開されているため、中小企業や開発者がvLLMなどの自社開発フレームワークやエンジンに効率的な推論機能を容易に統合できます。