AB
AiBoss站
project

Qwen3.8-27B-DFlash2 - Inco AI 开源的投机解码草稿模型

Qwen3.8-27B-DFlash2 是 Inco AI 开源的投机解码草稿模型,专为 Qwen3.8-27B 设计。模型仅 1.92B 参数,通过块级并行预测、轻量路径选择器和双抽头动态卷积,...

Qwen3.8-27B-DFlash2是什么

Qwen3.8-27B-DFlash2 是 Inco AI 开源的投机解码草稿模型,专为 Qwen3.8-27B 设计。模型仅 1.92B 参数,通过块级并行预测、轻量路径选择器和双抽头动态卷积,在单次前向传播中并行生成整块 token 草稿。模型在 H200 单卡、SGLang 单并发下,吞吐达到自回归解码的 2.7–3.4 倍,平均接受长度 4.80,优于原生 MTP 与社区 DSpark,且解码结果无损。

Qwen3.8-27B-DFlash2的主要功能

  • 并行草稿生成:作为 Qwen3.8-27B 的投机解码草稿模型,单次前向传播即可并行预测整块 token,取代传统逐 token 自回归草稿生成。
  • 智能路径选择:通过轻量路径选择器在每个位置的 top-16 候选中追踪出一条连贯路径,解决并行预测带来的 token 衔接不自然问题。
  • 局部依赖建模:用双抽头动态卷积专门建模块内相邻位置的局部依赖,显著缓解块尾位置的”后缀衰减”现象。
  • 无损推理加速:在 SGLang、vLLM、llama.cpp 等主流引擎上实现单并发 2.7–3.4 倍于自回归解码的吞吐,且严格保证解码输出无损。

Qwen3.8-27B-DFlash2的技术原理

  • 块级并行草稿生成:传统投机解码的草稿模型仍需自回归逐 token 生成,DFlash 将草稿过程也改为非自回归,通过一次前向传播并行预测整块内所有位置的 token。
  • 轻量路径选择器:由于各位置独立预测的 top-1 候选未必彼此连贯,选择器保留每位置的 top-16 候选,对所有相邻候选对并行打分(基于低秩双线性注意力与上下文门控),通过贪心或采样从最后一个已验证 token 出发追踪最佳后继路径,仅增加 2M 参数即可将接受长度提升约 0.4 个 token。
  • 双抽头动态卷积:观察到深层注意力对块内依赖的投入持续衰减,团队在 Attention 与 MLP 子层前后插入内容自适应的双抽头动态深度卷积,每个位置混合自身表示与前驱表示,用极低成本(+3% 参数、+0.7% 延迟)承担块内局部建模,使注意力回归上下文读取,效果接近增加十层 Transformer。

微信关注回复“开源”,加入AI开源项目交流群

如何使用Qwen3.8-27B-DFlash2

  • 模型准备:通过 ModelScope 分别下载 Qwen3.8-27B 目标模型与 Qwen3.8-27B-DFlash2 草稿模型到本地。
  • SGLang 部署:安装 sglang 后执行 sglang.launch_server,指定 --speculative-algorithm DFLASH 及草稿模型路径即可启动加速服务。
  • vLLM 部署:安装对应版本 vLLM 后使用 vllm serve,在 --speculative-config 中将 method 设为 dflash 并填入草稿模型名。
  • llama.cpp 部署:拉取并编译支持 DFlash 的 PR 分支,分别加载目标模型与草稿模型的 GGUF 文件,以 --spec-type draft-dflash 启动服务端。
  • Apple Silicon:使用 oMLX 预编译包,在 Model Manager 中为目标模型开启 DFlash、指定草稿模型并将 Verify mode 设为 dflash。
  • 命令行工具:安装 dflash 包后,可直接通过 dflash generate 命令搭配 transformers、MLX 或 OpenAI 兼容后端运行推理与评测。

Qwen3.8-27B-DFlash2的核心优势

  • 极小体积:仅 1.92B 参数(约 3.85GB)的草稿模型,即可为 27B 目标模型提供显著加速,部署成本极低。
  • 并行草稿:突破传统自回归草稿限制,单次前向传播并行生成整块 token,大幅降低草稿阶段延迟。
  • 无损加速:在单卡 H200 上实现单并发 2.7–3.4 倍于自回归解码的吞吐,且通过严格验证保证输出结果完全无损。
  • 精准选择:轻量路径选择器以仅 2M 参数、0.6% 延迟开销,从 top-16 候选中追踪连贯路径,显著提升草稿接受率。
  • 局部建模:双抽头动态卷积以 3% 参数量专门建模块内依赖,有效缓解深层位置的”后缀衰减”,效果媲美增加十层 Transformer。
  • 生态兼容:已原生集成 SGLang、vLLM、llama.cpp、oMLX 等主流推理引擎,支持 NVIDIA 与 Apple Silicon 多平台部署。

Qwen3.8-27B-DFlash2的项目地址

  • 项目官网:https://inco.ai/blog/dflash2/
  • GitHub仓库:https://github.com/z-lab/dflash

Qwen3.8-27B-DFlash2的同类竞品对比

对比维度 Qwen3.8-27B-DFlash2 DSpark(社区草稿模型)
平均接受长度 4.80 3.62
GSM8K 5.46 4.36
MATH-500 5.28 3.92
HumanEval 4.39 3.30
MBPP 4.79 3.51
MT-Bench 4.10 3.01
草稿生成方式 一次前向、整块并行预测 自回归、逐 token 生成
连贯性修正机制 轻量路径选择器(top-16 候选选路) 串行 head 重写全词表分布
额外参数开销 +2.0M(选择器)/ +16.5M(卷积) +77.8M
周期延迟开销 +1.3% +9.6%
单并发吞吐 自回归解码的 2.7–3.4× 低于 DFlash 2(接受长度差距显著)
输出一致性 严格无损 严格无损

Qwen3.8-27B-DFlash2的应用场景

  • AI Agent 服务:大幅降低 Agent 长时运行中的逐 token 解码成本,支撑工具调用、任务规划等高吞吐执行流程。
  • 实时对话系统:单并发 2.7–3.4 倍加速显著降低响应延迟,提升聊天机器人与客服助手的交互体验。
  • 代码生成助手:在 HumanEval、MBPP 基准上接受长度领先,适合 IDE 插件与编程 Copilot 等需要快速补全的场景。
  • 长文本创作:高接受长度使每次验证产出更多 token,加速文章、报告、营销文案等长文档生成。
  • 端侧本地部署:1.92B 小体积配合 oMLX 与 llama.cpp 支持,可在 Apple Silicon 笔记本等设备上实现高效本地推理。