project
Qwen3.8-27B-DFlash2 - Inco AI 开源的投机解码草稿模型
Qwen3.8-27B-DFlash2 是 Inco AI 开源的投机解码草稿模型,专为 Qwen3.8-27B 设计。模型仅 1.92B 参数,通过块级并行预测、轻量路径选择器和双抽头动态卷积,...
Qwen3.8-27B-DFlash2是什么
Qwen3.8-27B-DFlash2 是 Inco AI 开源的投机解码草稿模型,专为 Qwen3.8-27B 设计。模型仅 1.92B 参数,通过块级并行预测、轻量路径选择器和双抽头动态卷积,在单次前向传播中并行生成整块 token 草稿。模型在 H200 单卡、SGLang 单并发下,吞吐达到自回归解码的 2.7–3.4 倍,平均接受长度 4.80,优于原生 MTP 与社区 DSpark,且解码结果无损。
Qwen3.8-27B-DFlash2的主要功能
- 并行草稿生成:作为 Qwen3.8-27B 的投机解码草稿模型,单次前向传播即可并行预测整块 token,取代传统逐 token 自回归草稿生成。
- 智能路径选择:通过轻量路径选择器在每个位置的 top-16 候选中追踪出一条连贯路径,解决并行预测带来的 token 衔接不自然问题。
- 局部依赖建模:用双抽头动态卷积专门建模块内相邻位置的局部依赖,显著缓解块尾位置的”后缀衰减”现象。
- 无损推理加速:在 SGLang、vLLM、llama.cpp 等主流引擎上实现单并发 2.7–3.4 倍于自回归解码的吞吐,且严格保证解码输出无损。
Qwen3.8-27B-DFlash2的技术原理
-
块级并行草稿生成:传统投机解码的草稿模型仍需自回归逐 token 生成,DFlash 将草稿过程也改为非自回归,通过一次前向传播并行预测整块内所有位置的 token。
-
轻量路径选择器:由于各位置独立预测的 top-1 候选未必彼此连贯,选择器保留每位置的 top-16 候选,对所有相邻候选对并行打分(基于低秩双线性注意力与上下文门控),通过贪心或采样从最后一个已验证 token 出发追踪最佳后继路径,仅增加 2M 参数即可将接受长度提升约 0.4 个 token。
-
双抽头动态卷积:观察到深层注意力对块内依赖的投入持续衰减,团队在 Attention 与 MLP 子层前后插入内容自适应的双抽头动态深度卷积,每个位置混合自身表示与前驱表示,用极低成本(+3% 参数、+0.7% 延迟)承担块内局部建模,使注意力回归上下文读取,效果接近增加十层 Transformer。
微信关注回复“开源”,加入AI开源项目交流群
如何使用Qwen3.8-27B-DFlash2
- 模型准备:通过 ModelScope 分别下载 Qwen3.8-27B 目标模型与 Qwen3.8-27B-DFlash2 草稿模型到本地。
- SGLang 部署:安装 sglang 后执行
sglang.launch_server,指定--speculative-algorithm DFLASH及草稿模型路径即可启动加速服务。 - vLLM 部署:安装对应版本 vLLM 后使用
vllm serve,在--speculative-config中将 method 设为dflash并填入草稿模型名。 - llama.cpp 部署:拉取并编译支持 DFlash 的 PR 分支,分别加载目标模型与草稿模型的 GGUF 文件,以
--spec-type draft-dflash启动服务端。 - Apple Silicon:使用 oMLX 预编译包,在 Model Manager 中为目标模型开启 DFlash、指定草稿模型并将 Verify mode 设为 dflash。
- 命令行工具:安装
dflash包后,可直接通过dflash generate命令搭配 transformers、MLX 或 OpenAI 兼容后端运行推理与评测。
Qwen3.8-27B-DFlash2的核心优势
- 极小体积:仅 1.92B 参数(约 3.85GB)的草稿模型,即可为 27B 目标模型提供显著加速,部署成本极低。
- 并行草稿:突破传统自回归草稿限制,单次前向传播并行生成整块 token,大幅降低草稿阶段延迟。
- 无损加速:在单卡 H200 上实现单并发 2.7–3.4 倍于自回归解码的吞吐,且通过严格验证保证输出结果完全无损。
- 精准选择:轻量路径选择器以仅 2M 参数、0.6% 延迟开销,从 top-16 候选中追踪连贯路径,显著提升草稿接受率。
- 局部建模:双抽头动态卷积以 3% 参数量专门建模块内依赖,有效缓解深层位置的”后缀衰减”,效果媲美增加十层 Transformer。
- 生态兼容:已原生集成 SGLang、vLLM、llama.cpp、oMLX 等主流推理引擎,支持 NVIDIA 与 Apple Silicon 多平台部署。
Qwen3.8-27B-DFlash2的项目地址
- 项目官网:https://inco.ai/blog/dflash2/
- GitHub仓库:https://github.com/z-lab/dflash
Qwen3.8-27B-DFlash2的同类竞品对比
| 对比维度 | Qwen3.8-27B-DFlash2 | DSpark(社区草稿模型) |
|---|---|---|
| 平均接受长度 | 4.80 | 3.62 |
| GSM8K | 5.46 | 4.36 |
| MATH-500 | 5.28 | 3.92 |
| HumanEval | 4.39 | 3.30 |
| MBPP | 4.79 | 3.51 |
| MT-Bench | 4.10 | 3.01 |
| 草稿生成方式 | 一次前向、整块并行预测 | 自回归、逐 token 生成 |
| 连贯性修正机制 | 轻量路径选择器(top-16 候选选路) | 串行 head 重写全词表分布 |
| 额外参数开销 | +2.0M(选择器)/ +16.5M(卷积) | +77.8M |
| 周期延迟开销 | +1.3% | +9.6% |
| 单并发吞吐 | 自回归解码的 2.7–3.4× | 低于 DFlash 2(接受长度差距显著) |
| 输出一致性 | 严格无损 | 严格无损 |
Qwen3.8-27B-DFlash2的应用场景
-
AI Agent 服务:大幅降低 Agent 长时运行中的逐 token 解码成本,支撑工具调用、任务规划等高吞吐执行流程。
-
实时对话系统:单并发 2.7–3.4 倍加速显著降低响应延迟,提升聊天机器人与客服助手的交互体验。
-
代码生成助手:在 HumanEval、MBPP 基准上接受长度领先,适合 IDE 插件与编程 Copilot 等需要快速补全的场景。
-
长文本创作:高接受长度使每次验证产出更多 token,加速文章、报告、营销文案等长文档生成。
-
端侧本地部署:1.92B 小体积配合 oMLX 与 llama.cpp 支持,可在 Apple Silicon 笔记本等设备上实现高效本地推理。