File size: 2,456 Bytes
13c5606 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 | # DFlash: Block Diffusion for Flash Speculative Decoding
> 论文笔记:DFlash 用轻量级 block diffusion model 作为 speculative decoding 的 draft model,一次 forward 并行生成一段候选 token,再交给目标 AR LLM 验证。它的目标不是替代 AR LLM,而是在保持 rejection sampling 无损性的前提下,提高 draft 质量和接受长度,从而降低目标模型的顺序解码开销。
## 论文信息
| 项目 | 信息 |
|---|---|
| 标题 | DFlash: Block Diffusion for Flash Speculative Decoding |
| arXiv | https://arxiv.org/abs/2602.06036 |
| 代码 | https://github.com/z-lab/dflash |
| 本地代码 | `reference/code/dflash` |
| 模型 | https://huggingface.co/collections/z-lab/dflash |
## 这篇论文解决什么问题
Speculative decoding 依赖 draft model 先提出多个 token,再由 target model 并行验证。传统 draft model 多是小型 AR 模型,因此 draft 过程本身仍然是逐 token 的,速度上限受限。DFlash 的判断是:draft 阶段不一定要自回归,block diffusion 可以一次生成一整块候选 token,更适合 speculative decoding 的并行验证接口。
## 方法拆解
DFlash 把 draft model 设计成轻量 block diffusion 模型,并让它条件化在 target model 提供的上下文特征上。这样 draft 不只是盲目补全,而是利用目标模型的上下文表示生成更容易被接受的候选块。
推理时流程是:target model 编码上下文;DFlash draft model 并行提出 block tokens;target AR LLM 对候选进行标准 speculative verification;若某个位置失败,则按无损 speculative decoding 的规则回退。因此 DFlash 的加速不改变最终采样分布,核心收益来自更快、更长、更准的 draft。
## 实验与结论
论文摘要报告 DFlash 在一系列模型和任务上达到超过 6x 的无损加速,并且相对 EAGLE-3 有最高约 2.5x 的额外 speedup。代码 README 显示它已经对 vLLM、SGLang、Transformers 和 MLX 做了工程集成,说明该方法的重点是可部署加速,而不是只做离线指标。
## 整体评价
DFlash 是 speculative decoding 与 dLLM 的一个清晰结合点。它避开了“diffusion LM 是否全面超过 AR LM”的大问题,只让 diffusion 负责它擅长的并行草稿生成。局限是需要为目标模型训练或适配 draft,并且真实加速依赖 acceptance length、batch size、后端实现和模型族。
|