Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding
论文笔记:Fast-dLLM 是训练无关的 dLLM 推理加速方法,核心是让双向 diffusion LLM 也能近似复用 KV cache,并用 confidence-aware parallel decoding 控制一次解码多个 token 时的质量损失。
论文信息
| 项目 | 信息 |
|---|---|
| 标题 | Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding |
| arXiv | https://arxiv.org/abs/2505.22618 |
| 代码 | https://github.com/NVlabs/Fast-dLLM |
| 本地代码 | 官方仓库较大,当前磁盘空间不足,未完整拉取 |
这篇论文解决什么问题
dLLM 理论上能并行生成,但实际开源模型常常比 AR LLM 慢。主要原因有两个:双向 attention 很难像 AR 模型那样直接使用 KV cache;并行解码多个 token 时,token 依赖被条件独立假设破坏,质量会下降。
方法拆解
Fast-dLLM 的第一个组件是 block-wise approximate KV cache。它不要求严格 AR 式 cache,而是在 diffusion 解码过程中复用部分 KV 状态,减少重复计算。
第二个组件是 confidence-aware parallel decoding。模型并不是每一步强行填固定数量 token,而是优先解码置信度足够高的位置,避免低置信 token 过早固定后影响后续生成。
方法的特点是 training-free:它面向已有 LLaDA、Dream 等模型,不要求重新训练基座模型。
实验与结论
摘要报告该方法在 LLaDA 和 Dream 上取得最高约 27.6x throughput improvement,并且准确率损失较小。这个数字说明 dLLM 的真实性能瓶颈很大程度在推理系统,而不只在模型质量。
整体评价
Fast-dLLM 是理解后续 DMax、TAD、MultiBD 等工作的关键背景:后续很多论文都在回答“如何在加速时不牺牲质量”。它的优点是训练无关、容易作为 baseline;局限是近似 cache 和置信阈值仍然是启发式,最优配置会随模型和任务变化。