# Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding > 论文笔记:Fast-dLLM 是训练无关的 dLLM 推理加速方法,核心是让双向 diffusion LLM 也能近似复用 KV cache,并用 confidence-aware parallel decoding 控制一次解码多个 token 时的质量损失。 ## 论文信息 | 项目 | 信息 | |---|---| | 标题 | Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding | | arXiv | https://arxiv.org/abs/2505.22618 | | 代码 | https://github.com/NVlabs/Fast-dLLM | | 本地代码 | 官方仓库较大,当前磁盘空间不足,未完整拉取 | ## 这篇论文解决什么问题 dLLM 理论上能并行生成,但实际开源模型常常比 AR LLM 慢。主要原因有两个:双向 attention 很难像 AR 模型那样直接使用 KV cache;并行解码多个 token 时,token 依赖被条件独立假设破坏,质量会下降。 ## 方法拆解 Fast-dLLM 的第一个组件是 block-wise approximate KV cache。它不要求严格 AR 式 cache,而是在 diffusion 解码过程中复用部分 KV 状态,减少重复计算。 第二个组件是 confidence-aware parallel decoding。模型并不是每一步强行填固定数量 token,而是优先解码置信度足够高的位置,避免低置信 token 过早固定后影响后续生成。 方法的特点是 training-free:它面向已有 LLaDA、Dream 等模型,不要求重新训练基座模型。 ## 实验与结论 摘要报告该方法在 LLaDA 和 Dream 上取得最高约 27.6x throughput improvement,并且准确率损失较小。这个数字说明 dLLM 的真实性能瓶颈很大程度在推理系统,而不只在模型质量。 ## 整体评价 Fast-dLLM 是理解后续 DMax、TAD、MultiBD 等工作的关键背景:后续很多论文都在回答“如何在加速时不牺牲质量”。它的优点是训练无关、容易作为 baseline;局限是近似 cache 和置信阈值仍然是启发式,最优配置会随模型和任务变化。