Ouzhang's picture
Add files using upload-large-folder tool
13c5606 verified
|
Raw
History Blame Contribute Delete
2.06 kB

Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding

论文笔记:Fast-dLLM 是训练无关的 dLLM 推理加速方法,核心是让双向 diffusion LLM 也能近似复用 KV cache,并用 confidence-aware parallel decoding 控制一次解码多个 token 时的质量损失。

论文信息

项目 信息
标题 Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding
arXiv https://arxiv.org/abs/2505.22618
代码 https://github.com/NVlabs/Fast-dLLM
本地代码 官方仓库较大,当前磁盘空间不足,未完整拉取

这篇论文解决什么问题

dLLM 理论上能并行生成,但实际开源模型常常比 AR LLM 慢。主要原因有两个:双向 attention 很难像 AR 模型那样直接使用 KV cache;并行解码多个 token 时,token 依赖被条件独立假设破坏,质量会下降。

方法拆解

Fast-dLLM 的第一个组件是 block-wise approximate KV cache。它不要求严格 AR 式 cache,而是在 diffusion 解码过程中复用部分 KV 状态,减少重复计算。

第二个组件是 confidence-aware parallel decoding。模型并不是每一步强行填固定数量 token,而是优先解码置信度足够高的位置,避免低置信 token 过早固定后影响后续生成。

方法的特点是 training-free:它面向已有 LLaDA、Dream 等模型,不要求重新训练基座模型。

实验与结论

摘要报告该方法在 LLaDA 和 Dream 上取得最高约 27.6x throughput improvement,并且准确率损失较小。这个数字说明 dLLM 的真实性能瓶颈很大程度在推理系统,而不只在模型质量。

整体评价

Fast-dLLM 是理解后续 DMax、TAD、MultiBD 等工作的关键背景:后续很多论文都在回答“如何在加速时不牺牲质量”。它的优点是训练无关、容易作为 baseline;局限是近似 cache 和置信阈值仍然是启发式,最优配置会随模型和任务变化。