| # Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed | |
| > 论文笔记:Efficient-DLM 研究如何把预训练 AR 模型转换成高效 diffusion language model。它的重点不是从零训练 dLM,而是保留 AR 权重分布和已有能力,通过 block-wise attention、位置相关 masking 和连续预训练,让模型同时获得 diffusion 并行解码、KV cache 友好性和较好的任务准确率。 | |
| ## 论文信息 | |
| | 项目 | 信息 | | |
| |---|---| | |
| | 标题 | Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed | | |
| | arXiv | https://arxiv.org/abs/2512.14067 | | |
| | 代码 | 未确认公开官方 repo | | |
| | 本地代码 | 无 | | |
| ## 这篇论文解决什么问题 | |
| 很多 dLM 从头训练时学习效率不如 AR LM,而直接把 AR 模型改成全双向 diffusion 又容易破坏预训练权重的行为。Efficient-DLM 的问题意识是:如果目标是实用速度和任务能力,应该优先利用已有 AR 模型,而不是重新训练一个完全不同的语言模型。 | |
| ## 方法拆解 | |
| 第一,论文强调 block-wise attention:块之间保持因果关系,块内允许双向建模。这样既保留 AR 预训练的结构偏置,又支持块内并行去噪和 KV cache。 | |
| 第二,训练时使用 position-dependent token masking,让后面位置更容易被 mask,以贴近推理时偏左到右的解码状态。这个设计针对的是训练-推理 mask 分布不一致问题。 | |
| 第三,作者把这些策略组合成 AR-to-dLM conversion pipeline,通过连续预训练把 AR 模型推向 diffusion 解码范式,而不是从随机初始化开始训练。 | |
| ## 实验与结论 | |
| 摘要中报告 Efficient-DLM 8B 相比 Dream 7B 和 Qwen3 4B 在准确率与吞吐上都有优势,例如相对 Dream 7B 有更高准确率和约 4.5x throughput。关键结论是:dLM 的效率优势需要和 block attention、cache、mask schedule 一起设计,单纯“并行预测多个 token”不够。 | |
| ## 整体评价 | |
| 这篇适合作为 dLLM 工程路线的背景论文。它把问题从“dLM 能不能生成文本”推进到“如何把强 AR 模型转换成可服务的 dLM”。不足是目前未确认官方代码,复现和细节核验会受影响。 | |