dmax Related Papers
论文笔记:这个目录里的论文都围绕 dLLM 的高效推理、少步蒸馏、MoE 路由、RL 对齐和多块并行。它们共同关注一个问题:dLLM 的并行性很有吸引力,但如果训练目标、推理状态和系统实现不匹配,就会出现质量下降、路由浪费或奖励错配。
Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models
论文信息
| 项目 | 信息 |
|---|---|
| arXiv | https://arxiv.org/abs/2606.08501 |
| 方法关键词 | PAPO, Step-Aware Process Rewards, Entropy-Guided Historical Re-enactment |
| 代码 | 未确认公开官方 repo |
解读
这篇关注 dLLM reasoning 的 RL 训练错配。普通 RL 往往把终局 reward 分配给所有中间扩散步骤,导致 credit assignment 粗糙;同时策略更新还可能发生在不符合真实生成轨迹的人工状态上。论文提出 PAPO,用 Step-Aware Process Rewards 把稀疏终局奖励转成更细的 step-wise reward,再用 Entropy-Guided Historical Re-enactment 回放高不确定步骤的真实历史轨迹。
价值在于它把 dLLM 的“多步状态”当成 RL 对齐的一等公民,而不是照搬 AR LM 的终局奖励。局限是 RL pipeline 会更复杂,且目前未确认官方代码。
Few-Step Diffusion Language Models via Trajectory Self-Distillation
论文信息
| 项目 | 信息 |
|---|---|
| arXiv | https://arxiv.org/abs/2602.12262 |
| 代码 | https://github.com/Tyrion58/T3D |
| 本地代码 | reference/code/T3D |
解读
T3D 试图把 full-step diffusion teacher 的生成轨迹蒸馏到 few-step student。核心是 trajectory self-distillation:用模型自己的高步数 rollout 生成训练信号,减少 few-step 推理时的分布偏移。Direct Discriminative Optimization 则偏 reverse-KL / mode-seeking,让学生更集中到 teacher 的高概率模式。
这篇和 TAD、DMax 的关系很近:T3D 强调少步质量,TAD 强调时间感知监督,DMax 强调高并行自修正。三者都说明 dLLM 加速不能只靠减少 steps,还要改变训练信号。
dMoE: dLLMs with Learnable Block Experts
论文信息
| 项目 | 信息 |
|---|---|
| arXiv | https://arxiv.org/abs/2605.30876 |
| 代码 | https://github.com/fscdc/dMoE |
| 本地代码 | 官方仓库确认;磁盘不足未完整拉取 |
解读
dMoE 解决 dLLM 与 MoE 的路由粒度冲突。标准 MoE 按 token 独立路由,但 dLLM 一次 forward 通常处理一个 block 内多个相互依赖 token,导致同一个 block 激活过多不同 expert,推理变成 memory-bound。
论文提出 block-level expert distribution:先聚合 block 内 token 的 expert 分布,再用统一的 block-level routing 指导 expert 选择。这样可以显著减少每次 forward 激活的 unique experts,同时尽量保留性能。摘要报告 unique experts 从 69.5 降到 14.6,并保留 99.11% 性能,内存使用下降约 76.64% 到 79.84%。
Revise, Don't Freeze: Sampler-Matched Training for Self-Correcting Masked Diffusion Language Models
论文信息
| 项目 | 信息 |
|---|---|
Revise, Don’t Freeze- Sampler-Matched Training for Self-Correcting Masked Diffusion Language Models .pdf |
|
| 代码 | 未确认公开官方 repo |
解读
从标题看,这篇的中心思想是让 masked diffusion LM 在训练时匹配推理 sampler,而不是只学习从 mask 到 token 的一次性填充。传统 masked decoding 常把已经 unmask 的 token 冻结,这会放大早期错误;self-correcting sampler 希望后续步骤能修改已生成 token。
“Sampler-Matched Training”的关键意义是减少训练-推理错配:如果推理时允许 revise,训练时也应该暴露模型会遇到的中间状态和错误状态。它与 DMax 的自修正方向一致,但更强调 sampler 与训练目标的匹配。
Multi-Block Diffusion Language Models
论文信息
| 项目 | 信息 |
|---|---|
| arXiv | https://arxiv.org/abs/2606.29215 |
| 代码 | https://github.com/SJTU-DENG-Lab/mbd-lms |
| 本地代码 | 官方仓库确认;磁盘不足未完整拉取 |
解读
Multi-Block Diffusion 把 block diffusion 从一次只解一个 block 推进到同时维护多个 block 的 running-set。问题在于:已有 BD-LM 多在 teacher forcing 下只看一个 noisy block,而 MultiBD 推理时会看到多个噪声程度不同的 block,训练状态与推理状态不匹配。
论文提出 Multi-block Teacher Forcing,把 clean prefix 与有界 noisy block group 拼接训练,并用随机 noise scheduler 模拟 MultiBD 推理中的异质噪声模式。系统上又提出 Block Buffer,保持输入 shape 静态、保留 prefix cache,使多块并行能转成实际 wall-clock 加速。
摘要报告 MBD-LLaDA2-Mini 的平均 TPF 从 3.47 到 6.19,准确率从 79.95% 到 81.03%;结合 DMax 后 TPF 到 9.34。它是 dLLM 从单块并行走向跨块并行的重要工程论文。