| # dmax Related Papers |
|
|
| > 论文笔记:这个目录里的论文都围绕 dLLM 的高效推理、少步蒸馏、MoE 路由、RL 对齐和多块并行。它们共同关注一个问题:dLLM 的并行性很有吸引力,但如果训练目标、推理状态和系统实现不匹配,就会出现质量下降、路由浪费或奖励错配。 |
|
|
| ## Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models |
|
|
| ### 论文信息 |
|
|
| | 项目 | 信息 | |
| |---|---| |
| | arXiv | https://arxiv.org/abs/2606.08501 | |
| | 方法关键词 | PAPO, Step-Aware Process Rewards, Entropy-Guided Historical Re-enactment | |
| | 代码 | 未确认公开官方 repo | |
|
|
| ### 解读 |
|
|
| 这篇关注 dLLM reasoning 的 RL 训练错配。普通 RL 往往把终局 reward 分配给所有中间扩散步骤,导致 credit assignment 粗糙;同时策略更新还可能发生在不符合真实生成轨迹的人工状态上。论文提出 PAPO,用 Step-Aware Process Rewards 把稀疏终局奖励转成更细的 step-wise reward,再用 Entropy-Guided Historical Re-enactment 回放高不确定步骤的真实历史轨迹。 |
|
|
| 价值在于它把 dLLM 的“多步状态”当成 RL 对齐的一等公民,而不是照搬 AR LM 的终局奖励。局限是 RL pipeline 会更复杂,且目前未确认官方代码。 |
|
|
| ## Few-Step Diffusion Language Models via Trajectory Self-Distillation |
|
|
| ### 论文信息 |
|
|
| | 项目 | 信息 | |
| |---|---| |
| | arXiv | https://arxiv.org/abs/2602.12262 | |
| | 代码 | https://github.com/Tyrion58/T3D | |
| | 本地代码 | `reference/code/T3D` | |
|
|
| ### 解读 |
|
|
| T3D 试图把 full-step diffusion teacher 的生成轨迹蒸馏到 few-step student。核心是 trajectory self-distillation:用模型自己的高步数 rollout 生成训练信号,减少 few-step 推理时的分布偏移。Direct Discriminative Optimization 则偏 reverse-KL / mode-seeking,让学生更集中到 teacher 的高概率模式。 |
|
|
| 这篇和 TAD、DMax 的关系很近:T3D 强调少步质量,TAD 强调时间感知监督,DMax 强调高并行自修正。三者都说明 dLLM 加速不能只靠减少 steps,还要改变训练信号。 |
|
|
| ## dMoE: dLLMs with Learnable Block Experts |
|
|
| ### 论文信息 |
|
|
| | 项目 | 信息 | |
| |---|---| |
| | arXiv | https://arxiv.org/abs/2605.30876 | |
| | 代码 | https://github.com/fscdc/dMoE | |
| | 本地代码 | 官方仓库确认;磁盘不足未完整拉取 | |
|
|
| ### 解读 |
|
|
| dMoE 解决 dLLM 与 MoE 的路由粒度冲突。标准 MoE 按 token 独立路由,但 dLLM 一次 forward 通常处理一个 block 内多个相互依赖 token,导致同一个 block 激活过多不同 expert,推理变成 memory-bound。 |
|
|
| 论文提出 block-level expert distribution:先聚合 block 内 token 的 expert 分布,再用统一的 block-level routing 指导 expert 选择。这样可以显著减少每次 forward 激活的 unique experts,同时尽量保留性能。摘要报告 unique experts 从 69.5 降到 14.6,并保留 99.11% 性能,内存使用下降约 76.64% 到 79.84%。 |
|
|
| ## Revise, Don't Freeze: Sampler-Matched Training for Self-Correcting Masked Diffusion Language Models |
|
|
| ### 论文信息 |
|
|
| | 项目 | 信息 | |
| |---|---| |
| | PDF | `Revise, Don’t Freeze- Sampler-Matched Training for Self-Correcting Masked Diffusion Language Models .pdf` | |
| | 代码 | 未确认公开官方 repo | |
|
|
| ### 解读 |
|
|
| 从标题看,这篇的中心思想是让 masked diffusion LM 在训练时匹配推理 sampler,而不是只学习从 mask 到 token 的一次性填充。传统 masked decoding 常把已经 unmask 的 token 冻结,这会放大早期错误;self-correcting sampler 希望后续步骤能修改已生成 token。 |
|
|
| “Sampler-Matched Training”的关键意义是减少训练-推理错配:如果推理时允许 revise,训练时也应该暴露模型会遇到的中间状态和错误状态。它与 DMax 的自修正方向一致,但更强调 sampler 与训练目标的匹配。 |
|
|
| ## Multi-Block Diffusion Language Models |
|
|
| ### 论文信息 |
|
|
| | 项目 | 信息 | |
| |---|---| |
| | arXiv | https://arxiv.org/abs/2606.29215 | |
| | 代码 | https://github.com/SJTU-DENG-Lab/mbd-lms | |
| | 本地代码 | 官方仓库确认;磁盘不足未完整拉取 | |
|
|
| ### 解读 |
|
|
| Multi-Block Diffusion 把 block diffusion 从一次只解一个 block 推进到同时维护多个 block 的 running-set。问题在于:已有 BD-LM 多在 teacher forcing 下只看一个 noisy block,而 MultiBD 推理时会看到多个噪声程度不同的 block,训练状态与推理状态不匹配。 |
|
|
| 论文提出 Multi-block Teacher Forcing,把 clean prefix 与有界 noisy block group 拼接训练,并用随机 noise scheduler 模拟 MultiBD 推理中的异质噪声模式。系统上又提出 Block Buffer,保持输入 shape 静态、保留 prefix cache,使多块并行能转成实际 wall-clock 加速。 |
|
|
| 摘要报告 MBD-LLaDA2-Mini 的平均 TPF 从 3.47 到 6.19,准确率从 79.95% 到 81.03%;结合 DMax 后 TPF 到 9.34。它是 dLLM 从单块并行走向跨块并行的重要工程论文。 |
|
|