File size: 5,008 Bytes
13c5606
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
# dmax Related Papers

> 论文笔记:这个目录里的论文都围绕 dLLM 的高效推理、少步蒸馏、MoE 路由、RL 对齐和多块并行。它们共同关注一个问题:dLLM 的并行性很有吸引力,但如果训练目标、推理状态和系统实现不匹配,就会出现质量下降、路由浪费或奖励错配。

## Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models

### 论文信息

| 项目 | 信息 |
|---|---|
| arXiv | https://arxiv.org/abs/2606.08501 |
| 方法关键词 | PAPO, Step-Aware Process Rewards, Entropy-Guided Historical Re-enactment |
| 代码 | 未确认公开官方 repo |

### 解读

这篇关注 dLLM reasoning 的 RL 训练错配。普通 RL 往往把终局 reward 分配给所有中间扩散步骤,导致 credit assignment 粗糙;同时策略更新还可能发生在不符合真实生成轨迹的人工状态上。论文提出 PAPO,用 Step-Aware Process Rewards 把稀疏终局奖励转成更细的 step-wise reward,再用 Entropy-Guided Historical Re-enactment 回放高不确定步骤的真实历史轨迹。

价值在于它把 dLLM 的“多步状态”当成 RL 对齐的一等公民,而不是照搬 AR LM 的终局奖励。局限是 RL pipeline 会更复杂,且目前未确认官方代码。

## Few-Step Diffusion Language Models via Trajectory Self-Distillation

### 论文信息

| 项目 | 信息 |
|---|---|
| arXiv | https://arxiv.org/abs/2602.12262 |
| 代码 | https://github.com/Tyrion58/T3D |
| 本地代码 | `reference/code/T3D` |

### 解读

T3D 试图把 full-step diffusion teacher 的生成轨迹蒸馏到 few-step student。核心是 trajectory self-distillation:用模型自己的高步数 rollout 生成训练信号,减少 few-step 推理时的分布偏移。Direct Discriminative Optimization 则偏 reverse-KL / mode-seeking,让学生更集中到 teacher 的高概率模式。

这篇和 TAD、DMax 的关系很近:T3D 强调少步质量,TAD 强调时间感知监督,DMax 强调高并行自修正。三者都说明 dLLM 加速不能只靠减少 steps,还要改变训练信号。

## dMoE: dLLMs with Learnable Block Experts

### 论文信息

| 项目 | 信息 |
|---|---|
| arXiv | https://arxiv.org/abs/2605.30876 |
| 代码 | https://github.com/fscdc/dMoE |
| 本地代码 | 官方仓库确认;磁盘不足未完整拉取 |

### 解读

dMoE 解决 dLLM 与 MoE 的路由粒度冲突。标准 MoE 按 token 独立路由,但 dLLM 一次 forward 通常处理一个 block 内多个相互依赖 token,导致同一个 block 激活过多不同 expert,推理变成 memory-bound。

论文提出 block-level expert distribution:先聚合 block 内 token 的 expert 分布,再用统一的 block-level routing 指导 expert 选择。这样可以显著减少每次 forward 激活的 unique experts,同时尽量保留性能。摘要报告 unique experts 从 69.5 降到 14.6,并保留 99.11% 性能,内存使用下降约 76.64% 到 79.84%。

## Revise, Don't Freeze: Sampler-Matched Training for Self-Correcting Masked Diffusion Language Models

### 论文信息

| 项目 | 信息 |
|---|---|
| PDF | `Revise, Don’t Freeze- Sampler-Matched Training  for Self-Correcting Masked Diffusion Language Models .pdf` |
| 代码 | 未确认公开官方 repo |

### 解读

从标题看,这篇的中心思想是让 masked diffusion LM 在训练时匹配推理 sampler,而不是只学习从 mask 到 token 的一次性填充。传统 masked decoding 常把已经 unmask 的 token 冻结,这会放大早期错误;self-correcting sampler 希望后续步骤能修改已生成 token。

“Sampler-Matched Training”的关键意义是减少训练-推理错配:如果推理时允许 revise,训练时也应该暴露模型会遇到的中间状态和错误状态。它与 DMax 的自修正方向一致,但更强调 sampler 与训练目标的匹配。

## Multi-Block Diffusion Language Models

### 论文信息

| 项目 | 信息 |
|---|---|
| arXiv | https://arxiv.org/abs/2606.29215 |
| 代码 | https://github.com/SJTU-DENG-Lab/mbd-lms |
| 本地代码 | 官方仓库确认;磁盘不足未完整拉取 |

### 解读

Multi-Block Diffusion 把 block diffusion 从一次只解一个 block 推进到同时维护多个 block 的 running-set。问题在于:已有 BD-LM 多在 teacher forcing 下只看一个 noisy block,而 MultiBD 推理时会看到多个噪声程度不同的 block,训练状态与推理状态不匹配。

论文提出 Multi-block Teacher Forcing,把 clean prefix 与有界 noisy block group 拼接训练,并用随机 noise scheduler 模拟 MultiBD 推理中的异质噪声模式。系统上又提出 Block Buffer,保持输入 shape 静态、保留 prefix cache,使多块并行能转成实际 wall-clock 加速。

摘要报告 MBD-LLaDA2-Mini 的平均 TPF 从 3.47 到 6.19,准确率从 79.95% 到 81.03%;结合 DMax 后 TPF 到 9.34。它是 dLLM 从单块并行走向跨块并行的重要工程论文。