hku_diffusion_dllm / diffusion_dllm_reference_survey.md
Ouzhang's picture
Add files using upload-large-folder tool
851b203 verified
|
Raw
History Blame Contribute Delete
26.8 kB

Diffusion / dLLM Reference Survey and Experiment Plan

目的:把 reference/ 下所有论文和代码按学姐讨论的项目目标重新组织,形成后续做 block diffusion / dLLM 加速、蒸馏和复现实验的工作底稿。

当前状态:本文只整理本地 reference、论文笔记和代码 README 中已有信息,尚未在本机重新跑实验。后续我们自己的复现实验结果统一填到本文的实验表和对应小节中。

0. 学姐讨论后的项目定位

学姐的核心要求可以压缩成四点:

  1. 目标不是只做一个论文 novelty,而是要找真的能在较大模型上可用的技术路线。
  2. 当前主线优先放在 discrete diffusion / block diffusion language model 上,尤其是 block 内或 block 间加速。
  3. continuous / flow / embedding-space diffusion 可以作为启发或探索,但目前完整替代离散 dLLM 的成熟度不如 block-discrete 路线,尤其在 coding、reasoning 这类高精度任务上风险更高。
  4. 评测不能只看生成文本是否通顺,要看质量、速度、并行度、任务准确率、训练/推理成本、工程可部署性,以及是否能迁移到更大模型。

因此本文按以下问题组织 reference:

  • 它属于哪条技术路线?
  • 它在线路中解决什么问题?
  • 它的实验怎么复现?
  • 它的结果有哪些可以直接作为 baseline 或 sanity check?
  • 它对我们后续做 7B/8B/16B block diffusion 加速有什么启发?

1. 总体路线图

路线 核心问题 代表 reference 和我们项目的关系 优先级
A. Discrete block dLLM 推理加速 如何让 dLLM 一次 forward 产出更多有效 token,同时少掉重复计算 Fast-dLLM, Efficient-DLM, Nemotron-Labs-Diffusion, Multi-Block Diffusion LMs 最贴近学姐说的 block 生成加速和可部署模型
B. Block 内自修正 / 高并行解码 并行解码越激进错误越多,如何让模型能 revise 而不是 freeze DMax, Revise Don't Freeze, Nemotron-Image token editing 我们可以在 block 内做 mask/soft state/revise 机制
C. Few-step / step distillation 如何把 full-step teacher 压成 few-step student TAD, T3D, Beyond Single Tokens / D-MMD 最接近“步数蒸馏”,可作为我们第一个实验方向
D. Speculative decoding with diffusion draft diffusion 不直接替代 AR,而是做并行 draft,被 AR verifier 验证 DFlash, Teaching Diffusion to Speculate L2R, PRESTO, Nemotron self-spec 工程价值强,适合做无损/近无损加速 baseline 中高
E. MoE / 多 block 系统效率 dLLM 扩到 MoE 或多 block 后如何控制 memory bandwidth 和 cache dMoE, Multi-Block Diffusion LMs, Diffulex 如果用 LLaDA2-mini / MoE 基座,需要纳入
F. Continuous / flow / embedding-space LM 能否绕开离散 token factorization,在连续空间少步甚至一步生成 FLM/FMLM, ELF 作为蒸馏和 continuous-space organization 的启发,短期不作为主线
G. RL / reward alignment for dLLM dLLM 多步状态下如何做 reasoning reward 对齐 Back on Track / PAPO 如果后续做 reasoning 加速后的能力恢复,可作为扩展 低中

2. Reference 逐篇定位

2.1 Fast-dLLM

  • 路线:training-free dLLM inference acceleration。
  • 做什么:让 LLaDA / Dream 这类双向 dLLM 近似使用 KV cache,并用 confidence-aware parallel decoding 一步填多个高置信 token。
  • 评测重点:throughput improvement、accuracy drop、NFE、TPF。
  • 可复现入口:reference/code/Fast-dLLM,v1 可直接跑 Dream/LLaDA eval;v2 是 fine-tuned block diffusion。
  • 对我们的意义:应该作为训练无关加速 baseline。任何新蒸馏/训练方法都要至少和 Fast-dLLM 的同模型同任务结果比较。

2.2 Efficient-DLM

  • 路线:AR-to-dLM conversion。
  • 做什么:把已有 AR 模型转成 block-wise diffusion LM,保留块间因果关系,块内双向 denoising,并配 position-dependent masking 和连续预训练。
  • 评测重点:相比 Dream 7B / Qwen3 4B 的准确率和 throughput。
  • 代码状态:本地未确认官方代码。
  • 对我们的意义:说明实用 dLLM 不应从零训练,而应利用 AR 权重、KV cache、block attention 和 mask schedule 联合设计。

2.3 Nemotron-Labs-Diffusion

  • 路线:tri-mode LM,统一 AR / diffusion / self-speculation。
  • 做什么:同一模型通过切 attention pattern 支持纯 AR、block diffusion parallel decoding、self-speculation。self-spec 用 diffusion draft + AR verify,共享模型和 KV cache。
  • 评测重点:GSM8K、MATH-500 等任务 accuracy、avg NFE、TPF、不同 mode 的吞吐。
  • 可复现入口:reference/code/Nemotron-Labs-Diffusion/evaluate.py 可单进程跑 gsm8kmath-500eval.sh 可跑完整 benchmark suite 但依赖 SLURM/container。
  • 对我们的意义:这是最接近“可部署 dLLM”的系统参考。后续实验建议直接采用其 TPF/accuracy 记录方式。

2.4 DMax

  • 路线:aggressive parallel decoding + self-revising dLLM。
  • 做什么:把传统 mask-to-token 硬转移改成 mask embedding 到 token embedding 的渐进式软状态;训练上用 On-Policy Uniform Training 让模型见到自己生成的错误状态;推理上用 Soft Parallel Decoding。
  • 评测重点:math/reasoning/code/general tasks 的 accuracy-TPF trade-off。
  • 可复现入口:reference/code/DMax。训练依赖 dFactory/VeOmni;评测在 dInfer/evaluations,包含 GSM8K、MATH500、Minerva_Algebra、ASDIV、HumanEval/MBPP variants。
  • 可复用结果:README 报告 DMax-16B math/reasoning TPF 约 6.0,code TPF 约 6.6,同时保持质量。
  • 对我们的意义:最重要的 block 内加速 baseline。我们后续做 distillation 或 mask 改进时,应优先比较“同 block length 下 TPF 和 accuracy 是否超过 DMax/Fast-dLLM”。

2.5 TAD

  • 路线:temporal-aware trajectory self-distillation。
  • 做什么:把 teacher 的高步数轨迹蒸馏给 student,但区分 near tokens 和 distant tokens:near 用 hard CE,distant 用 soft KL,避免远期 token 过早硬决策。
  • 评测重点:LLaDA/Dream 上 GSM8K、MATH、HumanEval、MBPP;AUP/TPF/accuracy trade-off。
  • 可复现入口:reference/code/TAD。先生成 math/code trajectories,再 LoRA/Deepspeed 训练,最后 merge LoRA 并跑 eval。
  • 对我们的意义:非常适合做第一批复现实验,因为它直接对应“离散 dLLM 步数蒸馏”和学姐提到的 block 内蒸馏。

2.6 T3D / Few-Step Diffusion LMs

  • 路线:trajectory self-distillation + Direct Discriminative Optimization。
  • 做什么:用 full-step teacher rollout 生成 on-policy 轨迹,训练 few-step student;DPO/reverse-KL 风格目标让 student 更集中到 teacher 高概率模式。
  • 评测重点:MATH_train -> MATH500,few-step accuracy,block size,denoising steps per block。
  • 可复现入口:reference/code/T3D。三阶段:rollout、trajectory preprocessing、T3D training;提供 SDAR-4B-Chat-t3d-math checkpoint。
  • 对我们的意义:和 TAD 同属蒸馏路线,但 T3D 更强调 label-free/on-policy rollout 和 discriminative optimization。可以作为 TAD 的对照。

2.7 Beyond Single Tokens / D-MMD

  • 路线:discrete diffusion moment matching distillation。
  • 做什么:把连续扩散中的 MMD 蒸馏推广到离散 token/pixel 空间,用 teacher、student generator、auxiliary model 做交替优化,减少 NFE。
  • 评测重点:CIFAR-10 FID、OpenWebText GPT-2 Gradient Error、block-AR 256-token block。
  • 代码状态:未确认官方代码。
  • 可复用结果:OWT Masked D-MMD 16/32 steps 的 GGE 0.236/0.225,优于 256/512-step teacher 0.275;256-block Uniform D-MMD 16 steps GGE 0.225,匹配 256-step teacher。
  • 对我们的意义:提供“连续蒸馏思想迁移到离散”的模板。虽然代码缺失,但公式和评测指标 GGE 值得借鉴。

2.8 Revise, Don't Freeze

  • 路线:sampler-matched training for self-correcting masked DLM。
  • 做什么:训练时匹配允许 revise 的 sampler,而不是只训练一次性 mask-to-token 填充;目标是减少训练-推理状态错配。
  • 代码状态:未确认官方代码。
  • 对我们的意义:和 DMax 的 self-revise 思路一致,可作为我们设计“允许重写已解 token”的理论依据。

2.9 Multi-Block Diffusion Language Models

  • 路线:inter-block parallelism / MultiBD。
  • 做什么:从一次只解一个 block 的 SingleBD,扩展到同时维护多个 active blocks 的 running-set;训练上用 Multi-block Teacher Forcing,系统上用 Block Buffer 固定形状、保留 prefix cache。
  • 评测重点:GSM8K、MATH500、MBPP+、HumanEval+;Accuracy、TPF、AUP、TPS。
  • 可复现入口:reference/code/mbd-lms 是训练/method repo;reference/code/Diffulex-mbd-lms 是论文复现实验 runtime branch,统一入口 ./script/run_batch_experiments.sh
  • 可复用结果:LLaDA2-Mini 平均 TPF 3.47 -> 6.19,accuracy 79.95% -> 81.03%;结合 DMax 后 TPF 到 9.34;H100 TP=2 上 MBD-LLaDA2-Mini-DMax 平均 TPS 926.67。
  • 对我们的意义:如果我们做的不只是 block 内加速,而是多 block 并行,MBD 是最直接 baseline。

2.10 dMoE

  • 路线:MoE efficiency for dLLMs。
  • 做什么:把 token-level MoE routing 改成 learnable block expert distribution,减少一个 block 中激活的 unique experts,降低 memory bandwidth。
  • 评测重点:unique experts count、memory reduction、GSM8K/MATH500/MMLU/ARC-C accuracy。
  • 可复现入口:reference/code/dMoE。有 quick start 和 evaluations/scripts_moe/run_be_adaptive.sh
  • 可复用结果:论文笔记记录 unique experts 约 69.5 -> 14.6,保留 99.11% 性能,memory 降约 76.64%-79.84%。
  • 对我们的意义:如果基座是 LLaDA2.0-mini / MoE,dMoE 影响吞吐和显存,是系统维度的重要补充。

2.11 DFlash

  • 路线:diffusion draft for speculative decoding。
  • 做什么:用轻量 block diffusion model 做 speculative draft,一次 forward 生成候选块,然后 AR target model 标准 verification。
  • 评测重点:acceptance length、lossless speedup、backend throughput、benchmark accuracy。
  • 可复现入口:reference/code/dflash,支持 vLLM/SGLang/Transformers/MLX;benchmark 支持 gsm8k、math500、humaneval、mbpp、mt-bench。
  • 可复用结果:论文笔记记录一系列模型上超过 6x lossless speedup,相对 EAGLE-3 最高约 2.5x 额外 speedup。
  • 对我们的意义:如果公司侧更关心“马上可部署且不改变 AR 输出分布”,DFlash 是高价值路线。

2.12 Teaching Diffusion to Speculate Left-to-Right

  • 路线:align diffusion draft with AR verifier prefix acceptance。
  • 做什么:解决 diffusion block draft 与 AR left-to-right verification 的方向错配。训练目标包括 positional weighting、first-error focal loss、chain loss,优化 accepted prefix length。
  • 可复现入口:论文中官方 repo 当前不可用;本地有 SpecForge,可作为 DFlash/speculative training 复现框架。
  • 可复用结果:论文笔记记录 accepted draft length 提升 21%-76%,且不增加 forward、不改变 rejection sampling exactness。
  • 对我们的意义:如果做 DFlash-like draft,不能只优化 token CE,必须优化 verifier 真正在意的 prefix acceptance。

2.13 PRESTO

  • 路线:prefix-aligned tree drafting for diffusion speculative decoding。
  • 做什么:把 diffusion draft 的并行候选组织成 AR verifier 友好的 prefix tree,而不是只生成一条候选或无结构候选。
  • 代码状态:未扫到官方 repo。
  • 对我们的意义:推理结构方向。可以和 Teaching Diffusion to Speculate L2R 配套:一个改训练目标,一个改 draft tree。

2.14 SpecForge

  • 路线:speculative decoding training framework。
  • 做什么:SGLang 团队维护的 speculative model 训练框架,支持 EAGLE3、DFlash、Domino,并接 SGLang serving。
  • 可复现入口:reference/code/SpecForge,DFlash training script 是 scripts/train_dflash.py,示例是 examples/run_qwen3_8b_dflash_online.sh
  • 对我们的意义:如果要训练自己的 diffusion drafter,不必从 DFlash repo 单独拼 pipeline,可以优先研究 SpecForge 的 DFlash/DPACE/D2SD 训练接口。

2.15 FLM / FMLM

  • 路线:continuous flow over one-hot token encodings。
  • 做什么:FLM 在 one-hot 与 Gaussian noise 间做连续 flow;FMLM 学 two-time flow map,可 1/2/4-step 生成。
  • 评测重点:LM1B/OWT Gen. PPL、entropy、one-step/few-step quality、Sudoku 组合约束。
  • 可复现入口:reference/code/flm,提供 LM1B/OWT 训练和 gen_ppl 脚本,HuggingFace/Google Drive checkpoint。
  • 可复用结果:FMLM OWT 1/2/4/8/16/32 steps Gen. PPL = 168.30/133.29/111.31/86.50/63.63/45.09;LM1B one-step 119.34。
  • 对我们的意义:连续路线在 few-step 上很强,但目前更偏无条件生成和中小模型。可借鉴 semigroup distillation / flow map,而不是直接作为 coding/reasoning 主线。

2.16 ELF

  • 路线:embedded continuous flow language model。
  • 做什么:用 frozen T5 encoder 把 token 转成 contextual embedding,在 embedding space 做 flow matching,只在最后一步离散化;共享 denoiser/decoder,可用 CFG 和 SDE sampler。
  • 评测重点:OWT Gen. PPL/entropy、WMT14 De-En BLEU、XSum ROUGE、训练 token 预算。
  • 可复现入口:reference/code/ELF,JAX/TPU 主实现;提供 HF checkpoint 和 eval 脚本。PyTorch 版本在分支,当前本地只见主分支。
  • 可复用结果:ELF-B OWT 32-step SDE Gen. PPL 约 24.08/entropy 5.15;WMT14 De-En BLEU 26.4;XSum R1/R2/RL = 36.0/12.2/27.8;effective training tokens 45.2B。
  • 对我们的意义:这是 continuous-space organization 的强参考。短期可作为“连续空间是否值得探索”的对照,不建议替代 block discrete 主线。

2.17 Nemotron-Labs-Diffusion-Image

  • 路线:masked discrete diffusion for image tokens。
  • 做什么:高分辨率图像 token 的 masked discrete diffusion;引入 token-editing mechanism 和 Grouped Cross-Entropy,允许已 unmask token 被修正,并缓解大词表稀疏监督。
  • 代码状态:未扫到官方 repo。
  • 对我们的意义:虽然是 image,但 token editing / grouped CE 可能启发文本 dLLM 的 revise training 和近邻 token soft target。

2.18 Back on Track / PAPO

  • 路线:reasoning RL for diffusion LLM。
  • 做什么:提出 Step-Aware Process Rewards 和 Entropy-Guided Historical Re-enactment,让 reward 与 dLLM 中间扩散状态对齐。
  • 代码状态:未确认官方 repo。
  • 对我们的意义:如果我们后续发现加速后 reasoning 掉点,可考虑用 step-aware reward 恢复能力;短期不是第一阶段。

3. 可复用结果大表

说明:结果来源 表示本地论文笔记或代码 README 中已有的可引用数字;我们复现 留给后续实验填入。不同论文任务/模型不同,不能直接横向排名,只能作为各自路线的 sanity check。

Ref 路线 模型/设置 数据/任务 指标 论文/README 可复用结果 代码位置 我们复现
Fast-dLLM v1 training-free cache + parallel decoding LLaDA/Dream GSM8K 等 throughput/accuracy 最高约 27.6x throughput improvement,准确率损失较小 reference/code/Fast-dLLM/v1 TODO
Fast-dLLM v2 block diffusion fine-tuning Qwen2.5 7B LLM tasks speed/quality README 提供 Fast_dLLM_v2_7B reference/code/Fast-dLLM/v2 TODO
Nemotron-Labs-Diffusion tri-mode 8B default GSM8K acc/NFE/TPF README 示例:GSM8K acc 93.78%, avg NFE 52.1, TPF 5.89 reference/code/Nemotron-Labs-Diffusion TODO
DMax self-revising dLLM DMax-16B math/reasoning TPF/accuracy math/reasoning TPF 约 6.0 reference/code/DMax TODO
DMax self-revising dLLM DMax-Coder-16B code TPF/accuracy code TPF 约 6.6 reference/code/DMax TODO
TAD temporal-aware distillation LLaDA/Dream LoRA GSM8K/MATH/HumanEval/MBPP AUP/TPF/acc README 图给主结果,需从论文/图中抄具体数 reference/code/TAD TODO
T3D trajectory self-distillation SDAR-4B-Chat MATH500 few-step acc 提供 T3D checkpoint;论文结果待复核 reference/code/T3D TODO
D-MMD discrete MMD distillation Masked D-MMD OWT GGE 16/32 steps GGE 0.236/0.225,优于 256/512-step teacher 0.275 无代码 N/A
D-MMD block AR diffusion 256-block Uniform D-MMD OWT 1024-token block GGE 16-step D-MMD GGE 0.225,匹配 256-step teacher 无代码 N/A
D-MMD discrete image diffusion Masked D-MMD CIFAR-10 FID 64 steps FID 3.5;teacher 1024 steps FID 6.4 无代码 N/A
Multi-Block DLM MultiBD + MultiTF LLaDA2-Mini GSM8K/MATH500/MBPP+/HumanEval+ avg acc/TPF/AUP TPF 3.47 -> 6.19;acc 79.95% -> 81.03% reference/code/mbd-lms, reference/code/Diffulex-mbd-lms TODO
Multi-Block DLM + DMax MultiBD + DMax LLaDA2-Mini-DMax same avg TPF MBD-LLaDA2-Mini-DMax TPF 9.34 same TODO
Multi-Block DLM throughput Diffulex runtime MBD-LLaDA2-Mini-DMax H100 TP=2 TPS Avg TPS 926.67,step latency 11.20 ms reference/code/Diffulex-mbd-lms TODO
dMoE block-level MoE routing dMoE-16B GSM8K/MATH500/MMLU/ARC-C unique experts/perf unique experts 69.5 -> 14.6;保留 99.11% 性能;memory -76.64%~-79.84% reference/code/dMoE TODO
DFlash diffusion speculative draft Qwen/Gemma/Kimi 等 GSM8K/MATH500/HumanEval/MBPP/MT-Bench lossless speedup 多模型超过 6x speedup;相对 EAGLE-3 最高约 2.5x reference/code/dflash TODO
Teaching Diffusion L2R verifier-aligned draft training diffusion draft + AR verifier speculative decoding accepted draft length accepted length 提升 21%-76% reference/code/SpecForge 可参考 TODO
FLM continuous flow FLM LM1B Gen. PPL/entropy 1024 steps PPL 96.91 / entropy 4.29 reference/code/flm TODO
FLM continuous flow FLM OWT Gen. PPL/entropy 1024 steps PPL 62.23 / entropy 5.33 reference/code/flm TODO
FMLM flow-map distillation FMLM LM1B Gen. PPL/entropy 1/2/4 steps PPL 119.34/110.19/98.76 reference/code/flm TODO
FMLM flow-map distillation FMLM OWT Gen. PPL/entropy 1/2/4/8/16/32 steps PPL 168.30/133.29/111.31/86.50/63.63/45.09 reference/code/flm TODO
FMLM flow map on constraints FMLM Sudoku valid rate 4/2/1 steps valid 73.05%/42.58%/5.47% reference/code/flm TODO
ELF embedding flow ELF-B OWT Gen. PPL/entropy 32-step SDE PPL 24.08, entropy 5.15 reference/code/ELF TODO
ELF embedding flow ELF-B WMT14 De-En BLEU 26.4 reference/code/ELF TODO
ELF embedding flow ELF-B XSum ROUGE R1/R2/RL 36.0/12.2/27.8 reference/code/ELF TODO

4. 统一评测维度

后续不要只复现单个论文自己的指标。建议每个可跑方法都按以下维度记录:

维度 具体指标 为什么重要
任务质量 GSM8K acc, MATH500 acc, HumanEval pass@1, MBPP pass@1, MMLU/ARC-C 学姐强调 coding/reasoning 对精确度敏感,不能只看通顺文本
生成质量 Gen. PPL, entropy, GGE, Self-BLEU, qualitative samples 无条件生成或 continuous 路线需要补充质量/多样性
推理效率 NFE, TPF, TPS, latency/token, step latency, wall-clock block 加速最终要落到真实速度
并行-质量曲线 AUP, accuracy vs TPF, accuracy vs steps 单点结果容易 cherry-pick,曲线更稳
训练成本 GPU/TPU 数、训练 tokens、训练步数、LoRA/full finetune、trajectory generation cost 决定能否在我们资源上复现
工程复杂度 是否需改模型、是否需训练、是否需 SGLang/vLLM、是否支持 KV cache、是否依赖 SLURM 决定可部署性
可迁移性 适用基座:LLaDA/Dream/SDAR/Qwen/Nemotron/MoE 决定能不能扩到更大模型
风险 代码是否公开、checkpoint 是否可用、指标是否容易不一致、任务是否过于理想化 防止把不可复现论文当主线

5. 建议复现实验顺序

Phase 1: 建立 dLLM baseline 表

目标:不训练,先把能跑的模型在统一任务上跑出 baseline。

实验 路径 配置 输出
Nemotron evaluate.py smoke reference/code/Nemotron-Labs-Diffusion --mode ar/dlm/linear_spec, gsm8k, limit=50 acc, avg_tok, avg_nfe, TPF
Fast-dLLM v1 Dream/LLaDA eval reference/code/Fast-dLLM/v1 GSM8K, steps/threshold/use_cache sweep acc, throughput, latency
DMax official eval reference/code/DMax/dInfer/evaluations math/code scripts accuracy, TPF
DFlash Transformers small model reference/code/dflash Qwen3-8B + DFlash draft, gsm8k max 128 speedup, acceptance, acc

记录位置:

Date Experiment Model Task Config Accuracy NFE TPF TPS/Latency Notes
TODO Nemotron smoke TODO GSM8K-50 TODO TODO TODO TODO TODO TODO
TODO Fast-dLLM smoke TODO GSM8K TODO TODO TODO TODO TODO TODO
TODO DMax eval TODO MATH500 TODO TODO TODO TODO TODO TODO
TODO DFlash eval TODO GSM8K-128 TODO TODO TODO TODO TODO TODO

Phase 2: 复现蒸馏路线

目标:验证学姐提到的“离散空间借 continuous distillation 方法”的可行性。

实验 路径 训练方式 需要资源 关键对照
TAD on LLaDA/Dream reference/code/TAD LoRA + generated trajectories 8 GPUs per README baseline vs TAD,near/distant ablation
T3D on SDAR-4B reference/code/T3D rollout -> preprocess -> DDO training 8 GPUs preferred full-step teacher vs few-step student
D-MMD reimplementation design 无官方代码 先只实现 toy / small OWT block TBD teacher 256-step vs student 16/32-step

记录位置:

Date Method Base Model Teacher Steps Student Steps Block Length Task Accuracy/Metric TPF/NFE Training Cost Notes
TODO TAD TODO 256 TODO 32 GSM8K TODO TODO TODO TODO
TODO T3D SDAR-4B TODO TODO 4 MATH500 TODO TODO TODO TODO
TODO D-MMD toy TODO TODO TODO TODO OWT TODO TODO TODO TODO

Phase 3: 做我们自己的 block 加速改进

目标:在已有 baseline 上设计一个小而清楚的改进,不要一开始就重训大模型。

候选方向:

方向 具体 idea 对照 reference 第一版可做实验
时间感知蒸馏 + soft state TAD 的 near/distant supervision 叠加 DMax 的 soft parallel state TAD + DMax LLaDA/Dream 小规模 LoRA
sampler-matched revise training 训练时暴露模型自己的错误状态,允许已填 token 被修正 DMax + Revise Don't Freeze synthetic trajectory / on-policy rollout
verifier-aware block draft diffusion draft 不优化全块 CE,而优化 accepted prefix length DFlash + Teaching L2R SpecForge DFlash training loss 改造
multi-block + distilled block MBD 的 Block Buffer 上接蒸馏后的 few-step block MBD + TAD/T3D/DMax Diffulex config sweep
continuous guidance as auxiliary 用 flow/embedding-space teacher 给 discrete dLLM 的中间状态提供 soft target ELF/FMLM + D-MMD 先在小 OWT block 或 toy task 做

记录位置:

Date Our Variant Base Reference Baseline Change Task Accuracy TPF Speedup Ablation Verdict
TODO TODO TODO TODO TODO TODO TODO TODO TODO TODO TODO

6. 推荐第一周工作清单

  1. 先跑 Nemotron evaluate.py --mode dlm --tasks gsm8k --limit 50,确认本地环境、HF 下载和基本指标记录方式。
  2. 跑同一个模型的 ardlmlinear_spec,建立最小 AR/diffusion/self-spec 对照。
  3. 跑 DFlash 的 Transformers backend 小样本 benchmark,理解 speculative decoding 的 acceptance 和 speedup 记录。
  4. 跑 DMax 现成 eval 脚本,拿到 math/code 的官方 checkpoint baseline。
  5. 选择 TAD 或 T3D 中一个做训练复现。若资源紧张,优先 TAD LoRA;若想研究 few-step teacher trajectory,则选 T3D。

7. 当前判断

最稳主线:DMax/TAD/T3D + Fast-dLLM/Nemotron baseline

原因:它们都围绕 discrete/block dLLM,能直接服务“block 内加速到极致”的目标,也能在 GSM8K/MATH/HumanEval/MBPP 这类高精度任务上评测。

工程主线:DFlash/Nemotron self-spec/SpecForge

原因:它不要求 diffusion 全面替代 AR,只让 diffusion 做 draft,成功后可以无损加速 AR LLM,更适合短期落地。

探索主线:FMLM/ELF/D-MMD

原因:continuous/flow 方法在 few-step 上很有启发,尤其是 semigroup distillation、flow map、embedding-space denoising、GGE 指标。但它们目前主要在 OWT/LM1B 或中小模型上证明,距离 coding/reasoning block dLLM 还有一层迁移风险。

8. Reference 与本地路径索引

内容 本地路径
总 reference index reference/README.md
DMax paper/code reference/DMax- Aggressive Parallel Decoding for dLLMs.pdf, reference/code/DMax
Nemotron tri-mode reference/Nemotron-Labs-Diffusion- A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding.pdf, reference/code/Nemotron-Labs-Diffusion
TAD reference/TAD- Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLM.pdf, reference/code/TAD
D-MMD reference/beyond single token/README.md
DFlash reference/dflash/README.md, reference/code/dflash
Efficient-DLM reference/efficient-dlm/README.md
ELF reference/elf/README.md, reference/code/ELF
Fast-dLLM reference/flash-dllm/README.md, reference/code/Fast-dLLM
FMLM/FLM reference/one-step language modeling/README.md, reference/code/flm
dmax related papers reference/dmax/README.md
Nemotron/speculative related papers reference/nemotron/README.md
MBD-LMs training repo reference/code/mbd-lms
MBD-LMs Diffulex reproduction branch reference/code/Diffulex-mbd-lms
dMoE reference/code/dMoE
SpecForge reference/code/SpecForge