File size: 17,625 Bytes
13c5606 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 120 121 122 123 124 125 126 127 128 129 130 131 132 133 134 135 136 137 138 139 140 141 142 143 144 145 146 147 148 149 150 151 152 153 154 155 156 157 158 159 160 161 162 163 164 165 166 167 168 169 170 171 172 173 174 175 176 177 178 179 180 181 182 183 184 185 186 187 188 189 190 191 192 193 194 195 196 197 198 199 200 201 202 203 204 205 206 207 208 209 210 211 212 213 214 215 216 217 218 219 220 221 222 223 224 225 226 227 228 229 230 231 232 233 234 235 236 237 238 239 240 241 242 243 244 245 246 247 248 249 250 251 252 253 254 255 256 257 258 259 260 261 262 263 264 | # ELF: Embedded Language Flows
> 论文笔记:当前强势的 diffusion language models 多在离散 token 空间工作,而早期连续 DLM 通常效果较弱。本文提出 **Embedded Language Flows (ELF)**:把文本 token 映射到连续 embedding 空间,用 continuous-time Flow Matching 主要在 embedding 空间中去噪,只在最后一步 `t=1` 用共享权重网络把 embedding 解码回离散 token。ELF 在 OpenWebText 无条件生成、WMT14 De-En 翻译和 XSum 摘要上都表现很强:不用蒸馏、训练 token 预算少约 10 倍,却能以更少 sampling steps 获得比离散/连续 DLM baseline 更好的生成质量。

## 论文信息
| 项目 | 信息 |
|---|---|
| 标题 | ELF: Embedded Language Flows |
| 作者 | Keya Hu*, Linlu Qiu*, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He |
| 单位 | MIT |
| 备注 | *Equal contribution; order decided by a coin flip |
| arXiv | https://arxiv.org/abs/2605.10938 |
| PDF | https://arxiv.org/pdf/2605.10938 |
| DOI | https://doi.org/10.48550/arXiv.2605.10938 |
| 版本 | arXiv v1, 2026-05-11 提交;PDF 元数据日期为 2026-05-12 |
| 领域 | cs.CL, cs.AI, cs.LG |
| 代码 | https://github.com/lillian039/ELF |
| License | CC BY 4.0 |
## 这篇论文解决什么问题
语言是离散 token,但图像/视频扩散模型的很多成功技术都建立在连续空间和连续时间上。已有连续 DLM 往往在每个中间步骤就把状态投回 token 或用 token-level loss 约束,限制了连续 flow 的表达;latent diffusion 语言模型又常需要独立 decoder,推理系统更复杂。离散 DLM 虽然效果更强,但很难直接复用图像扩散中成熟的 CFG、ODE/SDE sampler 和 flow matching 技巧。
ELF 的核心判断是:连续 DLM 不是方向错了,而是连续-离散接口设计不够干净。它做了一个极简但关键的设计:**绝大多数时间都留在连续 embedding 空间,只有最后一步离散化**。具体包括:
- 用 frozen T5 encoder 把 token 转成 contextual clean embeddings `x`。
- 用 rectified flow 路径 `z_t = t x + (1-t) epsilon` 做 continuous-time Flow Matching。
- 模型采用 `x`-prediction,直接预测 clean embedding,而不是 velocity `v` 或 noise `epsilon`。
- 同一个 Transformer 同时承担 denoise mode 和 final decode mode,decode 时接 unembedding matrix `W` 输出 token logits。
- 由于状态是连续量,ELF 可以自然使用 self-conditioning CFG、training-time CFG、ODE/SDE sampler。
实验效果:ELF-B 只有 105M 参数,在 OWT 上用 32-step SDE sampler 达到 Gen. PPL 约 24,优于同设置下更大的 170M DLM baseline;同时它只用约 45.2B effective training tokens,而许多 baseline 约 524B 到 577B。
## 主图:系统级效果

Fig. 1 的信息是论文主张的压缩版:ELF 在 OWT 上比 MDLM、Duo、FLM、LangFlow 等 DLM 获得更低 generative perplexity,而且只需 32 steps;对比方法常用 1024 steps 或需要额外蒸馏。图中还强调 ELF 不用 distillation,并且训练 token 数约少 10 倍。
## 方法拆解
### 1. 概念轨迹:连续 embedding 到最终离散化

这张图说明 ELF 的生成路径:先从 Gaussian noise 出发,在连续 embedding 空间里沿 flow trajectory 去噪到 clean embedding 附近;只有最后 `t=1` 才把 embedding 通过共享网络和 unembedding 投到 discrete tokens。橙色点表示真实文本在 embedding 空间中的数据分布,紫色曲线表示从噪声到数据的连续去噪轨迹。
这个设计避免了两类问题:一是 per-step discretization 会让中间状态被 token 分类目标束缚;二是独立 decoder 会让系统变成 encoder/denoiser/decoder 三段式,推理时组件更多。
### 2. 训练与推理 pipeline

训练时,token 先被 T5 encoder 编码为 clean embeddings `x`,再与 Gaussian noise 插值得到 `z_t`。ELF 对大部分样本做 denoise mode,用 MSE 学 `x`-prediction;对最终离散化分支做 decode mode,用 token-wise CE 监督 unembedding 后的 logits。
推理时,从 `z_0 ~ N(0, I)` 开始,用 ODE 或 SDE sampler 迭代更新 embedding,到最后一步切换到 decode mode,一次性输出 token。关键点是 denoiser 和 decoder 共享 Transformer 权重,只通过 mode token 区分任务。
### 3. 为什么用 x-prediction
ELF 使用 clean embedding prediction,而不是标准 Flow Matching 中常见的 velocity prediction。原因有两个:
- 高维语言 embedding 可能位于低维流形上,直接预测 clean data 更稳定。
- final decode mode 本质也是从 corrupted/near-clean embedding 恢复 token,和 `x`-prediction 更对齐;如果用 `v`-prediction,denoise 与 decode 的共享权重关系会变差。
附录 prediction target 实验进一步验证:`x`-prediction 在 512/768/1024 维都稳定,`v`-prediction 在高维退化,`epsilon`-prediction 基本 collapse。
### 4. Self-conditioning 与 CFG
ELF 使用 self-conditioning:模型先给一个中间预测 `x_hat'`,再把它作为条件与 `z_t` 拼接输入。推理时可使用上一步预测作为 self-conditioning,因此不增加额外 forward。
由于 ELF 是连续 flow,CFG 可以像图像 diffusion 那样作用在 velocity/clean embedding 预测上。论文采用 training-time CFG,让模型单次 forward 直接建模 CFG 后的目标,从而避免推理时每步 conditional/unconditional 两次 forward。对无条件 OWT,condition 来自 self-conditioning;对条件生成,condition 还包括输入 prefix embeddings。
### 5. ODE 与 SDE sampler
ODE sampler 是确定性 flow integration;SDE-inspired sampler 在每步重新注入小噪声,并把时间略微往 noise regime 移动。论文发现 SDE 在少步采样时更好,可能是因为随机性可以修正早期去噪错误,而确定性 ODE 容易把错误一路放大。
## 主实验与图表解释
### Fig. 3: CFG 的质量-多样性权衡

横轴/纵轴展示 generative perplexity 与 unigram entropy 的 trade-off。CFG scale 增大时,Gen. PPL 下降,说明样本更像 GPT-2 Large 认为的自然文本;但 entropy 也下降,说明多样性减少。作者认为更理想的位置是低 perplexity、高 entropy,即图中的右下方向。后续很多消融都用扫 CFG scale 得到的 frontier 来比较。
### Fig. 4: 三个关键设计消融

Fig. 4a 比较 embedding choice。pretrained contextual embeddings 最好;从头训练的 contextual encoder 也不错但略差;非 contextual token embedding、Gaussian embedding 和 learnable embedding 更弱。这说明 ELF 依赖一个已有 encoder 提供语义结构良好的连续空间。
Fig. 4b 比较 decoding strategy。shared-weight denoiser-decoder 与 two-stage separate decoder 都可行,但 shared-weight 能延伸到更低 Gen. PPL 区域,而且省掉独立 decoder 训练和推理组件。
Fig. 4c 比较 ODE/SDE sampler 和步数。SDE-inspired sampler 在少步区间明显优于 ODE,用更少 steps 达到更低 perplexity,支持论文对 stochastic sampling 的设计。
### Fig. 5: 模型规模 scaling

ELF-B、ELF-M、ELF-L 从 105M 扩到 342M、652M 后,Gen. PPL-entropy frontier 持续改善:在相同 entropy 下,大模型 perplexity 更低;在相同 perplexity 下,大模型 entropy 更高。SDE 对不同规模都带来一致收益。这说明 ELF 不是只靠一个小模型配置调参,而是具备正常的 scaling trend。
### Fig. 6: OWT 系统级比较

Fig. 6a 比较未蒸馏的 discrete/continuous DLM:MDLM、Duo、FLM、LangFlow 等。ELF-B 在 32 steps 下达到 Gen. PPL 24 左右,参数更少但质量更好。
Fig. 6b 把 ELF 与蒸馏后的 few-step 方法比较,包括 MDLM+SDTT、Duo+DCD、FMLM。ELF 不做额外 distillation,少步区间仍能超过这些蒸馏模型。
Fig. 6c 比训练 token 预算。ELF 约 45.2B effective tokens;多个 baseline 约 524.3B,带蒸馏则到 550B/576B。作者据此强调 ELF 的数据效率,而不是只看最终 Gen. PPL。
### Table: 条件生成结果
| Model | Size | De-En BLEU ↑ | XSum R1 ↑ | XSum R2 ↑ | XSum R-L ↑ |
|---|---:|---:|---:|---:|---:|
| AR | 99M | 25.2 | 30.5 | 10.2 | 24.4 |
| MDLM | 99M | 18.4 | 33.4 | 11.6 | 25.8 |
| Duo | 170M (+35M) | 21.3 | 31.4 | 10.1 | 25.0 |
| E2D2 | 99M | 24.8 | 28.4 | 8.3 | 22.0 |
| SeqDiffuSeq | - | 21.3 | 19.3 | 1.7 | 14.1 |
| CDCD | - | 24.9 | - | - | - |
| ELF-B | 105M (+35M) | **26.4** | **36.0** | **12.2** | **27.8** |
解释:ELF 不只做无条件生成,也能扩展到 seq2seq。WMT14 De-En 上 BLEU 26.4,高于 AR 和 CDCD;XSum 上 R1/R2/R-L 全部最高。这里的 `+35M` 是 frozen T5-small encoder 的规模。说明连续 embedding flow 对条件任务也有效,且 CFG 对条件生成有帮助。
### Fig. 7: 定性样本

图中展示了 ELF-B 的无条件 OWT 样本、德英翻译样本和摘要样本,并附自动指标。作用是补充定量指标:ELF 能生成流畅、局部连贯并且大体遵循输入的文本。不过从 appendix 的更长样本看,ELF 仍会出现事实混乱、重复实体、语义漂移等语言模型常见问题,因此 qualitative evidence 只能作为辅助。
## 附录图表与补充实验
### 训练细节图

该图把训练 pipeline 展开:clean embeddings 先按 denoise/decode 两种 mode 采用不同 noise schedule;self-conditioning 把 `z_t` 与上一预测或零向量拼接;再 prepend time tokens、CFG scale tokens、mode tokens;最后同一模型输出 `x_hat`,并按 mode 用 MSE 或 CE 监督。这个图解释了 ELF 如何在一个 batch 内同时训练 denoising 和 final decoding。
### Prediction target 消融

该图比较 `x`、`v`、`epsilon` 三类预测目标在不同 embedding 维度下的表现。`x`-prediction 在所有维度都较稳;`v`-prediction 只在 512 维尚可,高维下 Gen. PPL 变差;`epsilon`-prediction 则容易低 entropy 或高 perplexity。它支撑了方法部分最关键的建模选择。
### Bottleneck 维度

ELF 默认把 T5 embedding 先投影到 128 维 bottleneck。消融显示 32 维可能牺牲多样性,512 维 perplexity 变差,而 128 维在质量和 entropy 间最平衡。这与“高维 clean data 在较低维流形上”的假设一致。
### Denoising/decode mode 比例

ELF 训练中 80% 样本走 denoise MSE,20% 走 decode CE。图中显示 denoising mode probability 太低会伤害生成质量,尤其是 SDE sampler 下更明显;0.8 是较好的平衡。含义是:最终解码重要,但连续 flow 的主体能力仍来自充分的 denoising 训练。
### Conditioning strategy 与 optimizer


conditioning 消融比较 in-context conditioning 和 adaLN-Zero。in-context conditioning 略好,并把 ELF-B 参数从 148M 降到 105M,因此作为默认。
optimizer 消融比较 Muon 与 AdamW。Muon 在相同训练步数下 loss 更低,推理时 Gen. PPL-entropy frontier 也更好,尤其配合 SDE sampler。不过作者也说明 AdamW 版本仍能超过 baseline,所以 ELF 的优势不完全来自 optimizer。
### Time schedule 与 SDE noise

Fig. a 说明 logit-normal time schedule 优于 uniform schedule,尤其在 few-step regime,因为它给高噪声区分配更细的时间步,并与训练时的时间采样更一致。Fig. b 说明 SDE 的 noise re-injection scale `gamma` 控制 perplexity-entropy trade-off:适度增大 gamma 可降低 Gen. PPL,但会略降 entropy。主实验默认 `gamma=1.0`,系统级 32-step 结果使用 `gamma=1.5`。
### 条件生成 CFG

这张图扫 WMT14 和 XSum 的 conditional CFG scale。scale 从 1 增到 2 时,BLEU/ROUGE 明显提升;继续增大则下降。说明条件任务需要更强约束来跟随输入,但过强 guidance 会伤害生成质量。主实验选择 input-condition CFG scale 2。
### Denoising trajectory

该图把不同 `t` 下的中间 embedding 解码成文本,展示从重复/不合语法的片段逐步变成流畅句子的过程。它是对连续去噪轨迹的定性验证:ELF 不是一步分类,而是在 embedding 空间中逐步修正语法和语义。
## 主要表格解释
### ELF 模型配置
| Model | Depth | Hidden size | Heads | Params | Training epochs |
|---|---:|---:|---:|---:|---:|
| ELF-B | 12 | 768 | 12 | 105M | 5 |
| ELF-M | 24 | 1056 | 16 | 342M | 4 |
| ELF-L | 32 | 1280 | 16 | 652M | 3 |
解释:主实验默认 ELF-B,scaling 实验扩到 M/L。注意参数量不含 frozen T5-small encoder 的 35M 时,条件生成表里会写 `105M (+35M)`。
### Scaling 数字表
| Sampler | SC CFG | ELF-B Gen. PPL / Entropy | ELF-M Gen. PPL / Entropy | ELF-L Gen. PPL / Entropy |
|---|---:|---:|---:|---:|
| SDE | 1.0 | 29.50 / 5.23 | 33.45 / 5.30 | 31.82 / 5.37 |
| SDE | 3.0 | 19.72 / 5.10 | 21.69 / 5.18 | 23.31 / 5.28 |
| ODE | 1.0 | 65.30 / 5.40 | 62.47 / 5.44 | 49.72 / 5.45 |
| ODE | 3.0 | 26.62 / 5.15 | 28.80 / 5.24 | 26.57 / 5.29 |
解释:完整表有更多 CFG scale。总体趋势是 SDE 明显优于 ODE;CFG scale 增大降低 Gen. PPL 但也降 entropy;大模型在保持 entropy 方面更好。表里部分 SDE 高 CFG 数字变灰,表示质量区域可能不稳定或不作为主要对比。
### 系统级多 seed 结果
| Steps | SC CFG | gamma | Gen. PPL ↓ | Entropy ↑ |
|---:|---:|---:|---:|---:|
| 8 | 3 | 2.0 | 67.32 ± 2.25 | 5.14 ± 0.085 |
| 16 | 3 | 2.0 | 33.66 ± 1.09 | 5.16 ± 0.026 |
| 32 | 3 | 1.5 | 24.08 ± 0.16 | 5.15 ± 0.002 |
解释:这是 Fig. 6 系统级结果的数值版本。ELF-B 在 32 steps 下稳定达到约 24 Gen. PPL,标准误很小;8 steps 仍明显偏弱,16 steps 已接近较强 few-step 区域。
### 训练 token 预算
| Method | Effective tokens | Ratio |
|---|---:|---:|
| MDLM | 524.3B | 11.6x |
| Duo | 524.3B | 11.6x |
| MDLM + SDTT | 550.5B | 12.2x |
| Duo + DCD | 550.5B | 12.2x |
| FLM | 524.3B | 11.6x |
| FMLM | 576.7B | 12.8x |
| LangFlow | 524.3B | 11.6x |
| ELF | **45.2B** | **1.0x** |
解释:这是本文很重要但容易被忽略的 claim。ELF 在更少训练数据预算下优于 baseline,因此优势不只是推理步数少,也包含训练效率高。需要注意这是 estimated effective tokens,baseline 数字来自论文按 batch、steps、sequence length 估算。
### 默认超参数
| 类别 | 默认设置 |
|---|---|
| Encoder | T5-small, frozen |
| Embedding / bottleneck | 512 -> 128 |
| Model | ELF-B, 105M, model dim 768 |
| Sequence length | 1024 |
| Denoiser/decoder prob | 0.8 / 0.2 |
| Self-conditioning prob | 0.5 |
| Optimizer | Muon |
| LR / batch | 0.002 / 512 |
| Epochs | 5 on OWT |
| Training device | TPU v5p x 64 |
解释:ELF 的效果依赖一组工程选择:Muon、logit-normal schedule、bottleneck 128、denoise/decode 0.8/0.2、self-conditioning 和 training-time CFG。论文做了较多消融来证明这些不是任意设置。
### 连续 DLM survey 表
这张大表把 continuous diffusion/flow language models 按 process、state、是否每步离散化、是否需要独立 decoder 等维度分类。ELF 的位置是:continuous-time Flow Matching、fixed pretrained encoder state、不做 train/inference per-step discretization、不需要 separate decoder。它突出 ELF 与 Diffusion-LM、CDCD、SeqDiffuSeq、LD4LG、FLM、LangFlow 等方法的结构差异。
## 总体评价
ELF 的贡献不是提出复杂的新理论,而是把 continuous flow 用在语言时,把“什么时候离散化”这个接口问题处理得很干净:中间全连续,最后一步离散;denoiser 和 decoder 共享权重;再自然接上 CFG 和 SDE sampler。这个设计的实验说服力较强,主文和 appendix 的消融也覆盖了 embedding、decoder、sampler、prediction target、bottleneck、optimizer、CFG 等关键选择。
我认为最值得关注的是两点。第一,它挑战了“语言扩散必须主要在离散 token 空间做”的经验判断,说明连续 embedding-space 方案仍有空间。第二,它把图像 diffusion 的成熟工具迁移到文本生成,比很多离散 DLM 更容易使用 CFG、flow sampler 和训练时 guidance。
局限也需要注意:无条件生成主要用 generative perplexity 和 entropy,仍不是完美文本质量指标;样本里还有事实和长程一致性问题;方法依赖 frozen T5 encoder、Muon、TPU 训练和较多工程超参数;与强 autoregressive LLM 的大规模比较还不是本文重点。整体看,ELF 是一篇设计简洁、实验扎实、很值得跟进的连续 diffusion LM 工作。
|