Ouzhang's picture
Add files using upload-large-folder tool
13c5606 verified
|
Raw
History Blame Contribute Delete
17.6 kB
# ELF: Embedded Language Flows
> 论文笔记:当前强势的 diffusion language models 多在离散 token 空间工作,而早期连续 DLM 通常效果较弱。本文提出 **Embedded Language Flows (ELF)**:把文本 token 映射到连续 embedding 空间,用 continuous-time Flow Matching 主要在 embedding 空间中去噪,只在最后一步 `t=1` 用共享权重网络把 embedding 解码回离散 token。ELF 在 OpenWebText 无条件生成、WMT14 De-En 翻译和 XSum 摘要上都表现很强:不用蒸馏、训练 token 预算少约 10 倍,却能以更少 sampling steps 获得比离散/连续 DLM baseline 更好的生成质量。
![GPT-generated ELF overview](assets/elf-overview-gpt.png)
## 论文信息
| 项目 | 信息 |
|---|---|
| 标题 | ELF: Embedded Language Flows |
| 作者 | Keya Hu*, Linlu Qiu*, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He |
| 单位 | MIT |
| 备注 | *Equal contribution; order decided by a coin flip |
| arXiv | https://arxiv.org/abs/2605.10938 |
| PDF | https://arxiv.org/pdf/2605.10938 |
| DOI | https://doi.org/10.48550/arXiv.2605.10938 |
| 版本 | arXiv v1, 2026-05-11 提交;PDF 元数据日期为 2026-05-12 |
| 领域 | cs.CL, cs.AI, cs.LG |
| 代码 | https://github.com/lillian039/ELF |
| License | CC BY 4.0 |
## 这篇论文解决什么问题
语言是离散 token,但图像/视频扩散模型的很多成功技术都建立在连续空间和连续时间上。已有连续 DLM 往往在每个中间步骤就把状态投回 token 或用 token-level loss 约束,限制了连续 flow 的表达;latent diffusion 语言模型又常需要独立 decoder,推理系统更复杂。离散 DLM 虽然效果更强,但很难直接复用图像扩散中成熟的 CFG、ODE/SDE sampler 和 flow matching 技巧。
ELF 的核心判断是:连续 DLM 不是方向错了,而是连续-离散接口设计不够干净。它做了一个极简但关键的设计:**绝大多数时间都留在连续 embedding 空间,只有最后一步离散化**。具体包括:
- 用 frozen T5 encoder 把 token 转成 contextual clean embeddings `x`。
- 用 rectified flow 路径 `z_t = t x + (1-t) epsilon` 做 continuous-time Flow Matching。
- 模型采用 `x`-prediction,直接预测 clean embedding,而不是 velocity `v` 或 noise `epsilon`。
- 同一个 Transformer 同时承担 denoise mode 和 final decode mode,decode 时接 unembedding matrix `W` 输出 token logits。
- 由于状态是连续量,ELF 可以自然使用 self-conditioning CFG、training-time CFG、ODE/SDE sampler。
实验效果:ELF-B 只有 105M 参数,在 OWT 上用 32-step SDE sampler 达到 Gen. PPL 约 24,优于同设置下更大的 170M DLM baseline;同时它只用约 45.2B effective training tokens,而许多 baseline 约 524B 到 577B。
## 主图:系统级效果
![System teaser](assets/system_teaser.png)
Fig. 1 的信息是论文主张的压缩版:ELF 在 OWT 上比 MDLM、Duo、FLM、LangFlow 等 DLM 获得更低 generative perplexity,而且只需 32 steps;对比方法常用 1024 steps 或需要额外蒸馏。图中还强调 ELF 不用 distillation,并且训练 token 数约少 10 倍。
## 方法拆解
### 1. 概念轨迹:连续 embedding 到最终离散化
![Conceptual trajectories](assets/conceptual_trajectories.png)
这张图说明 ELF 的生成路径:先从 Gaussian noise 出发,在连续 embedding 空间里沿 flow trajectory 去噪到 clean embedding 附近;只有最后 `t=1` 才把 embedding 通过共享网络和 unembedding 投到 discrete tokens。橙色点表示真实文本在 embedding 空间中的数据分布,紫色曲线表示从噪声到数据的连续去噪轨迹。
这个设计避免了两类问题:一是 per-step discretization 会让中间状态被 token 分类目标束缚;二是独立 decoder 会让系统变成 encoder/denoiser/decoder 三段式,推理时组件更多。
### 2. 训练与推理 pipeline
![Training and inference pipeline](assets/training_inference_pipeline.png)
训练时,token 先被 T5 encoder 编码为 clean embeddings `x`,再与 Gaussian noise 插值得到 `z_t`。ELF 对大部分样本做 denoise mode,用 MSE 学 `x`-prediction;对最终离散化分支做 decode mode,用 token-wise CE 监督 unembedding 后的 logits。
推理时,从 `z_0 ~ N(0, I)` 开始,用 ODE 或 SDE sampler 迭代更新 embedding,到最后一步切换到 decode mode,一次性输出 token。关键点是 denoiser 和 decoder 共享 Transformer 权重,只通过 mode token 区分任务。
### 3. 为什么用 x-prediction
ELF 使用 clean embedding prediction,而不是标准 Flow Matching 中常见的 velocity prediction。原因有两个:
- 高维语言 embedding 可能位于低维流形上,直接预测 clean data 更稳定。
- final decode mode 本质也是从 corrupted/near-clean embedding 恢复 token,和 `x`-prediction 更对齐;如果用 `v`-prediction,denoise 与 decode 的共享权重关系会变差。
附录 prediction target 实验进一步验证:`x`-prediction 在 512/768/1024 维都稳定,`v`-prediction 在高维退化,`epsilon`-prediction 基本 collapse。
### 4. Self-conditioning 与 CFG
ELF 使用 self-conditioning:模型先给一个中间预测 `x_hat'`,再把它作为条件与 `z_t` 拼接输入。推理时可使用上一步预测作为 self-conditioning,因此不增加额外 forward。
由于 ELF 是连续 flow,CFG 可以像图像 diffusion 那样作用在 velocity/clean embedding 预测上。论文采用 training-time CFG,让模型单次 forward 直接建模 CFG 后的目标,从而避免推理时每步 conditional/unconditional 两次 forward。对无条件 OWT,condition 来自 self-conditioning;对条件生成,condition 还包括输入 prefix embeddings。
### 5. ODE 与 SDE sampler
ODE sampler 是确定性 flow integration;SDE-inspired sampler 在每步重新注入小噪声,并把时间略微往 noise regime 移动。论文发现 SDE 在少步采样时更好,可能是因为随机性可以修正早期去噪错误,而确定性 ODE 容易把错误一路放大。
## 主实验与图表解释
### Fig. 3: CFG 的质量-多样性权衡
![CFG tradeoff](assets/cfg_perplexity_entropy_tradeoff.png)
横轴/纵轴展示 generative perplexity 与 unigram entropy 的 trade-off。CFG scale 增大时,Gen. PPL 下降,说明样本更像 GPT-2 Large 认为的自然文本;但 entropy 也下降,说明多样性减少。作者认为更理想的位置是低 perplexity、高 entropy,即图中的右下方向。后续很多消融都用扫 CFG scale 得到的 frontier 来比较。
### Fig. 4: 三个关键设计消融
![Key design ablations](assets/key_design.png)
Fig. 4a 比较 embedding choice。pretrained contextual embeddings 最好;从头训练的 contextual encoder 也不错但略差;非 contextual token embedding、Gaussian embedding 和 learnable embedding 更弱。这说明 ELF 依赖一个已有 encoder 提供语义结构良好的连续空间。
Fig. 4b 比较 decoding strategy。shared-weight denoiser-decoder 与 two-stage separate decoder 都可行,但 shared-weight 能延伸到更低 Gen. PPL 区域,而且省掉独立 decoder 训练和推理组件。
Fig. 4c 比较 ODE/SDE sampler 和步数。SDE-inspired sampler 在少步区间明显优于 ODE,用更少 steps 达到更低 perplexity,支持论文对 stochastic sampling 的设计。
### Fig. 5: 模型规模 scaling
![Model scaling](assets/model_scaling.png)
ELF-B、ELF-M、ELF-L 从 105M 扩到 342M、652M 后,Gen. PPL-entropy frontier 持续改善:在相同 entropy 下,大模型 perplexity 更低;在相同 perplexity 下,大模型 entropy 更高。SDE 对不同规模都带来一致收益。这说明 ELF 不是只靠一个小模型配置调参,而是具备正常的 scaling trend。
### Fig. 6: OWT 系统级比较
![System level comparison](assets/system_level_comparison.png)
Fig. 6a 比较未蒸馏的 discrete/continuous DLM:MDLM、Duo、FLM、LangFlow 等。ELF-B 在 32 steps 下达到 Gen. PPL 24 左右,参数更少但质量更好。
Fig. 6b 把 ELF 与蒸馏后的 few-step 方法比较,包括 MDLM+SDTT、Duo+DCD、FMLM。ELF 不做额外 distillation,少步区间仍能超过这些蒸馏模型。
Fig. 6c 比训练 token 预算。ELF 约 45.2B effective tokens;多个 baseline 约 524.3B,带蒸馏则到 550B/576B。作者据此强调 ELF 的数据效率,而不是只看最终 Gen. PPL。
### Table: 条件生成结果
| Model | Size | De-En BLEU ↑ | XSum R1 ↑ | XSum R2 ↑ | XSum R-L ↑ |
|---|---:|---:|---:|---:|---:|
| AR | 99M | 25.2 | 30.5 | 10.2 | 24.4 |
| MDLM | 99M | 18.4 | 33.4 | 11.6 | 25.8 |
| Duo | 170M (+35M) | 21.3 | 31.4 | 10.1 | 25.0 |
| E2D2 | 99M | 24.8 | 28.4 | 8.3 | 22.0 |
| SeqDiffuSeq | - | 21.3 | 19.3 | 1.7 | 14.1 |
| CDCD | - | 24.9 | - | - | - |
| ELF-B | 105M (+35M) | **26.4** | **36.0** | **12.2** | **27.8** |
解释:ELF 不只做无条件生成,也能扩展到 seq2seq。WMT14 De-En 上 BLEU 26.4,高于 AR 和 CDCD;XSum 上 R1/R2/R-L 全部最高。这里的 `+35M` 是 frozen T5-small encoder 的规模。说明连续 embedding flow 对条件任务也有效,且 CFG 对条件生成有帮助。
### Fig. 7: 定性样本
![Qualitative examples](assets/qualitative_generation_examples.png)
图中展示了 ELF-B 的无条件 OWT 样本、德英翻译样本和摘要样本,并附自动指标。作用是补充定量指标:ELF 能生成流畅、局部连贯并且大体遵循输入的文本。不过从 appendix 的更长样本看,ELF 仍会出现事实混乱、重复实体、语义漂移等语言模型常见问题,因此 qualitative evidence 只能作为辅助。
## 附录图表与补充实验
### 训练细节图
![Training pipeline details](assets/training_pipeline_details.png)
该图把训练 pipeline 展开:clean embeddings 先按 denoise/decode 两种 mode 采用不同 noise schedule;self-conditioning 把 `z_t` 与上一预测或零向量拼接;再 prepend time tokens、CFG scale tokens、mode tokens;最后同一模型输出 `x_hat`,并按 mode 用 MSE 或 CE 监督。这个图解释了 ELF 如何在一个 batch 内同时训练 denoising 和 final decoding。
### Prediction target 消融
![Prediction target](assets/prediction_target.png)
该图比较 `x`、`v`、`epsilon` 三类预测目标在不同 embedding 维度下的表现。`x`-prediction 在所有维度都较稳;`v`-prediction 只在 512 维尚可,高维下 Gen. PPL 变差;`epsilon`-prediction 则容易低 entropy 或高 perplexity。它支撑了方法部分最关键的建模选择。
### Bottleneck 维度
![Bottleneck dimension](assets/bottleneck_dimension.png)
ELF 默认把 T5 embedding 先投影到 128 维 bottleneck。消融显示 32 维可能牺牲多样性,512 维 perplexity 变差,而 128 维在质量和 entropy 间最平衡。这与“高维 clean data 在较低维流形上”的假设一致。
### Denoising/decode mode 比例
![Denoising mode probability](assets/denoising_mode_probability.png)
ELF 训练中 80% 样本走 denoise MSE,20% 走 decode CE。图中显示 denoising mode probability 太低会伤害生成质量,尤其是 SDE sampler 下更明显;0.8 是较好的平衡。含义是:最终解码重要,但连续 flow 的主体能力仍来自充分的 denoising 训练。
### Conditioning strategy 与 optimizer
![Conditioning strategy](assets/conditioning_strategy.png)
![Optimizer](assets/optimizer.png)
conditioning 消融比较 in-context conditioning 和 adaLN-Zero。in-context conditioning 略好,并把 ELF-B 参数从 148M 降到 105M,因此作为默认。
optimizer 消融比较 Muon 与 AdamW。Muon 在相同训练步数下 loss 更低,推理时 Gen. PPL-entropy frontier 也更好,尤其配合 SDE sampler。不过作者也说明 AdamW 版本仍能超过 baseline,所以 ELF 的优势不完全来自 optimizer。
### Time schedule 与 SDE noise
![Time schedule and SDE noise](assets/time_schedule_sde_noise.png)
Fig. a 说明 logit-normal time schedule 优于 uniform schedule,尤其在 few-step regime,因为它给高噪声区分配更细的时间步,并与训练时的时间采样更一致。Fig. b 说明 SDE 的 noise re-injection scale `gamma` 控制 perplexity-entropy trade-off:适度增大 gamma 可降低 Gen. PPL,但会略降 entropy。主实验默认 `gamma=1.0`,系统级 32-step 结果使用 `gamma=1.5`。
### 条件生成 CFG
![Conditional CFG](assets/conditional_cfg.png)
这张图扫 WMT14 和 XSum 的 conditional CFG scale。scale 从 1 增到 2 时,BLEU/ROUGE 明显提升;继续增大则下降。说明条件任务需要更强约束来跟随输入,但过强 guidance 会伤害生成质量。主实验选择 input-condition CFG scale 2。
### Denoising trajectory
![Denoising trajectory](assets/denoising_trajectory.png)
该图把不同 `t` 下的中间 embedding 解码成文本,展示从重复/不合语法的片段逐步变成流畅句子的过程。它是对连续去噪轨迹的定性验证:ELF 不是一步分类,而是在 embedding 空间中逐步修正语法和语义。
## 主要表格解释
### ELF 模型配置
| Model | Depth | Hidden size | Heads | Params | Training epochs |
|---|---:|---:|---:|---:|---:|
| ELF-B | 12 | 768 | 12 | 105M | 5 |
| ELF-M | 24 | 1056 | 16 | 342M | 4 |
| ELF-L | 32 | 1280 | 16 | 652M | 3 |
解释:主实验默认 ELF-B,scaling 实验扩到 M/L。注意参数量不含 frozen T5-small encoder 的 35M 时,条件生成表里会写 `105M (+35M)`。
### Scaling 数字表
| Sampler | SC CFG | ELF-B Gen. PPL / Entropy | ELF-M Gen. PPL / Entropy | ELF-L Gen. PPL / Entropy |
|---|---:|---:|---:|---:|
| SDE | 1.0 | 29.50 / 5.23 | 33.45 / 5.30 | 31.82 / 5.37 |
| SDE | 3.0 | 19.72 / 5.10 | 21.69 / 5.18 | 23.31 / 5.28 |
| ODE | 1.0 | 65.30 / 5.40 | 62.47 / 5.44 | 49.72 / 5.45 |
| ODE | 3.0 | 26.62 / 5.15 | 28.80 / 5.24 | 26.57 / 5.29 |
解释:完整表有更多 CFG scale。总体趋势是 SDE 明显优于 ODE;CFG scale 增大降低 Gen. PPL 但也降 entropy;大模型在保持 entropy 方面更好。表里部分 SDE 高 CFG 数字变灰,表示质量区域可能不稳定或不作为主要对比。
### 系统级多 seed 结果
| Steps | SC CFG | gamma | Gen. PPL ↓ | Entropy ↑ |
|---:|---:|---:|---:|---:|
| 8 | 3 | 2.0 | 67.32 ± 2.25 | 5.14 ± 0.085 |
| 16 | 3 | 2.0 | 33.66 ± 1.09 | 5.16 ± 0.026 |
| 32 | 3 | 1.5 | 24.08 ± 0.16 | 5.15 ± 0.002 |
解释:这是 Fig. 6 系统级结果的数值版本。ELF-B 在 32 steps 下稳定达到约 24 Gen. PPL,标准误很小;8 steps 仍明显偏弱,16 steps 已接近较强 few-step 区域。
### 训练 token 预算
| Method | Effective tokens | Ratio |
|---|---:|---:|
| MDLM | 524.3B | 11.6x |
| Duo | 524.3B | 11.6x |
| MDLM + SDTT | 550.5B | 12.2x |
| Duo + DCD | 550.5B | 12.2x |
| FLM | 524.3B | 11.6x |
| FMLM | 576.7B | 12.8x |
| LangFlow | 524.3B | 11.6x |
| ELF | **45.2B** | **1.0x** |
解释:这是本文很重要但容易被忽略的 claim。ELF 在更少训练数据预算下优于 baseline,因此优势不只是推理步数少,也包含训练效率高。需要注意这是 estimated effective tokens,baseline 数字来自论文按 batch、steps、sequence length 估算。
### 默认超参数
| 类别 | 默认设置 |
|---|---|
| Encoder | T5-small, frozen |
| Embedding / bottleneck | 512 -> 128 |
| Model | ELF-B, 105M, model dim 768 |
| Sequence length | 1024 |
| Denoiser/decoder prob | 0.8 / 0.2 |
| Self-conditioning prob | 0.5 |
| Optimizer | Muon |
| LR / batch | 0.002 / 512 |
| Epochs | 5 on OWT |
| Training device | TPU v5p x 64 |
解释:ELF 的效果依赖一组工程选择:Muon、logit-normal schedule、bottleneck 128、denoise/decode 0.8/0.2、self-conditioning 和 training-time CFG。论文做了较多消融来证明这些不是任意设置。
### 连续 DLM survey 表
这张大表把 continuous diffusion/flow language models 按 process、state、是否每步离散化、是否需要独立 decoder 等维度分类。ELF 的位置是:continuous-time Flow Matching、fixed pretrained encoder state、不做 train/inference per-step discretization、不需要 separate decoder。它突出 ELF 与 Diffusion-LM、CDCD、SeqDiffuSeq、LD4LG、FLM、LangFlow 等方法的结构差异。
## 总体评价
ELF 的贡献不是提出复杂的新理论,而是把 continuous flow 用在语言时,把“什么时候离散化”这个接口问题处理得很干净:中间全连续,最后一步离散;denoiser 和 decoder 共享权重;再自然接上 CFG 和 SDE sampler。这个设计的实验说服力较强,主文和 appendix 的消融也覆盖了 embedding、decoder、sampler、prediction target、bottleneck、optimizer、CFG 等关键选择。
我认为最值得关注的是两点。第一,它挑战了“语言扩散必须主要在离散 token 空间做”的经验判断,说明连续 embedding-space 方案仍有空间。第二,它把图像 diffusion 的成熟工具迁移到文本生成,比很多离散 DLM 更容易使用 CFG、flow sampler 和训练时 guidance。
局限也需要注意:无条件生成主要用 generative perplexity 和 entropy,仍不是完美文本质量指标;样本里还有事实和长程一致性问题;方法依赖 frozen T5 encoder、Muon、TPU 训练和较多工程超参数;与强 autoregressive LLM 的大规模比较还不是本文重点。整体看,ELF 是一篇设计简洁、实验扎实、很值得跟进的连续 diffusion LM 工作。