Ouzhang's picture
Add files using upload-large-folder tool
13c5606 verified
|
Raw
History Blame Contribute Delete
17.6 kB

ELF: Embedded Language Flows

论文笔记:当前强势的 diffusion language models 多在离散 token 空间工作,而早期连续 DLM 通常效果较弱。本文提出 **Embedded Language Flows (ELF)**:把文本 token 映射到连续 embedding 空间,用 continuous-time Flow Matching 主要在 embedding 空间中去噪,只在最后一步 t=1 用共享权重网络把 embedding 解码回离散 token。ELF 在 OpenWebText 无条件生成、WMT14 De-En 翻译和 XSum 摘要上都表现很强:不用蒸馏、训练 token 预算少约 10 倍,却能以更少 sampling steps 获得比离散/连续 DLM baseline 更好的生成质量。

GPT-generated ELF overview

论文信息

项目 信息
标题 ELF: Embedded Language Flows
作者 Keya Hu*, Linlu Qiu*, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He
单位 MIT
备注 *Equal contribution; order decided by a coin flip
arXiv https://arxiv.org/abs/2605.10938
PDF https://arxiv.org/pdf/2605.10938
DOI https://doi.org/10.48550/arXiv.2605.10938
版本 arXiv v1, 2026-05-11 提交;PDF 元数据日期为 2026-05-12
领域 cs.CL, cs.AI, cs.LG
代码 https://github.com/lillian039/ELF
License CC BY 4.0

这篇论文解决什么问题

语言是离散 token,但图像/视频扩散模型的很多成功技术都建立在连续空间和连续时间上。已有连续 DLM 往往在每个中间步骤就把状态投回 token 或用 token-level loss 约束,限制了连续 flow 的表达;latent diffusion 语言模型又常需要独立 decoder,推理系统更复杂。离散 DLM 虽然效果更强,但很难直接复用图像扩散中成熟的 CFG、ODE/SDE sampler 和 flow matching 技巧。

ELF 的核心判断是:连续 DLM 不是方向错了,而是连续-离散接口设计不够干净。它做了一个极简但关键的设计:绝大多数时间都留在连续 embedding 空间,只有最后一步离散化。具体包括:

  • 用 frozen T5 encoder 把 token 转成 contextual clean embeddings x
  • 用 rectified flow 路径 z_t = t x + (1-t) epsilon 做 continuous-time Flow Matching。
  • 模型采用 x-prediction,直接预测 clean embedding,而不是 velocity v 或 noise epsilon
  • 同一个 Transformer 同时承担 denoise mode 和 final decode mode,decode 时接 unembedding matrix W 输出 token logits。
  • 由于状态是连续量,ELF 可以自然使用 self-conditioning CFG、training-time CFG、ODE/SDE sampler。

实验效果:ELF-B 只有 105M 参数,在 OWT 上用 32-step SDE sampler 达到 Gen. PPL 约 24,优于同设置下更大的 170M DLM baseline;同时它只用约 45.2B effective training tokens,而许多 baseline 约 524B 到 577B。

主图:系统级效果

System teaser

Fig. 1 的信息是论文主张的压缩版:ELF 在 OWT 上比 MDLM、Duo、FLM、LangFlow 等 DLM 获得更低 generative perplexity,而且只需 32 steps;对比方法常用 1024 steps 或需要额外蒸馏。图中还强调 ELF 不用 distillation,并且训练 token 数约少 10 倍。

方法拆解

1. 概念轨迹:连续 embedding 到最终离散化

Conceptual trajectories

这张图说明 ELF 的生成路径:先从 Gaussian noise 出发,在连续 embedding 空间里沿 flow trajectory 去噪到 clean embedding 附近;只有最后 t=1 才把 embedding 通过共享网络和 unembedding 投到 discrete tokens。橙色点表示真实文本在 embedding 空间中的数据分布,紫色曲线表示从噪声到数据的连续去噪轨迹。

这个设计避免了两类问题:一是 per-step discretization 会让中间状态被 token 分类目标束缚;二是独立 decoder 会让系统变成 encoder/denoiser/decoder 三段式,推理时组件更多。

2. 训练与推理 pipeline

Training and inference pipeline

训练时,token 先被 T5 encoder 编码为 clean embeddings x,再与 Gaussian noise 插值得到 z_t。ELF 对大部分样本做 denoise mode,用 MSE 学 x-prediction;对最终离散化分支做 decode mode,用 token-wise CE 监督 unembedding 后的 logits。

推理时,从 z_0 ~ N(0, I) 开始,用 ODE 或 SDE sampler 迭代更新 embedding,到最后一步切换到 decode mode,一次性输出 token。关键点是 denoiser 和 decoder 共享 Transformer 权重,只通过 mode token 区分任务。

3. 为什么用 x-prediction

ELF 使用 clean embedding prediction,而不是标准 Flow Matching 中常见的 velocity prediction。原因有两个:

  • 高维语言 embedding 可能位于低维流形上,直接预测 clean data 更稳定。
  • final decode mode 本质也是从 corrupted/near-clean embedding 恢复 token,和 x-prediction 更对齐;如果用 v-prediction,denoise 与 decode 的共享权重关系会变差。

附录 prediction target 实验进一步验证:x-prediction 在 512/768/1024 维都稳定,v-prediction 在高维退化,epsilon-prediction 基本 collapse。

4. Self-conditioning 与 CFG

ELF 使用 self-conditioning:模型先给一个中间预测 x_hat',再把它作为条件与 z_t 拼接输入。推理时可使用上一步预测作为 self-conditioning,因此不增加额外 forward。

由于 ELF 是连续 flow,CFG 可以像图像 diffusion 那样作用在 velocity/clean embedding 预测上。论文采用 training-time CFG,让模型单次 forward 直接建模 CFG 后的目标,从而避免推理时每步 conditional/unconditional 两次 forward。对无条件 OWT,condition 来自 self-conditioning;对条件生成,condition 还包括输入 prefix embeddings。

5. ODE 与 SDE sampler

ODE sampler 是确定性 flow integration;SDE-inspired sampler 在每步重新注入小噪声,并把时间略微往 noise regime 移动。论文发现 SDE 在少步采样时更好,可能是因为随机性可以修正早期去噪错误,而确定性 ODE 容易把错误一路放大。

主实验与图表解释

Fig. 3: CFG 的质量-多样性权衡

CFG tradeoff

横轴/纵轴展示 generative perplexity 与 unigram entropy 的 trade-off。CFG scale 增大时,Gen. PPL 下降,说明样本更像 GPT-2 Large 认为的自然文本;但 entropy 也下降,说明多样性减少。作者认为更理想的位置是低 perplexity、高 entropy,即图中的右下方向。后续很多消融都用扫 CFG scale 得到的 frontier 来比较。

Fig. 4: 三个关键设计消融

Key design ablations

Fig. 4a 比较 embedding choice。pretrained contextual embeddings 最好;从头训练的 contextual encoder 也不错但略差;非 contextual token embedding、Gaussian embedding 和 learnable embedding 更弱。这说明 ELF 依赖一个已有 encoder 提供语义结构良好的连续空间。

Fig. 4b 比较 decoding strategy。shared-weight denoiser-decoder 与 two-stage separate decoder 都可行,但 shared-weight 能延伸到更低 Gen. PPL 区域,而且省掉独立 decoder 训练和推理组件。

Fig. 4c 比较 ODE/SDE sampler 和步数。SDE-inspired sampler 在少步区间明显优于 ODE,用更少 steps 达到更低 perplexity,支持论文对 stochastic sampling 的设计。

Fig. 5: 模型规模 scaling

Model scaling

ELF-B、ELF-M、ELF-L 从 105M 扩到 342M、652M 后,Gen. PPL-entropy frontier 持续改善:在相同 entropy 下,大模型 perplexity 更低;在相同 perplexity 下,大模型 entropy 更高。SDE 对不同规模都带来一致收益。这说明 ELF 不是只靠一个小模型配置调参,而是具备正常的 scaling trend。

Fig. 6: OWT 系统级比较

System level comparison

Fig. 6a 比较未蒸馏的 discrete/continuous DLM:MDLM、Duo、FLM、LangFlow 等。ELF-B 在 32 steps 下达到 Gen. PPL 24 左右,参数更少但质量更好。

Fig. 6b 把 ELF 与蒸馏后的 few-step 方法比较,包括 MDLM+SDTT、Duo+DCD、FMLM。ELF 不做额外 distillation,少步区间仍能超过这些蒸馏模型。

Fig. 6c 比训练 token 预算。ELF 约 45.2B effective tokens;多个 baseline 约 524.3B,带蒸馏则到 550B/576B。作者据此强调 ELF 的数据效率,而不是只看最终 Gen. PPL。

Table: 条件生成结果

Model Size De-En BLEU ↑ XSum R1 ↑ XSum R2 ↑ XSum R-L ↑
AR 99M 25.2 30.5 10.2 24.4
MDLM 99M 18.4 33.4 11.6 25.8
Duo 170M (+35M) 21.3 31.4 10.1 25.0
E2D2 99M 24.8 28.4 8.3 22.0
SeqDiffuSeq - 21.3 19.3 1.7 14.1
CDCD - 24.9 - - -
ELF-B 105M (+35M) 26.4 36.0 12.2 27.8

解释:ELF 不只做无条件生成,也能扩展到 seq2seq。WMT14 De-En 上 BLEU 26.4,高于 AR 和 CDCD;XSum 上 R1/R2/R-L 全部最高。这里的 +35M 是 frozen T5-small encoder 的规模。说明连续 embedding flow 对条件任务也有效,且 CFG 对条件生成有帮助。

Fig. 7: 定性样本

Qualitative examples

图中展示了 ELF-B 的无条件 OWT 样本、德英翻译样本和摘要样本,并附自动指标。作用是补充定量指标:ELF 能生成流畅、局部连贯并且大体遵循输入的文本。不过从 appendix 的更长样本看,ELF 仍会出现事实混乱、重复实体、语义漂移等语言模型常见问题,因此 qualitative evidence 只能作为辅助。

附录图表与补充实验

训练细节图

Training pipeline details

该图把训练 pipeline 展开:clean embeddings 先按 denoise/decode 两种 mode 采用不同 noise schedule;self-conditioning 把 z_t 与上一预测或零向量拼接;再 prepend time tokens、CFG scale tokens、mode tokens;最后同一模型输出 x_hat,并按 mode 用 MSE 或 CE 监督。这个图解释了 ELF 如何在一个 batch 内同时训练 denoising 和 final decoding。

Prediction target 消融

Prediction target

该图比较 xvepsilon 三类预测目标在不同 embedding 维度下的表现。x-prediction 在所有维度都较稳;v-prediction 只在 512 维尚可,高维下 Gen. PPL 变差;epsilon-prediction 则容易低 entropy 或高 perplexity。它支撑了方法部分最关键的建模选择。

Bottleneck 维度

Bottleneck dimension

ELF 默认把 T5 embedding 先投影到 128 维 bottleneck。消融显示 32 维可能牺牲多样性,512 维 perplexity 变差,而 128 维在质量和 entropy 间最平衡。这与“高维 clean data 在较低维流形上”的假设一致。

Denoising/decode mode 比例

Denoising mode probability

ELF 训练中 80% 样本走 denoise MSE,20% 走 decode CE。图中显示 denoising mode probability 太低会伤害生成质量,尤其是 SDE sampler 下更明显;0.8 是较好的平衡。含义是:最终解码重要,但连续 flow 的主体能力仍来自充分的 denoising 训练。

Conditioning strategy 与 optimizer

Conditioning strategy

Optimizer

conditioning 消融比较 in-context conditioning 和 adaLN-Zero。in-context conditioning 略好,并把 ELF-B 参数从 148M 降到 105M,因此作为默认。

optimizer 消融比较 Muon 与 AdamW。Muon 在相同训练步数下 loss 更低,推理时 Gen. PPL-entropy frontier 也更好,尤其配合 SDE sampler。不过作者也说明 AdamW 版本仍能超过 baseline,所以 ELF 的优势不完全来自 optimizer。

Time schedule 与 SDE noise

Time schedule and SDE noise

Fig. a 说明 logit-normal time schedule 优于 uniform schedule,尤其在 few-step regime,因为它给高噪声区分配更细的时间步,并与训练时的时间采样更一致。Fig. b 说明 SDE 的 noise re-injection scale gamma 控制 perplexity-entropy trade-off:适度增大 gamma 可降低 Gen. PPL,但会略降 entropy。主实验默认 gamma=1.0,系统级 32-step 结果使用 gamma=1.5

条件生成 CFG

Conditional CFG

这张图扫 WMT14 和 XSum 的 conditional CFG scale。scale 从 1 增到 2 时,BLEU/ROUGE 明显提升;继续增大则下降。说明条件任务需要更强约束来跟随输入,但过强 guidance 会伤害生成质量。主实验选择 input-condition CFG scale 2。

Denoising trajectory

Denoising trajectory

该图把不同 t 下的中间 embedding 解码成文本,展示从重复/不合语法的片段逐步变成流畅句子的过程。它是对连续去噪轨迹的定性验证:ELF 不是一步分类,而是在 embedding 空间中逐步修正语法和语义。

主要表格解释

ELF 模型配置

Model Depth Hidden size Heads Params Training epochs
ELF-B 12 768 12 105M 5
ELF-M 24 1056 16 342M 4
ELF-L 32 1280 16 652M 3

解释:主实验默认 ELF-B,scaling 实验扩到 M/L。注意参数量不含 frozen T5-small encoder 的 35M 时,条件生成表里会写 105M (+35M)

Scaling 数字表

Sampler SC CFG ELF-B Gen. PPL / Entropy ELF-M Gen. PPL / Entropy ELF-L Gen. PPL / Entropy
SDE 1.0 29.50 / 5.23 33.45 / 5.30 31.82 / 5.37
SDE 3.0 19.72 / 5.10 21.69 / 5.18 23.31 / 5.28
ODE 1.0 65.30 / 5.40 62.47 / 5.44 49.72 / 5.45
ODE 3.0 26.62 / 5.15 28.80 / 5.24 26.57 / 5.29

解释:完整表有更多 CFG scale。总体趋势是 SDE 明显优于 ODE;CFG scale 增大降低 Gen. PPL 但也降 entropy;大模型在保持 entropy 方面更好。表里部分 SDE 高 CFG 数字变灰,表示质量区域可能不稳定或不作为主要对比。

系统级多 seed 结果

Steps SC CFG gamma Gen. PPL ↓ Entropy ↑
8 3 2.0 67.32 ± 2.25 5.14 ± 0.085
16 3 2.0 33.66 ± 1.09 5.16 ± 0.026
32 3 1.5 24.08 ± 0.16 5.15 ± 0.002

解释:这是 Fig. 6 系统级结果的数值版本。ELF-B 在 32 steps 下稳定达到约 24 Gen. PPL,标准误很小;8 steps 仍明显偏弱,16 steps 已接近较强 few-step 区域。

训练 token 预算

Method Effective tokens Ratio
MDLM 524.3B 11.6x
Duo 524.3B 11.6x
MDLM + SDTT 550.5B 12.2x
Duo + DCD 550.5B 12.2x
FLM 524.3B 11.6x
FMLM 576.7B 12.8x
LangFlow 524.3B 11.6x
ELF 45.2B 1.0x

解释:这是本文很重要但容易被忽略的 claim。ELF 在更少训练数据预算下优于 baseline,因此优势不只是推理步数少,也包含训练效率高。需要注意这是 estimated effective tokens,baseline 数字来自论文按 batch、steps、sequence length 估算。

默认超参数

类别 默认设置
Encoder T5-small, frozen
Embedding / bottleneck 512 -> 128
Model ELF-B, 105M, model dim 768
Sequence length 1024
Denoiser/decoder prob 0.8 / 0.2
Self-conditioning prob 0.5
Optimizer Muon
LR / batch 0.002 / 512
Epochs 5 on OWT
Training device TPU v5p x 64

解释:ELF 的效果依赖一组工程选择:Muon、logit-normal schedule、bottleneck 128、denoise/decode 0.8/0.2、self-conditioning 和 training-time CFG。论文做了较多消融来证明这些不是任意设置。

连续 DLM survey 表

这张大表把 continuous diffusion/flow language models 按 process、state、是否每步离散化、是否需要独立 decoder 等维度分类。ELF 的位置是:continuous-time Flow Matching、fixed pretrained encoder state、不做 train/inference per-step discretization、不需要 separate decoder。它突出 ELF 与 Diffusion-LM、CDCD、SeqDiffuSeq、LD4LG、FLM、LangFlow 等方法的结构差异。

总体评价

ELF 的贡献不是提出复杂的新理论,而是把 continuous flow 用在语言时,把“什么时候离散化”这个接口问题处理得很干净:中间全连续,最后一步离散;denoiser 和 decoder 共享权重;再自然接上 CFG 和 SDE sampler。这个设计的实验说服力较强,主文和 appendix 的消融也覆盖了 embedding、decoder、sampler、prediction target、bottleneck、optimizer、CFG 等关键选择。

我认为最值得关注的是两点。第一,它挑战了“语言扩散必须主要在离散 token 空间做”的经验判断,说明连续 embedding-space 方案仍有空间。第二,它把图像 diffusion 的成熟工具迁移到文本生成,比很多离散 DLM 更容易使用 CFG、flow sampler 和训练时 guidance。

局限也需要注意:无条件生成主要用 generative perplexity 和 entropy,仍不是完美文本质量指标;样本里还有事实和长程一致性问题;方法依赖 frozen T5 encoder、Muon、TPU 训练和较多工程超参数;与强 autoregressive LLM 的大规模比较还不是本文重点。整体看,ELF 是一篇设计简洁、实验扎实、很值得跟进的连续 diffusion LM 工作。