跳转到主内容
极星编程网:以代码为星,赴技术山海!

ELF— 何恺明团队推出的首个扩散语言模型

elf(embedded language flows)是何恺明团队推出的首个基于连续扩散范式的语言模型,摒弃传统自回归生成路径,全程在连续 embedding 空间中执行去噪操作,并仅在最终时间步通过可学习的 unembedding 层离散化为 token。该模型以 105m 参数规模、45b 训练 token 和 32 步采样,在 openwebtext 上达成 24 的生成困惑度,仅用约十分之一的训练数据即超越主流离散扩散语言模型,在无条件生成、机器翻译与文本摘要等任务中均展现出显著性能优势。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜ELF的主要功能连续空间文本生成:整个生成过程在连续 embedding 域内完成去噪,不引入中间离散状态;最终一步通过统一 unembedding 矩阵将隐状态映射为 token logits。

无条件语言生成:从标准高斯噪声出发,经 32 次迭代即可生成连贯、低困惑度、类人风格文本,AI 特征弱、自然度高。

条件文本生成能力:支持 WMT14 英德翻译、XSum 新闻摘要等典型条件任务,在未蒸馏前提下性能优于现有扩散模型及部分自回归基线。

训练与推理一体化架构:去噪网络与解码逻辑共享全部参数,通过二值 mode token(如“0”=去噪、“1”=解码)动态切换功能,无需额外 decoder 或独立后处理模块。

ELF的技术原理上下文感知的连续编码:输入文本经冻结的 T5 编码器转换为双向 contextual embedding,仅用于训练阶段特征初始化,推理时完全移除,不增加部署开销。

Rectified Flow + x-prediction 范式:定义从噪声到目标 embedding 的平滑 rectified flow 轨迹;网络直接回归干净 embedding(x-prediction),而非速度场或噪声项,提升高维空间训练稳定性,优化目标为 MSE 损失。

终步离散化与抗过简机制:最后一步使用可学习 unembedding 矩阵输出 token logits;训练中引入 token-level 随机 corruption(如 masking 或替换),防止模型绕过去噪过程直接“抄答案”,联合交叉熵损失监督离散重建质量。

训练时 Classifier-Free Guidance(CFG)

:借鉴图像扩散中的 CFG 设计,在训练阶段注入条件信号(如语言对标识、摘要指令),推理时无需额外分类器或引导权重,零开销实现强条件控制。

如何使用ELF获取源码:前往 GitHub 克隆官方项目仓库。

环境配置:安装 PyTorch 及相关依赖,确保 CUDA 兼容 GPU 环境可用。

数据准备:利用预置脚本将原始文本经 T5 编码器批量转为 continuous embedding 格式,缓存为高效读取格式(如 memmap 或 HDF5)。

模型训练:采用 Flow Matching 目标函数优化去噪网络,支持 MSE(主损失)与 CE(终步监督)联合训练,可灵活启用 CFG 或 corruption 策略。

文本生成:启动噪声采样流程,调用同一网络执行 32 步去噪;第 32 步自动切换至解码模式,输出最终 token 序列。

下游任务适配:在 WMT14、XSum 等数据集上加载预训练权重,添加轻量级条件嵌入层并微调,快速适配翻译、摘要等场景。

ELF的核心优势极高的数据利用效率:仅需 45B token 即达 SOTA 水平,相较 MDLM(500B+)、Duo(~600B)、FLM(>1T)等模型减少一个数量级训练数据需求。

超快采样速度:32 步即可匹配甚至超越竞品 1024 步的生成质量,大幅降低延迟与算力消耗。

更强的生成保真度:OpenWebText 困惑度低至 24,文本流畅性、一致性与人类写作风格高度接近,AI 痕迹显著弱于同类扩散模型。

极简统一架构:去噪与解码共用网络参数,无额外 decoder、no latent diffusion error accumulation,训练更稳定、部署更轻量。

ELF的项目地址GitHub仓库:https://www.php.cn/link/82fe1347d0cd0194a7bc3c4c48a8d7fa arXiv技术论文:https://www.php.cn/link/4504e2077bf88a89fd9cbfb06a015786 ELF的同类竞品对比对比维度ELFMDLMLLaDA**技术路线**连续扩散(embedding空间全程去噪,最后一步离散化)离散扩散(直接在token空间操作,每步维护离散状态)离散扩散(基于BERT架构的掩码扩散语言模型)**参数规模****105M**350M / 1.3B**8B****训练数据****45B token**(少一个数量级)500B+ token数万亿 token**采样步数****32步**1024步(标准)/ 64步(需蒸馏)64~128步**生成困惑度****24**(OpenWebText,32步无蒸馏)~35(1024步)/ ~60(32步无蒸馏)~30(128步)**架构设计**去噪与解码共享同一网络,无额外模块每步在词表空间做离散状态转移基于掩码预测的Transformer,每步预测被掩码token**核心优势**数据效率极高、采样极快、架构最简与语言离散性天然契合,理论直观大规模参数带来强表达能力,可扩展性好**主要劣势**依赖预训练encoder提供embedding训练数据需求大、采样步数多、生成质量对步数敏感推理成本高、需要大量训练数据、推理步数仍较多ELF的应用场景低资源场景下的高效文本生成:适用于训练数据受限的中小机构或学术团队,以极低成本快速构建高质量 NLG 能力。

非自回归机器翻译系统:在 WMT14 等基准上表现优异,可作为低延迟、高吞吐翻译服务的核心引擎。

新闻摘要与文档精炼:在 XSum 等长文本摘要任务中保持关键信息完整性与语言凝练性,适配政务、金融、媒体等垂直领域。

创意内容生产与智能对话:凭借低困惑度与强自然度,支撑小说续写、广告文案生成、客服对话模拟等对语义连贯性要求严苛的任务。

扩散语言建模研究基础设施:作为首个完整验证“连续到底”路线可行性的模型,为后续大模型架构创新、跨模态扩散统一框架提供关键范式与开源基线。

相关文章