dLLM:复用自回归模型权重快速训练扩散语言模型

简介: dLLM是一个开源Python框架,统一了扩散语言模型的训练、微调、推理与评估流程。它支持将任意自回归大模型(如LLaMA、BERT)转化为扩散模型,提供LoRA、4-bit量化等高效训练能力,并兼容Hugging Face生态。通过Masked Diffusion、Edit Flows等方法,实现文本全局优化生成与编辑,在复杂推理、结构化输出等任务中表现优异,推动扩散语言模型迈向实用化。

大语言模型的文本生成方式一直都是以自回归为主:一个token接一个token,从左往右,生成完就定了。

但现在有个不太一样的思路开始在研究圈里流行起来,那就是扩散语言模型(Diffusion LMs)。扩散模型在图像生成领域已经证明了自己的可行性,但是问题是把这套东西用到文本上一直很麻烦——训练难、评估难、更别提怎么集成到现有的LLM工作流里了。


dLLM是一个开源的Python库,它把扩散语言模型的训练、微调、推理、评估这一整套流程都统一了起来,而且号称任何的自回归LLM都能通过dLLM转成扩散模型

扩散模型用在语言上有什么不同

做过图像扩散模型的应该能理解这个思路。

传统自回归是顺序生成,扩散模型的玩法不一样:先从噪声或者masked tokens开始,然后一步步把整个序列细化出来。它不是一个token一个token往后走,而是对整个输出做全局优化。

扩散模型在几个场景下表现特别好:需要复杂推理的任务、文本编辑重写、结构化生成,还有需要多轮迭代优化的场景。

dLLM提供了什么

dLLM不是某个具体模型它是个框架,包括了下面的功能:

统一的训练流程

底层用的是Hugging Face的

Trainer

,所以常见的那些东西都支持:LoRA微调、DeepSpeed、FSDP、多节点Slurm集群、4-bit量化。

训练扩散模型和训练transformer没什么区别用的都是同一套工具链。

统一的评估体系

评估部分基于

lm-evaluation-harness

搭建,好处是不同benchmark用同一套接口,不需要针对每个模型写推理代码,结果也能复现。

把AR模型转成扩散模型

这是dLLM最核心的功能,LLaMA系列模型、instruction-tuned的LLM,甚至BERT这种encoder,都能拿来微调成扩散模型。而且支持的方法包括:Masked Diffusion(MDLM)、Block Diffusion(BD3LM)和Edit Flows。

支持的模型和训练方式

dLLM自带了几个参考实现:LLaDA/LLaDA-MoE、Dream、BERT-Chat、Edit Flow模型。训练示例覆盖预训练、监督微调(SFT)、评估这几个阶段。

 # Create environment
conda create -n dllm python=3.10 -y
conda activate dllm

# Install PyTorch (CUDA 12.4 example)
conda install cuda=12.4 -c nvidia
pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 \
  --index-url https://download.pytorch.org/whl/cu124
# Install dLLM
 pip install -e .

如果要跑评估:

 git submodule update --init --recursive
 pip install -e "lm-evaluation-harness[ifeval,math]"

训练代码实际长什么样

最简单的训练脚本:

 import transformers
import dllm

model = dllm.utils.get_model(model_args)
tokenizer = dllm.utils.get_tokenizer(model_args)
trainer = dllm.core.trainers.MDLMTrainer(
    model=model,
    tokenizer=tokenizer,
    train_dataset=train_data,
    eval_dataset=eval_data,
    args=training_args,
    data_collator=transformers.DataCollatorForSeq2Seq(
        tokenizer,
        padding=True,
        return_tensors="pt",
    ),
)
 trainer.train()

就这些,不用写自定义loss,不用手动搞扩散循环,也不是那种只能在论文里跑的代码。

还可以使用LoRA + 4-bit量化微调

 accelerate launch \
   --config_file scripts/accelerate_configs/zero2.yaml \
   examples/llada/sft.py \
   --num_train_epochs 4 \
   --load_in_4bit True \
   --lora True

推理怎么做

扩散推理是分步骤迭代的和自回归的greedy decoding完全是不同的概念,dLLM用统一的sampler把这层抽象掉了:

 import dllm

model = dllm.utils.get_model(model_args).eval()
tokenizer = dllm.utils.get_tokenizer(model_args)
sampler = dllm.core.samplers.MDLMSampler(
    model=model,
    tokenizer=tokenizer
)
inputs = tokenizer.apply_chat_template(
    [{"role": "user", "content": "Explain diffusion models simply."}],
    add_generation_prompt=True,
    tokenize=True,
)
 outputs = sampler.sample(inputs)

sampler会处理mask schedule、refinement steps、decoding、output cleanup这些细节。

Edit Flows:拿扩散做文本编辑

Edit Flows算是dLLM里比较有意思的一个方向。模型不是从零生成文本,而是学会对现有文本做操作:插入token、删除token、替换token。这种方式特别适合代码重构、文档编辑、可控的文本改写这类任务,而dLLM提供了从头训练Edit Flow模型的完整教程。

评估

评估扩散模型确实有点麻烦,dLLM用标准化的脚本解决这个问题。

在MMLU-Pro上跑个评估的示例如下:

 accelerate launch --num_processes 4 \
   dllm/pipelines/llada/eval.py \
   --tasks "mmlu_pro" \
   --model "llada" \
   --apply_chat_template \
   --num_fewshot 0

总结

扩散语言模型之前一直停留在研究阶段,dLLM把它变成了能实际用起来的工程工具。现有的LLM可以直接复用,微调需要的算力也不夸张,模型之间的对比有了统一标准,想做实验也不用把整套东西重新搞一遍。

自回归LLM能占主导地位,很大原因是它足够实用。扩散模型要是想在语言领域站稳脚,就要做到训练简单、评估方便、容易集成,dLLM在这个方向上走了不小一步。

对于在做next-gen语言模型的人来说,这个框架确实值得研究一下。

https://avoid.overfit.cn/post/5dc5d844044d404d868bf9512bca2f9b

作者:Sonu Yadav

目录
相关文章
|
5月前
|
编解码 自然语言处理 文字识别
LLaDA2.0-Uni 开源: 打破 AR 桎梏,dLLM定义原生多模态统一新范式
LLaDA2.0-Uni是全球首个开源的多模态MoE离散扩散大模型(dLLM),以16B参数统一实现图像理解、生成与编辑。突破性采用全离散扩散建模,摆脱自回归依赖,支持并行解码与任意分辨率;语义视觉Token+定制Diffusion Decoder,8步即出高质量图。已在21项基准登顶,全面开源。
744 1
LLaDA2.0-Uni 开源: 打破 AR 桎梏,dLLM定义原生多模态统一新范式
|
机器学习/深度学习 自然语言处理
自然语言处理Transformer模型最详细讲解(图解版)
自然语言处理Transformer模型最详细讲解(图解版)
14056 1
自然语言处理Transformer模型最详细讲解(图解版)
|
缓存 弹性计算 Kubernetes
在生产环境中,阿里云如何构建高性能云原生容器网络?(含 PPT 下载)
关注“阿里巴巴云原生”公众号,后台回复 “ 416 ” 即可下载 PPT。
在生产环境中,阿里云如何构建高性能云原生容器网络?(含 PPT 下载)
|
9月前
|
存储 缓存 NoSQL
阿里云 Tair 联手 SGLang 共建 HiCache,构建面向“智能体式推理”的缓存新范式
针对智能体式推理对KVCache的挑战,阿里云Tair KVCache团队联合SGLang社区推出HiCache技术,通过多级存储卸载与全局共享机制,实现缓存命中率翻倍、TTFT降低56%、QPS提升2倍,构建面向长上下文、高并发、多智能体协作的下一代推理缓存基础设施。
1576 27
阿里云 Tair 联手 SGLang 共建 HiCache,构建面向“智能体式推理”的缓存新范式
|
2月前
|
人工智能 自然语言处理 人机交互
最新版阿里云千问 Qwen3.5-Omni 功能介绍
在大模型技术迈入全模态原生交互的2026年,传统图文单模态模型的短板日益凸显,普遍存在音视频理解薄弱、实时交互生硬、多场景融合能力不足、无法适配视听指令开发等问题,难以满足实时对话、视频解析、音频翻译、视听编程等前沿AI应用需求。阿里云百炼重磅迭代**通义千问Qwen3.5-Omni原生全模态大模型**,作为千问系列主打全场景视听融合、实时智能交互、跨模态协同的旗舰级模型,凭借全新Thinker-Talker双架构设计、混合注意力专家机制,在215项第三方权威测试中斩获SOTA最优成绩,多项能力超越国际主流模型,成为当前全球综合实力顶尖的全模态AI模型。本文将全方位详解新版Qwen3.5-Om
525 0
|
9月前
|
监控 算法 安全
室内外融合定位系统从核心架构、技术原理到部署实施流程等详解(一)
室内外融合定位通过“北斗+UWB+IMU”多技术协同,实现工业场景全区域厘米级精准定位。系统采用终端-网络-平台三层架构,支持无缝切换与惯性补盲,广泛应用于化工、矿山、港口等高危场所,保障人员与物资安全。如果您想进一步了解室内外融合定位的技术和案例,欢迎搜索维构lbs智能定位~
|
9月前
|
消息中间件 人工智能 NoSQL
AgentScope x RocketMQ:打造企业级高可靠 A2A 智能体通信基座
Apache RocketMQ 推出轻量级通信模型 LiteTopic,专为 AI 场景设计,结合 A2A 协议与 AgentScope 框架,实现多智能体高效、可靠协作,支持海量会话持久化、断点续传与动态订阅,重塑企业级 AI 应用架构。
482 28
|
11月前
|
运维 监控 异构计算
142_故障容错:冗余与回滚机制 - 配置多副本的独特健康检查
在大语言模型(LLM)的生产环境部署中,系统的可靠性和稳定性至关重要。随着LLM应用场景的不断扩展,从简单的文本生成到复杂的多模态交互,用户对服务可用性和响应质量的要求也日益提高。据2025年最新的AI服务可用性报告显示,顶级AI服务提供商的SLA(服务级别协议)承诺已达到99.99%,这意味着每年的计划外停机时间不得超过52.56分钟。
909 11
|
6月前
|
存储 弹性计算 小程序
2026阿里云轻量应用服务器详解:免费试用、费用价格、200M带宽优势及问题解答FAQ
2026阿里云轻量应用服务器全面升级:新用户享1个月免费试用(2核1G/4G+200M带宽),国内套餐38元起/年,全系标配200M峰值带宽、不限流量、一键镜像。适合个人建站、小程序后端与开发测试,免备案香港版可选。
2099 3