一、引言:为什么扩散模型统治了生成式AI
自2020年DDPM(去噪扩散概率模型)发表以来,扩散模型逐渐取代GAN和VAE成为生成式AI的主流架构。从Stable Diffusion到Sora,从DALL-E 3到FLUX,现代AIGC系统的核心几乎都建立在扩散过程之上。但扩散模型并不是单一算法,而是一个持续演进的理论家族——从基于随机微分方程(SDE)的原始框架,到去噪扩散隐式模型(DDIM)的加速采样,再到当前最先进的Flow Matching和一致性模型(Consistency Models),每一次架构革新都在效率和质量上实现了数量级的提升。
二、扩散过程的数学基础
2.1 前向扩散:逐步摧毁信息
扩散模型的核心思想极为优雅:定义一个逐渐将数据分布转化为简单噪声分布的前向过程,然后学习这个过程的逆过程。数学上,前向扩散定义为马尔可夫链:
q(x_t | x_{t-1}) = N(x_t; sqrt(1-β_t)·x_{t-1}, β_t·I)
其中β_t是一个预定义的噪声调度表(noise schedule),从β_1=0.0001线性增长到β_T=0.02。经过T步后,原始数据x_0几乎完全转化为各向同性高斯噪声。
关键的解析性质:由于高斯分布的线性组合仍是高斯分布,我们可以直接从x_0采样任意时刻t的噪声版本:
x_t = ᾱ_t·x_0 + sqrt(1-ᾱ_t)·ε, ε~N(0,I)
其中ᾱ_t = ∏_{s=1}^{t}(1-β_s)。这一闭式性质是训练效率的关键——无需逐步迭代即可获取训练对(x_t, ε)。
2.2 反向去噪:从噪声中恢复信号
前向过程是不可逆的马尔可夫链,但学习其逆过程是可行的。反向转移概率:
q(x_{t-1} | x_t, x_0) = N(x_{t-1}; μ̃_t(x_t, x_0), β̃_t·I)
其中μ̃_t和β̃_t有解析表达式。训练目标是最小化变分下界(VLB),对于DDPM简化为噪声预测损失:
L_simple = E[||ε - ε_θ(x_t, t)||²]
网络学会预测添加到x_t上的噪声ε,反向去噪时从x_t中减去预测噪声,乘以适当缩放因子即可恢复x_{t-1}。
三、DDPM:扩散模型的奠基之作
3.1 架构设计
DDPM(Ho et al., 2020)采用U-Net作为骨干网络,核心创新包括:
- 时间步嵌入:通过正弦位置编码(Transformer风格)将离散时间步t映射为向量,经MLP后注入U-Net各分辨率层级
- 注意力机制:在16×16分辨率层引入全局自注意力,捕获长距离依赖
- 残差块:GroupNorm + SiLU激活 + 卷积的组合,每个残差块接收时间嵌入作为额外条件
- 渐进式下采样/上采样: encoder-decoder结构配合skip connection
3.2 训练与推理的矛盾
DDPM的致命弱点在推理端:完整的反向去噪需要执行全部T步(通常T=1000),每步都需完整U-Net前向传播。生成一张512×512图像需要约20-30秒(单GPU),远不满足实时需求。这一效率瓶颈催生了后续大量加速采样研究。
四、加速采样:从DDIM到DPM-Solver
4.1 DDIM:确定性采样的突破
DDIM(Song et al., 2021)的关键洞察:DDPM的训练目标q(x_t|x_0)只依赖边缘分布而非完整的马尔可夫链。因此存在无限多个前向过程产生相同的边缘分布,其中许多是非马尔可夫的。
DDIM定义了确定性映射(非随机):
x_{t-1} = sqrt(ᾱ_{t-1})·x_0_pred + sqrt(1-ᾱ_{t-1}-σ_t²)·ε_θ(x_t,t) + σ_t·z
当σ_t=0时完全确定性,这使得:(1) 可用任意子序列采样(如只用20-50步),(2) 隐空间可逆(编码-解码一致性),(3) 隐空间有良好语义结构支持语义插值。
4.2 DPM-Solver:ODE视角的数值方法
DPM-Solver(Lu et al., 2022)基于概率流ODE(Probability Flow ODE)的发现:每个SDE对应的扩散过程都有一个等价的ODE形式:
dx = [f(t)x - 1/2·g(t)²·(s_θ(x,t) + λ_θ(x,t))] dt
DPM-Solver将此ODE分解为线性(可解析求解)和非线性两部分,对后者应用高阶指数积分器,实现10-20步高质量采样。DPM-Solver++进一步引入数据预测参数化,精度更高。
五、Latent Diffusion:Stable Diffusion的核心工程创新
5.1 从像素空间到潜空间
Stable Diffusion(Rombach et al., 2022)的革命性贡献是将扩散过程从像素空间迁移到VAE压缩后的潜空间。像素空间维度(H×W×3)远大于语义信息实际维度,大量计算浪费在感知无关的高频细节上。
具体架构:VAE encoder E将x∈R^{H×W×3}压缩为z=E(x)∈R^{h×w×c}(下采样因子f=8,h=H/8, w=W/8);扩散-去噪过程在z空间执行;VAE decoder D将去噪结果z解码回像素空间。计算量降至原来的1/64。
5.2 条件控制机制
Stable Diffusion的核心创新是将UNet扩展为条件生成器,通过cross-attention注入多模态条件:
- 文本条件:CLIP Text Encoder将提示词编码为token embeddings,通过cross-attention注入各分辨率层
- 空间条件:ControlNet通过额外编码分支(深度图/边缘图/姿态骨架)提供像素级空间控制
- 修复/超分辨:通过mask或低分辨率图像实现img2img、inpaint、upscale任务
六、Flow Matching:新一代生成框架
6.1 从SDE到ODE再到ODE Flow
Flow Matching(Lipman et al., 2023;Esser et al., 2024)代表了对扩散过程更本质的理解。其核心思想:不通过噪声扰动间接定义数据分布,而是直接学习一个速度场(velocity field),该向量场将简单分布(高斯)连续传输到数据分布。
数学定义:给定简单分布p₀(标准高斯)和复杂分布p₁(数据分布),学习向量场v_t满足连续性方程:
∂p_t/∂t + ∇·(p_t · v_t) = 0
其中p_t = (1-t)·p₀ + t·p₁(线性插值路径),v_t = x₁ - x₀(常数速度)。
6.2 Flow Matching vs DDPM的本质差异
- API不同:DDPM学习噪声ε,Flow Matching学习速度场v
- 路径形状:DDPM沿固定噪声曲线,Flow Matching沿最优传输直线
- 训练采样比:DDPM训练简单但采样慢;Flow Matching训练更复杂(需ODE求解)但采样极快(1-4步!)
- 质量:直线ODE路径无弯曲,更少离散化误差,相同步数下质量显著优于DDPM
6.3 FLUX的工程实现
FLUX(Black Forest Labs, 2024)是Flow Matching在工业级文生图的首次成功应用:
- 双流Transformer块:交替处理图像tokens(RoPE位置编码+3×3卷积)和文本tokens
- 单流DiT块:joint attention融合图像-文本信息流
- Guidance Embedding:adaLN-Zero调制替代传统分类器自由引导(CFG),训练时随机drop条件
- 12B参数规模:24个Transformer块,首次证明Flow Matching在超大规模模型上可与扩散模型匹敌甚至超越
七、一步生成:蒸馏与一致性模型
7.1 Consistency Models
Consistency Models(Song et al., 2023)的核心创新是自一致性性质:ODE轨迹上的任意一点沿轨迹移动会到达同一个终点。基于此,一致性模型学习:
f_θ(x_t, t) = x_ε (直接预测ODE轨迹终点,即干净数据)
训练可以通过蒸馏预扩散模型实现:将DM的多步ODE轨迹压缩为单步一致性映射。结果是1步生成高质量图像。
7.2 Progressive Distillation & Guided Distillation
渐进式蒸馏逐步减少采样步数:将T步DM蒸馏为T/2步→T/4步→...→2步,每轮训练学生网络匹配教师网络的n步结果。引导蒸馏结合classifier-free guidance,在高guidance scale下仍保持步数减少的有效性。
7.3 LCM-LoRA:即插即用的实时生成
Latent Consistency Model(LCM)训练一致性约束的LoRA适配器,可与任何基础模型组合:在基础模型上叠加LoRA即可实现2-4步超快生成。LCM-LoRA将一致性模型的部署成本降至最低,SDXL基础模型+LCM-LoRA实现实时交互式文生图。
八、行业应用与技术选型策略
8.1 文生图场景决策树
追求极致速度(实时交互/边缘设备):FLUX.Schnell / LCM-LoRA / SDXL-Turbo
追求最高质量(广告/艺术创作):FLUX.1 [dev] / SD3 / Midjourney V7
追求可控性(产品/游戏设计):SDXL + ControlNet / FLUX + Redux
追求低成本(大规模部署):SD 1.5 + 定制LoRA / PixArt-Σ蒸馏版
8.2 视频生成的特殊挑战
从图像扩展到视频面临3D一致性(时间维度上的世界稳定性)、计算量爆炸(帧数×像素)、长程依赖三大挑战。Sora/H Kling/CogVideoX的解决方案:时空3D Patch、3D DiT、RoPE时空位置编码、关键帧引导插值。
九、总结与展望
扩散模型的演进本质上是一部从随机到确定、从多步到少步、从像素到语义、从学术到工业的技术进化史。当前最前沿的方向包括:
- DiT替代U-Net:纯Transformer主干在可扩展性和质量上全面超越卷积架构
- 自回归混合架构:结合扩散的连续空间与自回归的离散token化(如Janus、Chameleon)
- 3D原生生成:直接从3D表示(NeRF/3DGS)扩散而非2D投影
- 个性化生成效率:从LoRA到Encoder-based适配(IP-Adapter、InstantStyle)的更细粒度控制
扩散模型从理论优雅的噪声去除工具,演变为承载整个AIGC时代的工程基础设施。理解从DDPM到Flow Matching的演进脉络,是构建下一代生成系统的前提。

发表评论 取消回复