扩散模型简介:图像生成背后的原理(去噪的魔法)

Midjourney、Stable Diffusion 背后的扩散模型是怎么工作的?用最直观的方式讲清'从噪声到图像'的过程。

#扩散模型#Stable Diffusion#图像生成#DDPM更新于 2026-08-12
📑 本页目录

Midjourney、Stable Diffusion、DALL·E 3 背后,是扩散模型(Diffusion Model)。它取代了早期的 GAN,成为图像生成的事实标准。

理解它的钥匙是一句反直觉的话:

图像生成 = 把纯噪声一点点“擦干净”成一张图。

核心思想:加噪与去噪

扩散模型分两个过程:

正向过程(加噪,训练时): 把一张真实图片一步步加入随机噪声,直到变成完全随机的噪点。这个过程是确定、可算的——每一步往图片上叠一点噪声。

反向过程(去噪,生成时): 训练一个神经网络,学会倒着走——从纯噪点一步步“猜”出上一步更清晰的样子,逐步还原出图像。

纯噪声 →(去噪)→ 模糊轮廓 →(去噪)→ 越来越清晰 → 最终图像

三个关键角色

  1. 噪声调度器(Scheduler):控制每一步加多少噪声、去噪时的步长
  2. 去噪网络(U-Net / DiT):核心神经网络,学会估计“这一片噪声该怎么去掉”
  3. 文本条件(Cross-Attention):把“一只戴帽子的猫”这样的文字提示,通过注意力机制引导去噪方向——这就是文生图的关键

为什么用“文本”能控制图像

生成时,文本被编码成向量,在每一步去噪时通过 交叉注意力 注入去噪网络,告诉它“往有猫、有帽子、有这些特征的方向走”。文字成了“方向盘”。

Latent Diffusion:Stable Diffusion 的优化

直接在像素上做扩散太慢、太吃显存。Stable Diffusion 的巧妙做法:

  1. 先用 VAE 编码器把图像压缩到低维“潜空间”(Latent Space)
  2. 在潜空间里做扩散(快得多、省显存)
  3. VAE 解码器还原成高清像素

这就是为什么 SD 能在普通显卡上跑文生图。

关键参数(用得上的)

  • Steps(步数):去噪步数,越多越精细但越慢,一般 20-40
  • CFG(提示词引导强度):越高越贴合文字但越“死板”,一般 5-8
  • Sampler(采样器):不同去噪算法,影响速度与质量
  • Seed(种子):固定随机种子可复现同一张图

一句话总结

扩散模型 = 学会“把噪声还原成图像”(去噪)的模型。配合文本引导(交叉注意力)和潜空间压缩(VAE),就成了我们天天用的文生图工具。核心是理解:生成不是“从无到有”,而是“从乱到整”。