Back to Home

Diffusion Models 101: The "Noising" and "Denoising" Behind AI Image Generation

September 15, 2026 at 08:02 AMSource: 润百AI0 comment(s)TechGuide

扩散模型(Diffusion Model)是当前主流文生图系统的核心。从早期的 Stable Diffusion 到后来的 DiT 架构,背后的基本思想其实相当直白:先教会模型"加噪",再让它学会"去噪"。

一、前向过程:把图片一步步"弄糊"

训练时,系统对一张真实图片反复叠加微小的随机噪声,经过很多步之后,图片会变得几乎与纯噪声无异。这个过程叫前向过程(forward process),是固定的数学操作,不需要模型去学习。

二、反向过程:让模型学会"擦掉"噪声

接着训练一个神经网络:给它看"加噪后的图片"和"当前时间步",让它预测这张图里混入了多少噪声。学会之后,从一张纯噪声图出发,反复"减去"模型预测的噪声,就能一步步"洗"出图像——这就是生成图像的反向过程(reverse process)。

三、为什么要在"潜空间"里做

直接在像素上做扩散,计算开销很大。潜扩散(Latent Diffusion)先把图片压缩到更小的潜空间,再在潜空间里做加噪与去噪,最后解码回像素。正是这一步把训练与推理成本大幅降下来,也是这类模型能跑在消费级显卡上的重要原因。

四、文本是怎么"指挥"图像的

扩散模型本身只负责生成图像,并不"听指令"。文生图系统通常先用文本编码器把提示词变成向量,再通过交叉注意力(cross-attention)注入去噪网络,让每一步去噪都朝着文字描述的方向走。这也是同一句提示词、不同随机种子会得到不同结果的原因。

五、给使用者的几点实用理解

- 采样步数不是越多越好:超过一定步数后收益递减,只是更慢;

- "种子"决定随机起点,固定种子加相同提示词有助于复现结果;

- 提示词起的是引导方向的作用,而不是精确控制像素,学会迭代微调比追求"一句到位"更实际。

最后需要提醒:扩散模型生成的内容可能涉及版权与事实性问题,商用前应确认素材来源与授权。

【参考来源】

- Ho、Jain、Abbeel《Denoising Diffusion Probabilistic Models》(DDPM,2020)

- Rombach 等《High-Resolution Image Synthesis with Latent Diffusion Models》(Latent Diffusion,2022)

- Peebles 与 Xie《Scalable Diffusion Models with Transformers》(DiT,2023)

Computer Vision
Discussion

Comments (0)

No comments yet. Be the first!

Leave a Comment