从雪花屏到一只熊猫:AI 是怎么画图的?

它不是在图库里找一张改一改——它学的是「怎么把一团乱码一步步擦成你要的样子」

leonardchow.work · 读物 | AI 与大模型 · 原理与实测

2026-07-26

一句话:AI 画图的核心思路反直觉得可爱——先学会怎么把一张好图弄脏,然后反过来做。训练时把清晰图片一步步加噪声直到变成雪花屏;生成时从一张随机雪花屏出发,按你的文字描述一步步「擦干净」。模型里没有存任何一张原图

反幻觉声明:原理描述基于 2020 年的扩散模型论文(作者、年份已核实)。文中对「现代模型不全是经典扩散」的说明是为了避免以偏概全,未涉及任何厂商未公开的实现细节。

一、一个反过来的想法

假设我给你一个任务:教电脑画一只熊猫

直觉做法是「教它怎么画」——先画圆,再画耳朵……但这条路走不通,因为「画得好看」这件事没法写成规则。

2020 年,三位研究者提出了一个反过来的想法1

与其教它怎么画,不如教它怎么「把画弄脏」,然后让它反着来。

这听起来像绕远路,但它有个巨大的好处:「怎么弄脏」是我们自己控制的,所以完全知道标准答案

二、两个方向

训练时把好图一步步加噪成雪花屏,生成时从雪花屏一步步擦回成品

训练阶段:往前走,加噪声

拿一张清晰的熊猫照片,加一点点随机噪点,再加一点,再加……重复几百上千步,最后变成一屏纯粹的雪花(就是老电视没信号那样)。

在这个过程中,模型被训练做一件很具体的事:看着「加噪后的图」,猜出「刚才加进去的噪点长什么样」

因为噪点是我们自己加的,所以每一步的正确答案我们都有。这让训练变得非常好做。

生成阶段:倒过来走,一步步擦

现在反过来。给模型一张全新的、随机生成的雪花屏,让它一步步把噪点擦掉。

每擦一步,图就清楚一点点。擦几十步之后,一张之前从未存在过的图就出来了。

那你的文字描述在哪起作用? 就在「往哪个方向擦」上。你说「一只熊猫」,模型每一步就往「更像熊猫」的方向去除噪点;你说「穿校服的熊猫在食堂打饭」,它就往那个方向擦。

三、破除三个误解

误解 1:「它是在图库里找一张图改一改」

不是。 模型文件里没有存任何一张训练用的图片。它存的是「怎么从乱码一步步逼近符合描述的图」这套本事。

证据很直接:同一句提示词,你每次生成的结果都不一样——因为起点那张随机雪花屏每次都不同。如果是在图库里找,结果应该稳定才对。

误解 2:「步数越多越好看」

不完全对。步数增加到某个点之后,收益会明显变小,但时间和费用是线性涨的。这也是为什么各家工具都会给你一个步数选项——不是越大越好,是要找那个拐点。

误解 3:「现在的画图 AI 都是扩散模型」

这条要特别提醒。扩散是 2020 年那套经典做法,但后来出现了很多变化:

所以严格说:现代的图像生成模型受扩散思想影响很深,但不都是教科书上那个经典扩散。看到有人斩钉截铁说「所有 AI 画图都是扩散」,可以在心里打个问号。

四、这解释了几个你可能遇到过的现象

你遇到的现象 原因
同样的提示词,每次结果都不同 起点的随机噪声每次不同
手指画错、数量画错 模型学的是「整体像不像」,没有专门数数的机制
文字写不对 同上——它在「画出像文字的形状」,不是在「写字」
越具体的描述越容易得到想要的 描述决定「往哪个方向擦」,方向越明确越好
加负面描述(不要什么)有时有用 相当于告诉它「别往那个方向擦」

五、一句话总结

它不是画家,是修复师——面对一团随机的噪点,按你的描述,一层层把「不像的部分」擦掉,直到剩下的东西看起来就是你要的。

下一次你输入提示词的时候,可以想象一下:屏幕背后有一张雪花屏,正在按你的话,一点点变清楚。



  1. Jonathan Ho, Ajay Jain, Pieter Abbeel (2020). Denoising Diffusion Probabilistic Models. arXiv:2006.11239。提出前向加噪与反向去噪的训练范式,是现代图像生成模型的重要源头之一。https://arxiv.org/abs/2006.11239↩︎