夜雨聆风学习资料网

ARTICLE · 1073664

AI如何精准生成图片?100%人话,0基础也能看懂,带你揭开扩散模型“从无到有”的秘密!

AI如何精准生成图片?100%人话,0基础也能看懂,带你揭开扩散模型“从无到有”的秘密!

你有没有想过:我们只输入一句“画一个蓝色的球”,AI为什么真的能画出一个蓝色的球?

它是不是先在脑子里想好了图片,再一笔一笔画出来?

扩散模型的做法有点出人意料:它从一张乱七八糟的噪声图开始,一点一点把图片“找”出来。

听起来像魔术?我们把整个过程拆成三步。

第一步:把清楚的图片,变成一团噪声

先拿一张清楚的蓝色小球图片。

现在,往图片里撒上一点随机的彩色小点。球还看得清,只是画面有些花。

再撒一些,球开始模糊。

继续撒、继续撒……最后,整张图都变成了杂乱的彩色小点,已经看不出原来是什么。

这些随机小点,就叫噪声。

你可以把它想成一张照片被反复“撒雪花”:从清楚,到模糊,再到完全看不清。扩散模型学习画图,就是从这个过程开始的。

第二步:让AI学会找出噪声

接下来,要训练一个“噪声预测器”。它的任务非常具体:

给它一张被弄花的图片,让它猜:这张图片里,刚刚加进去了哪些噪声?

比如,我们拿一张蓝色小球图片,往里面加一些噪声,再把这张变花的图片交给AI。同时告诉它:现在加噪加到了哪一步;这张图对应的文字要求是“蓝色的球”。

AI会猜哪些小点是噪声。因为噪声是我们亲手加进去的,所以我们知道正确答案,也就能告诉AI:“这里猜对了,那里猜错了。”

它猜错一次,就调整一次。用大量图片反复练习后,它逐渐学会了:面对一张有噪声的图片,该怎样判断其中的噪声。

第三步:从一团噪声开始,生成新图片

终于轮到AI画图了。

我们对它说:“给我画一个蓝色的球。”

这时,AI手里并没有一张现成的球。它拿到的起点,是一张随机生成的噪声图——看上去只有五颜六色的小点。

然后,它把这张噪声图和“蓝色的球”这句话一起交给训练好的噪声预测器。它预测当前图片中的噪声,AI据此更新图片,让画面稍微清楚一点。

这一步做完,图片可能还是很乱。没关系,再来一次。

一次、两次、很多次……画面里的杂乱逐渐减少,蓝色的轮廓慢慢出现,最后变成一张蓝色小球的图片。

这就是扩散模型生成图片时最直观的过程:

随机噪声 → 反复预测并去除噪声 → 逐渐出现符合文字要求的图片。

一句话记住

扩散模型先通过“给图片加噪声”学习图片是怎样变乱的,再训练噪声预测器预测噪声。等真正画图时,它从一团随机噪声出发,在文字要求的引导下,一步步减去噪声把图片生成出来。

所以下次看到AI生成的图片,你可以想象:在它变清晰之前,那里曾经只有一团看不出任何东西的噪声。

相关学习资料