夜雨聆风学习资料网

ARTICLE · 1113680

读懂扩散模型:AI 绘画背后的核心技术,一张图片是怎么 “变” 出来的?

读懂扩散模型:AI 绘画背后的核心技术,一张图片是怎么 “变” 出来的?

不知道你有没有体验过AI绘画:输入一段文字描述,几秒之内,一张精美插画、写实照片或者概念图就自动生成。

如今大火的文生图、图生图、局部重绘、风格迁移,背后绝大多数都离不开扩散模型(Diffusion Model)。它是当前主流AI 绘画的底层算法,依靠不断去除噪声的思路,一步步把杂乱的随机噪点,转化成清晰高质量图像。

今天用通俗的语言,拆解这项火爆的AI视觉技术,零基础也能看懂。

01 扩散模型是什么?一句话理解

扩散模型的灵感,来自现实世界的扩散现象:比如一滴墨水滴进清水里,墨水会慢慢扩散,最后整杯水变得浑浊。

扩散模型把这个过程反过来用:

1.前向扩散(加噪):给一张清晰图片,一点点持续添加随机噪声,直到整张图完全变成杂乱无章的噪点,图片原本的内容彻底消失。这是模型训练阶段。

2.反向扩散(去噪):AI学习加噪的逆过程。拿到一张纯随机噪点图,反复一点点去掉噪声,不断还原画面细节。经过多轮迭代,噪点慢慢褪去,最终生成符合提示词描述的完整图像。

简单比喻:就像一块布满灰尘的画布,AI一点点擦去灰尘,慢慢露出画布上的画面。

重点:AI不是一次性画出整张图,而是经过几十上百轮迭代,逐步降噪优化画面。

在扩散模型出现之前,GAN(生成对抗网络)也曾用于图像生成,但 GAN 容易出现画面扭曲、细节崩坏、训练不稳定的问题。扩散模型凭借稳定的生成效果、优秀的细节表现力,迅速成为 AI 绘画领域的主流方案。

02 训练阶段:让AI学会“擦除噪声”

很多人会好奇,AI凭什么知道怎么去掉噪点?答案来自海量图片数据训练。

训练的时候,模型拿到大量真实图片,不断重复“给图片加噪声” 的操作。

·每次只加一小部分噪声;

·模型的任务:观察带噪图片,预测刚刚被加上去的噪声是什么样子。

经过数百万、上亿张图片的反复学习后,模型掌握了强大的噪声预测能力。它学会分辨:哪些是无意义的随机噪点,哪些是图片本身的物体轮廓、光影、纹理。

训练完成后,我们只需要给它一串文字提示词,引导它在去噪的过程中,生成和文字描述匹配的画面。

03 生成图像:反向去噪,从噪点到成品

当我们输入提示词“海边日落,少女,油画质感”,AI绘画就启动反向扩散流程:

1.先生成一张完全随机的噪点图,此时没有任何画面内容;

2.模型开始第一轮预测噪声,抹除一部分噪点,画面隐约出现模糊轮廓;

3.重复迭代去噪数十次:轮廓越来越清晰,慢慢出现人物、大海、天空;光影、色彩、纹理细节不断完善;

4.最后一轮去噪完成,输出最终图像。

整个过程,提示词就像导航,不断引导模型:去噪的时候,要朝着“海边日落、油画风格” 这个方向还原画面。

我们常听到的采样器,本质就是不同的去噪算法。不同采样器,去噪策略不一样,有的速度更快,有的画面细节更好,这也是为什么更换采样器,生成图片风格会有细微差别。

04 扩散模型不止是文生图,能力远比想象丰富

扩散模型强大之处在于,它不只是单纯根据文字画图,还衍生出大量我们日常在用的AI 图像功能:

✅图生图:上传一张参考图,保留原图构图,只修改画面内容或者更换画风;

✅局部重绘(Inpaint):框选图片某一块区域,单独重绘这部分画面,修改人物面部、替换背景;

✅ 图片超分:对低分辨率图片降噪修复,提升清晰度;

✅图像修复:把破损、有遮挡的图片还原;

✅风格迁移、ControlNet 结构控制:锁定人物姿态、线稿,让AI 严格按照结构绘图;

✅拓展应用:现在扩散模型还被用于AI视频生成、3D模型生成。

补充:ControlNet并不是扩散模型本身,而是扩散模型的配套技术,作用是增加结构约束,解决 AI 画人物肢体错乱的痛点。

05 扩散模型的优势与局限

✅ 核心优势

1.图像质量高:生成画面细节丰富,色彩自然,相比旧方案,不容易出现畸形、崩坏;

2.训练稳定:相比GAN,训练过程更容易收敛,更容易做大模型;

3.扩展性强:可以灵活接入文本、深度图、线稿等多种条件输入,适配各类图像任务;

4.可控性持续提升:搭配ControlNet 等插件,姿态、构图、透视都可以精准控制。

⚠️ 当前局限

1.生成需要迭代:要经过多轮去噪,相比一次性生成模型,耗时更长;

2.长提示词理解有限:过长、复杂的文字描述,依然容易出现细节理解偏差;

3.依然会有常识错误:比如画手的时候手指数量出错,物体透视不合理;

4.算力消耗大:高清大图生成,对显卡算力有一定要求。

06 写在最后

扩散模型,把图像生成变成了一场循序渐进的降噪过程。它不是像人类画家一样一次性构思完整画面,而是在无数次噪声预测中,一点点雕刻出图像。

从2015年理论提出,再到2022年 Stable Diffusion 引爆AI绘画,扩散模型从冷门学术算法,变成大众随手可用的工具。

当然技术还在持续迭代:更快的采样方法、更小的轻量化模型、图文视频一体化扩散方案,都是当下研究热点。

看懂扩散模型,你就明白了AI 绘画底层逻辑:AI不是拥有想象力,而是从海量数据中学到图像的规律,通过去除噪声,创造出全新画面。

声明:该文章为AI生成,如有侵占请联系作者删除。

相关学习资料