最近在做相关的东西,顺手研究 AI 生图的底层原理,整理了一些笔记,从扩散模型到自回归架构,一路往下挖,遂整理出来。
写在前面:
"模型"是什么?
最简单的理解:模型就是一组参数(几十亿个数字),这些数字编码了某种能力。
你可以把它想成一本极厚的"经验手册"——不是一条条规则写出来的,而是通过大量训练压缩出来的。手册里没有文字说明,全是数字,但这些数字组合在一起就能完成某个任务。
不同的训练方式、不同的训练数据、不同的任务目标,会得到不同的模型。
生图模型和语言模型(LLM)有什么不同?
它们的根本差异是任务不同:输入什么、输出什么、中间怎么处理。一个学会了"文字接龙",一个学会了"看图还原"。底层逻辑完全不同。
语言模型(比如 ChatGPT):输入是文字,输出也是文字。它的能力是"预测下一个词"——给它一段话的开头,它接着往后写,一个字一个字地生成。训练时看了几万亿字的文本,学会了语言的统计规律。
核心机制叫 autoregressive generation(自回归生成)。每次根据前面所有已有的内容,预测下一个 token,然后把预测出来的 token 加入序列,再预测下下一个,循环往复。即next token prediction。
生图模型(比如 Stable Diffusion):输入是文字(prompt),输出是图片(像素)。它的能力是"从噪声中去噪"——给它一张纯噪声,它参考你的文字描述一步步还原出画面。训练时看了几十亿张图片,学会了视觉的统计规律。


一、传统AI如何生图:Diffusion Model
你有没有玩过这样的游戏:给你看一张模糊的照片,让你猜原图是什么?
主流生图 AI 用的技术叫扩散模型(Diffusion Model),它的训练逻辑和这个游戏很像,只不过分两步来做。
第一步,学习"加噪"。 拿一张清晰的图,一点一点往上加随机噪点,直到图片变成一张完全随机的噪声图。这个过程重复几百次,模型看着图片从清晰变模糊,记录下每一步"噪声长什么样"。
第二步,反过来训练:给模型一张噪声图,让它预测"下一步应该去掉哪些噪声",一步一步还原出清晰图片。同时告诉它:这张图对应的文字描述是 XXX。


训练几亿张图之后,模型就学会了——看到"一个扎马尾的女生坐在窗边,手里捧着一杯热可可,窗外是下雪的街道"这段文字,应该从噪声里还原出什么样的画面。
所以你输入 prompt 的时候,模型做的事情是:先生成一张纯噪声,然后一边参考你的文字描述,一边一步步去噪,最终"还原"出一张从未存在过的图片。
但它真的"理解"画面内容吗?
不理解。它不知道"热可可是暖的",也不懂"雾气是温差造成的"。
模型见过一亿张图,其中有大量"人坐在窗边喝东西"的画面。这些图在去噪过程中有共同的规律——人的坐姿大概是什么样、杯子和手的位置关系是怎样的、窗外的雪应该是什么色调、玻璃上的雾气是什么质感。它把这些规律都压缩进了自己的参数里。
当你描述某个画面,模型不是在回忆训练数据里某张具体的图,而是在用这些规律重新合成一张符合统计规律的画面。

模型看不懂文字,它只认数字。所以中间需要一个翻译官,把你的文字翻译成模型能理解的数字信号。这个翻译官叫 CLIP。
想象一个坐标系。最简单的坐标系是平面的——X 轴代表色调冷暖,Y 轴代表画面明暗。"窗外下雪的夜晚"落在左下角(冷色 + 暗),"阳光下的沙滩"落在右上角(暖色 + 亮)。

CLIP 用的坐标系是同样的逻辑,只是维度多得多——768 维。
先想一个问题:你描述一张画面,最多能说清楚多少个视觉属性?
颜色、光线方向、构图、主体是谁、穿什么衣服、什么材质、什么风格、什么情绪、景深多少、拍摄角度……你使劲想,也就想得出来几十个你能用语言说清楚的东西。
而CLIP的768个维度每个维度代表某种视觉特征:有没有人脸、头发长短、室内还是室外、光线方向、材质质感……甚至有你说不出来的东西。比如:"某种光线穿过雾气之后散射形成的特定纹理"——你没有一个词来描述它,但模型见过这种画面几万次,它能区分这种纹理和另一种纹理的差异,并且把这个差异存在某个维度上。
再比如:"日系动漫里那种特有的高光处理方式"——你可以说"日系动漫风格",但风格内部还有上百种微妙的差异(赛璐璐硬光 vs 水彩柔光 vs 新海诚式的光斑),模型能在不同维度上区分它们,即使你未必有对应的词汇来调用。
在这个空间里,每一张图片、每一段文字,都能被转换成一个由 768 个数字组成的坐标点。
插一句,模型团队想要实现更好的模型,就需要不断精进这个坐标系以及CLIP。
他们从互联网上爬取了很多组"图片+描述文字"的配对数据(比如一张猫的照片,配着"a cat sitting on a sofa"这样的文字)。然后让CLIP 把同一对的文字和图片,映射到 768 维空间里相近的位置;把不匹配的图文的,推到远处。几亿对图文训练完之后,CLIP 就学会了:看到任何一段文字,都能算出它应该落在 768 维空间里的哪个点;看到任何一张图,也能算出它落在哪个点。意思相近的文字和图片,会自动聚在一起。
即:对比学习(Contrastive Learning)——不断地做"配对题",做几亿次之后,CLIP 就学会了"什么文字该对应什么视觉特征"。
而CLIP 的精度取决于见过多少图文配对、坐标系有多少维度、以及训练时有没有被故意刁难过——这些都是模型团队在训练阶段做的功课,不是写 prompt 的人能控制的。
现在完整链路就清楚了:
你写了 prompt:"一个扎马尾的女生坐在窗边,手里捧着一杯热可可,窗外是下雪的街道,玻璃上有一层雾气。"
第一步,CLIP 把这段话翻译成 768 维空间里的一个坐标点。这个点的位置,编码了"马尾""窗边""热可可""雪""雾气"这些视觉特征的组合。
第二步,生图模型从一张纯噪声开始去噪。每一步去噪时,模型都会参考 CLIP 给的那个坐标点,决定"往哪个方向推"。就像你在迷宫里走路,手里有一个指南针始终指向目的地——那个坐标点就是指南针。
最终,噪声一步步被推到坐标点对应的视觉区域,变成一张完整的画面。
这解释了 prompt 为什么有写得好和写得差的区别。prompt 本质上不是指令,是坐标。你写的每一个词,都在 768 维空间里把目标位置往某个方向拽。你的 prompt文字表述决定了你能调动多少维度。
你写"窗户上有雾气"——CLIP 能把它定位到一个大致的区域,但一句"窗户上有雾气"可能只拨动了其中十几个维度的滑块,剩下七百多个维度模型就随机填了。
你写"frosted glass with condensation, soft diffused light filtering through foggy window"——CLIP 能把它定位到一个非常精确的点,因为训练时见过大量这类英文摄影描述,对这些专业视觉词汇的位置记得很牢。坐标越精确,模型去噪的方向越明确,画面越接近你想要的。


("frosted glass with condensation, soft diffused light, warm golden bokeh, cool blue exterior")— 冷暖色对比、水珠顺着玻璃滑下来、室内暖光透过来形成光晕、浅景深把窗外雪景虚化。同一个"窗户上有雾气",但出来的是完全不同级别的画面。
而如果你写"氛围感"——这个词太抽象了,在 768 维空间里找不到一个明确的落点。模型去噪时没有清晰方向,最终画面就是"随便走了一个方向"的结果。
词越具体、越视觉化,坐标点越精确,模型就越能画出你想要的东西。
不过这种"只有统计规律、没有逻辑规则"的能力边界,会导致什么问题?
比如:捧杯子的手指数量不对。 女生双手捧着杯子,模型可能画出六根手指,或者两只手的手指交错融在一起。因为训练数据里"手握住东西"的姿态太多样了,模型学到的规律只是"这个区域应该有几根细长的东西环绕着杯子",但精确数量和前后遮挡关系,它没有稳定的判断。再比如:杯子上的文字变乱码。 你想让热可可的杯子上印着"Cocoa House"的品牌名。模型知道杯子表面应该有一排笔画组合,看起来像文字,但它不懂字母的拼写规则,所以生成出来形状类似但内容完全错乱的东西。
这也就引申出了自回归模型——一个全新的生图模型架构。
三、自回归:像写作文一样"写"出图片
前面我们花了很大篇幅讲扩散模型——从一团噪点出发,在 CLIP 坐标的指引下,一步步擦掉噪点还原出图像。这是 2022-2025 年所有主流生图模型的共同路线。
但 2026 年 4 月,GPT Image 2 的出现打破了这个格局。它完全不用扩散,而是用了另一条路——自回归(Autoregressive)。
具体怎么做的?它把一张图片切成很多小块(类似马赛克),每个小块被编码成一个"视觉 token"。然后就跟写作文一模一样——从第一个视觉 token 开始,根据你的文字描述和已经生成的部分,预测下一个视觉 token 应该是什么,一个一个"写"下去,直到整张图写完。
相比之下,扩散模型的做法像是雕塑:先给你一块大理石(噪点),然后一点点凿掉多余的部分,直到形状浮现。它是"从混沌到清晰",整张图是同时从模糊变清楚的。
而自回归模型的做法像是画油画:从画布的某个位置开始,一笔一笔画下去。画到窗框的时候,它已经"知道"之前画了什么(女生的位置、光线方向),所以能确保后面画的部分跟前面保持一致。它是"从局部到整体",按顺序生成。

为什么自回归的"理解力"更强?
扩散模型的结构里,"理解文字"和"生成图像"是两个分开的系统。CLIP 负责把你的话翻译成坐标,然后扔给去噪网络去画——它们之间的沟通只靠那个 768 维的向量。
而 GPT Image 2 里,"理解文字"和"生成图像"是同一个大脑在做。它读你那段话的时候,用的就是 GPT-4o 那颗最强的语言大脑;然后它继续用同一颗大脑来"写"图像 token。中间没有翻译环节,没有信息损失。
这就是为什么 GPT Image 2 能做到:你说"玻璃上有一层薄薄的雾气,但通过雾气能隐约看到街对面亮着暖光的面包店"——扩散模型可能会顾此失彼(画了雾气就看不清面包店,或者面包店太清晰显得没有雾气),但自回归模型因为是"一笔一笔画"的,画到面包店的时候它已经"知道"前面画了雾气,会自动调整透明度和模糊程度来保持一致性。
一个你马上就能验证的证据:中文文字渲染。
你有没有试过让 Midjourney 或 Stable Diffusion 在图里写中文字?大概率会得到一堆"看起来像汉字但又不是任何一个字"的乱码。英文倒是经常能写对。

这素何物!
为什么?
扩散模型生成文字时,本质上是在"画一个看起来像那个字的形状"。英文字母只有 26 个,结构简单,训练数据里见过无数次,所以它能画得像。但中文有几千个常用字,每个字笔画结构都不同,一个"捧"字左边提手旁右边是奉——模型并不知道这些,它只是在像素层面模仿一个"大概见过的形状"。笔画稍微歪一点,就变成乱码了。
而 GPT Image 2 用自回归架构,在生成文字的视觉 token 时,它用的是和理解中文语义同一颗大脑——它真的"知道"这是哪个字、该有哪些笔画、结构是什么样的。所以它的中文渲染准确率能做到 99%,这在扩散模型时代是不可能的事。
这就是"统计模仿"和"真正理解"之间最直观的差距。
看到这里你可能会想:自回归模型既然不需要 CLIP 翻译了,已经可以自己理解了,那 prompt 是不是就随便写写就行了?
不是。回忆一下扩散模型的逻辑:你的话要先经过 CLIP 压缩成 768 个维度的坐标。这个过程有信息损失,而且 CLIP 有自己的"听力偏好"——有些词它认识、有些不认识,关键词的顺序和权重会影响翻译精度。所以那个时代的"prompt 工程"本质上是在研究翻译官的脾气:
masterpiece, best quality, 8k, highly detailed这些词不是给你看的,是给 CLIP 看的,是用来把坐标往"高质量区域"推的咒语。
自回归模型里,这个中间人消失了。GPT Image 2 用 GPT-4o 那颗最强语言大脑直接理解你的话——它读得懂长句、理解得了隐喻、能处理复杂的空间关系和因果逻辑。你不需要再迁就任何"翻译官的能力边界"。但新的挑战出现了:模型什么都听得懂,问题是你自己说清楚了吗?
打个比方。以前是你跟一个只会基础中文的外国画师沟通——你得简化语言、用他认识的词、避免复杂句式。现在是你跟一个母语流利的顶级画师沟通,他什么都听得懂。但如果你说"帮我画个好看的窗边场景",他画出来的可能不是你脑子里想的那个画面——不是他不行,是你没说清楚。
所以 prompt 的价值从"技术门槛"转向了"创意门槛"。以前需要会关键词选择、权重语法、负面 prompt、模型专属咒语。 而现在你要写光线方向、情绪氛围、构图意图、叙事细节——你作为创作者真正想要什么。
对产品来说,这意味着 prompt 拼装系统的设计思路也要跟着变。以前拼装规则的核心是"怎么组合关键词让 CLIP 解析更精准",未来如果底层模型切换到自回归架构,拼装逻辑应该转向"怎么把用户的创作意图用自然语言精确表达出来"——更像是帮用户写一段精准的画面描述,而不是拼一串关键词。
四、当下主流的图像生成模型,到底有什么区别?
前面我们搞清楚了三件事:扩散模型是怎么从噪点里"去噪"出一张图的,CLIP 是怎么把你的文字翻译成模型能理解的坐标的、新出现的架构如何重塑了生图模型。
搞清楚了原理,最后一个问题——市面上这么多工具,Midjourney、豆包、ChatGPT、可灵……它们用的是同一套技术吗?生出来的图为什么风格差异那么大?
架构设计:去噪的方式是否更高效;用更先进的网络结构,去噪步数更少,速度更快,细节保持更好。
训练数据:看的图质量是否更高、数量更多、类型全。数据质量直接决定了模型的审美上限和泛化能力。
文本理解:CLIP 这层做得是否更精确。文字翻译成坐标的精度越高,prompt 的执行力越强。
工程优化:生成速度、最大分辨率、显存占用、可控性工具的丰富度。同样的底层能力,工程做得好就能更快更稳地交付结果。
我到底该用哪个?下面这张图按你的需求来选。

先写到这里。下篇有空开LoRA和ControlNet,图生图,生视频等等...(无限画饼中
夜雨聆风