ARTICLE · 1113506
AI 会画画,为什么不听指挥?Google 的答案是一张"说明书"
现在的 AI 生图模型有多强?
Nano Banana、Stable Diffusion,你随手敲一句"雨夜的霓虹街头",几秒钟出图,光影、发丝、水花,挑不出毛病。
但你提个具体要求试试:"把左边这个人去掉"、"这张脸修清楚点"、"照着这张线稿上色"、"让模特摆成这个姿势"。
它当场翻脸。要么整张重画,把你已经满意的部分也毁掉;要么答非所问,改出一张全新的图。
做电商的朋友对此深有体会:商品图只想把背景里的椅子换成沙发,AI 一动手,连商品都给你换了。改一处、毁全部,是所有修图人的日常。
业内不是没办法,是办法太笨重:一个任务,训一个专用模型。修图一个、补全一个、去模糊一个、姿势迁移再来一个。每训一个,都要重新收集数据、设计架构、烧一轮 GPU。Google 在论文里把这笔账摊开算了:这种"一事一模型"的玩法,贵到只有少数玩家烧得起,而且每加一个新功能,整套流程从头再来一遍。
你看,问题不是 AI 不会画,是"指挥 AI"这件事本身,贵得离谱。

一、Google 的答案:把任务写成"说明书"
思路的转换很漂亮:别再给每个任务造一台专用机器了,把任务写成一张说明书,让同一个模型看懂说明书干活。
说明书就两样东西:一张低分辨率的小图(论文里叫 map,相当于结构草稿——哪里是人物、哪里是背景、哪里要动),加一句白话指令("把模糊区域修清晰"、"按草稿的姿势重画人物")。
这套方法叫 Diffusion Controller。修补、去模糊、线稿上色、姿势迁移……在它眼里不再是四个任务,只是四张不同的说明书。模型从"背题型"变成了"读题干"——同一张照片,今天递"去模糊"的卡片,明天递"换姿势"的卡片,它都接。
打个比方:以前是给每个国家配一名专属翻译,现在改成教会所有人一门通用语。
有意思的是,这条路跟大语言模型的演进暗合。GPT 们早就不分"翻译模型""摘要模型"了,一个模型听指令办事。生图领域折腾到 2026 年,总算也走到了这一步。

二、改图的手艺:先看整体,再抠细节
光有说明书还不够。改图这活有个特殊麻烦:改动往往只集中在局部。补个背景、修张脸,画面里另外九成区域不该动,动了就是灾难。
Diffusion Controller 的核心组件 CoMAnDiff,全称"由粗到细的操控注意力",专门管这个:生成过程中,它把输出图和输入图对齐着看——先在低分辨率上确认整体布局没跑偏,再逐级放大,检查细节改得准不准。
像不像你自己修照片?先看缩略图确认构图,再放大到 100% 抠瑕疵。没人一上来就盯着单个像素修图,好手艺都是先抓大放小。
再说个工程上的聪明之处:这套注意力是在模型的"潜在空间"(压缩表示)里、推理阶段完成的,不用重新训练。跟那些把注意力烧进训练过程的方法比,速度优势相当明显。

三、防偏科,还自己印教材
训练这样一个多面手,有两个坑,Google 各给了一个解法。
第一个坑:偏科。哪个任务的数据多,模型就把哪个背得滚瓜烂熟,别的敷衍了事。解法叫 task dropout——训练时随机屏蔽某些任务,逼模型学会"听懂指令"本身,而不是死记"这句指令对应哪套固定动作"。这个思路是从 Flan(Google 指令微调的开山之作)借来的:练的是解题能力,不是题库。
第二个坑更麻烦:有的任务压根凑不够训练数据。解法说实话有点狠——让模型自己给自己印教材。它拿一张图,按指令自己动手做一遍变换,一张原图就变成一套"题目加标准答案"。不用人工标注,理论上能无限生成,冷门任务也不再等米下锅。
说到底,这是我们这个系列反复出现的主题:没数据,就自己造。ToolGrad 用文本梯度造工具调用数据,Retrieve-for-Train 造 AI 搜索的训练数据,MilleMiglia 造物流数据。Google 这回把"自己造数据"搬进了生图领域。

说到底
效果说话。在去模糊这类任务上,Diffusion Controller 追平甚至反超了专用模型——注意,人家专用模型是"一事一训"的满血选手,它是全科参赛的通才。
更野的是说明书可以自由组合:A 图的内容,套 B 图的风格,再按 C 图的姿势,拼成一张全新说明书,模型照样接单。很多从没专门训练过的玩法,现场写张卡片就能解锁。
落到实际,能干什么?老照片修复、商品图换背景、动画师给线稿一键上色、电商模特批量换姿势。以前每一样都得单独采购工具、单独跑流程,现在同一个模型全接。
这件事真正的分量在门槛。以前上线一个新功能,等于训练一个新模型;现在,等于写一张说明书。以前只有算法团队碰得了的事,现在把需求说清楚就行。论文和代码 Google 也开源了。

从"造数据"三连,到给 AI 配一个完整剧组,再到今天这张说明书,这个系列讲的一直是同一件事:把又贵又烦的活,交给 AI 自己。
下次你被某个专用工具卡住,不妨想想——它缺的也许不是更好的模型,是一张更好的说明书。
觉得有意思,点个"在看",转给那个还在为改图抓狂的朋友。