ARTICLE · 1064478
5款AI图片工具实测:同一个prompt,结果差多少?
差别很大,并且完全不同。
上个月我做了一件很无趣的事情,在同样的 prompt 下对同一个场景进行描述——穿深蓝色风衣的亚洲女性站在雨后东京街头,背景是朦胧的霓虹灯招牌、黄昏时分的侧光以及半身构图,人物、环境和光线都没有改变,只是把它们分别放进5种主流人工智能图片工具里。
那么结果是什么呢?就是5位画家根据自己的理解去把握了甲方的需求。
我测试了5个工具,分别是Midjourney V6、DALL·E 3、Stable Diffusion XL、Adobe Firefly以及国内的文心一格。prompt是一样的,在英文版上都用同一段文字来描述,而文心一格那边把中文版翻译成了英文但是意思保持一致。
所考虑的因素为4点:人物还原程度、环境气氛、光照效果以及图片大小与所写的相符。

Midjourney V6出图的第一眼就让我觉得信服了,雨后地面反光、霓虹灯映在积水里的倒影营造出很好的氛围感,但是仔细一看,人物的脸部特征比较欧式化,我没有写亚洲女性的话就会有一种很强的混血儿味道。光线方面没有跑偏,在半身构图上也做得很好。
DALL·E 3 在人物复原方面却比较老实,并且把亚洲人、风衣的颜色都对上了。但是场景出现了问题——背景中的霓虹灯招牌太清楚了,我已经注明是模糊不清的状态了,但它仍然把它还原成了清晰的特写镜头,并且光线也很冷淡,并没有体现出黄昏时候的那种温暖的感觉。
Stable Diffusion XL单独讲解的话,因为它的可控性最强、最折腾。同样的prompt直接出图,效果中规中矩,人物的比例有点奇怪,头偏大。但是如果你肯花时间去调整参数和添加ControlNet的话,它可以接近你脑海中的画面,所以这个工具并不是为了懒人准备的。

Adobe Firefly给我的惊喜就是它非常听话,你说是深蓝色的风衣就会出现深蓝色的衣服,你说一个模糊不清的背景就会被准确地还原出来,并且比例关系也都保持得十分到位。但是画面过于清爽了,并没有一丝情绪上的波动,在雨后东京街头那种潮湿黏腻的感觉完全没有体现出来,仿佛是一张商业素材图,技术上达标但是缺少了灵魂。
文心一意的表现其实让我很为难,因为其中的人物肤色是5个人中最好的一种,这个可以肯定。但是场景氛围还是有的,只是细节放大之后就很难看出来了,比如霓虹灯下的光影效果就是这样的感觉,看起来比较粗糙,整体上有一种被滤镜硬生生地添上去的效果电影感。
我认为这5个工具的不同原因并不在于算法的好坏,在于训练数据的偏向上。Midjourney吃了大量的摄影、插画等作品,因此它自然地带有很强的艺术感但是人种识别能力较差。DALL·E 3和GPT结合得比较紧密,文本理解能力很强但是美学判断较为保守,Firefly 使用的是Adobe自家版权素材库,虽然符合法规但缺少野性。
这说明了另外一种情况,即 prompt虽然很准确,但是所能控制的是输出端的事情,并不是输入端的事情。模型对于黄昏侧光的理解程度如何,取决于它遇到过的黄昏侧光照片的数量以及每张照片所反映出来的效果不同,不同的模型见识也各异。

我认为人们认为Prompt可以解决一切问题,只要写出好的Prompt就一定能得到相同的图片。在2025年年末的时候,在CSDN上有一篇关于使用GPT进行图像生成的文章中提到画质已经被压榨到了极限,而且速度也非常快。
如果需要快速生成商业素材的话,可以使用Firefly、DALL·E 3;而如果想要的画面情绪,则还是Midjourney最好用但是要接受它的自由发挥。Stable Diffusion适合那些愿意折腾的技术流的人;文心一格在中文场景以及亚洲人物上也有自己的优势,并不是一开始就否定它就可以的。
同一种说法,用5种不同的面孔来表达它。在选择工具的时候,并不是说只要好看就行,还要考虑它的功能是否符合自己的需求。