你有没有想过一个问题:AI 在描述一张图片的时候,它到底在「看」哪?
不是比喻意义上的看,是真实意义上——当你丢给它一张照片,让它说「图里有个穿红衣服的小孩在公园里玩」,它到底是真的「盯」着那个小孩在描述,还是它把整张图打成一团糨糊,然后统计了一堆概率,随机蒙出来的?
说真的,这个问题我之前觉得根本没法回答。
AI 的内部就是一堆矩阵运算,说「AI 在看哪」感觉像是在问「风在想什么」——形而上,没法验证。
但最近有篇论文直接把这个问题拍碎了给你看答案:AI 读图时,真的有「视线」。而且这条视线,你能用手拽。
AI 描述图片,内部真有「眼睛」在盯着
这篇论文叫《Gaze Heads: How VLMs Look at What They Describe》,研究对象是 VLM——就是那种能看图说话的 AI,比如 GPT-4V 这类多模态模型。
论文做的事情不复杂,说清楚就行:他们盯着模型的内部,找到了一批特殊的「注意力头」(attention head)。
先解释一下注意力头是什么。VLM 内部有大量的小计算单元,每个都在处理不同的信息,有些负责理解语法,有些负责对齐概念——论文里发现,有一小撮,专门负责在生成文字描述的时候,「盯」着图片里对应的区域。
这一小撮有多小?论文结果是:不到 9% 的注意力头承担了这个「视线对齐」的工作。
你可以把整个 VLM 的注意力机制想象成一个大公司,几百个员工各司其职。这 9% 不到的人,就是盯着「图文对应」这件事的专员——模型在说「红衣服小孩」的时候,他们就在专心盯着图里红衣服那一块。
而且关键是:这些「视线头」不是分散在模型各处的,研究者发现它们在特定层、特定位置有集中分布的规律。这意味着找到它们不是大海捞针,是有方法论可循的。研究者通过分析注意力头在生成 token 时对图片各区域的权重分布,筛出了这批专门干「对位」活的家伙。
这件事本身就已经离谱了。以前我们以为模型读图是「全图打平处理」,现在发现内部居然有这么精细的分工——有专门负责「把描述和图片位置对上」的头。

发现视线,还能用手拽它
光找到这些「gaze heads」(论文把它们叫做视线头)还不够,研究有意思的地方在后半段:他们不只是观察,还去「动」了它。
具体怎么动?
研究者在推理阶段(就是模型正在生成回答、不做任何训练的时候),直接介入这些视线头,把它们的注意力指向图片的另一块区域。
结果是什么?
模型描述的内容,跟着变了。
论文报告的数字:以 83% 的准确率,强迫模型去描述你指定的区域。更绝的是,他们还做了一个「换台」实验——模型在描述一半的时候,突然把视线头切到另一块区域,描述的内容就跟着「切台」,开始讲新区域的内容。
他们做了一个交互 demo(https://gaze.baulab.info/),你可以直接在浏览器里拽着 AI 的「视线」玩——把注意力拖到图里你想要的地方,模型的输出就跟着变。
我跟你讲,这个体验有点上头。
你可以理解成:以前 AI 的眼睛是玻璃珠,你没法控制它看哪。现在研究者找到了控制眼球的肌肉,而且还能在模型运行的时候直接抓着那块肌肉动。
动一下,眼球就转了。眼球转了,嘴巴说出来的话就变了。
不用重新训练模型,就能在推理时改变它关注的地方。 这是这篇论文最实在的工程价值。
可解释性,从「看热闹」变成了「能用的工具」
说到这儿,我得聊一个更大的背景。
可解释性(Interpretability)这个方向,在 AI 圈子里一直有个尴尬处境:学术界搞得热热闹闹,工业界看完论文,「哦,有意思」,然后翻页了。
为什么?
因为以前的可解释性研究,大多数是「拆黑箱发论文」——我找到了模型内部的某个结构,我分析了它的作用,我发了篇 paper。但对做产品的人来说,这个信息不能直接转化成「我怎么让模型表现更好」。
知道黑箱里有什么,但拆完还是装回去,没有后续动作。
《Gaze Heads》不一样的地方是:它拆开黑箱之后,反过来操控了它。
可解释性研究的价值,直接从「我理解了模型」升级成了「我可以推理时介入模型行为」。这是质的变化。
你品,你细品。
以前你读一篇可解释性论文,最终落点是:「模型原来是这样工作的,Amazing。」
现在的落点变成了:「找到这个结构之后,我可以在不重训的情况下,调整模型的行为,而且准确率有数可查。」
这条路一旦走通,可解释性研究就不再只是发论文的,它变成了工具——用来纠偏模型、控制模型行为、提升多模态任务精度的工具。

对做多模态产品的人,意味着什么
我们公司这边也在搞多模态的东西。做这类产品,有个永远的痛:模型盯错地方了,但你不知道它在干嘛,也不知道怎么修。
比如你让模型分析一张合同扫描件里的特定条款,它给你扯了半天另一块的内容。以前你能做的是:调 prompt,换写法,多试几次,靠运气。
Gaze Heads 这类工作,给了另一条路:
找到注意力里负责「视线对齐」的那些头,在推理时把视线拉到你要的地方。
不用重训,推理时操控,低成本。
当然,我得补一句:这条路现在还在研究阶段,距离工程化落地还有距离。论文报告的 83% 是实验室设定下的数字,真实产品场景里跑起来效果怎样,还没有大规模验证。
但信号已经很清楚了:拆注意力、找可操控部件、推理时介入——这个方向正在跑通,而且跑通之后能给工程端带来实实在在的工具。
今天搞多模态产品的人,应该把这类研究放进眼睛里,而不是等它发展成熟了再看。
更大的趋势是:这类工作——找注意力里的可操控部件、推理时不训练直接介入——正在成为多模态 AI 工程化的新思路。以前你要改模型行为,标准答案是重新微调。现在的新答案开始变成:找到内部结构,推理时直接插手。前者代价是数据、算力、时间;后者代价是研究门槛,但一旦找到结构,操控成本低得多。
说清楚局限,别过度解读
这里我得说几句清醒话,不然我对不起自己。
第一,这不是「AI 有了视觉意识」。 别被标题带跑。所谓「视线」是注意力头在图片 token 上的权重分布,是数学结构,不是认知,不是意识,更不是感知。模型还是那个无意识的统计机器,只是内部有了更精细的分工结构而已。
第二,不是所有 VLM 都有这套东西。 论文明确说了:在部分使用冻结编码器(frozen encoder)的模型里,找不到这套「gaze heads」。换句话说,这个发现和对应的操控方法,不是 100% 普适于所有多模态模型。你用的模型架构不一样,结论要具体验证。
第三,83%/9% 是论文报告的实验室数字。 我引用的是原文结果,不是在说「你拿去用保证 83%」。研究环境和生产环境差距很大,这两个数字说明的是可行性和方向,不是产品级 SLA。
这些边界我觉得必须说清楚。可解释性研究现在热,但越热越容易被过度解读。

写在最后
这篇论文的 arxiv 地址是 http://arxiv.org/abs/2606.14703v1,交互 demo 在 https://gaze.baulab.info/,有兴趣直接去玩。
我自己对这个方向的判断是:可解释性正在完成一次身份升级。
从「拆开模型看看里面是啥」,升级为「拆开之后还能反过来调它」。这个升级不是小事。做 AI 产品的人,以后面对多模态行为不符预期的问题,手里会多一类工具。
不用等 AI 完美了再用,但也别把现在的研究进展当成了铁板钉钉的结论。
这两件事不矛盾。
就聊到这儿。觉得有用的话点个「在看」,觉得我说得不对,评论区来怼我。
🌟 加入大雷早上好 AI 星球
我在知识星球持续分享 AI 实战经验、工具测评、变现案例和一线踩坑记录。白天搬砖晚上整活,所有干货都在星球里。
👉 长按下方二维码加入星球:

夜雨聆风