乐于分享
好东西不私藏

找到了 AI 的视线,还能遥控它:Gaze Heads 让可解释性变成真工具

找到了 AI 的视线,还能遥控它:Gaze Heads 让可解释性变成真工具

你有没有想过一个问题:AI 在描述一张图片的时候,它到底在「看」哪?

不是比喻意义上的看,是真实意义上——当你丢给它一张照片,让它说「图里有个穿红衣服的小孩在公园里玩」,它到底是真的「盯」着那个小孩在描述,还是它把整张图打成一团糨糊,然后统计了一堆概率,随机蒙出来的?

说真的,这个问题我之前觉得根本没法回答。

AI 的内部就是一堆矩阵运算,说「AI 在看哪」感觉像是在问「风在想什么」——形而上,没法验证。

但最近有篇论文直接把这个问题拍碎了给你看答案:AI 读图时,真的有「视线」。而且这条视线,你能用手拽。


AI 描述图片,内部真有「眼睛」在盯着

这篇论文叫《Gaze Heads: How VLMs Look at What They Describe》,研究对象是 VLM——就是那种能看图说话的 AI,比如 GPT-4V 这类多模态模型。

论文做的事情不复杂,说清楚就行:他们盯着模型的内部,找到了一批特殊的「注意力头」(attention head)。

先解释一下注意力头是什么。VLM 内部有大量的小计算单元,每个都在处理不同的信息,有些负责理解语法,有些负责对齐概念——论文里发现,有一小撮,专门负责在生成文字描述的时候,「盯」着图片里对应的区域。

这一小撮有多小?论文结果是:不到 9% 的注意力头承担了这个「视线对齐」的工作。

你可以把整个 VLM 的注意力机制想象成一个大公司,几百个员工各司其职。这 9% 不到的人,就是盯着「图文对应」这件事的专员——模型在说「红衣服小孩」的时候,他们就在专心盯着图里红衣服那一块。

而且关键是:这些「视线头」不是分散在模型各处的,研究者发现它们在特定层、特定位置有集中分布的规律。这意味着找到它们不是大海捞针,是有方法论可循的。研究者通过分析注意力头在生成 token 时对图片各区域的权重分布,筛出了这批专门干「对位」活的家伙。

这件事本身就已经离谱了。以前我们以为模型读图是「全图打平处理」,现在发现内部居然有这么精细的分工——有专门负责「把描述和图片位置对上」的头。


发现视线,还能用手拽它

光找到这些「gaze heads」(论文把它们叫做视线头)还不够,研究有意思的地方在后半段:他们不只是观察,还去「动」了它。

具体怎么动?

研究者在推理阶段(就是模型正在生成回答、不做任何训练的时候),直接介入这些视线头,把它们的注意力指向图片的另一块区域。

结果是什么?

模型描述的内容,跟着变了。

论文报告的数字:以 83% 的准确率,强迫模型去描述你指定的区域。更绝的是,他们还做了一个「换台」实验——模型在描述一半的时候,突然把视线头切到另一块区域,描述的内容就跟着「切台」,开始讲新区域的内容。

他们做了一个交互 demo(https://gaze.baulab.info/),你可以直接在浏览器里拽着 AI 的「视线」玩——把注意力拖到图里你想要的地方,模型的输出就跟着变。

我跟你讲,这个体验有点上头。

你可以理解成:以前 AI 的眼睛是玻璃珠,你没法控制它看哪。现在研究者找到了控制眼球的肌肉,而且还能在模型运行的时候直接抓着那块肌肉动。

动一下,眼球就转了。眼球转了,嘴巴说出来的话就变了。

不用重新训练模型,就能在推理时改变它关注的地方。 这是这篇论文最实在的工程价值。


可解释性,从「看热闹」变成了「能用的工具」

说到这儿,我得聊一个更大的背景。

可解释性(Interpretability)这个方向,在 AI 圈子里一直有个尴尬处境:学术界搞得热热闹闹,工业界看完论文,「哦,有意思」,然后翻页了。

为什么?

因为以前的可解释性研究,大多数是「拆黑箱发论文」——我找到了模型内部的某个结构,我分析了它的作用,我发了篇 paper。但对做产品的人来说,这个信息不能直接转化成「我怎么让模型表现更好」。

知道黑箱里有什么,但拆完还是装回去,没有后续动作。

《Gaze Heads》不一样的地方是:它拆开黑箱之后,反过来操控了它。

可解释性研究的价值,直接从「我理解了模型」升级成了「我可以推理时介入模型行为」。这是质的变化。

你品,你细品。

以前你读一篇可解释性论文,最终落点是:「模型原来是这样工作的,Amazing。」

现在的落点变成了:「找到这个结构之后,我可以在不重训的情况下,调整模型的行为,而且准确率有数可查。」

这条路一旦走通,可解释性研究就不再只是发论文的,它变成了工具——用来纠偏模型、控制模型行为、提升多模态任务精度的工具。


对做多模态产品的人,意味着什么

我们公司这边也在搞多模态的东西。做这类产品,有个永远的痛:模型盯错地方了,但你不知道它在干嘛,也不知道怎么修。

比如你让模型分析一张合同扫描件里的特定条款,它给你扯了半天另一块的内容。以前你能做的是:调 prompt,换写法,多试几次,靠运气。

Gaze Heads 这类工作,给了另一条路:

找到注意力里负责「视线对齐」的那些头,在推理时把视线拉到你要的地方。

不用重训,推理时操控,低成本。

当然,我得补一句:这条路现在还在研究阶段,距离工程化落地还有距离。论文报告的 83% 是实验室设定下的数字,真实产品场景里跑起来效果怎样,还没有大规模验证。

但信号已经很清楚了:拆注意力、找可操控部件、推理时介入——这个方向正在跑通,而且跑通之后能给工程端带来实实在在的工具。

今天搞多模态产品的人,应该把这类研究放进眼睛里,而不是等它发展成熟了再看。

更大的趋势是:这类工作——找注意力里的可操控部件、推理时不训练直接介入——正在成为多模态 AI 工程化的新思路。以前你要改模型行为,标准答案是重新微调。现在的新答案开始变成:找到内部结构,推理时直接插手。前者代价是数据、算力、时间;后者代价是研究门槛,但一旦找到结构,操控成本低得多。


说清楚局限,别过度解读

这里我得说几句清醒话,不然我对不起自己。

第一,这不是「AI 有了视觉意识」。 别被标题带跑。所谓「视线」是注意力头在图片 token 上的权重分布,是数学结构,不是认知,不是意识,更不是感知。模型还是那个无意识的统计机器,只是内部有了更精细的分工结构而已。

第二,不是所有 VLM 都有这套东西。 论文明确说了:在部分使用冻结编码器(frozen encoder)的模型里,找不到这套「gaze heads」。换句话说,这个发现和对应的操控方法,不是 100% 普适于所有多模态模型。你用的模型架构不一样,结论要具体验证。

第三,83%/9% 是论文报告的实验室数字。 我引用的是原文结果,不是在说「你拿去用保证 83%」。研究环境和生产环境差距很大,这两个数字说明的是可行性和方向,不是产品级 SLA。

这些边界我觉得必须说清楚。可解释性研究现在热,但越热越容易被过度解读。


写在最后

这篇论文的 arxiv 地址是 http://arxiv.org/abs/2606.14703v1,交互 demo 在 https://gaze.baulab.info/,有兴趣直接去玩。

我自己对这个方向的判断是:可解释性正在完成一次身份升级。

从「拆开模型看看里面是啥」,升级为「拆开之后还能反过来调它」。这个升级不是小事。做 AI 产品的人,以后面对多模态行为不符预期的问题,手里会多一类工具。

不用等 AI 完美了再用,但也别把现在的研究进展当成了铁板钉钉的结论。

这两件事不矛盾。

就聊到这儿。觉得有用的话点个「在看」,觉得我说得不对,评论区来怼我。


🌟 加入大雷早上好 AI 星球

我在知识星球持续分享 AI 实战经验、工具测评、变现案例和一线踩坑记录。白天搬砖晚上整活,所有干货都在星球里。

👉 长按下方二维码加入星球:

大雷早上好 AI 星球