ARTICLE · 1123577
AI“读心术”更进一步:仅凭脑扫描,就能重建你正在看的画面

一款新的AI工具,只需分析你的脑部扫描,就能猜出你正在看什么,甚至能以惊人的精度重新生成那幅画面。这个过程也可以反过来进行:根据一个人正在观看的内容,预测其大脑活动。
例如,在上面的图片中,每组左侧的图像是受试者实际看到的内容,右侧则是模型根据其脑扫描数据重建出的图像。
这款工具由米哈尔·伊拉尼(Michal Irani)及其同事在以色列雷霍沃特的魏茨曼科学研究所(Weizmann Institute of Science)开发。伊拉尼希望,这种“读心”工具最终能够帮助我们进一步理解大脑的工作机制。未来,它或许还能帮助闭锁综合征患者与外界交流,甚至让科学家重建梦境中的内容。
虽然并未参与这项研究,但加拿大不列颠哥伦比亚大学神经伦理学家、神经病学教授朱迪·伊尔斯(Judy Illes)将这项工作形容为“了不起”。她说:“利用这种方法帮助神经系统疾病患者进行治疗,这个想法令人无比兴奋。”
但另一些科学家警告,类似的方法也可能被用于揭示一个人的内心想法和脑海中的图像,甚至可能在未经本人同意的情况下进行。加州大学圣塔芭芭拉分校神经科学家汤米·斯普拉格(Tommy Sprague)说:“这些结果看起来非常惊人。但如果真的存在一可以在不被察觉的情况下提取你正在思考的内容,那么……过去150年科幻作品里描绘的东西随时都有可能成为现实,而这在很多方面都令人担忧。”

窥探大脑
多年来,神经科学家一直在研究如何利用功能性磁共振成像(fMRI),重建人们看到的东西,以及他们脑海中正在发生的事情。
最早的尝试只能生成模糊、难以辨认的图像。但随着技术进步,既包括fMRI扫描本身的改进,也包括分析扫描结果的工具不断发展,重建效果这些年来一直在提高。
伊拉尼和同事首先分析了公开可用的脑扫描数据。此前,其他研究人员已经招募志愿者,让他们躺在fMRI扫描仪中观看数百张图片,并记录相应的脑部扫描数据。fMRI利用巨大的磁体追踪大脑中含氧血液的流动。扫描中“亮起”的脑区,通常被认为在当时处于相对活跃状态。
但这种结果并没有特别高的精度。在普通fMRI扫描仪中,一个被标记为活跃的“体素”(voxel)大约覆盖3立方毫米的脑组织,而每立方毫米脑组织中大约包含1.6万个神经元。
不过,伊拉尼和同事使用了由更高分辨率扫描仪采集的新数据集。她表示,在这些数据中,每个体素大约只覆盖1立方毫米的脑组织。这些数据记录了志愿者观看不同图像时的大脑活动模式。
其他研究团队也进行过类似工作,此前已经出现多种利用脑扫描数据重建图像的工具。但伊拉尼认为,它们还不够好。假设一个人看到了一根香蕉。此前的模型确实可以生成一张香蕉图片,但生成出来的香蕉和原图可能并不一样。
“它不会拥有相同的结构,也不会处在相同的位置。”她说。

更好的“大脑解码器”
研究人员希望更加精确地重建受试者实际看到的图像。
第一步,是利用已有数据训练AI模型。这些数据来自8名受试者,每个人在高分辨率fMRI扫描仪中观看了大约9000张图片。关键在于,他们开发的“大脑解码器”包含两个分支:一个负责预测图像的结构,例如不同颜色分别位于什么位置;另一个则负责预测图像的内容,例如“盘子里放着一串香蕉”。
这些预测结果随后会被输入一个扩散模型(diffusion model)。这类AI模型最为人熟知的用途就是生成图片和视频:它从一片充满噪声的像素开始,逐渐“去噪”,最终形成清晰图像。借助这种方式,模型能够更加准确地重建一个人实际看到的内容。
但研究人员很快遇到了另一个问题:如果想继续提升模型性能,他们需要更多数据,这远远超过现有fMRI数据的规模。为了解决这个问题,伊拉尼和同事又训练了另一个模型:一个能够根据图像预测大脑活动的“编码器”(encoder)。
随后,团队把编码器和解码器结合起来,让两个模型相互帮助、共同提升。具体来说,假设从一张新的豹子图片开始。首先,让编码器预测:如果一个人正在看这张豹子图片,他的fMRI脑扫描结果可能是什么样子。接下来,再让解码器根据预测出来的脑活动重新生成图片。伊拉尼说,一开始,重建出来的图像可能根本不像豹子。但通过不断重复这一训练过程,模型最终会获得显著提升。
这种方法还有一个重要优势:研究团队可以使用任意数量的图片训练模型,即使这些图片从来没有真正展示给躺在fMRI扫描仪里的人看过。伊拉尼表示,大约70%的训练数据来自原本并没有对应fMRI扫描结果的图片。
通过整合多项研究的数据,他们还识别出了一些似乎在不同个体之间具有共同功能的脑区。例如,其中一个区域似乎会对食物图片产生反应,另一个区域则会对体育运动图片产生反应。
作为一名计算机科学家,伊拉尼表示,她目前正在与神经科学家合作,“看看我们能否真正利用这些已经开发出来的工具,发现一些关于大脑的新东西”。最终得到的这个“通用大脑编码器”(universal brain encoder),只需要极少量校准,就可以用于一个全新的受试者。此前类似工具如果要预测一个新人正在看什么,通常需要先收集大约40小时的fMRI数据。而伊拉尼表示,她们的解码器只需要1小时的数据。
这项研究成果于上个月在纽约举行的认知计算神经科学大会(Cognitive Computational Neuroscience Conference)上公布。斯普拉格认为,这可能使该工具对研究大脑的神经科学家非常有价值。
“我们没有谁负担得起为一个新受试者做40个小时的成像。”他说,“每小时的费用大约是600到1000美元。”他认为,这类工具可以显著加快研究进程。

当前最先进的水平
编码器和解码器并非完美无缺。“当然,我们也会失败。”伊拉尼说。在一次Zoom通话中,她展示了一张蛋糕的图片,模型却把它重建成了三明治堆;还有一张浴缸里的狗,被模型重建成了一只颜色相似、同样待在浴缸里的山羊。
尽管如此,这套系统仍代表了目前这一领域的前沿水平。在对比测试中,该工具的表现明显优于此前公布的其他方法。伊拉尼说:“总体而言,我们确实大幅超过了其他方法。”她补充说,把他们正在做的事情称为“读心”,其实只是一个“可爱又抓眼球的名字”。
现在,伊拉尼计划进一步从静态图像扩展到视频和音频。她希望未来能够重建一个人正在思考或想象的内容,甚至还原梦境。“这是我们现在还做不到的,”她说,“但我们正在努力实现。”她认为,这样的工具未来或许能够让完全瘫痪的“闭锁”患者仅凭大脑活动与外界交流。它还可能帮助科学家解开一些长期困扰我们的心智谜题,例如创伤后应激障碍(PTSD)患者经历的闪回,在大脑中究竟是什么样的。
然而,这类技术的发展也不可避免地提出了一个问题:思想隐私(mental privacy)怎么办?如果某个恶意行为者能够重建一个人的思想或记忆呢?
“如果你10年前问我这个问题,我可能会笑很久。”斯普拉格说。即使让一个自愿参加实验的人安静地躺在扫描仪里,并积极配合研究任务,本身就已经很困难了,更不用说强迫一个人这样做。
但是,伊拉尼以及其他科学家已经开始研究类似的方法,希望利用脑电图(EEG)来解码大脑活动。EEG通过电极帽采集大脑的电活动,甚至已经出现了通过耳机采集相关信号的设备。随着模型能力不断提升,分析以这种方式采集到的大脑活动也将越来越容易。
“我们必须更加认真地对待其中的伦理问题。”斯普拉格说。他认为,伊拉尼的方法很可能也能够“相当有效”地预测一个人脑海里正在想象、但眼睛并没有实际看到的图像。
德国慕尼黑工业大学神经科学家兼哲学家马塞洛·延卡(Marcello Ienca)认为,如果这项技术从fMRI进一步转向EEG,将成为一个“游戏规则改变者”。一旦一台EEG设备针对某个用户的大脑完成校准,公司就可能相对容易地从这个人的大脑中提取额外信息,甚至可能未经本人同意。
延卡甚至设想,未来某些法院可能会允许把根据大脑活动重建出来的心理图像作为法律证据。他说:“我毫不怀疑,这项研究的出发点是善意的。但同样显而易见的是,它也可能被挪作他用,进入一些在伦理和社会层面都存在问题的商业应用。”
伊拉尼也承认,如果这项技术与EEG结合,确实存在被滥用的可能。不过,目前她还没有太过担忧。
“我现在只想去想那些好的事情。”她说。
https://www.technologyreview.com/2026/10/01/1145588/ai-mind-reading-reconstructs-what-youre-looking-at/