ARTICLE · 1116768
AI"读心" 工具能根据脑部扫描重建你正在看的内容

科学家希望它未来可用于重建人的内心想法、心理意象,甚至梦境。
(图片:三栏、每栏四组对照图。每组左图为受试者实际看到的照片,右图为根据脑部扫描生成的结果。)
核心摘要
一种新的 AI 工具仅通过分析你的脑部扫描,就能猜出你在看什么 —— 并以惊人的精确度重新生成该图像。它也能反向工作:根据一个人正在看的内容预测其大脑活动。
例如在上面的图片中,每组对照的左图是用户实际看到的画面,右图则是模型根据脑部扫描重建出的结果。
米哈尔・伊拉尼(Michal Irani)与她在以色列雷霍沃特魏茨曼科学研究所(Weizmann Institute of Science)的同事共同开发了这一工具。她希望这个 "读心" 工具最终能揭示更多关于大脑运作的奥秘,也许还能帮助 "闭锁综合征" 患者进行交流,或让科学家重现梦境的内容。
朱迪・伊莱斯(Judy Illes)是加拿大不列颠哥伦比亚大学的神经伦理学家和神经学教授,她没有参与这项研究,但形容这项工作 "非常出色"。"(用这种方法)在治疗上帮助有神经系统疾病的人…… 这个想法令人无比兴奋," 她说。
但其他科学家警告说,类似的方法也可能被用来在未经当事人同意的情况下揭示人们的内心想法和心理意象。"结果看起来非常令人印象深刻," 加州大学圣巴巴拉分校的神经科学家汤米・斯普拉格(Tommy Sprague)说。"但如果存在一种能秘密提取你正在想什么的信息的方法,那么……150 年的科幻小说随时可能成真,这在很多方面都令人担忧。"
窥探大脑
神经科学家多年来一直在研究如何利用功能性磁共振成像(fMRI)来重建人们看到的东西以及他们脑中正在发生的事。最初的尝试产生的图像模糊不清、难以辨认。技术上的进步 —— 无论是 fMRI 扫描本身,还是用于解读结果的工具 —— 都让效果逐年改善。
伊拉尼和她的同事从分析公开可用的脑部扫描数据入手。此前已有研究人员收集了志愿者躺在 fMRI 扫描仪中观看数百张图像时的扫描数据。
fMRI 利用一个巨大的磁铁来追踪含氧血液在大脑中的流动。扫描中 "亮起" 的大脑区域被认为是某一特定时刻特别活跃的区域。结果并非特别精细 —— 在典型的 fMRI 扫描仪中,每个高亮显示的 "体素"(voxel)活动大约覆盖三立方毫米,包含约 16,000 个神经元。
但伊拉尼和同事们使用的是更新的数据集,由更高分辨率的扫描仪采集 —— 每个体素大约覆盖一立方毫米的神经元,她说。这些数据集展示了志愿者观看各种图像时的大脑活动。
其他团队也做过类似的工作,已有几种工具被用于从脑部扫描数据重建图像。但伊拉尼说它们还不够好。假设一个人看到了一根香蕉,这些模型能生成一根香蕉的图像,但看起来会不一样,她说。"它不会有相同的结构、相同的位置。"
更好的解码器
研究人员希望更精确地重建被看过的图像。第一步是在已有的数据上训练一个 AI 模型 —— 这些数据来自八名受试者,每人在高分辨率 fMRI 扫描仪中各观看了约 9,000 张图像。
关键的是,他们的 "大脑解码器" 有两个分支 —— 一个用于预测图像的结构(例如颜色分布在哪里),另一个用于预测图像的内容(例如盘子里的一串香蕉)。这些预测让扩散模型(diffusion model,一种以通过逐步清理噪点像素来生成视频和图像而闻名的 AI 类型)能够生成远比以往精确的、反映人实际所见内容的表征。
但要改进模型,他们需要更多的数据 —— 远比实际可用的数据多。
为了解决这个问题,伊拉尼和同事们训练了另一个模型 —— 一个编码器(encoder),能够根据图像预测大脑活动。研究团队随后将编码器和解码器结合使用,同时改进这两个工具。
它的工作原理是这样的:从一张新图像开始,比如一张豹子的图片。然后用编码器预测,当某人看到这张图片时,他的 fMRI 脑部扫描会是什么样子。接着用解码器重建图像。起初,重建结果很可能不太像豹子,伊拉尼说。但如此反复训练模型,最终会带来巨大的改进。
这种方法还让团队能够在任意多的图像上训练模型,甚至包括从未有人在 fMRI 扫描仪中看过的图像。伊拉尼说,大约 70% 的训练数据来自原本未与 fMRI 扫描配对的图像。
通过整合多项研究的数据,他们还识别出了一些似乎在所有人身上功能共通的大脑区域。例如,一个区域似乎对食物图像有反应,而另一个区域对运动图像有反应。伊拉尼是一名计算机科学家,她说她正在与神经科学家合作,"看看我们能否真正利用开发的这些工具去发现关于大脑的新知识"。
由此产生的 "通用大脑编码器" 可以用最少的校准来处理一个新人物的扫描结果。在以往的其他尝试中,一个工具通常需要约 40 小时的新受试者 fMRI 数据,才能用于预测该人在看什么。伊拉尼说,她的解码器只需一小时的数据。这项研究上个月已在纽约举行的认知计算神经科学大会上发表。
斯普拉格说,这可能对研究大脑的神经科学家很有价值。"我们没人负担得起为新受试者做 40 小时的成像," 他说,"那大约是每小时 600 到 1,000 美元。" 像这样的工具可以加快研究速度,他说。
当前最高水平
编码器和解码器并不完美。"我们当然有失败的时候," 伊拉尼说。在一次 Zoom 通话中,她指出了一个例子:她的工具把一张蛋糕图片重建成了三个三明治摞在一起,还有一张浴缸里的狗被重建成了颜色相近的浴缸里的山羊。
但它们代表了当前的最高水平。在一项对比测试中,该工具被发现明显优于此前描述过的其他工具。"总而言之,我们确实以显著优势超越了其他工具," 伊拉尼说。她还补充说,"读心" 是对他们所做工作的一个 "可爱、花哨的名字"。
伊拉尼现在计划从图像扩展到视频和音频。她希望能够重建人们在思考或想象的内容,以及他们梦境的内容。"那东西我们还没有," 她说,"但我们正在努力实现它。"
她说,这样的工具或许能让 "闭锁"(locked in)且完全瘫痪的人仅凭大脑活动进行交流。它还能帮助科学家解开一些围绕我们心智运作方式的长期谜团,例如创伤后应激障碍(PTSD)闪回画面到底是什么样。
这类进步不可避免地引发了关于心理隐私的疑问。如果某个恶意行为者能重建某人的想法或记忆怎么办?
"如果你 10 年前问我这个问题,我会大笑一场," 斯普拉格说。让一个自愿的人安静地躺在扫描仪里并积极投入研究任务已经够难了;想象一下强迫某人这样做会怎样。但伊拉尼和其他科学家正在研究类似的方法,从脑电图(EEG)—— 通过电极帽甚至通过耳机采集的大脑电活动信号 —— 中解码大脑活动。
而且随着模型的改进,分析以这种方式采集的大脑活动会变得更加容易。"我们必须对伦理考量更加认真一些," 斯普拉格说。他认为伊拉尼的方法在预测一个人正在想但没有看的图像时 "很可能效果相当好"。
德国慕尼黑工业大学的神经科学家和哲学家马塞洛・延卡(Marcello Ienca)说,转向脑电图将是 "颠覆性的变革"。一旦 EEG 设备针对使用者自己的大脑完成校准,公司就可能相对容易地从那个人脑中提取额外信息 —— 而且可能是在未经同意的情况下。延卡还能想象,一些法院会允许把心理图像重建作为法律证据。
"我毫不怀疑这是善意的研究,但我觉得也很明显,它可能被挪用于…… 在伦理和社会层面都有问题的商业用途," 他说。
伊拉尼承认 EEG 存在被滥用的可能。但她目前并不担心。"我只想考虑好的一面," 她说。
https://www.technologyreview.com/2026/10/01/1145588/ai-mind-reading-reconstructs-what-youre-looking-at/