本期论文速览
01|CHASMBrain:Mamba 走进脑编码
如果你关注 AI 架构的演进,一定听说过 Mamba——这个 2024 年提出的状态空间模型,在处理长序列时比 Transformer 更快、更省内存。过去两年,Mamba 在语言、图像、视频上都已经证明了自己。但把它用到脑编码上?这还是第一次。
CHASMBrain: Coarse-to-fine Hierarchical Architecture with Sequential Mamba for Brain Reconstruction 做了一件顺理成章但又需要勇气的事:用 Mamba 替换掉脑编码模型里的传统 backbone。
他们的设计非常精巧。视觉皮层本身就有一个天然的层级结构——初级区处理局部纹理和边缘(视网膜拓扑),高级区处理全局语义(面孔、场景)。CHASMBrain 利用了这种结构,设计了一个双流 Mamba:
Patch 流处理图像的局部空间特征,专门对应早期视觉皮层。CLS 流处理全局语义 token,对应高级视觉区。
两股流不是简单拼在一起,而是通过一个粗到细的策略协同工作:第一阶段预测去噪后的 ROI 级激活(粗),第二阶段用 Mamba-VAE 将粗糙的预测精炼到全脑体素级别(细)。
结果是:Pearson 相关系数达到 0.429,在 NSD 基准上超越了所有现有方法。
但最让我印象深刻的不是数字,而是他们的因果消融实验。他们切断了 Patch 流——早期视觉皮层的预测精度应声下跌,但高级区几乎不受影响。切断 CLS 流——反过来,高级区崩溃,初级区完好。这不只是"预测准确",而是证明了架构设计和大脑功能层级之间存在因果对应。
论文信息
原标题:Coarse-to-fine Hierarchical Architecture with Sequential Mamba for Brain Reconstruction
作者:Hoang-Son Vo, Van-Hung Bui, Minh-Huy Mai-Duc, Tien-Dung Mai, Soo-Hyung Kim
来源:arXiv (2026-06-03)
DOI:10.48550/arXiv.2606.04772
链接:https://arxiv.org/abs/2606.04772
02|用"假数据"训练真模型:TRIBE v2 的数据增强
脑解码有一个绕不开的瓶颈:fMRI 数据太贵了。
采集一个人的 fMRI 数据需要扫描仪、被试时间、实验设计、伦理审批。一个高质量的公开数据集(比如 NSD)通常只包含 8-10 个被试,每个人看几千张图。这点数据放在深度学习的世界里,还不够塞牙缝。
那如果——用 AI 生成"假"的 fMRI 数据,用来训练"真"的解码模型呢?
TRIBE v2 来自 Meta AI 的 Jean-Rémi King 团队,这篇论文就做了这件事。TRIBE v2 是一个巨大的编码模型,用超过 1000 小时的 fMRI 数据预训练过(包含视频、音频、语言多种模态),可以给定任意图像预测对应的 fMRI 响应。
答案是可以,而且很可以。在 NSD 和 BOLD5000 两个数据集上,加入合成数据后,Top-10 图像检索准确率最高提升了 68%。
更有趣的是两个发现:第一,合成数据的比例需要调——不是越多越好。第二,只用合成数据训练的解码模型,在某些设置下也能超过随机水平——这意味着 TRIBE v2 可能支持"零样本"脑解码,不需要任何真实被试的数据。
这有点像计算机视觉里的"用 ImageNet 预训练,再在你的小数据集上微调"——只不过这里的 ImageNet 是一个学会了"大脑如何反应"的大模型。脑解码的"基础模型时代",也许比我们想象的要近。
论文信息
原标题:Boosting Brain-to-Image Decoding with TRIBE v2 Data Augmentation
作者:Yohann Benchetrit, Marlène Careil, Simon Dahan, Hubert Banville, Stéphane d'Ascoli, Jean-Rémi King
来源:arXiv (2026-06-04)
DOI:10.48550/arXiv.2606.06345
链接:https://arxiv.org/abs/2606.06345
03|线性就够了:从"堆复杂度"到"选对目标"
Retrieval-Based Brain Decoding by Alignment, not Complexity 做了一件让人反思的事:系统性地比较了线性对比学习解码器和各种非线性方法在 fMRI 解码上的表现。
结果出人意料——又或者说,如果你了解 fMRI 的信号特性,就不会太意外:线性对比学习解码器在图像、文字、声音三种模态上,都稳定地跑赢了非线性方法。
为什么?fMRI 信号是对数十万个神经元在数秒内的空间和时间平均,加上血流动力学响应的平滑效应。这个过程天然地"线性化"了底层的非线性神经计算。换句话说,fMRI 本身就是一个线性化观察——你在单细胞层面看到的是高度非线性的脉冲编码,但 fMRI 把所有这些非线性搅在一起,最终输出的是一个被线性主导的信号。
这意味着对于 fMRI 解码来说,把精力花在"设计更复杂的非线性架构"上,可能不如花在"选择一个更好的训练目标"上。而对比学习——让同一刺激的脑信号嵌入和图像嵌入在空间中靠近——恰好是这个"更好的目标"。
这篇论文的价值不在于提供了一个新 SOTA 数字,而在于它给整个领域提了一个方法论上的醒:在堆更多参数之前,先想清楚你的信号有什么样的数学结构。
论文信息
原标题:Retrieval-Based Brain Decoding by Alignment, not Complexity
作者:Matteo Ciferri, Matteo Ferrante, Nicola Toschi
来源:arXiv (2026-06-17)
DOI:10.48550/arXiv.2606.19081
链接:https://arxiv.org/abs/2606.19081
04|神经元会说话吗?NEURRATOR 的单细胞叙事
NEURRATOR: Can neurons speak? Semantic narration of vision at single-cell resolution 的核心问题异常大胆:能不能让单个神经元"开口说话"——把它看到的东西用自然语言描述出来?
方法是这样的。他们用 Neuropixel 探针同时记录了小鼠视觉皮层中数千个神经元的脉冲活动(spike train),同时给小鼠播放自然电影。然后,一个编码器把这些脉冲信号映射到 CLIP 的嵌入空间,再通过一个多模态语言模型和稀疏自编码器,生成自由形式的自然语言描述——比如"一只猫在窗台上走"——而且不需要任何语言层面的训练。
这意味着什么?你不需要预先定义"这个神经元对面孔有反应""那个神经元对运动有反应"。你直接把脉冲序列扔进模型,它会用自然语言告诉你这些神经元"看到了什么"。
更惊人的是,这个框架可以从不同尺度上"叙述"——可以是数千个神经元一起"说",可以是某一个皮层区域"说",可以是一个局部神经元群体"说",甚至可以是一个分子层面定义的单类细胞"说"。
他们还用这个框架量化了解码精度如何随神经元数量和脑区位置缩放。这为理解神经系统的信息编码提供了一个全新的度量——不是"这个神经元对什么刺激反应最强",而是"从这个神经元的活动里,我能读出多少语义信息"。
把神经元活动翻译成人类语言,这件事在概念上接近科幻。但 NEURRATOR 让它变得可以度量、可以比较、可以系统化——这就是科学和科幻的区别。
论文信息
原标题:Can neurons speak? Semantic narration of vision at single-cell resolution
作者:Arnau Marin-Llobet, Richard Hakim, Sara Matias, Venkatesh N. Murthy, Na Li, Demba Ba
来源:arXiv (2026-06-17)
DOI:10.48550/arXiv.2606.18667
链接:https://arxiv.org/abs/2606.18667
05|反向传播和大脑:貌合神离?
最后一篇论文,回到基础问题。
深度学习靠反向传播(backpropagation)学习。三十年来,神经科学家一直在问:大脑也用反向传播吗?
这个问题的意义远超学术八卦。如果大脑确实用了反向传播(或其某种近似),那么"用深度网络模拟大脑"这件事就有了更深层的合法性。但如果大脑没有用反向传播,那就意味着——尽管深度网络和大脑在很多任务上看起来很像,它们的底层学习机制可能是根本不同的。
Misalignment Between Backpropagation and the Hierarchy of Brain Responses to Images 来自 Jean-Rémi King 和 Meta AI 联合团队,对这个问题做了一次系统性的检验。之前所有人都在用前向激活来预测大脑反应。这篇论文第一次把这个框架扩展到了反向传播的梯度上。
结果分两层。第一层,好消息:反向传播的梯度确实能预测大脑信号——特别是在高级视觉皮层和较晚的潜伏期上。第二层,不那么好的消息:梯度的空间和时间组织与生物大脑的层级结构不吻合。按照生物可行的反向传播机制,梯度应该在时间上从高级区传回初级区,在空间上遵循视觉皮层的层级拓扑。但他们观察到的模式不符合这个预期。
他们用 DINOv3 做了主实验,又在 8 个不同的视觉模型上复现了结果。一致性很高。
这篇论文的结论不是"反向传播绝对不在大脑中发生",而是——如果大脑确实在用某种误差反向传播机制,那它的实现方式和我们目前在深度网络中使用的反向传播有结构性的差异。大脑和深度网络可能共享相似的"表征内容",但它们的"学习机制"很可能是两条不同的路。
这让我想起上一期 BrainCause 的洞见——预测相关不等于机制相同。这一篇把同样的逻辑推到了更深的层次:表征层面的相似,不等于学习层面的相似。 这是"用 AI 理解大脑"这件事必须面对的一个根本性限制。
论文信息
原标题:Misalignment Between Backpropagation and the Hierarchy of Brain Responses to Images
作者:Joséphine Raugel, Maximilian Seitzer, Marc Szafraniec, Huy V. Vo, Jérémy Rapin, Patrick Labatut, Piotr Bojanowski, Valentin Wyart, Jean-Rémi King
来源:arXiv (2026-05-27)
DOI:10.48550/arXiv.2605.28693
链接:https://arxiv.org/abs/2605.28693
夜雨聆风