乐于分享
好东西不私藏

AI 的视觉直觉从哪里来?一个模型复刻了大脑的结构推断能力

AI 的视觉直觉从哪里来?一个模型复刻了大脑的结构推断能力

人类的视觉系统有一个特别迷人的能力。哪怕画面里只有一些零散的 Gabor 元件,只要它们之间隐约存在某种几何关系,我们的大脑就会自动把它们串成一条连续的轮廓。更有意思的是扩散模型在面对同样的碎片化图像时,也会做出类似的判断。它会把那些看似无序的线段重新组织成结构化的形状,甚至补全缺失的部分。这种跨生物系统与人工模型的“共识”,让人不禁好奇,它们是不是在背后共享某种深层的推断机制。

视觉皮层的推理过程一直是神经科学的核心难题,扩散模型的生成过程则是现代 AI 的热门话题。一个来自 UC Berkeley、Flatiron Institute、UC Davis 的跨学科团队试图把这两个世界连接起来。团队成员包括 Zeyu Yun、Alexander Belsten、Dasheng Bi、Zahra Kadkhodaie、Yubei Chen,以及长期深耕视觉计算与稀疏编码的 Bruno A. Olshausen。他们提出一个大胆的想法,构建一个极简但可解释的模型,让我们能够同时理解视觉皮层的推断机制和扩散模型的内部结构。
这项研究的目标不是再造一个更大的生成模型,而是拆解扩散模型的“推断逻辑”,并把它与视觉皮层的神经结构对应起来。研究团队希望回答一个关键问题,为什么视觉皮层和扩散模型在面对模糊、碎片化的图像时,会做出如此一致的结构补全行为。答案可能藏在一个更基本的计算框架里。

01 背景——稀疏编码、自然图像统计与扩散模型的可解释性困境

稀疏编码模型在视觉神经科学中有着重要地位。它曾经成功解释了 V1 简单细胞的方向选择性和局部感受野结构。模型的核心思想是用一组基函数去重建图像,并让这些基函数的激活尽可能稀疏。经典稀疏编码的能量函数是:
这个结构简单优雅,却有一个明显的限制。它假设所有潜变量之间是独立的,也就是所谓的因子化先验。问题在于,自然图像并不是独立的像素拼贴。图像中的边缘、轮廓、纹理都有强烈的共线性和共圆性结构。视觉皮层的水平连接也早已被证明会把空间上分离但方向一致的特征联系起来。
图1:轮廓刺激的似然性和雅可比分析。
自然图像统计告诉我们,真实世界的视觉结构是高度相关的。视觉皮层的神经解剖告诉我们,大脑确实利用了这些相关性。稀疏编码的因子化假设显然无法捕捉这种结构依赖。
扩散模型的出现让情况变得更复杂。扩散模型的 score function 可以计算,它告诉我们模型认为图像在哪些方向上更“可能”。但扩散模型内部的神经网络结构是黑箱的。我们知道它能补全轮廓、延展结构、生成自然的形变,却不知道它是怎么做到的。
这项研究试图解决这个困境。研究团队希望找到一个既能学习自然图像统计,又能提供可解释推断动力学的模型。一个能让我们真正看到扩散模型内部“结构推断”的机制,而不是只能从结果猜测。

02 模型提出非因子化稀疏编码作为最小扩散模型

研究团队提出的核心模型,是在稀疏编码的框架里加入一个可学习的成对交互矩阵 M。新的能量函数变成
这个结构有三个关键部分。第一部分是重建项,用字典 Φ 去重建输入图像。第二部分是稀疏项,用 α 去控制潜变量的稀疏性。第三部分是结构先验,用 M 去捕捉潜变量之间的依赖关系。
M 是整个模型的灵魂。它不再假设潜变量独立,而是让模型自己从自然图像中学习哪些特征应该互相联系。比如哪些方向一致的边缘应该被视为同一条轮廓,哪些空间上分离但结构上相关的特征应该被绑定在一起。
γ(σ) 是一个根据噪声动态调节先验权重的函数。噪声越大,模型越依赖结构先验。噪声越小,模型越依赖重建项。这种设计让模型在不同噪声水平下都能保持稳定的推断能力。
这个模型的目标不是手工设计视觉结构,而是让 M 自动学习自然图像中的结构依赖。它希望让模型自己学会视觉皮层的水平连接,而不是人为硬编码。

03 训练方法:用DSM将稀疏编码转化为可解释的扩散模型

这项研究的训练思路非常有意思。团队没有走传统的最大似然路线,而是把整个稀疏编码模型直接塞进了扩散模型的训练框架里,用的是 Denoising Score Matching,也就是大家熟悉的 DSM。这个方法的核心思想很朴素,给一张干净图像加噪声,让模型学会从噪声图像里恢复出原图。听起来像是去噪任务,但本质上是在逼模型去学习数据分布的梯度,也就是 score function。
在这个模型里,score function 的近似形式非常简洁。因为稀疏编码的能量函数是显式的,团队直接用 MAP 近似,把潜变量的后验分布收缩到它的最优解上。于是 score function可以写成
这个公式的含义很直白,模型认为图像更可能的方向,就是重建图像和输入图像之间的差值。换句话说,稀疏编码的重建结果本身就成了扩散模型的梯度估计。
DSM 的损失也因此变得非常简单。把 score function 代回 DSM 的目标函数之后,整个训练目标直接变成一个加权的重建误差
这里的 x 是加噪后的图像,y 是干净图像,w是噪声权重。这个结构让模型在不同噪声水平下都能稳定学习,同时保留了稀疏编码的可解释性。模型既像扩散模型一样学习概率梯度,又像稀疏编码一样保持结构透明。这种训练方式让整个模型既有生成模型的能力,又有神经科学模型的可读性。

04 推断动力学:ISTA作为视觉皮层的递归神经回路

模型的推断过程是这项研究最精彩的部分之一。团队用的是经典的 ISTA,也就是迭代式阈值算法。这个算法在稀疏编码里很常见,但在这里,它被重新解释成一个视觉皮层的递归神经回路。
ISTA 的更新公式写成:
这个公式拆开来看,会发现它和视觉皮层的结构几乎一一对应。第一项是前馈驱动,把输入图像投影到字典空间。第二项是局部递归驱动,由 Gram 矩阵控制,代表感受野重叠的神经元之间的相互作用。第三项是长程递归驱动,由 M控制,代表空间上分离但方向一致的特征之间的联系。最后的稀疏偏置则对应神经元的抑制机制。
整个推断过程就像一个可解释的视觉皮层动力系统。前馈输入激活局部特征,局部连接强化重叠结构,长程连接延展轮廓,稀疏抑制保持整体稳定。模型不是在做黑箱推断,而是在模拟视觉皮层的真实计算逻辑。每一步更新都能找到对应的神经结构,这让模型的行为变得非常透明。

05 隐式微分:用IFT获得可解析的Jacobian

为了真正理解模型的隐式先验,团队需要计算 Jacobian,也就是输出对输入的梯度。这个梯度揭示了模型认为哪些方向是高概率方向,也就是扩散模型内部的结构偏好。问题在于,z* 是通过迭代得到的,直接对迭代过程求导会非常复杂。
团队的解决方案是使用隐式函数定理,也就是 IFT。把固定点条件写成:
然后用 IFT 得到:
这个公式的意义非常关键。它让我们不用展开整个迭代过程,就能直接得到 z* 对输入的梯度。再把这个梯度投影回像素空间,就能得到完整的 Jacobian:
这让模型的隐式先验变得完全可解析。相比之下,U-Net 扩散模型的 Jacobian 是黑箱的,只能通过数值方法近似。这个模型则可以直接看到 Jacobian 的结构,甚至可以分解它的每一项,理解它如何沿着轮廓传播信息,如何形成连续的形变基。
这种可解析性是这项研究的核心价值之一。它让我们第一次能够从机制层面理解扩散模型的结构推断能力,而不是只能从结果猜测。

06 结果一:模型自动学习出V1的共线性水平连接

图2:V1类连通性和去噪性能的出现。
模型训练完成后的那一刻,最让人惊讶的不是它能把噪声图像修好,而是它居然自己长出了类似 V1 的水平连接结构。字典 Φ 的形状非常眼熟,都是一块块方向明确、位置局部的 Gabor 样式基函数。更关键的是,潜变量之间的交互矩阵 M 也出现了非常强烈的共线性结构。那些在空间上分离但方向一致的基函数,会在 M 中形成明显的兴奋性连接,而方向不一致的基函数则被抑制。
这种结构在视觉神经科学里有一个经典名字,叫做 association field。意思是视觉皮层会把方向一致的边缘自动串成一条线,让大脑更容易感知轮廓。模型完全没有被告知这种结构,却在自然图像的统计中自己学了出来。M 的连接图看起来就像一张神经解剖图,展示了哪些方向一致的特征会互相激活,哪些会互相抑制。
这说明模型不仅重现了 V1 的结构,还给出了它的功能解释。共线性连接不是为了美观,而是为了让模型在模糊场景中延展真实轮廓,补全缺失结构,维持整体一致性。模型的结构先验就是视觉皮层的计算逻辑。

07 结果二:非因子化先验显著提升去噪与结构推断能力

当把模型放到高噪声环境里,它的优势就更明显了。研究团队训练了一个因子化稀疏编码模型作为对照,也就是把 M 设为零。结果非常直观,因子化模型在噪声图像里会产生大量虚假边缘,像是把噪声误认成结构。非因子化模型则稳得多,它会利用 M 的结构先验,把真实轮廓延展出来,同时把孤立的噪声压下去。
图3:去噪雅可比矩阵的机械分解。
这种差异在去噪任务里表现得非常明显。非因子化模型的输出更干净、更连贯,甚至在某些场景下接近 U-Net 扩散模型的表现。结构先验在这里发挥了关键作用,它让模型不再孤立地看每个特征,而是把它们放在整体结构里判断。
这也说明一个事实,图像去噪不是简单的像素修补,而是结构推断。模型必须知道哪些边缘是可信的,哪些是噪声,哪些应该被延展,哪些应该被抑制。M 就是这个判断的依据。

08 结果三: Jacobian主方向揭示扩散模型的结构生成机制

如果说结构先验解释了模型的推断能力,那么 Jacobian 就揭示了模型的生成能力。Jacobian 的主特征向量展示了模型认为图像在哪些方向上更“可能”。这些方向不是随机的,而是自然图像中的连续形变基,也就是 oscillatory bases。
这些形变基看起来像沿着轮廓的波动模式,能让模型在保持结构一致性的前提下进行局部形变。比如让一条直线轻微弯曲,让一个轮廓向外扩展,让一个边缘产生细微的摆动。这些形变不是离散的,而是连续的。模型可以在这些方向上自由组合,生成无限多种结构变体。
图4:语义泛化和分离神经元的出现。
这些形变基的形成机制也非常清晰。Jacobian 在潜变量空间里的结构可以写成
这里的 E 是稀疏 gating,只允许当前激活的神经元传播。W 是总连接矩阵,包含局部连接和长程连接。每一次传播都会沿着当前轮廓扩散,而稀疏gating 会把扩散限制在结构上相关的区域。无限次传播叠加起来,就形成了完整的形变基。
这就是扩散模型能够生成无限新图像的机制基础。模型不是在记忆训练集,而是在学习一个高概率结构流形。这个流形由连续的形变基构成,让模型可以在结构空间里自由移动。

09 结果四:模型出现“脱离输入的神经元”,形成层级结构

模型的字典里还有一个非常有趣的现象。大约三成的基函数学习到了极小的权重,几乎不参与输入的重建。这些基函数被称为 detached neurons,也就是脱离输入的神经元。
图5:状态相关激励和动态几何布线。
它们看起来像是“闲置”的神经元,但在高噪声推断中却发挥了关键作用。研究团队发现,如果把这些神经元移除,模型在高噪声下的表现会迅速崩溃,PSNR 会明显下降。原因在于这些神经元负责维持全局一致性,它们像是高层视觉区域,对低层结构进行整体调控。
这种层级结构的出现完全是自发的。模型没有被告知要分层,也没有被要求建立高层调控。它只是为了在噪声环境中保持结构一致性,自动形成了一个层级推断系统。低层神经元负责局部结构,高层神经元负责全局一致性。
这和视觉皮层的层级结构非常相似。模型再次展示了自然图像统计如何驱动结构涌现。
图 6:生成性能。

10 视觉皮层推断机制与扩散模型的统一视角

把所有结果放在一起看,会发现一个非常有意思的统一视角。视觉皮层的推断机制和扩散模型的生成机制,可能共享同一个计算框架。结构先验对应水平连接,Jacobian 对应形变基,层级结构对应高层调控。模型的推断过程像视觉皮层,模型的生成过程像扩散模型。
这对神经科学的意义非常大。它提供了水平连接的功能解释,也展示了层级结构如何从推断任务中自发涌现。它让我们看到视觉皮层不是简单的特征检测器,而是一个结构推断系统。
这对机器学习的意义也非常大。它让扩散模型的可解释性更进一步,让我们理解扩散模型为什么能泛化,为什么能生成无限新图像,为什么能补全结构。它展示了结构化生成机制的数学基础,也为未来的可解释生成模型提供了方向。
这项研究不是在造一个更大的模型,而是在拆解一个更深的机制。它让我们看到视觉皮层和扩散模型之间的共同逻辑,也让我们看到自然图像统计如何塑造智能系统的结构。(END)
参考资料:https://arxiv.org/abs/2607.15693

亲爱的人工智能爱好者、研究者,为了确保您不会错过*波动智能*的最新推送,请星标*波动智能*。我们倾心打造并精选每篇内容,只为为您带来启发和深思,希望能成为您理性思考路上的伙伴!

加入AI交流群请扫码加微信