ARTICLE · 1150373
OpenAI花3亿美元买下的那篇论文,到底写了什么
OpenAI花3亿美元买下的那篇论文,到底写了什么
“写这篇文章的初衷,是有朋友想了解一些前沿ISP。恰好2026年9月OpenAI以超过3亿美元收购了Glass Imaging,这笔交易背后的技术论文恰好把“光学的物理极限”和“计算的信息论边界”这两个问题推到了同一个画面上,值得认真讲一讲。文中涉及的MTF(调制传递函数)等光学基础知识,后续会陆续展开,这里先用最直白的方式说明它为什么关键。
一、光学系统是一个有损信道
在信息论的意义上,任何成像系统都是一个信道。物体表面反射的光携带了关于场景的完整信息,但光在抵达传感器之前,必须经过透镜的“过滤”。这个过滤过程可以用一个数学对象来精确描述:点扩散函数(PSF) 。

一个理想的光学系统,PSF是一个δ函数——物平面上一个点发出的光,在像平面上仍然汇聚为一个点。但真实的光学系统做不到这一点。孔径的有限性带来衍射,透镜的球面形状带来球差,轴外光线带来彗差和像散,不同波长的光折射率不同带来色差。这些效应叠加在一起,使PSF变成一个有一定宽度的“斑”。
“所谓“有损”,并不是说光丢了,而是说光携带的信息被重新分配了——原本属于某个点的光能量,被摊开到了一个斑上。信息没有消失,但它的空间地址被搅乱了。
这个“斑”的意义是深远的:它意味着光学系统在频域上是一个低通滤波器。MTF曲线正是这个低通特性的精确刻画。通俗地说,你可以把它理解成一张“频率通行证”:低频信号(大块的明暗结构)基本畅通无阻,高频信号(头发丝、织物纹理这种精细细节)则被大幅衰减。当MTF在某个空间频率处降到接近零时,该频率的结构在图像中已无法被分辨。光通过有限孔径时必然发生衍射,这意味着即使是最完美的透镜,MTF也会在某个频率处截断。

“MTF的本质,是问光学系统一句话:这个频率上的明暗对比,你还剩下多少?剩下零,就是彻底看不见了。
传统ISP面临的根本困境就在这里。去马赛克、降噪、锐化、多帧融合,这些操作都是在已经丢失了高频信息的信号上进行的。传统ISP的工作方式是逐级的、局部的,每一步只处理前一步的输出,对光学系统本身的缺陷没有任何显式建模。锐化操作(如USM)可以增强中频的对比度,让图像看起来更“锐”,但它无法恢复被透镜衰减掉的高频信息——它只是在已有的信息上做视觉上的放大。
“锐化的本质是把“还剩下一点”的频率放大给你看,而真正被截断为零的频率,放大多少倍都还是零。
这就是光学系统作为信息瓶颈的物理本质:一旦高频信息被透镜的低通特性截断,任何后续的信号处理都无法从原理上将其恢复。
二、OpenAI为什么花3亿美元买一家相机公司
一笔不寻常的收购
2026年9月15日,据《华尔街日报》报道,OpenAI以超过3亿美元收购了Glass Imaging,交易估值较该公司上一轮约1亿美元的融资估值溢价超过两倍。Glass Imaging成立于2019年,总部位于加州洛斯阿尔托斯,成立至今累计从投资者处筹集资金约3000万美元。
这家公司的核心创始团队带有鲜明的苹果技术背景:创始人Ziv Attar与Tom Bishop均为前苹果工程师,早年曾共同领导苹果手机人像模式功能的核心研发工作。Attar更早创立了LinX Imaging,该公司2015年被苹果收购。两人离开苹果后,将研发方向锁定在同一个命题上:用计算来突破手机摄像头的物理硬件限制。
“OpenAI买的不是镜头,不是传感器,甚至不是一款App。它买的是一篇论文背后的技术路线,以及这条路线指向的一个判断:当摄像头从“给人拍照”变成“给AI提供判断依据”时,图像的真实性比美观更重要,而真实性的根基在RAW数据里,不在后期修图里。
这笔收购并非孤立事件。早在2025年,OpenAI就以65亿美元完成了对前苹果设计总监Jony Ive创立的AI硬件公司io的收购,这是OpenAI史上规模最大的交易。OpenAI CEO Sam Altman与Jony Ive联合打造的AI硬件设备,预计将在2026年面世。而Glass Imaging的Neural ISP技术,恰好为这类设备提供了“忠实的视觉前端”。业内分析认为,本次对Glass Imaging的收购,正是OpenAI延续此前硬件战略的关键落子,为其后续自有AI终端产品补齐核心能力板块。
这篇论文是谁写的,发表在哪里
被收购的核心技术,集中体现在Glass Imaging于2026年6月4日提交至arXiv的预印本论文中,编号arXiv:2606.07675,分类为eess.IV(图像与视频处理)。论文标题本身就构成了一种判断:
《The Need for Neural ISP in the Small-Pixel Era: How Shrinking Pixels Push Optics to the Limit and Neural Restoration Pushes Back》
作者共七人,全部来自Glass Imaging:Jingxi Li、Neerja Aggarwal、Laurent Gudemann、Shivansh Rao、Vishal Vinod、Tom E. Bishop、Ziv Attar。论文目前是预印本,尚未经过正式同行评议。
论文要回答的问题:长焦物理墙
论文摘要开篇便给出了核心判断:智能手机长焦摄像头正在逼近一堵“长焦物理墙” ——随着像素间距缩小到0.5 µm以下,光学系统仍然受限于几何像差,分辨率收益递减。传统ISP无法消除这些像差,因为它们通过局部、逐级处理工作,对底层PSF没有任何显式建模。
手机长焦摄像头的像素间距已经从iPhone 7+时代的1.0 µm缩小到当前200MP潜望式模组的约0.5 µm。像素越小,理论上分辨率越高。但光学系统必须同步跟上——为了避免衍射模糊主导成像,相机设计者被迫开大光圈(降低F数) 。论文以具体机型为例:OPPO Find X9 Pro(0.5 µm,F/2.1)采用了比荣耀Magic8 Pro(0.56 µm,F/2.6)显著更快的镜头,且这一趋势预计将持续。

光圈一开大,透镜边缘以更陡角度入射的“边缘光线”就会引入球差、彗差、像散等高阶几何像差,即便是最优秀的光学设计也难以完全消除。论文对此的描述是:“更宽的光圈从光瞳边缘以更陡的角度捕获光线。这些边缘光线对几何像差贡献过大——球差、彗差、像散以及更高阶项,即使是最好的镜头设计也难以消除。因此,虽然衍射斑尺寸减小了,像差引起的模糊却随着光圈增大而增加。”
“这就是“长焦物理墙”的残酷之处:像素缩小本身没错,但它逼着光圈变大,光圈变大又逼出了像差。你以为在往一个方向走,其实是在往墙上撞。
结果是:衍射斑虽然被压小了,像差引起的模糊却随之增大。论文将这个临界点命名为**“长焦物理墙”**——硅基像素的缩放速度,已经超过了传统光学和传统ISP能够干净交付的极限。
论文的核心判断是:在像素缩小到0.5 µm以下时,传统ISP的瓶颈不是噪声,而是未被校正的PSF模糊。 如果模糊不被撤销,继续缩小像素只是在更小的面积上重复记录同一个被光学系统抹糊的信号,分辨率收益趋近于零。
三、Neural ISP如何“推回去”——以及为什么会产生幻觉
从“修补信号”到“求解逆问题”
传统ISP的根本局限在于它是逐级串行的:去马赛克、降噪、锐化、多帧融合各自独立工作,每一步只处理前一步的输出。它没有光学系统PSF的显式模型,因此无法“知道”模糊究竟来自哪种像差。论文对此的表述是:传统ISP“通过局部、逐级处理工作,对底层PSF没有任何显式建模”。
Glass Imaging的方案是训练一套针对具体镜头和传感器组合的神经网络,从RAW连拍数据出发,把去马赛克、降噪、去模糊、多帧融合放进同一个联合训练的网络中完成,同时执行镜头像差反卷积和传感器串扰校正。论文将其概括为:“一个基于学习的Neural ISP,在底层退化上训练,反演了逐级管线无法反演的东西,将小像素设计转化为净优势”。

这里的关键词是**“反卷积”** 。卷积是光学系统对场景的成像操作:场景乘以PSF,得到传感器上的图像。反卷积则是已知传感器上的图像和光学系统的PSF,反推原始场景。Glass Imaging的神经网络学到的,正是特定镜头和传感器组合的逆映射。
“传统ISP在模糊已经发生之后,试图在信号层面“修补”它;Neural ISP在做的事情,是在知道镜头具体怎么模糊的前提下,从数学上把模糊“撤回去”。一个是事后涂改,一个是事前撤销。
幻觉的数学根源
但恰恰是“求解逆问题”这个操作,内在地携带着幻觉的风险。
一篇发表于SIAM Review的论文对这一问题给出了理论层面的分析。该论文摘要明确指出:“在成像逆问题中,越来越多的经验证据表明,方法可能遭受幻觉——即虚假但看起来逼真的伪影;不稳定性——即对数据扰动的敏感性;以及不可预测的泛化——即在某些图像上表现优异,但在其他图像上显著退化。本文为这些现象提供了理论基础。”
这篇论文给出了五个核心结论,其中第一个直接指向幻觉的根源:“在单张图像上过度表现的方法,可能错误地将细节从一张图像转移到另一张图像,从而创造幻觉”。更关键的是,论文指出:“这些效应根植于前向算子的核(kernel),只要它是非平凡的”。
这里的“核”,就是前向算子的零空间。
“把光学系统想象成一个“信息筛子”——它让某些信息通过,把另一些信息挡在外面。那些被挡在外面的信息,在数学上就构成了这个光学系统的零空间。不同场景中属于零空间的那部分差异,经过同一个镜头退化后,会产生完全相同的传感器图像。从传感器图像反推原始场景时,零空间里的内容没有任何数据可以约束它。
当神经网络被用来求解这个不适定问题时,它必须在零空间里“选择”一个解。这个选择由训练数据的统计先验驱动。SIAM Review论文的第三个结论指出:“优化精度-稳定性权衡通常是困难的”,第四个结论进一步警告:“幻觉和不稳定性,如果发生,不是罕见事件,且可能被标准训练所鼓励”。
“用最直白的话说:当镜头已经把一个细节“筛掉”了,网络只能根据它“见过的世界”来猜测那个细节应该长什么样。猜得越自然,越可能是假的。
感知质量与不确定性之间存在一个根本性的权衡
如果事情仅仅到“不适定问题有零空间”为止,那或许还可以通过更强的正则化来压制幻觉。但理论工作揭示了一个更深层的困境。
SIAM Review论文的第二个结论指出:“在两张或更多图像上过度表现的方法,可能产生幻觉或不稳定”。这意味着,当网络被训练以在多个图像上产生“看起来更真实”的结果时——更锐利的边缘、更自然的纹理——它必然要更多地依赖先验来填补信息空缺。更多的先验依赖,意味着更大的幻觉风险。
“这不是工程缺陷,而是信息论层面的根本性约束。视觉上越“好看”的复原结果,其不确定性越大——你无法从外观上判断,哪些细节是真实恢复的,哪些是先验猜测的。
论文的第四个结论更直接地指出,幻觉“可能被标准训练所鼓励”。Glass Imaging官方博客对此的表述很直接:“使用AI生成细节,会在系统试图在没有信息的地方创造视觉信息时,产生幻觉或伪影”。
四、Glass AI如何消解幻觉
策略一:把“恢复”和“增强”分开
Glass Imaging的应对方式建立在一个关键的设计原则之上:区分信号恢复和感知增强。ISP管线中越靠前的阶段——即信号恢复阶段——越不容易产生幻觉;而越靠后的阶段——即增强操作——越容易引入虚假内容。
Glass AI的做法是将处理重心前移:从RAW数据出发,用同一个联合训练的网络完成去马赛克、降噪、去模糊和多帧融合,同时加入镜头像差反卷积和传感器串扰校正,直接输出成品RGB图像。由于所有操作在一个网络内联合优化,不存在“先降噪后锐化”这种串行处理中信息反复损失的问题。
“幻觉最容易出现在哪里?出现在管线末端那些“美化”操作里。把一个模块专门用来让图片“更好看”,它就有动机去编造。Glass AI的做法是不给管线留这个“编造岗”——所有处理都在一个网络里,目标是恢复,不是美化。
Glass Imaging官方公告称,GlassAI“将神经网络处理应用于变焦成像,帮助在整个变焦范围内恢复精细细节、降低噪声,并保持自然的色彩与质感”。
策略二:把反卷积锚定在物理模型上
这是Glass AI与生成式AI最核心的区别。Glass Imaging反复强调,它的网络目标是恢复传感器实际捕捉到的信息,而不是凭常识生成新的纹理。
Glass Imaging的技术路径被描述为:“通过训练专属神经网络,系统性学习不同品牌、不同型号智能手机的每一套摄像头系统的硬件特性,让影像优化过程在用户按下快门的瞬间同步完成,直接输出经过AI校准的高质量成片,从底层提升移动端影像的原生画质表现”。Glass Imaging专门开发“边缘部署的Neural ISP,通过专为校正镜头和传感器问题而定制的模型来增强移动相机性能”。
这个声明的数学含义是:反卷积是物理模型约束下的逆运算,不是数据分布驱动的生成。给定一个PSF,反卷积在数学上是良定义的。当然,由于零空间的存在,信息确实丢失了,反卷积仍然需要正则化先验来填补空缺。但关键区别在于:先验来自光学系统的退化模型,而非训练数据的统计分布。
“打个比方:扩散模型修图,像是让一个看过千万张月亮照片的人,根据“月亮大概长这样”的记忆去补全一个光斑。Glass AI的做法,像是让一个知道“这个镜头会把月亮糊成什么形状”的人,从糊掉的形状反推月亮原本的轮廓。前者靠的是“世界知识”,后者靠的是“物理知识”。物理知识不会帮你编出陨石坑,它只会告诉你哪些信息是真的被镜头吃掉了,哪些还能捞回来。
一个更直观的对比是:扩散模型超分辨率的典型失败模式是“生成不匹配的伪影”。月亮拍成光斑后重新出现陨石坑纹理,人脸模糊后浮现出清晰的五官——这些细节在原始数据中并不存在,它们是模型从训练分布中“采样”出来的。而Glass AI的反卷积利用的是特定光学系统的退化模型,它的“猜测”被约束在“什么样的场景经过这个特定镜头退化后,会产生传感器上看到的这些数据”这个物理问题之内。
策略三:让不确定性变得可度量
但即使有物理模型的约束,零空间仍然存在。SIAM Review论文的第五个结论指出:“对于某些问题,可能无法构造最优的重建映射”。这意味着,完全消除幻觉在数学上是不可能的。
Glass AI的第三个策略是让网络在先验主导的区域做出可识别的标记。因为网络在训练时同时接触RAW数据和对应的真值图像,它可以在学习反卷积映射的同时,学习一个不确定性估计——在信息充足的区域输出高置信度的恢复,在信息缺失的区域输出低置信度的“猜测”标记。这些低置信度区域就是需要被警惕的幻觉风险区。
“完全消除幻觉是不可能的,但你可以知道哪些地方最可能出幻觉。就像一个诚实的翻译,遇到听不懂的词不会硬编,而是标一个“此处存疑”。对AI Agent来说,一个标了“存疑”的像素,比一个编得很漂亮的像素安全得多。
SIAM Review论文的结论为此提供了理论支撑:理解幻觉的根源在于前向算子的核,而标记出核的方向,就标记出了不确定性最高的区域。论文的目标正是“激发对开发鲁棒和可靠的AI逆问题方法的新研究”。
五、已经装在口袋里的未来
Glass Imaging的GlassAI变焦技术已经量产落地在荣耀600系列手机上。Glass Imaging于2026年5月26日发布官方公告,确认GlassAI Neural ISP变焦成像技术被应用于荣耀最新发布的600系列智能手机中,帮助在整个变焦范围内恢复精细细节、降低噪声、保持自然的色彩与质感。Glass Imaging CEO Ziv Attar表示:“很荣幸与荣耀合作,让我们的Neural ISP技术应用于600系列。”
这不是实验室里的概念验证,是已经装在消费者口袋里的东西。
OpenAI的兴趣远不止于“让手机拍得更清楚”。当摄像头从“给人拍照”转向“给AI Agent提供物理判断依据”时,图像的真实性不再是一个审美问题,而是一个操作安全问题。如果一张照片中凭空出现了实际不存在的障碍物,一个基于该照片决策的Agent可能做出灾难性的动作。
“Neural ISP的“恢复而非生成”承诺,本质上是在说:计算可以在不引入幻觉的前提下,从物理上不完美的光学系统中提取出比传统信号处理更多的东西。这正是OpenAI在具身智能和Agent方向上最需要的东西——一个忠实的、可信的、从物理世界直接提取信息的视觉前端,而不是一个会“脑补”的生成器。
论文本身指向了一种设计哲学的转变:与其继续投入越来越复杂的光学设计来压制残余像差,不如让Neural ISP来校正这些像差,从而让0.5 µm以下像素、200MP以上的传感器真正释放分辨率潜力。论文摘要的最后一句给出了这个判断:“这些结果指向一种设计哲学:Neural ISP通过校正残余光学像差来使高分辨率长焦模组成为可能,而非要求越来越复杂的光学系统。”
“光的物理极限仍然在那里。透镜仍然是低通滤波器,零空间仍然存在,反卷积仍然需要先验来填补信息空缺。但计算的回答,正在把那堵墙往后推——同时小心翼翼地守护着一条界线:推墙的力来自光学物理模型的约束,而非训练数据的统计想象力。
论文链接:https://arxiv.org/abs/2606.07675
Glass Imaging官方解读:https://www.glass-imaging.com/journal/the-need-for-neural-isp-in-the-small-pixel-era