8月25日,OpenAI首次公布自研AI推理芯片Jalapeño的实际测试成绩。相比此前已经公开“正在开发自研推理芯片”这件事,这次真正新增的信息更关键:Jalapeño已经从一项芯片计划,变成了可以实际运行大模型、拥有公开性能数据,并准备进入OpenAI计算基础设施的真实硬件。

按照OpenAI公布的测试结果,Jalapeño在GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T三类不同模型上,都表现出了明显的推理效率优势。在峰值吞吐场景下,它每瓦能够完成的AI计算工作比参与比较的商用AI系统高1.5至1.9倍,端到端延迟降低1.7至3.6倍;在高交互负载下,性能提升达到2.1至4.1倍。Jalapeño额定功耗为700W,但OpenAI表示,在这批测试中持续功耗没有超过约550W。
这些数字真正重要的地方,并不只是证明OpenAI做出了一颗性能不错的芯片,而是Jalapeño针对的恰好是未来AI成本中越来越重要的一部分——推理。
训练一个大型模型确实需要极其庞大的GPU集群,但训练是阶段性的。模型一旦部署,真正每天持续烧钱的是推理。每一个ChatGPT回答、每一次语音交互、每一次代码生成、每一个Agent任务,背后都需要持续调用计算资源。尤其进入Agent时代之后,一次任务已经不再只是“输入一个问题,输出一段答案”,而可能连续搜索资料、读取文件、调用工具、执行代码、检查结果、重新修改,再继续运行几十甚至上百个步骤。

这意味着,未来AI公司的成本竞争会越来越落到一个很现实的问题上:同样一度电、同样一台服务器,到底能够生成多少有效Token,完成多少真实任务。
Jalapeño本质上就是围绕这个问题设计的。传统GPU必须兼顾训练、图形计算和大量通用计算任务,而OpenAI非常清楚自己的模型每天在做什么,因此可以直接围绕自身推理负载设计芯片。语言模型推理本身也不是一种单一计算。用户输入Prompt时主要消耗计算能力,模型逐Token生成答案时又更加依赖内存带宽,多芯片之间的数据传输还会带来额外延迟。所以真正高效的推理系统,并不是简单做一颗算力更高的芯片,而是要把芯片、内存、网络、Serving软件和模型运行方式一起优化。
这也是OpenAI现在不断强调“全栈算力”的原因。过去大家通常把OpenAI看成一家模型公司,它最核心的能力是训练GPT。但现在它控制的技术栈正在不断向下延伸,从模型、推理软件、编译和调度系统,一直延伸到网络、内存、芯片和整个数据中心。模型公司正在越来越像一家完整的计算平台公司。

这条路线其实和Apple、Tesla过去做过的事情很相似。Apple之所以能够把手机芯片做到很高的能效,并不只是因为它会设计CPU,而是因为iPhone、iOS、芯片和应用场景都掌握在自己手里。Tesla自研自动驾驶芯片也是同样的逻辑:当一家公司清楚知道自己的神经网络未来需要长期运行什么任务,就不一定需要一颗什么都能做的通用芯片,而可以围绕自己的软件负载直接设计硬件。
OpenAI现在正在把这种思路搬进AI数据中心。Jalapeño此前已经确认由OpenAI主导架构设计,并与Broadcom和Celestica合作完成芯片实现、板卡、机架、网络和规模化生产系统。OpenAI目前表示,这颗芯片将在未来几个月继续扩大部署,同时第二代芯片已经进入深入开发阶段,第三代也已经开始形成设计方向。
另一个值得注意的细节,是AI本身也开始参与设计AI芯片。OpenAI表示,从最初设计到芯片Tapeout只用了9个月,AI被用于探索电路实现、设计验证和性能优化。芯片完成之后,OpenAI又反过来使用Codex和内部模型帮助编写针对Jalapeño的计算代码。在部分GPT-OSS注意力和MoE计算模块中,AI生成的实现速度达到原有人类专家代码的1.5至1.8倍。这里需要注意,这个数字只针对部分计算模块,并不代表整个模型整体快了1.8倍。
这实际上形成了一个很有意思的循环:更强的AI帮助设计更好的芯片,更好的芯片又被用来运行下一代更强的AI。

当然,Jalapeño并不意味着OpenAI马上就会摆脱NVIDIA。训练前沿模型仍然需要巨大的通用GPU集群,OpenAI未来也依然会大量部署NVIDIA以及其他合作伙伴的加速器。真正发生的变化,是OpenAI第一次拥有了一条可信的第一方芯片路线。
过去OpenAI提高模型能力,主要依靠买更多GPU、建设更大的数据中心,以及优化模型和软件。现在它又多了一种办法:直接改变最底层的计算硬件。
如果Jalapeño未来大规模部署后的性能和成本优势能够接近今天公布的数据,影响的最终不会只是OpenAI自己的数据中心账单。对普通用户来说,它可能表现为更快的ChatGPT、更低延迟的语音和Agent;对开发者来说,则可能最终反映到API价格和单位任务成本上。
前沿AI竞争正在逐渐从“谁训练出来的模型更聪明”,扩展到另一个更底层的问题:谁能够用更低的能源和硬件成本,把这些智能真正运行几十亿、几百亿甚至更多次。
而OpenAI现在显然不准备只做使用芯片的人,它正在开始设计支撑自己未来AI业务的计算机器。
夜雨聆风