乐于分享
好东西不私藏

OpenAI 首颗推理芯片 Jalapeño 亮相,ChatGPT 要从算力成本开刀

OpenAI 首颗推理芯片 Jalapeño 亮相,ChatGPT 要从算力成本开刀
OpenAI 与 Broadcom 展示 Jalapeño 推理芯片

OpenAI 终于把自研芯片从传闻推进到实物阶段。

6 月 24 日,OpenAI 和 Broadcom 正式公布 Jalapeño。这是 OpenAI 第一颗 Intelligence Processor,定位为面向大语言模型推理的加速器,而非训练芯片,直接服务 ChatGPT、Codex、API 和未来 Agent 产品的高并发使用。

这件事对普通用户的意义很直接:大模型能不能更快、更稳定、更便宜,最终取决于推理算力是否足够充足。

OpenAI 给出的标题很清楚:Jalapeño 要成为“为 LLM 优化的推理平台”。从现在披露的信息看,它更像 OpenAI 在基础设施上补上的一块关键拼图,而不是一次单纯的硬件展示。

Jalapeño 解决的是推理账单,而不是训练炫技

AI 芯片最容易被写成性能竞赛,但 Jalapeño 的关键词是 inference,也就是模型接到用户请求后的实际运行。

每一次 ChatGPT 回复、Codex 处理任务、API 被企业调用,背后都在消耗推理算力。用户规模越大,推理成本越容易成为产品体验和商业模型的硬约束。

OpenAI 官方称,Jalapeño 从零开始按现代 LLM 推理需求设计,不是把通用加速器改造成 AI 负载芯片。它关注的是模型服务里的内存移动、算子、网络、调度和延迟,而不是只堆理论峰值。

披露点
具体信息
影响
芯片定位
OpenAI 首颗 Intelligence Processor,面向 LLM 推理
服务 ChatGPT、Codex、API 等高频请求
设计目标
结合领先 AI 加速器的吞吐,与专用推理系统接近的低延迟
改善交互式 AI 产品的响应速度
早期测试
样片已在实验室以目标频率和功耗运行 ML 负载,包括 GPT-5.3-Codex-Spark
仍待最终性能报告确认
能效说法
OpenAI 称性能功耗比将明显优于当前前沿水平
推理成本有下降空间

九个月 tape-out,AI 参与设计下一代 AI 芯片

这次发布里最值得单独看的一组数字,是九个月。

OpenAI 和 Broadcom 称,Jalapeño 从初始设计到制造 tape-out 只用了九个月。OpenAI 认为这可能是高性能先进半导体里最快的 ASIC 开发周期之一。

速度来自三件事:OpenAI 对自身模型、内核和服务系统的理解;Broadcom 的芯片实现和网络技术;以及 OpenAI 模型参与了部分设计和优化流程。

这形成了一个很有代表性的闭环:今天运行在数据中心里的模型,开始帮助工程师设计未来运行这些模型的硬件。

当然,九个月 tape-out 不等于九个月完成大规模部署。官方仍然把详细性能报告放在未来几个月,最终成本、良率、供货和数据中心集成效果,还要看实际落地。

这不是 OpenAI 单干,产业链分工已经摆出来了

Jalapeño 更准确的说法,是 OpenAI 主导架构和需求,Broadcom 与系统伙伴把它工程化、规模化。

OpenAI 负责把 ChatGPT、Codex、API 和未来 Agent 产品里的真实推理需求转成芯片设计目标;Broadcom 负责硅实现、网络和连接技术;Celestica 参与板卡、机架和系统集成;Microsoft 及其他数据中心伙伴将参与部署。

角色
负责内容
看点
OpenAI
芯片架构、模型路线、内核、推理服务需求
从模型公司继续向全栈基础设施扩展
Broadcom
硅实现、网络与连接技术,包括 Tomahawk 网络芯片
把定制 ASIC 推向大规模生产
Celestica
板卡、机架和系统级集成
让芯片进入数据中心形态
Microsoft 等伙伴
初始部署与数据中心承载
决定实际供给规模和上线节奏

Broadcom CEO Hock Tan 在官方稿中提到,双方将从 2026 年开始,与 Microsoft 和其他伙伴推动吉瓦级数据中心部署。Business Times 引述 Bloomberg 报道称,Tan 还预计 2027 年部署规模有望超过其此前 1.3GW 的预期。

这意味着 OpenAI 的芯片计划不只是实验室样片,而是已经按多代平台和数据中心规模在规划。

成本下降约 50% 的说法,需要放在早期阶段理解

Business Times 引述 Bloomberg 报道称,Hock Tan 在采访中表示,目前 Jalapeño 相比典型 AI GPU 显示出约 50% 的成本节省。

这个数字很吸引人,但它还不是公开技术报告里的最终结论。OpenAI 官方也强调,最终性能仍在测量中,详细报告会在未来几个月公布。

更稳妥的理解是:Jalapeño 的目标很明确,优先减少数据搬运,让计算、内存和网络更贴近 LLM 推理的真实使用方式。只要在大规模部署中兑现,成本改善会直接影响 ChatGPT 响应速度、Codex 可执行任务长度、API 成本和高峰期服务稳定性。

对开发者和企业来说,推理芯片的价值不在“OpenAI 又多了一颗芯片”,而在模型服务的单位成本能否继续下降。模型越强,调用越频繁,基础设施效率就越接近产品竞争力本身。

下一代已经排上日程,训练芯片还没有明确承诺

Jalapeño 是第一代,官方说法是多代计算平台的起点,计划在 2026 年底前开始初始部署,并在之后几年扩展。

Business Times 引述采访信息称,下一版芯片计划在 2028 年推出,之后可能按年度节奏更新。Jalapeño 当前聚焦推理,OpenAI 未来是否把定制芯片扩展到其他工作负载,还没有给出确定路线。

这也是它的边界:Jalapeño 不能简单理解为 OpenAI 马上摆脱 NVIDIA,或者立刻重写 AI 芯片格局。OpenAI 仍然会继续使用外部 GPU 和其他供应方案,定制 ASIC 更像是把最核心、最可预测、规模最大的推理负载逐步收回到自控体系中。

这一步的长期影响会体现在两处:一是 OpenAI 对模型、产品、芯片、网络和数据中心的协同控制更强;二是前沿模型公司的基础设施竞争,会从“买多少 GPU”继续走向“能否为自己的模型设计专用算力”。

来源

  • • OpenAI:OpenAI and Broadcom unveil LLM-optimized inference chip
  • • Broadcom:OpenAI and Broadcom Unveil LLM-Optimized Intelligence Processor
  • • The Business Times / Bloomberg:OpenAI, Broadcom unveil chip to run models faster, cheaper
  • • VentureBeat:OpenAI unveils first custom AI inference chip Jalapeno with Broadcom

推荐阅读