ARTICLE · 977628
从软件到硅片:OpenAI用Jalapeño打响全栈战争
2026年8月25日,OpenAI公布其首款自定义推理芯片Jalapeño的首批实测结果并同步发布详细技术报告。这不是简单的硬件宣传,而是AI公司从“软件+模型”向“全栈硬件控制”迈进的重要节点。
Jalapeño是什么Jalapeño是OpenAI与Broadcom合作开发的第一代自定义推理加速器(ASIC,应用特定集成电路),专门为大型语言模型(LLM)的推理(inference)场景优化——即运行已训练好的模型来响应用户查询、生成内容或驱动智能体(agents),而非训练新模型。
关键亮点(基于OpenAI官方报告与InferenceX公开基准):
- •
在单位功耗下提供更多有效AI工作量,同时显著降低延迟。 - •
测试模型包括OpenAI自身的GPT-OSS 120B、DeepSeek R1 670B以及Kimi K2.5 1T(万亿参数级)。 - •
峰值吞吐量下,每瓦特AI工作量提升约1.5–1.9倍;端到端延迟降低约1.7–3.6倍。 - •
在高度交互式工作负载中,性能提升达2.1–4.1倍。 - •
芯片额定功耗700W,实际持续功耗可控制在550W及以下。 - •
架构从一开始就围绕现代LLM的prefill(提示处理,计算密集型)和decode(逐token生成,内存带宽受限)阶段设计,通过减少数据移动、优化KV缓存本地化、整合网络等方式,在单一架构中同时实现高吞吐与低延迟——传统系统往往需要在两者之间权衡。
OpenAI还强调,它用自家模型(包括Codex与GPT-Astra)加速了芯片设计与编程:从初始设计到tape-out仅用约9个月,并对部分内核实现了优于人工专家的优化。
部署计划:年底前开始在OpenAI计算基础设施中小规模上线,2027年 ramp up。这是多代路线图的起点——Gen 2已深入开发,Gen 3在规划中。OpenAI明确表示仍会继续大量使用NVIDIA及其他伙伴的硬件(训练与推理都需要)。
为什么产生?
AI推理成本与能耗正成为规模化落地的核心瓶颈。ChatGPT、Codex、各类agent的实时交互需求暴涨,而通用GPU(如NVIDIA Blackwell系列)虽然强大,但在专为LLM推理优化时存在效率冗余。
主要驱动因素:
- 1.成本与功耗压力
:推理占运营成本的大头。更高能效意味着同样电力与机架空间能服务更多用户,降低每token成本。 - 2.供应与独立性
:NVIDIA GPU长期供不应求。Google(TPU)、Amazon、Microsoft、Meta等都已布局自定义芯片。OpenAI此前高度依赖NVIDIA,自研可降低风险。 - 3.全栈协同优势
:OpenAI掌握模型、服务软件、产品需求与真实工作负载数据。从芯片、内存、网络到系统一起设计,能针对agentic工作负载(多步骤、交互式)做深度优化。 - 4.AI加速硬件开发
:用AI设计AI芯片本身就是闭环——缩短迭代周期,验证“AI可加速硬件创新”的路径。
与Broadcom的合作(类似其帮助Google打造TPU的经验)以及Celestica在系统集成上的支持,使项目能快速落地。
有什么影响?
对用户与产品:
- •
更快的ChatGPT响应、更流畅的Codex会话、更可靠的agent体验。 - •
随着需求增长,服务可用性与规模扩展能力提升。 - •
长期有望降低AI使用成本,推动更广泛普及。
对OpenAI:
- •
提升运营杠杆:有用工作与收入增长可快于服务成本。 - •
多代路线图带来持续竞争优势。 - •
虽不替代NVIDIA等伙伴,但增强议价能力与供应链韧性。
对行业:
- •
加速“AI公司自研芯片”趋势。Google、Amazon已有先例,OpenAI的加入进一步证明垂直整合的价值。 - •
NVIDIA仍主导训练市场,但推理端竞争加剧(包括Cerebras等)。 - •
能效提升对数据中心电力与可持续性有积极意义。 - •
公开基准覆盖第三方模型(DeepSeek、Kimi),显示架构具有一定通用性,而非仅服务于自家模型。
背后可能蕴藏着什么?
这远不止一款芯片:
- •全栈战争的升级
:真正的护城河不再只是模型参数,而是“模型 + 软件 + 芯片 + 系统 + 数据中心运营”的闭环。OpenAI正从“AI实验室”向“AI基础设施公司”演进。 - •硬件民主化与专业化并存
:通用GPU仍重要,但针对特定工作负载的ASIC能实现数量级效率提升。未来可能出现更多“推理专用”与“训练专用”分化。 - •AI自我加速的飞轮
:用AI设计芯片、用芯片加速AI——这种正反馈可能让领先者拉开差距,也让后来者更难追赶。 - •成本结构重塑
:如果推理成本大幅下降,agentic AI(多步骤自主任务)的经济可行性会显著提高,推动从“聊天机器人”向“数字劳动力”转变。 - •竞争与合作并存
:OpenAI仍强调与NVIDIA等伙伴合作。行业可能走向“混合部署”——自研芯片处理核心高流量推理,通用硬件处理训练与多样化需求。 - •潜在风险
:自定义芯片开发成本高、周期风险大、软件生态需长期打磨。若基准过于理想化或部署规模不及预期,影响会打折扣。同时,过度依赖自研可能削弱与外部生态的兼容性。
总的来说,Jalapeño是OpenAI应对AI规模化挑战的务实一步:在算力饥渴与能源约束下,用更聪明的硬件榨取更多“智能每瓦特”。它标志着AI产业从“烧钱堆算力”向“系统级效率优化”的转折。未来几年,谁能在模型、软件与硅片之间形成最紧密的协同,谁就更有可能定义下一代智能基础设施。
(信息主要基于OpenAI官方公告、技术报告及多家科技媒体报道。实际部署效果仍需时间验证。)