夜雨聆风学习资料网

ARTICLE · 977628

从软件到硅片:OpenAI用Jalapeño打响全栈战争

从软件到硅片:OpenAI用Jalapeño打响全栈战争

2026年8月25日,OpenAI公布其首款自定义推理芯片Jalapeño的首批实测结果并同步发布详细技术报告。这不是简单的硬件宣传,而是AI公司从“软件+模型”向“全栈硬件控制”迈进的重要节点。

Jalapeño是什么

Jalapeño是OpenAI与Broadcom合作开发的第一代自定义推理加速器(ASIC,应用特定集成电路),专门为大型语言模型(LLM)的推理(inference)场景优化——即运行已训练好的模型来响应用户查询、生成内容或驱动智能体(agents),而非训练新模型。

关键亮点(基于OpenAI官方报告与InferenceX公开基准):

  • 在单位功耗下提供更多有效AI工作量,同时显著降低延迟。
  • 测试模型包括OpenAI自身的GPT-OSS 120B、DeepSeek R1 670B以及Kimi K2.5 1T(万亿参数级)。
  • 峰值吞吐量下,每瓦特AI工作量提升约1.5–1.9倍;端到端延迟降低约1.7–3.6倍。
  • 在高度交互式工作负载中,性能提升达2.1–4.1倍。
  • 芯片额定功耗700W,实际持续功耗可控制在550W及以下。
  • 架构从一开始就围绕现代LLM的prefill(提示处理,计算密集型)和decode(逐token生成,内存带宽受限)阶段设计,通过减少数据移动、优化KV缓存本地化、整合网络等方式,在单一架构中同时实现高吞吐与低延迟——传统系统往往需要在两者之间权衡。

OpenAI还强调,它用自家模型(包括Codex与GPT-Astra)加速了芯片设计与编程:从初始设计到tape-out仅用约9个月,并对部分内核实现了优于人工专家的优化。

部署计划:年底前开始在OpenAI计算基础设施中小规模上线,2027年 ramp up。这是多代路线图的起点——Gen 2已深入开发,Gen 3在规划中。OpenAI明确表示仍会继续大量使用NVIDIA及其他伙伴的硬件(训练与推理都需要)。

为什么产生?

AI推理成本与能耗正成为规模化落地的核心瓶颈。ChatGPT、Codex、各类agent的实时交互需求暴涨,而通用GPU(如NVIDIA Blackwell系列)虽然强大,但在专为LLM推理优化时存在效率冗余。

主要驱动因素:

  1. 1.成本与功耗压力
    :推理占运营成本的大头。更高能效意味着同样电力与机架空间能服务更多用户,降低每token成本。
  2. 2.供应与独立性
    :NVIDIA GPU长期供不应求。Google(TPU)、Amazon、Microsoft、Meta等都已布局自定义芯片。OpenAI此前高度依赖NVIDIA,自研可降低风险。
  3. 3.全栈协同优势
    :OpenAI掌握模型、服务软件、产品需求与真实工作负载数据。从芯片、内存、网络到系统一起设计,能针对agentic工作负载(多步骤、交互式)做深度优化。
  4. 4.AI加速硬件开发
    :用AI设计AI芯片本身就是闭环——缩短迭代周期,验证“AI可加速硬件创新”的路径。

与Broadcom的合作(类似其帮助Google打造TPU的经验)以及Celestica在系统集成上的支持,使项目能快速落地。

有什么影响?

对用户与产品

  • 更快的ChatGPT响应、更流畅的Codex会话、更可靠的agent体验。
  • 随着需求增长,服务可用性与规模扩展能力提升。
  • 长期有望降低AI使用成本,推动更广泛普及。

对OpenAI

  • 提升运营杠杆:有用工作与收入增长可快于服务成本。
  • 多代路线图带来持续竞争优势。
  • 虽不替代NVIDIA等伙伴,但增强议价能力与供应链韧性。

对行业

  • 加速“AI公司自研芯片”趋势。Google、Amazon已有先例,OpenAI的加入进一步证明垂直整合的价值。
  • NVIDIA仍主导训练市场,但推理端竞争加剧(包括Cerebras等)。
  • 能效提升对数据中心电力与可持续性有积极意义。
  • 公开基准覆盖第三方模型(DeepSeek、Kimi),显示架构具有一定通用性,而非仅服务于自家模型。

背后可能蕴藏着什么?

这远不止一款芯片:

  • 全栈战争的升级
    :真正的护城河不再只是模型参数,而是“模型 + 软件 + 芯片 + 系统 + 数据中心运营”的闭环。OpenAI正从“AI实验室”向“AI基础设施公司”演进。
  • 硬件民主化与专业化并存
    :通用GPU仍重要,但针对特定工作负载的ASIC能实现数量级效率提升。未来可能出现更多“推理专用”与“训练专用”分化。
  • AI自我加速的飞轮
    :用AI设计芯片、用芯片加速AI——这种正反馈可能让领先者拉开差距,也让后来者更难追赶。
  • 成本结构重塑
    :如果推理成本大幅下降,agentic AI(多步骤自主任务)的经济可行性会显著提高,推动从“聊天机器人”向“数字劳动力”转变。
  • 竞争与合作并存
    :OpenAI仍强调与NVIDIA等伙伴合作。行业可能走向“混合部署”——自研芯片处理核心高流量推理,通用硬件处理训练与多样化需求。
  • 潜在风险
    :自定义芯片开发成本高、周期风险大、软件生态需长期打磨。若基准过于理想化或部署规模不及预期,影响会打折扣。同时,过度依赖自研可能削弱与外部生态的兼容性。

总的来说,Jalapeño是OpenAI应对AI规模化挑战的务实一步:在算力饥渴与能源约束下,用更聪明的硬件榨取更多“智能每瓦特”。它标志着AI产业从“烧钱堆算力”向“系统级效率优化”的转折。未来几年,谁能在模型、软件与硅片之间形成最紧密的协同,谁就更有可能定义下一代智能基础设施。

(信息主要基于OpenAI官方公告、技术报告及多家科技媒体报道。实际部署效果仍需时间验证。)

相关学习资料

返回首页浏览学习资料