
导语:这两天 OpenAI 干了件大事——发布了自己人生第一颗芯片,名字还挺逗,叫"哈拉皮纽辣椒"(Jalapeño)。更有意思的是,这颗芯片不是用来训练大模型的,而是专门用来"答题"的。你每问 ChatGPT 一句话,背后就要"答题"一次。今天咱们就借这件事,把一个被忽略了很久、却越来越要命的问题讲透:为什么 AI 公司,要专门为"答题"单独造一颗芯片。
一、先看这个有点反常识的新闻
先说事儿。
2026 年 6 月 24 日,OpenAI 和一家叫博通(Broadcom)的芯片公司,一起官宣了一颗新芯片,代号 Jalapeño——直译过来就是"哈拉皮纽辣椒",墨西哥菜里那种绿色的小辣椒。OpenAI 给它起了个挺唬人的官方名字,叫"Intelligence Processor",智能处理器。
这是 OpenAI 成立这么多年来,第一颗自己的芯片。
你可能心想:OpenAI 不是做 ChatGPT 的吗,怎么跑去造芯片了?而且现在英伟达的卡那么火,它不直接买卡,自己折腾这一颗干嘛?
更反常识的是下面这句——这颗芯片,不是用来"训练"大模型的,而是专门用来"推理"的。
这俩词你先别晕。简单说:训练,是把 AI"教出来";推理,是把教好的 AI"拿来用"。你每次跟 ChatGPT 聊天、让它写段文案、帮你改代码,背后跑的,全是"推理"。
所以这条新闻翻译成大白话就是:OpenAI 专门为"回答你的问题"这件事,单独造了一颗芯片。
这就奇怪了。芯片不都是越通用越好吗,怎么还专门为"答题"造一颗?要把这事讲明白,咱们得先把骨架立住。
二、先立骨架
先立骨架 · 事件速览
• 时间 :2026 年 6 月 24 日,OpenAI 与博通(Broadcom)联合官宣。 • 主角 :芯片代号 Jalapeño("哈拉皮纽辣椒"),OpenAI 称之为"Intelligence Processor"(智能处理器),是 OpenAI 首款自研芯片 。 • 它是什么 :一颗专为大模型推理(inference) 打造的定制 ASIC(专用集成电路)——不是训练加速器,也不是通用 AI 芯片。芯片巨大,接近"光罩极限尺寸"(reticle-sized,一次曝光能造出的最大单片)。 • 关键数字 :从设计到流片(tape-out)只用了约 9 个月 ,业界极快;早期测试称"每瓦性能 显著优于现有最强方案";工程样片已在实验室以量产目标频率/功耗跑真实负载,包括 GPT-5.3-Codex-Spark 模型。 • 时间表 :2026 年底起部署;与微软等伙伴的千兆瓦(gigawatt)级 数据中心从 2026 年起推进。详细技术报告与公开跑分要等未来几个月。 • 为何重要 :它代表 AI 行业一个大趋势——当"用 AI"的次数多到天文数字,怎么把"每一条回答"的成本压下去 ,成了决定 AI 能不能真正便宜到人人可用的命门。 • 来源 :OpenAI 官博、Broadcom 投资者新闻、Tom's Hardware、TechCrunch、CNBC,2026-06-24。
立完骨架,咱们一层层往下挖。先从最关键的那个区别说起——训练和推理,到底差在哪。
三、第一层:训练像供个大学生,推理像他天天上班
这是全文最重要的一个比方,记住它,后面全好懂了。
训练,就好比十年寒窗,供出一个大学生。
你想想供一个孩子读到大学是什么概念:从小学到大学十几年,学费、补习、生活费,一笔笔砸进去,是一次性的、巨大的投入。而且这个过程要"通用"——你不知道这孩子将来干哪行,所以数理化、语文外语,什么都得学,底子要打得宽、打得活。
训练大模型一模一样。把一个模型"喂"出来,要用海量数据反复地教、反复地调,烧的钱是天文数字(训练一个顶级大模型,光算力成本就是几千万甚至上亿美元)。而且训练这活儿特别吃"灵活"——算法三天两头改,今天试这个结构、明天试那个参数,你需要一把"什么都能干"的工具。
这把"什么都能干"的工具,就是 GPU。所以训练阶段,英伟达的 GPU 最合适,因为它够灵活、够通用,正对训练的胃口。
那推理呢?
推理,就是这个大学生毕业后,每天上班答题。
孩子供出来了,开始工作了。从此以后,他每天到公司,处理一个又一个具体任务:写报告、回邮件、算报表。一天八小时,年复一年。
你每问 ChatGPT 一句话,就相当于让这个"AI 大学生"答一道题。全世界每天有多少人在用 AI?亿万次。这就意味着,这个"大学生"每天要答的题,是亿万道,而且只会越来越多。
现在关键的反差来了——
供他读书(训练),是一次性的、巨贵的开销;可他天天上班答题(推理),是日复一日、永不停止、还在不断增长的开销。
打个最直白的算盘:供孩子读大学花了 50 万,听着吓人,但那是一锤子买卖。可他工作四十年,每天的吃穿用度、通勤水电,一天天累加起来,总额早就远远超过那 50 万了。
AI 也是这个理。训练虽然单次巨贵,但它是阶段性的;推理虽然单次便宜,可它海量、持续、还在膨胀——规模化之后,推理才是那个日复一日、不断长大的大头成本。
这就是为什么,当 AI 真正铺开、用的人海量增长之后,所有公司突然意识到一件事:真正要命的成本,不在"建脑子",而在"答问题"。

四、第二层:一条回答背后,烧的是电费和硅
光说"推理是大头成本"还不够,咱们得往下看一层:这个成本,具体烧在哪?
答案朴素得有点扎心——烧在电费上,也烧在硅上。
你每发一条消息给 AI,它在后台要做的,是海量的数学运算(主要是矩阵乘法)。这些运算跑在芯片里,芯片一跑就发热、就耗电。所以你那条轻飘飘的"帮我写个朋友圈文案",落到机房里,是实打实的几瓦、几十瓦电力在转。
单看一条,电费小到忽略不计。但前面说了,这种调用全世界每天是亿万次 。亿万次乘起来,电账单就大得吓人。咱们之前聊过"AI 的尽头是电费"——一个大型 AI 数据中心,一年的电费能顶上一座小城市。这些电,绝大部分不是花在训练上,而是花在一刻不停地"答题"——也就是推理上。
这里有个特别关键、却容易被忽略的细节:芯片真正费电的地方,往往不是"算",而是"搬"。
什么意思?你以为芯片耗电主要在做乘法加法,其实不是。现代芯片做一次运算耗的电,远小于把数据从内存搬到计算单元、再搬回去耗的电。打个比方:让一个工人做一道算术题,他算只要一秒;可要他先跑到隔壁仓库把数字搬过来、算完再跑回去放好,这一来一回的力气,远比算本身费。
数据搬运,才是大模型推理里最贵的那块。 OpenAI 这颗 Jalapeño 的官方说法里,反复强调的就是这个——它专治推理在规模化时的三个瓶颈:数据搬运昂贵、算力和内存的平衡、网络效率。 它的核心思路,就是通过减少数据搬运 ,让芯片的"实际利用率"更接近"理论峰值"。
这话翻译成大白话:一颗芯片标称能干 100 的活,可因为数据老在那儿来回搬、搬运堵在路上,实际往往只发挥出六七十。Jalapeño 干的事,就是把"搬运"这条路修宽、修顺,让芯片少跑冤枉路,把那原本浪费掉的三四成捞回来。
所以你看,"为答题造芯片"这件事的本质,一点都不玄乎——就是想办法让每一条回答,少烧一点电、少搬一点数据,把单位答案的成本一分一分抠下来。

那问题就来了:既然英伟达的 GPU 这么强,直接拿 GPU 来答题不就行了?为啥非得另造一颗专用的?这就是下一层。
五、第三层:GPU 是全能选手,可答题更吃"专一+省电"
要回答这个问题,得先搞清楚 GPU 到底是个什么东西。
GPU,本质是个"通用多面手"。
它最早是给游戏渲染画面用的,里头塞了成千上万个小核心,能同时处理一大批简单运算。AI 火起来之后,大家发现拿它训练神经网络正合适,英伟达就靠这个一飞冲天。
GPU 最大的优点是灵活——什么并行计算的活儿它都能接。 打个比方,它像一把瑞士军刀:剪刀、起子、开瓶器样样齐全。训练阶段算法天天变,正需要这种"什么都能干"的灵活性,所以训练用 GPU,对路。
可一把瑞士军刀,问题也在这"样样齐全"上——为了什么都能干,它身上带了一堆这个任务用不上的零件。这些零件不干活,可照样占地方、照样耗电、照样要花钱。
而推理这件事,恰恰不需要那么多灵活性。
你想,一个模型训练好之后,它跑的运算是相对固定的——同一个模型,反复地、海量地跑同样那套计算。这种"又固定、又重复、量还特别大"的活,根本用不上瑞士军刀的全套功能。你需要的,是一把只切菜、但切得飞快又省力的好菜刀。
这就是 ASIC——专用集成电路。把通用芯片上那些"答题用不上"的功能统统砍掉,只保留、并且拼命强化推理最需要的那部分电路。砍掉的是灵活性,换来的是更高的每瓦性能 (花同样的电,干更多的活)和更少的数据搬运。
Jalapeño 就是这么一颗专为推理定制的大号 ASIC。它不追求"什么都能干",它只追求一件事:把"答题"这一种活,干到又快又省。
效果怎么样?OpenAI 早期测试给的说法是:每瓦性能显著优于现有最强方案。 注意是"每瓦性能"——不是绝对算力谁更猛,而是"花同样一度电,谁干的活更多"。对一家每天要答亿万道题的公司来说,这个指标,就是真金白银。
打个总账你就明白了:训练阶段要的是灵活,GPU 给得起,所以训练用 GPU;推理阶段要的是专一加省电,定制 ASIC 更划算,所以答题用专用芯片。 这不是谁取代谁,是"通用"和"专用"开始分工——一个负责"建脑子"时的灵活探索,一个负责"答问题"时的极致省钱。

这里还得提一句这颗芯片造得有多快。从设计到流片(tape-out,就是设计定稿、交给工厂去造的那一步),Jalapeño 只用了约 9 个月。 业界一颗复杂 ASIC 从头设计出来,常常要一两年甚至更久,9 个月属于极快。而且 OpenAI 还透露,开发过程里用上了自家的 AI 模型来加速。你品品这个套娃:用 AI 设计出一颗专门让 AI 答题更省钱的芯片。
六、第四层:为什么连买卡最猛的公司,都在自己造硅
把镜头拉远一点你会发现,OpenAI 这步棋,根本不是孤例。它踩的,是整个行业一条越来越清晰的大路:纵向整合,自己造芯片。
咱们把这条时间线捋一捋,你就知道这趋势有多猛了。
最早动手的是谷歌。 早在 2016 年,谷歌就推出了自研的 TPU(张量处理单元),专门给自家的 AI 运算优化。十年下来,TPU 已经是英伟达 GPU 之外最成气候的一支。
紧接着是亚马逊。 它搞了两条线:Trainium 管训练,Inferentia 管推理——光看名字(Inference + ium)就知道,亚马逊老早就把"推理"单拎出来,专门造芯片了。
再往后,微软也下场了, 推出了自家的 MAI 系列芯片。
就连一向用英伟达卡的 Anthropic, 也在 2026 年联手谷歌和博通,大举扩建基于 TPU 的算力。
如今轮到 OpenAI, 用这颗 Jalapeño,"补上了自己的那颗硅"。OpenAI 自己的说法是,要"build the full stack"——把从模型到芯片的整条链路都攥在自己手里。
你看出门道没有?这几家,恰恰是全世界买英伟达卡买得最猛的公司。 一边在抢卡,一边在自研,这事拧巴吗?一点都不拧巴,背后是三笔再清楚不过的账。
第一笔,成本账。 英伟达这几年毛利率长期在 70% 以上,你花 100 块买它的卡,一大半是它的利润。对买几张卡的小公司,认了;可对一年要砸几百亿美元买算力的巨头,这笔"溢价"大到能让人睡不着。自己造芯片哪怕造得糙一点,只要能把这块利润省下来,账就划得来——尤其是用在推理这个"日复一日的大头"上,省一分是一分,乘上海量调用就是巨款。
第二笔,供给账。 当全世界的 AI 算力都卡在英伟达一家手里,给谁、先给谁、什么价,全是它说了算。前阵子连谷歌都被曝出要去外部租算力,可见缺货之严重。手里有自研芯片这张牌,命脉就不至于全攥在别人手里。
第三笔,议价权账。 这跟上一条连着——你手里有自己的芯片,哪怕只占一部分用量,谈判桌上腰杆都硬:你不降价?我把用量往自研那边挪一挪。没有这张牌,你就只能被人牵着走。
成本、供给、议价权,三笔账叠在一起,你就明白为什么"抢英伟达卡"和"自己造硅"会同时发生——前者解燃眉之急,后者图长远主动权。两件事不矛盾,是一套组合拳。而 OpenAI 选择把第一颗自研芯片砸在"推理"上,正说明它认准了:未来真正要拼命省钱的地方,是答题,不是建脑子。

七、对照:这步棋也有风险,别急着吹
讲到这,是不是觉得专用芯片稳赢、英伟达要凉?先别急,咱们反过来泼盆冷水,把账算全。
定制 ASIC 这条路,有两个绕不过去的硬伤。
第一,它押注的是"自家模型架构相对稳定"。 专用芯片之所以省,是因为它照着"今天这套 AI 算法"量身定做,把别的可能性都砍了。可 AI 这行变得太快——万一哪天主流模型结构来个大改,换了一种数学算法,你那颗为旧结构定做的芯片,可能一夜之间就没那么好使了。而通用 GPU 因为"什么都能干",反倒更扛得住这种变化。这就是"专用"和"通用"永恒的权衡:专用赢在效率,通用赢在适应。 押注专用,本质是赌"我自己的模型路线,短期内不会大变"。
第二,流片快,不等于量产成熟。 Jalapeño 9 个月就流片,确实亮眼,但"流片"只是把设计交给工厂去造的那一步,离"大规模、稳定、良率高地量产"还有很长的路。芯片从样片到铺满数据中心,中间多少坑,业界都懂。
还有一条得老实交代:目前还没有公开的、第三方的跑分。 OpenAI 给的"每瓦性能显著更优",是它自己早期测试的说法,工程样片确实已经在实验室以量产目标的频率和功耗跑了真实负载(包括 GPT-5.3-Codex-Spark 这个模型),但详细的技术报告和基准测试,官方说要等未来几个月才公布。在那之前,咱们保持客观——这颗芯片的潜力值得重视,但"它到底有多强",还得等数据落地再下结论。
所以更准确的说法不是"GPU 要被取代",而是:市场正在分层。 最前沿、最不确定的探索,大家还是会用灵活的 GPU;而那些已经跑顺了、要大规模重复跑的活(尤其是推理),就越来越多交给专用芯片去省钱。通用的归通用,专用的归专用。OpenAI 这颗辣椒,是给这个趋势又添了一把火,但火候到没到,市场说了算。
八、落地:这跟你的 AI 账单,关系大着呢
你可能觉得,芯片公司神仙打架,关我什么事?关系大着呢,而且直接关到你钱包。
第一件事:你的 AI 订阅为什么是这个价,根子就在这。
你每个月给 AI 工具付的那点订阅费,或者你白嫖的那些免费额度,背后都是一笔账:AI 公司为你的每一次提问付出了电费和硅的成本。这个"单位答案的成本"压不下来,AI 就便宜不下来。 推理芯片这场竞赛,本质就是一场"把每条回答的成本往下打"的竞赛。这场仗打得越凶,你用 AI 就越便宜、免费额度就越大方。OpenAI 自己造芯片,图的也有这一条——把推理成本打下来,才能让 ChatGPT 这类服务,真正便宜到人人都用得起。
第二件事:AI 公司为什么疯狂囤电、囤数据中心,你也看懂了。
新闻里老说某某 AI 公司又签了多大的数据中心、又锁了多少电力。Jalapeño 这次也一样,配套的是与微软等伙伴从 2026 年起推进的千兆瓦(gigawatt)级 数据中心——一千兆瓦是什么概念?差不多是一座中型核电站的发电量级别。为什么这么疯狂囤电?因为他们算清楚了:未来 AI 最大的开销,是这个"大学生"日复一日答题烧掉的电。谁能用更省电的芯片、更充足的电力,把每条回答的成本压得更低,谁就能在这场仗里活下来、活得好。

往大了说,这事还给了咱们一个看产业的好视角:任何一个东西,只要它的使用是"海量、持续、还在增长"的,那这件东西的"单位成本",迟早会变成所有玩家死磕的战场。 当年是流量资费、是云服务器单价,今天就是"每一条 AI 回答的成本"。看懂了这条,你再看 AI 行业那些囤电、自研、抢产能的新闻,就不是一团乱麻,而是同一个逻辑的不同侧面。
九、小结
说到底,OpenAI 这颗叫"辣椒"的芯片,讲的是一个特别朴素的道理。
训练 AI,像十年寒窗供出一个大学生——一次性、巨贵、要灵活,所以用通用的 GPU 最合适。推理 AI,是这个大学生每天上班答题——海量、持续、还在增长,所以值得为它单独造一颗专一又省电的芯片,把每条回答的成本一分一分抠下来。
这场竞赛的本质,不是谁的芯片参数更炸,而是:谁能把"每一个答案"背后烧的电费和硅,压到最低。 因为只有把这个成本压下去,AI 才能真正便宜到人人可用——便宜,才是普及最硬的那道门槛。
GPU 不会消失,专用芯片也不会一统天下。更可能的结局是它们各干各的——就像你家厨房里,既有一把万能的瑞士军刀,也有一把只切菜、但切得飞快的好菜刀。
这世界的逻辑,往往就是这么朴素:当一件事你要做亿万遍,省下的每一分钱、每一度电,最后都会变成决定胜负的那座山。
参考来源
• OpenAI 与博通联合发布 Jalapeño 推理芯片,OpenAI 官方博客,2026-06-24:https://openai.com/index/openai-broadcom-jalapeno-inference-chip/ • OpenAI 与博通发布面向大模型优化的"智能处理器",Broadcom 投资者新闻,2026-06-24:https://investors.broadcom.com/news-releases/news-release-details/openai-and-broadcom-unveil-llm-optimized-intelligence-processor • 博通与 OpenAI 发布定制芯片 Jalapeño,OpenAI 首颗芯片是一颗巨大的光罩级 ASIC、9 个月超快开发周期,Tom's Hardware,2026-06-24:https://www.tomshardware.com/tech-industry/artificial-intelligence/broadcom-and-openai-unveil-custom-built-jalapeno-inference-processor-openais-first-chip-is-a-massive-reticle-sized-asic-built-in-an-ultra-fast-nine-month-development-cycle • OpenAI 发布由博通打造的首款定制芯片,TechCrunch,2026-06-24:https://techcrunch.com/2026/06/24/openai-unveils-its-first-custom-chip-built-by-broadcom/ • OpenAI 与博通公布合作中的首款 AI 芯片 Jalapeño,CNBC,2026-06-24:https://www.cnbc.com/2026/06/24/openai-and-broadcom-reveal-jalapeno-first-ai-chip-in-partnership.html
("每瓦性能显著更优"为 OpenAI 早期内部测试说法,截至发稿尚无公开的第三方基准测试,文中已注明保持客观。)
配图来源
• 封面、图1(训练 vs 推理 对照)、图2(一条回答的成本构成 / 推理成本随规模增长)、图3(自研芯片时间线):均系作者用 Matplotlib 制作的示意图,图中数据与事实已核实,来源见上方参考来源。 • 网络1《Silicon wafer.jpg》(硅晶圆,喻"为每条回答烧硅"):Wikimedia Commons 文件页 https://commons.wikimedia.org/wiki/File:Silicon_wafer.jpg ,公有领域(自published work,PD),授权以 Commons 文件页为准。 • 网络2《BalticServers data center.jpg》(数据中心机房):Wikimedia Commons 文件页 https://commons.wikimedia.org/wiki/File:BalticServers_data_center.jpg ,知识共享署名(CC BY)类授权,具体以 Commons 文件页为准。
夜雨聆风