

凌晨一点,硅谷被一张视频封面炸醒了。
OpenAI官方账号发布了一条44秒的演示视频:同一个GPT-5.6 Sol,左边在Standard档位上慢条斯理地吐代码,右边却在以每秒750个token的速度疯狂输出,一个完整的3D仓储模拟器,右边已经搭建完毕,左边才刚画完地基。随后,Sam Altman只用了一个词转发了这条推文:“/ultrafast”。
你上一次看到奥特曼这么惜字如金,还是GPT-5发布那天。
这次的爆点落在速度上:同一套前沿智能被塞进了一条短得多的等待时间里,最高14倍于标准速度,官方还宣称智能不打折。负责驱动这条极速通道的是Cerebras,绕开了英伟达硬件。

▲ OpenAI官方深夜释出的演示视频封面,并排对比Ultrafast与Standard的生成速度,视觉冲击极强
2000个token,2.7秒:等待被重新定义了
先别急着谈技术我们来说说“2.7秒”意味着什么
按照OpenAI官方公布的数据,Ultrafast模式下的GPT-5.6 Sol输出速率最高达到每秒750个token。科技资讯账号Chris(@ChrisGPT)在引用官方消息时做了个直观换算:一个2000 token的代码补丁,大约2.7秒就能流式吐完;而完整的128K输出上限,理论上约3分钟就能跑完。
*这里的2000以token为单位;若换算为代码行,会因语言和写法而变化。*但即便如此,这个数字也足够让每个写过代码的人头皮发麻。
你上一次等模型补完一个函数、起身去倒杯水、回来看它还在“推理中”的日子,可能真的要结束了。OpenAI员工Sherwin Wu在转发中用了更激进的判断:750 tok/s对多数工作负载“几乎像瞬时”,瓶颈会转移到工具本身。文件系统、测试套件、浏览器自动化、你那套用了八年的企业内部API,才是下一块天花板。

▲ Cerebras官方同步发文:完整GPT-5.6 Sol,最高750 tok/s,HLE考试11小时11分钟刷完
而Cerebras给出的背书更“狂”:GPT-5.6 Sol Ultrafast用11小时11分钟跑完了Humanity's Last Exam的2500道题,接近7倍于Claude Fable 5的全程耗时,且准确率“可比”。
11小时11分这个数字的象征意义,几乎和它本身一样重要,曾经要花三天三夜的“人类终极考试”,现在可以在一个中国工作日的通勤加加班之间跑完了。
44GB片上内存:为什么Cerebras能“叫板”英伟达?
技术线索要从一块比你的脸还大的芯片说起。
传统GPU推理大模型的瓶颈,可以这样理解:模型权重就像一位厨师的全部菜谱,但每次炒菜之前,他都得从很远的总仓库把菜谱一页一页搬进厨房。GPU的显存带宽,就是这条“搬菜谱的路”。Cerebras选择把整片晶圆做成一颗芯片,省去了切成几百颗小GPU的做法。这块WSE-3上塞了44GB片上SRAM,菜谱直接摊在灶台旁边,厨师伸手就能翻。
结果就是:Cerebras此前在开源模型上演示过每用户数千token/s的惊人吞吐,早已在极客圈声名大噪。但这次,它拿下了OpenAI闭源旗舰Sol的商业化接入。

▲ Cerebras博客:Accelerating GPT-5.6 Sol Ultrafast,顶部柱状图清晰对比Ultrafast 14×、Fast 2.5×、Standard 1×
事实上,这场联姻早在2026年1月就已铺垫。当时TechCrunch报道OpenAI与Cerebras达成多年算力合作:约750兆瓦算力、总价值超100亿美元。当时的新闻稿把这次合作类比为“宽带之于互联网”,没人会嫌弃网速太快,只是还没意识到自己的产品形态会被网速重塑。
八个月后,第一件“可见交付物”落地了

▲ 奥特曼只回了一个词:“/ultrafast”,像一句产品口令,也像一句战书
一场从“更聪明”到“先答完”的军备竞赛
速度带来的变化,落在竞争轴的倾斜方向。
过去两年,AI行业的主旋律是“谁更聪明”:智力榜、编码榜、多模态榜,各家轮番刷榜。但GPT-5.6 Sol在Artificial Analysis上的定位很微妙:智力指数约61,输出速度约62.3 tok/s,被评价为“接近最强竞品,但单位成本更低”。当能力差距收窄到普通用户几乎无感的时候,“谁先答完”就变成了新的战场。

▲ Artificial Analysis上GPT-5.6 Sol标准API的测速基线:约62.3 tok/s。14倍之后,就是750的量级
这就是为什么OpenAI要把速度做成产品档位:Standard、Fast(2.5×、约2倍价格)、Ultrafast(14×、价格未公开)。这和云计算卖“标准实例/加速实例/预留实例”的逻辑一模一样。未来企业采购AI服务,招标字段里可能不再只有“模型名称”,还会有P95延迟、峰值tok/s、故障切换路径。
而对英伟达来说,这是一个不能再忽视的信号:OpenAI在英伟达生态之外,保留并展示了另一条可商业化的推理路径。CUDA仍占据主导,但前沿闭源模型的极速通道,第一次系在了别人的芯片上。
只不过,这场喧嚣背后也有“冷静剂”社区评论里反复出现的疑问是:既然限量预览、多数人用不上,为什么现在就要高调宣布?另一个待验证的问题是:750 tok/s是否牺牲了输出质量?官方和Cerebras都坚称“同智能、无妥协”,但独立第三方的大规模复测,目前还几乎空白。Hacker News上的开发者则指出:HLE的2500道题互相独立、高度可并行,总耗时对比如果没固定并行度和资源池,解读就会失真。真实coding agent循环中,工具调用、二次prefill、等待测试套件,都会把端到端加速比从“峰值14×”拉回地面。
烧钱机器与2.7秒:速度是一把双刃剑
Chris的推文评论区里,有一条回复值得你品:“Astra + Ultrafast Mode = an absolute money-draining machine”,烧钱机器。

▲ 网友锐评:Astra + Ultrafast = 烧钱机器。速度越快,浪费越多?
这句话戳中了行业焦虑:更快不会自动等于更高效。糟糕的提示词、冗余的agent循环、无意义的反复试错,也会以14倍的速度消耗你的token预算。OpenAI自己此前就在效率声明中强调“让每个token做更多有用功”,速度档位和token效率,其实是同一枚硬币的正反面。
但对那些“每一秒都是钱”的场景,生产事故处置、盘中金融研究、实时风控、电商客服,Ultrafast的产出价值,可能远超它的账单。Sherwin Wu说的“瓶颈转移到工具本身”,翻译成人话就是:模型速度上来后,慢点会落到你的组织上。
这大概是整个事件里,最值得每位读者记住的一句潜台词。
当AI快到让你来不及“先去干点别的”,人类的工作方式,就轮到被迫重构了。

夜雨聆风