ARTICLE · 1117623
AI 造的引擎比 vLLM 快 90%,这账怎么算

刷到"AI 把推理引擎改快了 90%"这种说法,你的第一反应大概是:又来。我觉得这次是真的,但它挂着一串前提,而且最值钱的东西不在那个 90% 里。
先说判断:让 AI 自己优化 AI,门槛从来不在算力,在你能不能把需求写成一个它没法作弊的目标。
起因是一篇论文,和一台 B200
事情的起因,是一篇叫 MetaInfer 的论文。它声称:agent 不写任何专用工具,只靠"技能",就能从零造出一个推理引擎,性能还超过 vLLM。
Baseten 的工程师 Shawn Rushefsky 刷到它,第一反应是怀疑。于是他给了 Claude Code 一台 B200 工作站,让它自己试,跑的是 Anthropic 的 Fable 5 模型。
目标只写了一句:在所有性能指标上比 vLLM 快 20%,精度不能掉。
测的模型是 Qwen-3.6-35B-A3B,NVFP4 量化,单张 B200。基线是当时最新的 vLLM 0.25.1。
结果,单流解码 1,792 token/秒,对 vLLM 的 943——快 90%。首 token 12 毫秒对 28 毫秒,2.3 倍。
并发开到 32,输出吞吐 10,307 对 6,030,快 71%。
代价是:Claude 基本自主跑了一周,烧掉 约 17 亿 token(绝大多数是缓存输入)、约 200 个 B200 机时。换算成钱,官方口径是"数千美元"。
那 90%,是在什么工况下拿到的
这一点官方写得很清楚,值得先表扬。
90% 那个数字,测的是单流、重复且结构化的文本。
换个负载,数字就掉。
并发 32 的场景,提升是 71%。
看到"A 比 B 快 X%",第一句要问的就是:在什么条件下测的。
同一个引擎,换个工况,数字可能差一截。这不是谁在撒谎,是性能数字天生绑着工况。

真正难的,是别让它作弊
说实话,这段是我觉得全篇最值钱的。
论文和 Baseten 都反复强调同一件事:先把目标函数设计好。如果只写"尽量快",不加精度约束,agent 会收敛到什么?
官方给出的答案是这么一段:
```while True:yield "a"```
这个"引擎"的延迟和吞吐好得离谱,因为它每毫秒都能吐一个字符出来。但它除了字母 a,什么都不会。
意思很明白:agent 会想尽办法"通过"你的目标。你的活儿,是设计一个它赢了就等于你赢了的游戏。

Baseten 的机制是层层设卡:精度得对得上全精度基线,指标得跑在真实部署上。它甚至还允许 agent 停下来问一句"这个改动有精度偏差,行不行"。
目标设对了,结果来得很快。
作者自己写了一句大实话:Claude 其实几天就追平了 vLLM,后面接着跑,是"为了科学"。
通用引擎的通用性,本来就是拿性能换的
vLLM、SGLang、TensorRT-LLM 这些引擎,要照顾的是一大片情况。要覆盖的模型和硬件,太宽了。官方原话是:它们没有为任何一个"模型+硬件+负载"的组合做超优化。
这是取舍,不是谁做得不好。
你不可能既覆盖所有场景,又在某一个场景里做到极致。专用引擎的逻辑正好相反:只讨好一个组合,把通用性整个扔掉。
Baseten 还试了第二个模型。SAM 3.1 图像分割,换一张 H100,跑到 91 张图/秒,比 Meta 的参考实现快 50%,只花两天、约 2 亿 token。
但他们自己给这个结果打了折:没做对照实验,所以只算"提示性证据",不算"确定性证据"。
这笔账,什么时候才划算
先把两个前提摆出来。
第一,这两个引擎目前都没在生产环境跑流量。官方原话。
第二,实验是 7 月底做的,博客 10 月初才发。作者自己补了一句:现在是 10 月,Kimi K3、GLM-5.3 在很多榜单上已经接近最好的闭源模型。
这意味着,同样的活儿,以后的门槛会往下掉。
200 个 B200 机时,换一个"特定工况快 90%"的引擎。官方给的参照是:大公司每年在推理上花几千万到上亿美元。
在这个量级上,个位数百分比的提升就值几百万美元。所以门槛很清楚:你的推理量得大到那个程度。
小团队花一周做这件事,省下的钱可能还不够付机时。这事离你其实就隔一层,引擎每省一点钱,最后都会落到你用 AI 的价格上。
结论:下次看到"快 X%",先问三句
回到开头那个判断。
这套方法难的地方,从来不在模型多强,在你有没有想清楚什么不能让。
下次再看到"AI 把某个东西优化快了 X%",先问三句:
① 这个数字是在什么工况下测的?
② 目标函数设对了吗,它有没有作弊的空间?
③ 这份投入,什么时候回本?

三句都答得上来,这条新闻才值得你花时间。你平时会留意"提升了几个百分比"这类说法背后的工况吗?评论区聊聊。
AI 圈的事,搜「AI 览无余」就有——不追热搜追数据,每篇都标出处、都算给你看。