一场电视访谈,一张被忽略的图表,一个价值数十亿美元的定价谎言
2026年7月20日,CNBC演播室灯光打在Bret Taylor脸上这个同时头顶OpenAI董事长和Sierra联合创始人两顶帽子的男人,正在对着全美CEO们喊话:别被开源模型的低价标签骗了,它们没你想的那么便宜
他讲得自信、从容、逻辑闭环。
但导播切出的那张图表,来自独立评测机构Artificial Analysis,正在用冰冷的数字讲一个完全相反的故事



▲ Karl Mehta帖子直接点出张力:Taylor在镜头前讲“开源不一定更便宜”,同一时段电视画面上的图表却显示Kimi K3每任务成本仅为Claude Fable 5的三分之一
“Token之于智能,就像瓦特之于电力”,一个精彩但危险的类比
先说Taylor到底讲了什么。他每月和大约100位CEO交谈,说这些老板们反复问两件事:我的Token花销换到价值了吗?在AI时代我的护城河是什么?
然后他抛出了这次访谈最核心的概念,Token效率(token efficiency)
“有一个东西叫Token效率。事实证明,前沿模型的Token效率高得多。”
“Token之于智能,就像瓦特之于电力……完成一个任务需要多少Token?每个Token带来的价值并不相同。”
换成日常说法:一个模型每Token卖你1分钱,但它啰嗦得要命,兜兜转转写500行才把活干完;另一个模型每Token卖你5分钱,但一击即中只用50行谁更贵?
这个逻辑本身无可挑剔。开发者社区对此早有痛感。Thorsten Ball描述过一种常见困境:你以为某些任务用便宜模型就够了?但你事先根本不知道它需要多聪明。不够聪明时,它会不断重试,用更便宜但更多的Token硬扛

▲ “更便宜但更费Token”已经出现在大量agent工作流的账单里
打脸时刻:0.94美元 vs 2.75美元
问题出在Taylor把“前沿模型Token效率更高”直接等价于“前沿模型按任务算更便宜”
数据不答应。
就在他说话的同一段采访中,CNBC画面切出了Artificial Analysis的图表这张图不比每百万Token标价,比的恰恰是Taylor所倡导的,每任务成本(Cost per Task)
结果呢?
| $0.04 | |
| $0.32 | |
| Kimi K3 | $0.94 |
| Claude Fable 5 | $2.75 |


▲ Artificial Analysis官方数据:用Taylor自己主张的“按任务算账”口径,Kimi K3约为Fable 5价格的三分之一
Karl Mehta在帖中用了一个精准的词:“未解的一栏”(the unresolved column)沿用Taylor推崇的计量方式,他在摄像机前捍卫的闭源溢价显得缺乏价格证据
Taylor谈到的“Token效率”确实存在Kimi K3依然很啰嗦,跑完Artificial Analysis全部Intelligence Index任务,输出了惊人的1.3亿Token,是同类中位数的两倍多但即便如此,折算下来,它依然比顶级闭源模型便宜
亚马逊CTO的灵魂拷问:你真的需要最强大脑吗?
几乎同一时期,亚马逊CTO Werner Vogels也从企业架构角度谈到模型选择:
企业AI账单正在失控。越来越多公司正在从昂贵的大模型转向更便宜的开源模型。核心架构问题是,“你真的需要最大、最顶尖的模型来解决这个具体问题吗?”答案往往是否。
这和Box CEO Aaron Levie更早的判断遥相呼应:当开源权重与前沿只差一个“边际”而非“鸿沟”时,任务总成本的下降会抬升整体AI用量前沿实验室不会因此消失,规划、编排、审阅这些高价值环节仍是它们的领地,但“所有Token都必须高价”的假设,已经站不住了

▲ Levie的判断:开源逼近前沿,对整个应用层都是重大利好
计费单位正在变化:从“按Token收费”到“按结果收费”
Taylor访谈中还有一个更长远的观点,落在计费单位的变革上:
“按Token付费,就像注册Gmail却按CPU周期付费一样荒谬。”
他认为市场终将走向按结果付费,解决一次客服、完成一笔贷款预审、处理一份医疗授权他的公司Sierra据称已经这么做了有人在评论区给了个更毒舌的版本:按Token付费,就像按扳手拧了多少圈付钱给修车师傅;合理的费用只看车有没有修好。
计量单位一旦从“资源”转向“结果”,模型价格和Token效率都会汇入同一个问题:完成这件事,花了多少钱?
公开评测里,多款开源权重模型已经给出了极具竞争力的答案Kimi K3自身也是证据,相比上一代K2.6,它输出Token减少了21%,Intelligence Index得分却跃升了13分开源阵营也在学习“说少一点、做对一点”


▲ K3比K2.6少说了21%的废话,分数却高了13分,开源模型的Token效率也在飞速进化
最后一个问题
Taylor提出的框架成立,结论仍要交给数据
“不要只看每Token标价,要看完成任务花多少钱”,这个认知框架是对的,甚至是这场辩论里最有价值的共识
沿用他推崇的框架去算账,独立评测给出了另一幅图景:在任务成本轴上,多家开源权重模型已经领先闭源前沿
闭源模型当然还有质量、稳定性、合规性等溢价空间支撑这份溢价的理由也在变化:更高价格要靠更好的结果来证明
这是一个完全不同的故事。而市场最终会用最残酷的方式回答:“更好”到底值多少钱
夜雨聆风