ARTICLE · 1054951
47% 到 80%:AI 不写字了,它开始抢 if 语句
一、先说病:软件里最多的那块积木,是 if
软件做了二十年,我有个不太上台面的体会。
代码里最多的东西不是算法,是判断。
这个单子要不要人工审核,走 A 还是走 B,这封邮件是投诉还是咨询,这条评论要不要删,这个用户算不算老客户。
写成代码就是一堆 if。
问题在于,真实世界的 if 永远写不完。
你可以写"香蕉进果蔬区、饼干进零食区、孜然进调料区"。可现实会给你一车熟过头的香蕉、碎了的饼干、受潮结块的孜然。
规则写死的那一刻,就是在赌自己把世界看全了。而我们从来没看全过。
过去两年,大家的解法是把这些判断交给大模型:"你看着办。"
这个解法很贵,也很飘。它写得像模像样,用得提心吊胆——因为它的输出是一段文字,你还得自己解析、自己校验、自己兜住它哪天心情不好。
我要说的这件事,就发生在这个位置上。
二、这个新东西,不写字
官方给这类模型起的名字叫 System One,第一个公开的模型叫 Jev,9 月 15 日发布,这两天才刚把候补名单放开。
它的主张很干脆,一句话:
Decisions, not strings。给判断,不给字符串。
我一开始的反应是:哦,又一个"结构化输出"的包装。
不是。这两件事差得很远。
结构化输出,是让大模型照格式写一段字——它还是在一个 token 一个 token 地写,只不过你要求它写成 JSON。写得乖不乖,看运气。
这个东西是:你在调用的时候,把可能的答案先列出来。它不接受"自由发挥",它只在这些答案里选,并且给每个选择一个概率。它输出的是一个类型化的值,加上一个校准过的置信度。
官方自己的比喻是——一次前沿智能的函数调用:非结构化的一堆状态进去,带概率的类型化决策出来。
它还给自己"关掉"了一个能力:不生成字符串。
官方原话说得很直白:放弃了字符串生成,换来的是它没法胡说。
我盯着这句话看了挺久。这不是一句漂亮的营销词,这是一次取舍声明:我把"能说会道"这条腿砍了,因为我要的是能在代码里被信任。
顺带说个我挺喜欢的细节。它的命名梗有两层:System One 来自心理学里那个"快思考"的说法——不推理、不啰嗦,看见就判断;Jev 这个词来自经济学里一个老悖论——效率越高,总消耗反而越大。
这个名字起得很诚实。它没说自己要取代谁。
它说的是:我便宜到你看不出我在花钱,所以你会用我用到爆。
三、便宜到什么程度
这部分我按"谁说的"分开写,免得混在一起。
官方自陈的(出自它自己的对比表和主页):
输入每百万 token 0.042 美元——折成它自己的说法,是每十亿 token 42 美元。 - 输出免费
。原话是"便宜到不值得计量"。 端到端响应时间 70 毫秒到 500 毫秒。作为对照,它给现在的大模型标的是 3 秒到 329 秒。 主页上两个大字:193.6 倍更快、444.6 倍更便宜。这个数字来自它自己组织的一组工作流评测。 它还说自己的输入价比某家旗舰模型低 238 倍。 官网上挂了一段对跑:同样一件事,它 0.000081 美元、0.114 秒;大模型 0.013880 美元、8.566 秒。
第三方算的(出自那篇带脚注的实验记录):
按一个典型的分类调用算(2000 个输入 token、60 个输出 token),对上"3 美元输入 / 15 美元输出"这一档的模型,大约便宜 82 倍。 按官方公开的那组工作流评测算,每一例 0.0004 美元,对面是 0.0304 美元和 0.0836 美元——76 倍到 209 倍的区间。
这里必须补一句我服气的话。
官方在同一份材料里自己写了:"我们没法证明这个价格不是补贴出来的。"
国内做产品的公司,很少这么说话。我见过太多把"限时特价"写成"技术突破"的稿子。一个团队愿意在自己主页上承认"我的价格可能撑不住,要时间来证明",这条信息本身的权重,不比那个 238 倍低。
而且它顺手补了一句更狠的:它预期自己的价格会往下走,不是往上走。
四、真正让我坐直的,是那 98 条
现在说第三列。
一个自己做生产系统的人——他在风投做早期投资,但自己的 agent 是天天在跑的——把自己的生产邮件线程捞出来。
98 条,逐条人工核验过。
同一份数据,同一个任务,三个模型对跑:
他原来在生产里用的生成式分类器:47%(46/98)。 - Jev:80%(78/98)
。 一个本地跑的开源复现版:82%(80/98)。
我知道很多人看到这儿的第一反应跟我一样:47%?
我们天天说 AI 很强,强到要讨论它会不会取代人。结果在一件真实的分类活上——不是考试题,不是榜单题,是他自己生产系统里的邮件——它连一半都没对。
这个数字难看得有点可爱。因为它和我们的日常感受是冲突的,而冲突才是值得写的东西。
然后他还有一段更值钱的记录:不只是离线对跑。
线上 31 封进来的邮件里,那个本地决策器自己处理了 8 封,零错误,其余的它判断自己没把握,老老实实交回给前沿模型。
这一条比 82% 重要。
因为它演示的不是"小模型更准",而是"一个小模型知道自己什么时候不该说话"。
顺手他还写了个动作细节:他在自己的 agent 里翻"哪些调用其实是 if",几分钟之内替换掉了大约四分之一。
四分之一。
不是全部。是四分之一。
我特别喜欢这个数字的克制——真正用过生产系统的人,不会说自己一把梭全换了。
五、它凭什么又快又准
说机制。我尽量说人话。
一个大模型回答问题的过程,是一个 token 一个 token 往下写。写第一个字的时候,它得把整个网络从头到尾跑一遍;写第二个字,再跑一遍。所以它慢,所以它按 token 收费,所以输出比输入贵。
这一类模型的走法是:把注意力在输入上跑一遍,然后直接在输出那一层,给每一个候选答案打分。
不逐字写,不绕远路。一次算完,把概率摊在桌上。
开源复现版的做法更"土":它拿一个冻结的 4B 小模型,在单张消费级显卡上跑——把注意力跑一遍,直接读候选答案的分数,把后面那几层和逐字解码整段跳过。
我第一次看明白这点的时候,脑子里蹦出来的是考试。
大模型是那种每道题都写小作文的考生,写得漂亮,但你得读、得判、得防他一本正经地编。
这个新东西是只涂答题卡的考生:答案你已经印好了,他只在 ABCD 里选,还告诉你他对这个选项有几成把握。
答题卡不能瞎编。但答题卡也拿不到你没印上去的答案。
这句话请记住。它是这类模型最大的优点,也是它最大的限制——第六节我专门说。
六、但是,先别上头
我数了数,这份材料里值得打问号的地方,至少六处。而且大多不是我发现的,是它自己承认的。
- 那 98 条,来自一个人自己的生产系统。
它不是第三方评测机构做的横向榜。样本是真的、分母是真的、核验也是真的——但那是一家公司、一类任务。换个行业换种邮件,数字会变,可能变得很大。 - 官方那组工作流评测,是自家能力团队的人构造的。
官方自己写:可能存在偏置。虽然他们补了一句"这些工作流不在我们的训练分布里",但构造者身份这件事,抹不掉。 - 参考答案取的是两家最贵旗舰模型的平均值。
官方明说这会偏向那两家(相当于拿它们当标准答案),并且"可能低估了自己和 DeepSeek"。这句话说得挺体面,但反过来说:换个参考标准,那张图上的排序是可能变的。 - 大模型那侧的数字来自一个第三方路由平台。
官方直接写了:"几乎肯定有偏"——因为更复杂的查询可能被路由到更强的模型。这意味着对手那边的成绩,可能被人为压低了。 - "输出免费"和"不会幻觉",都建立在同一个前提上:答案集合是你给的。
它不会编答案,但它会在你给错的答案里自信地选。给了一个错的选项,它会给你一个 0.93 的置信度,然后你的系统会非常放心地做错事。你以为你消除了幻觉,其实你只是把幻觉从模型搬到了自己的选项设计里。 - 它的能力边界是"可枚举"。
分类、路由、打分、抽取、审核——只要答案能列全,它就有戏。要它写方案、做开放推理、构思一段文案,它不行。官方自己坦白了候选上限:单次最多 255 个,再多就得分两步走。
还有第 7 条,是我自己加的:它承认"类型安全"是"数学上做不到出错"。 注意这句话管的是什么——管的是格式,不是对错。
它永远不会输出一个格式错的东西。它完全可能输出一个格式完美的错误判断。
七、这件事真正改变的
把上面那些收一收,我觉得有三件事值得记住。
第一,AI 的账单开始分叉了。
过去两年,大家的默认动作是"哪个最强用哪个"。现在这条线分成了两半:发现用最贵的,生产用最窄的。
用最贵的模型去探路、去发明、去搭框架;一旦某个流程被工程化、被固定下来、要跑几千几万次,就换成一个专门为那一件事造的小模型进去跑。
这不是"小模型取代大模型"。这是同一套系统里,两种智能开始分工,并且价差两个数量级。
第二,"便宜"这件事的杀伤力,比"更强"大。
官方举了个例子:有人用它做了个实时打游戏的机器人,每秒 10 次查询,一小时大概 7 美元。官方的反应是"比想象中便宜"。
我更喜欢这个例子的另一面。每秒 10 次判断,这是人做不到、以前也不值得做的事。
成本掉一个数量级,不是"原来那批活便宜了",是原来根本不在清单上的活,会自己长出来。
这就是那个名字里的老悖论:效率提高了,总消耗反而变大——因为能被用上的地方,一下子多了。
第三,也是我最想说的:被抢走的是 if,不是判断。
它接走的是那些你本来就得写死、只是为了不出错而写死的判断。
留下的是什么?
是"这个单子要不要通融一下",是"这个客户其实话里有话",是"这件事虽然合规但不对"。
是那些你没法提前把选项列全的判断——因为选项本身,就是你判断的一部分。
我做了二十年开发,见过最贵的 if,从来不是写在代码里的那些。
是写在人脑子里的那些:没法外包、没法枚举、也没法交给一个 0.042 美元每百万 token 的东西。
当一次判断的成本趋近于零的时候,真正稀缺的就不再是判断力,而是"值得被判断的事情"。
这句话我今天抄在了本子上。因为往后很长一段时间,我们大概都要用它来回答同一个问题:
那些被省下来的时间,你打算拿去干什么?
以上。既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。