ARTICLE · 1076303
刷屏7天就被实测打脸,Jev 戳破了 AI 跑分的泡沫
2026 年 9 月 15 日,一个叫 Jev 的模型横空出世。
发布者是 TypeSafe AI,创始人 Diogo Almeida——OpenAI 前研究员,RLHF 和 InstructGPT 的核心成员。带着 4000 万美元融资走出隐身模式,第一枪就打得极响:Jev 不生成文本。你给它一个应用状态和一个结构化问题,它单次并行返回"判断加概率"。只提供三种原语:Choice,从选项里挑一个;Score,打个分;Noul,回答是否。
数字漂亮得不像话:输入每百万 token 只要 0.042 美元,输出免费;官方宣称比前沿模型快 20 到 200 倍、便宜 40 到 400 倍;工具调用错误率,零。
发布推文浏览量冲破 3700 万,Hacker News 刷屏。一周之内,开源社区复现出了 Kev,有人做了基准测试工具 JevBench,还有一堆玩梗项目——jevchat、jev-2048。那几天的科技圈,空气中都是"新王登基"的味道。
然后,打脸来了。而且来得飞快。
一、爆火:它卖的不是模型,是"判断"这个原语
先说清楚,Jev 为什么能火。
过去三年,整个行业都在用大模型做小判断。用户输入是不是恶意的?这个工单该分给哪个部门?这封邮件是不是钓鱼邮件?Agent 这一步操作验收通过了吗?
这些问题有一个共同特点:不需要长篇大论,只需要一个判断。但我们一直在用能写论文的模型去干保安的活。让一个 2000 亿参数的模型回答"是不是",就像请一位米其林主厨来按电梯按钮——能按,但贵、慢、而且浪费。
Jev 的创始人显然看透了这一点。他不跟你比谁的文章写得好,他直接把"判断"这个动作抽象成产品。你问,它答,顺便给你一个概率。更妙的是它的训练方法 RLCD,校准决策强化学习,让它输出的置信度不是随口说说,而是一个真实的统计信号——它说 90% 把握,长期看就真的对 90% 左右。
这对做 Agent 系统的人来说,诱惑力是致命的。因为 Agent 系统里 80% 的调用都是这种高频小判断:路由、过滤、护栏、验收。每一次都用大模型,成本曲线根本跑不通。Jev 给出的价格是输出免费,等于把这 80% 的成本直接归零。
这里还有一层值得注意的细节。Jev 的创始人是 RLHF 的核心成员——RLHF 是什么?是教大模型"好好说话"的技术。一个教 AI 说了半辈子话的人,转头创业做的第一件事,是让 AI 闭嘴。这个转身本身就是一个信号:连生成式路线的缔造者之一都判断,下一个价值洼地不在"说得更好",而在"判得更准"。
所以它的爆火不是营销奇迹,是击中了真痛点。这是这个故事里真正有价值的第一课:在生成式 AI 的狂欢里,有人转身去做"闭嘴干活"的生意,反而一鸣惊人。
但请注意,痛点是真的,不等于实力是真的。这两件事,被市场用七天时间就做了切割。
二、反转:实测一周,四个战场全部失守
爆火之后,独立测试接踵而至。结果是一场全方位的溃败。
第一个战场,钓鱼邮件识别。独立测试中,Jev 准确率 62.6%,Claude Haiku 4.5 是 81.3%。注意,Haiku 在 Anthropic 的产品线里也只是小模型。也就是说,在"判断"这个 Jev 号称的主场上,它输给了别家的轻量级选手,而且输了将近 20 个百分点。
第二个战场,商业邮件分类。Gemini 的准确率更高。当然,Gemini 贵 10 到 20 倍——Jev 的拥趸可以辩护说"我便宜"。但便宜的前提是够用,62 分和 81 分的差距,在很多业务里就是"能用"和"不能用"的区别。一个护栏模型每漏掉一封钓鱼邮件,省下的 token 钱可能一次就赔光。
第三个战场最有戏剧性,下棋。GLM 5.3 在 29 步之内将死了 Jev。这个测试结果传开后,圈子里流传一句话:"下得快,未必想得深。"单次判断再快,一旦任务需要多步推演、需要全局视野,专门做"瞬间判断"的模型就露出了底牌——它根本没有深想的能力,因为它的设计目标就是不深想。
第四个战场是 Jev 自己选的:官方基准。在官方自测里,它也只是和 Claude Sonnet 5 打平,67.8%。注意,这是它主场作战、自己出题的成绩。自己出题都只能打平,别人出题自然就是输。
四个战场看下来,一个清晰的结论浮出水面:Jev 发布即巅峰。它的最佳状态,永远停留在了发布会那天。
三、为什么跑分总是不等于实战
Jev 不是第一个塌房的,也不会是最后一个。过去一年,"发布即封神、实测现原形"的剧情我们看了不下五次。这背后是一个结构性的问题,值得拆开说。
第一,基准是可以被"准备"的。任何厂商发布模型时展示的跑分,本质上都是自选动作。测试集是不是提前见过?prompt 是不是精心调过?对比模型的参数是不是用了最弱的一档?这些问题在发布会的光环里没人追问,但在独立测试里会被一一拆穿。Jev 的官方基准只敢对标 Sonnet 5 且只敢声称打平,这本身已经是一种诚实的暗示——但 3700 万浏览的传播里,没人读到这一层。
第二,跑分测的是"平均情况",实战撞见的是"你的情况"。钓鱼邮件测试之所以致命,是因为真实的钓鱼邮件每天都在变异,它不在任何静态测试集的分布里。一个在基准上 90 分的模型,到了你的业务数据上可能是 60 分。而基准 70 分但鲁棒的模型,实战可能反而更稳。分数是实验室里的体温,实战是户外的天气。
第三,单点性能掩盖不了架构缺陷。下棋测试暴露的不是"Jev 棋艺差",而是一个更本质的短板:很多真实任务看起来是单点判断,实际上是伪装的多步推理。路由一个客服工单,表面是分类,实际上需要理解上下文、用户历史、业务规则。Jev 把这些全部压缩成"一次判断",速度是上去了,但任务的隐性复杂度不会消失,它只是被忽略了。
还有第四个原因,藏在传播结构里。一个模型发布,第一时间转发的永远是最容易被打动的人群——开发者、爱好者、媒体,他们的兴奋是真实的,但兴奋不等于验证。独立测试者反而是慢的一批人:要写测试集、要跑对照、要复核结果,等这些声音出来,热度早就收割完了。传播的时间差,就是泡沫的生存空间。Jev 的 3700 万浏览发生在第一天,而 62.6% 这个数字出现在第五天以后。如果你只活在第一天,你永远看不到第五天。
所以,"跑分不等于实战"这句话,更准确的版本应该是:跑分是厂商想让你看到的世界,实战是你真正生活的世界。这两个世界的差距,就是营销预算的去处。
四、塌房之后:它真正的位置在哪
如果故事到这里结束,那只是一个普通的翻车八卦。但 Jev 的故事有意思的地方在于:塌房之后,它没有死,而是找到了自己真正的位置。
行业共识在一周内迅速形成:Jev 不是 frontier 杀手,它是"语义逻辑门"。
这个词值得停下来理解一下。芯片里有逻辑门,与门、或门、非门,每一个都极其简单、极其便宜、极其快,但无数个逻辑门组合起来,就是整个计算机。Jev 们扮演的角色类似:在一个 AI 系统里,成千上万的微小判断——这个请求要不要拦、这步操作过不过关、该调用哪个工具——全部由这种"语义逻辑门"以接近零的成本完成,而真正需要深想的问题,才上交给人或者大模型。
这其实就是卡尼曼说的系统 1 和系统 2。人脑不是靠一个全知全能的模块运转的,而是靠"快思考"处理 95% 的日常,靠"慢思考"攻坚 5% 的难题。未来健康的 AI 架构也一样:不是造一个越来越贵的超级大脑,而是快慢分工、各司其职。
在这个架构里重新审视 Jev,它的成绩单打脸吗?钓鱼邮件 62.6%,确实不配做最后一道防线,但做第一层粗筛绰绰有余——把 95% 的明显正常邮件以近零成本放掉,只把可疑的交给 Haiku 或 Sonnet 精查。系统总成本下降一个数量级,准确率几乎不变。
这才是 Jev 这类模型的正确打开方式。它的悲剧不在于弱,而在于被营销推上了一个不属于它的王座。一个优秀的零件,被包装成了一台完整的机器,这是它塌房的真正原因。
写在最后
回看 Jev 的 7 天:9 月 15 日发布即封神,一周内实测全面打脸,又在一周内被行业重新安置到合适的位置。这个节奏本身,就是 AI 行业走向成熟的信号——市场的纠错速度,已经快过营销的传播速度了。
最后给你三条建议。
第一,对任何刷屏的新模型,执行"72 小时法则"。发布当天的声量、创始人的履历、融资的金额,这三样东西都和能力无关。等 72 小时,独立测试会替你拆穿一切。Jev 的 3700 万浏览和 62.6% 的实测准确率之间,只隔了不到一周。
第二,如果你的团队在搭 AI 系统,现在就做一件事:把调用日志拉出来,数一数有多少比例的调用其实只是"判断"。路由、过滤、护栏、验收,凡是返回值不超过一个词的,都是候选。把这些从昂贵的大模型上拆下来,交给小而专的判断模型。这可能是你今年性价比最高的一次架构优化。
第三,也是最重要的:评价任何 AI 产品,把"它的巅峰时刻"和"它的稳定位置"分开看。前者是发布会,后者是三个月后的留存。Jev 的巅峰是假的,但它的位置是真的。反过来,很多现在还在神坛上的模型,巅峰是真的,位置可能也是假的。
潮水退得越来越快了。这大概是这个行业最好的消息。