ARTICLE · 1058617
一个不会说话的AI,凭什么刷屏硅谷?
一个不会说话的AI,凭什么刷屏硅谷?
朋友,最近AI圈出了件挺有意思的事。 一个叫 Jev 的模型火了。火到什么程度呢?上线 Vercel AI Gateway 24小时,就有接近13%的付费团队用上了它——这是 Vercel 平台历史上采用速度最快的新模型。 但你猜怎么着?这个模型一句话都不会说。 你问它任何问题,它都不会写一段回答给你。它不聊天、不写代码、不写文案、也不解释。它只会做一件事——判断。 给它一段材料,再给它几个选项,它直接告诉你选哪个、有几成把握。就像考试里做选择题,它不写解题过程,直接涂答题卡。 听上去是不是有点反直觉?大家都在往"更聪明、更会说、更全能"的方向卷,突然冒出来一个"哑巴AI",还火了。 今天我们就来聊聊,这个不会说话的AI到底是什么、为什么会火,以及它背后那个可能改变整个Agent行业的信号。 先把概念搞清楚。 Jev 是一家叫 TypeSafe AI 的旧金山创业公司发布的产品。创始人叫迪奥戈·阿尔梅达(Diogo Almeida),前 OpenAI 研究员,参与过 GPT-4 和 InstructGPT 的研发——说直白点,ChatGPT 的前身就有他的功劳。 公司隐身研发了两年,出来的时候带着 DCVC 领投的4000万美元种子轮。在硅谷,这个配置加上这个背景,本身就足够让人多看两眼了。 但真正让它刷屏的,是它给自己贴的标签:System One Model(系统一模型)。 这个名字来自诺贝尔奖得主丹尼尔·卡尼曼的经典著作《思考,快与慢》。书里说,人的大脑有两套系统: 过去这三年,所有大模型都在卷"系统二"——推理能力越来越强,写的文章越来越长,思考链越来越深。GPT 从初代走到现在,核心就是越来越会"想"。 Jev 走了一条完全相反的路:它不做系统二,专做系统一。 它的用法很简单。你给它两样东西: 它支持三种问题类型,官方叫"AI原语": 重点是:它不会解释为什么,不会写一段分析给你看。它直接返回结构化的数字结果,你的程序拿来就能用。 而且,多个问题可以一起问,延迟几乎不增加。问一个问题和问四个问题,耗时差不多。 你可能会说:等等,这不就是分类模型吗?风控模型、审核模型不都是干这个的? 还真不太一样。我们来拆解几个关键差异。 传统大模型的收费方式是按 Token 算——你输入多少字、输出多少字,分别计价。输出通常比输入贵好几倍。 Jev 的收费方式是:输入按 Token 收费,输出免费。 因为它根本不"输出"文字,它只输出一组概率数字。根据官方数据:输入百万 Token 只要0.042美元,端到端延迟70到500毫秒。 这个差距有多大呢?根据 TypeSafe 自己的对比:
速度最高快200倍,价格便宜几十到上百倍。 这个差异的本质是什么?大模型卖的是"顾问服务"——每次调用都相当于请一个顾问写一段分析。Jev卖的是"电子元件"——一次判断就是一个零件,你可以在代码里调用它一万次。 零件可以进采购清单,可以算单位经济账,可以塞进一行代码里跑上亿次。这是完全不同的商业模式。 Jev 宣传自己"幻觉率为0%",这句话很容易被误解。 它不是说自己永远判断正确——它完全可能选错选项。它说的"零幻觉"是指:它绝不会给出你选项之外的答案。 举个例子,你让传统大模型用JSON格式返回分类结果,它可能时不时给你写一段解释、或者字段名拼错、或者多输出一个逗号。这些问题在生产环境里非常头疼——你得写大量容错代码。 Jev 不会。因为它的输出空间是提前限定死的,从数学上就不可能跑出你定义的 schema 之外。它不会编造不存在的选项,不会拼错字段名,不会输出格式错误的JSON。 用官方的话说:"它可以自信地选错,但不会自信地胡说八道。" Jev 用的训练方法叫RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)。 这个名字有点绕,核心意思是:它说有70%的把握,那就真的大约70%的时候是对的。 听上去理所当然?其实不是。普通大模型说"我很确定"的时候,这句话本身并不附带刻度。它可能90%确定但其实只有60%准,也可能50%确定但其实80%准。 这在生产环境里是个大问题——你没法信任模型给你的置信度,就没法用它来做自动化决策。 RLCD 就是专门解决这个问题的:让模型的概率输出经过校准,"说几成就是几成"。 这件事的价值,做过AI产品落地的人应该能懂。 Jev 能爆火,不是因为它技术有多炫,而是因为它精准地踩中了当下AI行业最痛的那个点: Agent 太费钱、太慢、太脆了。 我们来想一下,一个 Agent 在执行任务的时候,80%以上的操作是什么? 不是深度推理,不是写长篇大论,而是各种琐碎的判断: 每一次这样的判断,现在的做法都是:调一个大模型,让它写一段话(或者一段JSON),然后你的程序再把答案解析出来。 这就好比你去问前台"请问三楼怎么走",前台先给你写了一篇300字的建筑布局分析,最后才告诉你"左转乘电梯上三楼"。你还得从300字里把答案抠出来。 又贵,又慢,还容易格式错。 Jev 的价值就在于:它把"判断"这件事从"生成"里剥离了出来。 该让大模型干的事——规划、推理、写代码、写方案——继续让大模型干。 该让判断模型干的事——分类、评分、选选项——就交给便宜又快的 Jev。 这就是所谓的"快慢脑分工":系统二负责想清楚,系统一负责高频执行。 这个思路一出来,Agent 的成本结构就变了。 举个实际例子,国内的 APUS 团队已经基于这个思路做了开源复现——他们用 Qwen3.5-9B 模型跑浏览器自动化 Agent,把"点哪个元素"的判断交给本地小模型,跳过自回归解码,直接一次性前向计算出结果。 效果怎么样呢?在一台 M2 Pro 的 MacBook 上,全程离线,做维基百科检索任务中位耗时18秒,表单填报只要3秒。单任务模型打分只需要4次,全程零云端调用、零API费用。 这就是"判断层"独立出来之后的能量。 聊了这么多好处,也得说说它的边界。Jev 不是来取代大模型的,它补的是另一个位置。 Jev 擅长的是"直觉判断",不是"逻辑推理"。它没法做需要多步推演的事。 有个 Browser Use 的创始人做了测试:让 Jev 执行长程浏览器交互任务,结果20次只成功了1次。而具备推理能力的 GPT-5.6 Luna 能做到17/20。 原因很简单:浏览器操作涉及状态搜索、路径回溯、遇到意外情况的调整,这些都是系统二的工作,不是系统一能搞定的。 官方文档明确标注了:CJK(中日韩)语言的准确率偏低。英文短文本表现最稳定,中文场景建议先拿自己的数据测一测。 这个倒也不意外——很多模型都是先在英文上验证,再逐步优化多语言。 传统大模型答错了,你能从它的回答里看出逻辑漏洞。Jev 呢?它给你一个95%置信度的选项,错了就是错了,你不知道它为什么错。 这是判断模型的天然特性:黑箱式输出,没有推理过程供你审查。 所以越是高风险场景,越不能全靠它。它更适合量大、容错率高的场景——比如客服分类、内容初审、异常检测、Agent 的中间状态判断。 TypeSafe 自己也承认:目前无法证明定价不依赖补贴。简单说就是——现在可能是赔本赚吆喝,等用户量上来之后会不会涨价,不好说。 不过这个倒也正常,新产品进入市场先用低价抢份额,是常见策略。 Jev 的爆火,表面上看是一个新品类模型的走红。但往深了想,它其实折射出整个AI行业正在发生的几个重要变化。 最早的 Agent 就是一个大模型从头干到尾——规划、执行、判断、反思,全是它。 后来有了"专家模型 + 路由"的思路,不同的任务分给不同能力的模型。 现在又进了一步:连同一个任务内部,也开始按认知层次拆分。规划层用大模型(系统二),执行层用判断模型(系统一),工具调用层用专用接口。 这很像人类大脑的进化——不是大脑整体变聪明了,而是分化出了不同功能的区域,各管一摊,协同工作。 过去三年,整个行业衡量AI需求的核心指标是 Token 消耗量。"Token 就是 AI 时代的发电量",这句话我们听了很多遍。 但如果判断模型开始普及呢?大量高频、低复杂度的判断从通用大模型手里切走,Token 消耗量这个指标就开始失真了。 因为判断模型的输出不收 Token 费,它按"次"收费。一次判断就是一次调用,和输入多少字有关,和输出多少字无关。 这意味着,未来可能会出现新的 AI 计量体系。Token 仍然重要,但不再是唯一的、甚至不再是最核心的衡量指标。 通用大模型的推理需求是"长输出、能忍几秒"——用户愿意等模型慢慢写完。 判断模型的推理需求是"短输入、高并发、必须毫秒级返回"——一秒钟要处理上万次判断,每次都得立刻出结果。 这两种需求对应的硬件架构、调度策略、数据中心设计,可能完全不一样。 这也是为什么英伟达、华为、移动云这些公司都在探索异构推理架构——不是所有场景都需要堆GPU,按计算特征分工才是未来。 Jev 火了没几天,国内就冒出了开源复现版。而且底座用的就是阿里千问的开源模型。 这说明什么?判断模型的"壳"很容易复制,核心壁垒是那个校准训练方法(RLCD)。壳子谁都能做,但要做到"说80%就是80%"的概率校准,可能需要大量的工程和数据积累。 但反过来想,对于大多数企业来说,可能也不需要那么精准的校准——能干活、够便宜、自己可控,就够了。 开源模型 + 业务场景微调,可能会是判断模型这条路线上的主要竞争形态。 朋友,为什么我觉得 Jev 这件事值得专门写一篇? 因为它不是又一个"更大、更快、更强"的模型版本更新。它带来的是一种思路上的转向——AI 不一定非要越来越全能,不一定非要什么都能说、什么都能干。 有些场景,AI 越沉默,越有价值。 这就像杰文斯悖论(Jev 的名字就取自这里):蒸汽机效率提高了,每吨煤更便宜了,结果煤炭的总消耗反而涨了——因为便宜的动力被用到了更多地方。 判断也是一样。当一次AI判断只要万分之一美元、几毫秒就能出结果的时候,软件里会冒出大量以前根本不值得用AI的判断点。邮件分类、工单路由、异常检测、内容审核、风控筛查、Agent中间状态……这些以前靠写死规则或者人工做的事,突然变得可以用AI了。 判断层会像数据库、像缓存一样,变成软件架构里的一层默认基础设施,藏在每个应用的最底层。 这可能才是 Jev 真正的意义——它不是来抢大模型的饭碗的,而是来把 AI 往更深、更广的地方铺的。 大模型负责想清楚,判断模型负责跑得快。 一个负责深度,一个负责广度。 一个负责创造,一个负责执行。 快慢脑协作的AI时代,可能比我们想象的来得更快。 好了,今天就聊到这儿。你觉得"系统一模型"这个方向靠谱吗?你所在的行业里,有没有大量高频判断的场景可以用这种方式来优化?欢迎留言聊聊。

一、Jev到底是个什么东西
系统一:快速、直觉、自动化的判断。比如你一眼就能看出"这个人在生气",不需要思考。 系统二:慢速、理性、需要集中注意力的深度推理。比如让你算一下"17 × 24等于多少",你得一步步来。
state(状态):要判断的上下文,比如一封邮件、一条工单、一段程序日志 questions(问题):预先定义好类型的问题,可以同时问多个
Noul(是/否):给一个判断,返回0到1之间的概率值。比如"这封邮件是不是紧急的?" Choice(多选一):从最多255个选项里选一个,返回每个选项的概率分布。比如"这个工单该分给哪个部门?" Score(评分):在2到10级的量表上打分,可以落在两个等级之间。比如"用户的愤怒程度是几级?"
二、为什么说它"不一样"
1. 计价单位变了:从"卖字数"到"卖判断"
2. "零幻觉"到底是什么意思
3. 校准:概率要"诚实"
三、Jev 真正火的原因:戳中了 Agent 的痛点
下一步该点哪个按钮? 这个页面是不是我要找的? 这封邮件算不算投诉? 这段代码有没有bug? 要不要继续执行下一步? 这个文件需不需要修改?