ARTICLE · 1049877
未被充分定价的下阶段AI风口:新模型Jev

周末,开发者圈子并不太平,一个看起来功能被砍了一大半的AI模型被刷了屏。
它叫Jev。不会聊天不写代码,不生成文字,也没有对话界面。你给它一个问题,它不会回答你一句话。它给你的是三种东西:判断一个置信度分数,从预设选项中选出分类结果,或者一个数值评分,0.1秒出结果。
创始人Diogo Almeida是InstructGPT论文的作者之一,参与了RLHF方法的共同发明,简单讲,他是让GPT变成ChatGPT的那群人之一,现在他做了和ChatGPT方向完全相反的东西。这件事之所以值得一篇完整的文章,是因为它揭示了一个正在发生但还没有被充分定价的趋势:AI行业正在从追求最强大脑的阶段,进入区分什么任务需要大脑,什么任务只需要反射弧的阶段。
系统1和系统2:Jev在赌AI的另一面
理解Jev需要先理解一组概念:系统1和系统2。
这是诺贝尔经济学奖得主丹尼尔卡尼曼在《思考,快与慢》里提出的框架。
系统1是快速、直觉、自动化的思维。你看到一张脸就知道对方在笑,不需要推理,你开车拐弯不需要计算角速度,身体自动完成。
系统2是慢速、刻意、费力的思维,做一道复杂的数学题,每一步都需要有意识地推进。
过去三年,AI行业几乎所有的进步都发生在系统2这一边。GPT-4到GPT-6,Claude从Sonnet到Opus到Mythos,以及各种推理模型如o系列、DeepSeek-R1等等,它们的核心能力是深度思考+长链条推理+复杂任务分解。它们越来越擅长那些需要想很久才能得出答案的任务。
Jev赌的是另一面:系统1。
Almeida的论点:Agent时代就是AI不再只是回答问题,而是自主完成任务的时代,绝大多数的智能需求是海量快速廉价的小判断。一个AI Agent在执行任务的过程中,每一步都需要做判断,下一步该做什么?该调用哪个工具?这个任务完成了没有?这些判断有几个共同特征:它们不需要长篇推理,一个有经验的人0.5秒就能判断;答案是结构化的;发生的频次极高,每天可能是几百万次。而且它们需要在后台自动完成,不能每次都让人类坐在屏幕前盯着。
用当下的AI模型来做这些判断当然可以。但就像用一台跑车去送快递,能完成任务,成本和效率都不合理。让GPT-6判断这封邮件是不是垃圾邮件,它会生成一段100到200个token的分析,花1到3秒,花费几毛钱,然后你还要从那段话里解析出"是"还是"否"。Jev做同样的判断,0.1秒,几乎无成本,直接输出一个结构化的是/否加置信度。
从人类喜欢什么,到判断对不对
Jev的技术核心在于训练方法。
TypeSafe把这个方法叫RLCD:Reinforcement Learning for Calibrated Decisions,强化学习用于校准决策。
首先理解它的两个前辈:RLHF和RLVR。
RLHF: Reinforcement Learning from Human Feedback,来自人类反馈的强化学习。让ChatGPT变得好用的关键,其核心逻辑是让人类标注员对模型的两个回答投票,哪个更好,然后用这个投票信号来训练模型,让模型学会生成人类更喜欢的回答。RLHF的问题是什么?它优化人类偏好,不是事实正确性。人类可能更喜欢一个措辞优美事实有误的回答,但不是一个干巴巴完全正确的回答。这就是大家说的AI有时候会一本正经地胡说八道,因为它被训练成说人话,但不一定是说对话。
RLVR: Reinforcement Learning with Verified Rewards,用可验证奖励的强化学习。过去两年数学和代码是推理能力突飞猛进的关键,它的逻辑是用一个可以自动验证答案的程序来提供奖励信号,数学题有标准答案,代码可以跑测试,答对了就奖励,答错了就惩罚。RLVR的问题是它只适用于有明确对错标准的任务。数学和代码可以,但对于邮件应该被分到哪个类别这类判断没有一个自动化的验证程序。
RLCD填的就是RLHF和RLVR之间的空白。它优化两件事:这个判断对不对?模型说的置信度准不准?
第二件事,置信度校准是Jev的杀手锏。
如果一个AI模型反馈90%确信这封邮件是垃圾邮件,那在所有它给出90%置信度的判断中,大约90%应该确实是正确的。如果实际正确率只有60%,那这个模型的置信度就是虚高,你不能信任它。
在人类盯着屏幕的场景下,置信度校准不那么重要,反正人类会看一眼模型的输出,自己做最终判断。但在Agent自主运行的场景下,置信度校准是生死线。如果一个Agent在后台自动处理几百万个判断,它需要知道哪些判断自己有信心,可以自动执行,哪些判断自己不确定需要交给人类审核。只有当置信度是校准过的,说90%就真的是90%,Agent才能可靠地做出这个区分。
这就是Almeida反思RLHF的核心论点:RLHF训练出来的模型很擅长和人聊天,但不擅长给出可信赖可被机器直接消费的判断。后者在未来很长一段时间,或许会是Agent时代真正需要的能力。
Jev在哪里强,在哪里弱
MindStudio做了一组12个真实自动化任务的对比测试。
整体准确率:Jev的整体一致率是67%,GPT-5.6 Sol的一致率是74%,差了约6个百分点。
细分任务:在客户服务分类上,Jev达到了76%,接近GPT的78%,差距很小。
速度和成本:有人用Jev在0.7秒内完成了777个判断,花费约0.25美分。同样的任务用GPT可能需要几分钟和几十美分。
另一组小规模测试:Jev在7个植入写作缺陷中识别出了6个,Fable 5.1识别出了7个,准确率差一点,但Jev的速度快了25倍,成本低了580倍。
理性看,Jev不是一个更聪明的模型。在需要理解复杂上下文+处理非结构化信息+做多步推理的任务上,它比前沿语言模型差。但在那些可以被定义为判断是或否的结构化判断任务上,它的性价比高出两个数量级。对Jev更精准的定位是:生产环境中的机会不是用Jev替换所有语言模型,把每种工作放到合适的层级更合适,如确定性规则写在代码里,有边界的语义判断交给Jev,开放式推理和沟通交给语言模型,需要授权的重大操作交给人类。
对AI产业链的影响?
Jev本身的商业规模现在还很小,4000万美元融资+等候名单制+早期,不过它代表的趋势可能改变AI产业链的价值分配。
趋势一:不是所有任务都需要前沿模型。
当下AI行业的隐含假设是模型越大,能力越强越好。此假设驱动了天文数字级别的GPU采购和数据中心建设。2026年五大超级规模企业的资本支出合计7250亿美元,几乎全部是为了训练和运行越来越大的模型。Jev的存在提出了一个反问:如果现实世界中80%的AI调用按次数计,只需要一个0.1秒几毫厘成本的判断模型,那么对GPU的总需求量是不是被高估了?
这个问题目前还没有答案,因为Agent时代还没有真正到来,每天几百万次自动判断的场景还在建设中。当这些场景逐步成熟时,市场可能会发现:Agent消耗的算力中,大部分花在了小判断上,只有一小部分花在了大推理上。
趋势二:AI的价值将从生成转向判断。
到目前为止,AI的商业价值主要体现在生成:生成文本、图片、代码、报告等等,用户付费买的是AI的生成能力。在Agent时代,AI的核心价值可能转向判断,Agent需要自主决定做什么、怎么做、做得对不对。如果这个转变发生,那训练判断模型的方法(RLCD)可能比训练生成模型的方法(RLHF)更有商业价值。因为判断模型的输出是直接可被机器消费的结构化数据,不需要人类解析,判断模型的调用频次远高于生成模型,判断模型的单次成本远低于生成模型,但总量更大。
趋势三:AI安全的讨论需要区分系统2安全和系统1安全。
上周Amodei、Altman、Musk达成的"AI降速共识",核心关切是前沿模型的能力提升可能带来不可控的风险。这是一个系统2安全问题,大模型变得太聪明以后,能做的事情太多,我们需要放慢能力提升的速度。Jev提出了一个不同的安全维度,在系统1安全背景下,如果AI在后台每天自动做几百万个判断,不需要人类审核,那么判断的校准性和边界清晰度就变成了安全的核心指标。一个不校准的判断模型在后台自动运行,比一个聪明但被人类监督的推理模型更危险,因为前者的错误是大规模的,且不容易被人注意到。
🗣️ 我的看法
第一,Jev不是GPT或Claude的竞争对手,就像方向盘不是引擎的竞争对手,它们解决的是AI价值链上不同层级的问题。在Agent时代两者会协作,Jev在每一步做快速判断,遇到需要深度推理的节点再调用后者。
第二,RLCD这个训练方法更值得关注。因为它让AI学会了做判断。如果RLCD的思路被验证有效并被更多团队采用,未来可能出现一个判断模型的细分赛道,不追求参数量或跑分,追求置信度的校准精度和每秒判断次数。
第三,对AI产业链的投资逻辑来说,Jev的出现强化了一个判断,AI的价值链正在从单一大模型走向大小模型分层协作。GPU的需求结构可能发生变化,推理端的需求持续增长,单次调用消耗的算力可能比预期少得多,这对英伟达的总销量不一定是利空,但对推理GPU和训练GPU的需求结构分配可能有影响。
第四,Almeida花了两年时间做了一个RLHF无法解决的问题,AI领域的前沿研究者或许已经开始分化:一部分人继续沿着更大更强的系统2方向前进,另一部分人开始探索更快更准的系统1方向。两条路线没有非此即彼,而是并行发展。但市场目前几乎只在定价前一条路线,后一条路线还没有被充分认知。