ARTICLE · 1071011
化繁为简,爆火的“判断型AI”Jev的下一步是“自动化”

Jev不会聊天,不会写代码,甚至不会像ChatGPT那样生成大段答案,只专注做一件事:做判断。
据了解,Jev在任务执行过程中,它只做三件事,bool、choice、score,bool 是 yes 或者 no 判断,choice 是做选择,score 是打分。所以,Jev 最大的特点就是“极速”与“极省”。官网介绍,Jev 的端到端延迟在 70 到 500 毫秒之间,比普通大语言模型快20到200倍,成本低近两个数量级,输出Token免费。

Jev模型来自TypeSafe AI,创始人是Diogo Almeida。他曾在OpenAI工作,是GPT-4、ChatGPT以及InstructGPT/RLHF相关工作的参与者,也是构建了今天大模型最重要的一套后训练范式的参与者。

一直以来,Almeida都有一个想法:RLHF这套让ChatGPT变得好用的训练方式,可能并不适合AI真正走向自动化。因为到了Agent时代,AI真正需要的可能不只是“深思熟虑”,还有海量、快速、低成本的判断:下一步做什么、该调用哪个工具、任务是否完成。
更重要的是,这些判断未来需要AI自己在后台完成,不再需要人一直坐在屏幕前盯着。Jev看上的,就是这些每天可能发生几百万次的小决定。
不久前,Almeida做过一场演讲。在那场演讲中,他提到:“Today's AI is incredible at assistance, not automation.”简单理解就是,今天的AI很会帮你干活,却还不太能自己把活干完。

Almeida认为,“真正的自动化”是人根本不在场,AI在后台自己判断、自己执行,一天可能运行几十万甚至几百万次,你甚至永远不会看到它做了什么。
为此,他提出了一套新的训练方法:RLCD(Reinforcement Learning for Calibrated Decisions)——校准决策强化学习。RLCD 通过“并行采样”,在机器内部同时看一堆选项,并在70ms-500ms内输出结构化的最终决策。
此外,RLCD会强制机器输出“对应自身认知的概率答案”,有几成把握就给出几成结果,绝不会虚构内容。因此,Almeida表示,在这种训练模式下,Jev不会出现“幻觉”问题。
与此同时,Jev所具备的这种快速、便宜的特质让它非常适配需要高频、实时、结论明确的应用场景。举个例子,目前Agent真正运行起来后,会产生海量的小判断:下一步调用哪个工具?这个网页该点哪个按钮?任务到底完成没有?结果要不要重新检查?这些问题单个看都不难,但一个Agent一天可能需要判断几十万、几百万次。如果每一次都找最强的大模型,花几秒钟“深思熟虑”,再吐出一大段Token,成本和延迟很快就上去了。
因此,Jev的思路就是把大量高频的小判断交给自身处理,真正需要复杂推理的任务,再转交给大模型完成。这样就可以做到提高速度和降低成本。根据TypeSafe公布的测试中,Jev最高提速约193.6倍,成本最多降低444.6倍。输入每百万Token只要0.042美元,输出Token免费。
但需要注意的是,Jev在复杂的开放任务中行不通。它的正确打开方式,是“有限解空间 + 高实时要求 + 结构化输出”。只要任务被严格限定在封闭边界内,它就能将低延迟和极低成本的优势发挥到极致。
当智能决策的成本下降两个数量级,将会解锁海量自动化场景。因此,Jev下一步探索的方向是:当人不再坐在屏幕前,机器能不能自己做决定。
小结:Agent时代,AI或许可以给出答案,但却未必理解答案对一个人意味着什么。因此,判断型AI的正确位置,应该是“判断助手”,而不是“判断主体”。
-END-
关于卫斯登

卫斯登以“立足上海 放眼全球”为目标,依托投资人于科创产业资源背景,协同“政产学研金服用”融合发展力量,为客户提供全方位的企业经营建设解决方案。公司主要从事项目挖掘、品牌推广、线下活动、文化项目传播、投资并购等领域,与30+战略合作伙伴、100+上海国家级和市级孵化器园区建立深度合作关系,形成强大的资源开发和联动整合能力,不断通过“大中小企业融通”活动与创新服务赋能,构建三者在信息、资源、技术、产品业务及资本等方面的合作,为创新对接产业出路。