ARTICLE · 1038517
AI新贵Jev来了,它不干正事,却有效
最近研究 AI 的人,应该已经开始刷到一个新名字了:Jev。
这个东西有点奇怪。ChatGPT、Claude、豆包这些 AI,大家都在比谁更聪明、谁更会推理、谁更会写代码。Jev 却反着来了:它不跟你聊天,也不负责给你写一大段答案。
那它到底是个啥?它和我们现在用的大模型有什么区别?为什么我觉得这个东西,特别值得做 AI 应用和 Agent 的人关注?
我是一直追逐技术新浪潮的 Python大大,今天就用最简单的方式,给大家说道说道。
一句话说清楚 Jev 是什么
先记住一个最简单的比喻:
ChatGPT 像一个人,Jev 更像一个拥有常识的
if。
程序员写了几十年这样的代码:
1 2 3 4 5 6 7
if amount > 10000:
...
if stock == 0:
...
if not logged_in:
...
这些都很好写,因为条件非常明确。但是下面这些呢?
1 2 3 4 5
if 这个客户看起来快要流失了
if 这封邮件很像诈骗
if 这个用户已经非常生气了
if 这个 Agent 下一步操作可能有危险
这就难了,因为它们不是简单的数学条件,而是需要一点人的常识和判断力。

过去怎么办?只能人来看,或者写一大堆规则。再后来有了 ChatGPT,我们可以把这些东西扔给大模型判断。但是大模型有一个问题:它太喜欢说话了。
你问:“这个客户是不是想退款?”
你其实只想要一个 Yes,结果它可能给你来一段长篇大论。程序要的是结果,不是作文。
而 Jev 真正有意思的地方就在这里:它试图把过去只能由人判断的这些“模糊 if”,变成程序可以直接调用的一种基础能力。
理解 Jev,不需要懂机器学习
你只需要知道,它主要会干三件事情:选择、打分、判断 Yes/No。
1. 第一招:选择
比如一个客户发来消息:“你们给我寄错鞋码了,我要换成 10 码。”
系统要判断这个问题应该交给哪个部门:A:退换货B:物流C:账务。
普通大模型可能跟你解释半天,Jev 不需要,它直接给出分布概率:
• 退换货:98% • 物流:1% • 账务:1%
如果客户换了一种说法:“鞋码发错了,而且信用卡还莫名其妙多扣了一笔钱。” 此时它可能输出:
• 退换货:55% • 账务:44% • 物流:1%
注意这里: Jev 不需要硬装自己什么都知道,它可以把自己的“不确定”告诉你。现实世界本来就不是非黑即白的,这个特性非常重要。
2. 第二招:打分
假设收到一个 Bug,你给 Jev 定义一把尺子:
• 0:只是界面不好看,不影响使用• 1:某个功能坏了,但是还有其他办法绕过去• 2:完全卡死,软件已经没法用了
把 Bug 描述扔给它,Jev 可能会给出 1.3。
这并不是突然发明了一个“1.3 级 Bug”,而是说:这个问题最像 1,但是又比普通的 1 严重一点,有一点往 2 靠。这特别像人类专家做判断——把模糊判断变成了机器可以直接使用的数字。
3. 第三招:Yes / No
比如问:“这个客户是不是在要求退款?”
Jev 直接给程序一个概率:0.99(99% 的可能性是)。
于是你的程序直接可以写:
1 2 3
if refund_probability > 0.95:
process_refund()
它不是另一个 ChatGPT,它更像一个“有常识的 if”。
更有意思的是:一次可以问它一堆
我们用普通大模型有一个习惯:少问一点。因为生成得越多,Token 越多、速度越慢、成本越高。
但 Jev 的思路不太一样。同样是一条客服消息进来,你可以一次性问它:
• 这个客户应该去哪个部门? • 是不是要求退款? • 现在有多生气? • 要不要马上转人工? • 有没有欺诈风险? • 是不是高价值客户?
一条普通客服消息进入系统以后,可能一瞬间就被贴上一排标签:
1 2 3 4 5 6
refund = 0.96
angry = 0.82
fraud = 0.03
vip_issue = 0.91
need_human = 0.76
软件突然拥有了一层廉价的判断力。这个变化,比“又发布了一个新模型”重要得多。
“零幻觉”到底是什么意思?
TypeSafe 在介绍 Jev 的时候,用了一个非常吸引眼球的词:Zero Hallucinations(零幻觉)。
看到这里千万不要理解成“Jev 永远不会判断错”。
这里的“零幻觉”指的是:它不会跳出你规定好的答案空间。
比如我们规定答案只能是 A、B、C。普通大模型可能突然给你来一个没定义的 D,或者开始写 500 字小作文;而 Jev 只会在 A、B、C 里面选。
正因如此,所谓的置信度(Confidence)才有意义。我们完全可以设计这样的自动化逻辑:
• 置信度 > 0.95 自动执行 • 置信度 0.70 ~ 0.95 再检查一次 • 置信度 < 0.70 交给人
接下来才是最夸张的地方:便宜
按照 TypeSafe 目前公布的价格:
• 10 亿输入 Token:42 美元 • 100 万 Token:折合约 0.042 美元 • 速度与成本:在部分测试任务上,相比传统 LLM 最高做到约 193.6 倍速度提升,444.6 倍成本下降。
如果一次“AI 判断”的价格便宜到几乎可以忽略,AI 的调用量可能会爆发出 100 倍甚至 1000 倍 的增长。从前一个订单调用一次 AI,以后订单的几十个环节都可以顺手判断一下。
为什么它偏偏叫 Jev?
Jev 来自经济学家 William Stanley Jevons 提出的 Jevons Paradox(杰文斯悖论)。
杰文斯悖论: 工业革命时期蒸汽机越来越省煤,但煤的总消耗量反而暴涨。因为效率变高、成本变低后,原本舍不得用蒸汽机的地方全开始用了。
TypeSafe 押注的就是同一件事情:当“智能判断”的成本接近于零时,我们不会少用 AI,而是会将 AI 塞进以前根本舍不得用的每一个角落。
• 客服消息 判断一下 • 邮件 / 订单 判断一下 • 数据库数据 判断一下 • Agent 每一步操作前 判断一下
写在最后
如果今天这篇文章你只记住一句话,那就记住这句:
ChatGPT 给了计算机一张嘴,Jev 想给计算机一种判断力。
过去的软件只能执行确定规则:
1 2 3
if amount > 10000:
...
Jev 想让我们写的是:
1 2 3 4 5
if 这个客户快要流失了
if 这封邮件很像诈骗
if 这个操作可能有危险
if 这个 Agent 不应该继续执行
如果“人的判断力”第一次变成一种足够便宜、足够快、可以被程序随时调用的基础能力,会出现什么新的软件?这才是 Jev 带给开发者最大的想象空间。
我是 Python大大。下一篇我们继续拆:到底能拿 Jev 来做什么?有哪些以前做不了的产品,现在值得重新做一遍?