ARTICLE · 1047965
AI 前沿 · 新技术解读 · JEV,Next AI?

ChatGPT 联合发明人做了个「不会说话」的模型——放弃文本,只给类型安全的决策和校准的概率。
九月下半个月以来,AI 圈被一个「不说话」的模型刷了屏。
它不写文章、不聊天、不生成代码。你丢给它一段结构化的问题,它回你一串类型安全的决策,每个决策都带一个概率和置信度。有人叫它「闭嘴模型」,有人围观到 2400 万次,有人兴奋地说这是「下一代 AI」,也有人泼冷水说「这玩意儿大家早就见过」。
它就是 Jev,TypeSafe AI 的第一个「System One 模型」。
在满世界都在把模型做得更大、更会聊天的 2026 年,一家由 ChatGPT 联合发明人创办的公司,掉头走了一条相反的路——not chat(不做聊天)。这篇文章,我们把 Jev 拆开看:它是谁做的、它是什么、它凭什么敢说「Next AI」、以及这个「Next」到底成不成立。
一、谁做的:ChatGPT 联合发明人,潜行两年
先看人。做 Jev 的人,来头不一般。
TypeSafe AI 的创始人叫 Diogo Almeida(迪奥戈·阿尔梅达)。他是 ChatGPT 的联合发明人之一,在 OpenAI 时参与了 RLHF(人类反馈强化学习)和 InstructGPT 的研发——正是这套方法,最终演化出了 ChatGPT 和 GPT-4。再往前,他在 Google Brain。换句话说,今天几乎所有聊天模型身上流的「RLHF 血统」,有一份就来自他。而他现在要做的事,恰恰是「反 RLHF」。
2024 年前后,他离开 OpenAI,带着一个追问潜行两年:「模型在聊天这件事上早就超过人类了,可真正的自动化呢?都在哪?」。2026 年,TypeSafe AI 以 4000 万美元种子轮浮出水面,9 月 15 日发布了第一个公开模型 Jev。联合创始人还有 COO Sasha Sheng(前 Meta/FAIR 研究员)和 CTO Erik Gafni(连续创业者)。团队文化里有句话挺能说明立场:Build Prod, Not God(构建生产,不是构建上帝)。
二、Jev 是什么:一个「决策模型」,不是「语言模型」
Jev 最扎眼的一点,是它根本不生成文字。
它属于一个 TypeSafe 新造的分类——System One Model(系统一模型)。名字借用丹尼尔·卡尼曼《思考,快与慢》里的「系统一」:快速、直觉、不费力。现有的大模型更像「系统二」:慢、深思、逐字逐句。
两者差在哪?现有 LLM 优化的是人类偏好(RLHF),输出的是字符串——很自由,可以是回复、代码,也可以是幻觉、拒绝、甚至跑偏,软件要用得先解析再校验;Jev 优化的是校准决策(RLCD),输出的是类型安全的结构化值——结构预先定义,永远不犯类型错误,每个答案带校准的概率和置信度。采样方式也不同:LLM 顺序生成,一个 token 接一个;Jev 并行生成,所有输出一次性出。
一句话概括 Jev:它像一个大模型智商的「函数调用」——非结构化的状态进去,类型化的、带概率的决策出来。打个比方,LLM 像一个会聊天、会写文章、但偶尔胡说八道的聪明人;Jev 像一个只回答「是/否 + 几分把握」、从不出错的判断题机器。前者灵活,后者可靠。TypeSafe 赌的是:软件自动化真正缺的,是后者。

▲ System One 模型:三个特征
三、核心技术:RLCD,把「校准」当成训练目标
Jev 背后的三样东西:一个新架构、一个并行采样器、一个叫 RLCD 的训练方法。
RLCD 全称是 Reinforcement Learning for Calibrated Decisions——面向校准决策的强化学习。这是整个故事里最值得关注的一个词。
为什么要新发明一个训练方法?因为 RLHF 有个绕不开的毛病:它让模型学会了「讨好人类」,带来了三个副作用——模式坍缩(总给最安全的答案)、过度自信(估计把握总虚高)、缺乏可靠性(同样输入不敢保证同样输出)。共同后果是:LLM 没法被信任去独立做决定,永远需要一个人盯着(human-in-the-loop)。RLCD 要做的,是直接训练模型「给出真实、校准过的概率」——自信时敢说 95%,没把握就老实说 60%,让软件能据此决定「放手去干」还是「叫人看看」。
TypeSafe 那句「Decisions, not strings」(决策,而非字符串),落点就在这。RLCD 放弃了「生成」,换来了「校准」——这就是它敢喊「零幻觉」的底气:不生成文字,自然没有文字层面的胡编乱造;输出结构预先定义,自然没有类型错

▲ Jev 三件套:架构 + 采样 + 训练
四、它解决了什么:自动化卡住的那个点
Almeida 在博客里反复问一个问题:模型聊天早就超过人类了,可自动化去哪了?
他的答案指向一个被忽视的死角。过去几年,所有人都在卷「模型更聪明」,但聪明不等于「能自动化」。一个能考过律师考试的模型,你让它自动处理十万条客服工单,它可能:慢——一条回复要等 3 到 329 秒;贵——输入 token 每百万 0.2 到 10 美元,输出还贵 5 倍;不可靠——它能 95% 的时间做对,但从不说清那 5% 错在哪,所以你还是不敢放手。
Jev 要解决的,就是这个「聪明但不肯说『我不确定』」的信任缺口。它做的每件事——类型安全、校准概率、并行采样——都是冲着「让软件敢把决策交给它」去的。
用 TypeSafe 自己的话:LLM 为人类产文字,Jev 为机器产决策。前者需要人盯着,后者可以被代码组合起来,跑在无人值守的流水线上。

▲ RLHF 的三大毛病
五、快到离谱,便宜到离谱
Jev 的性能数字,是它刷屏的直接原因。
速度:端到端响应 70–500 毫秒,前沿 LLM 是 3–329 秒,换算下来是 40–200 倍。价格:输入 $0.042 每百万 token($42 每十亿 token),输出免费——官方原话是「太便宜了,不值得计费」,比前沿模型低 238 倍。首页那句「193.6 倍更快、444.6 倍更便宜」,来自 TypeSafe 自己做的一组工作流评测:同样跑完一组 System One 任务,Jev 花了 $0.000081、0.114 秒,LLM 花了 $0.013880、8.566 秒。
在「每一美元买到多少智能」的图上,Jev 直接冲出了坐标轴之外,独占帕累托前沿将近两个数量级。
这些数字有多可信,我们后面单独说。但有一点是确定的:当一个模型快两个数量级、便宜两个数量级,它解锁的不是「更好的聊天」,而是一整批以前根本不敢想的应用场景。

▲ 性能对比:Jev vs 现有 LLM

▲ 决策流程:按置信度决定放手还是叫人
六、能拿来干什么:四个方向
第一,智能 if-else。分类、路由、打分、抽取、分支——这些手写逻辑太脆、大模型又太重的地方,Jev 的「类型化决策」可以直接插进软件,当成一条条「模糊决策规则」来用。外围代码框住了它的自由度,让它能拼进可靠的系统。
第二,Map-reduce 大数据。把 PB 级的数据转成特征和洞察。便宜到「输出免费」,意味着你可以拿它过海量数据,这在以前是成本上不可想象的。
第三,实时应用。100 毫秒的速度,让 AI 第一次能进 UX 敏感的场景——用户点了就得出结果,等不起三秒。
第四,验证一切。打分、判断、验证、护栏、检测大模型的 jailbreak(越狱)——用 Jev 去监督别的 LLM 的输出,这本身就是一个「确定性」去兜底「生成」的活儿。

▲ 四个用武之地
七、质疑:这真的是 Next AI 吗?
刷屏的同时,泼冷水的声音也不小。这些质疑,恰恰是判断「Next AI 成不成立」的关键。
第一,RLCD 算不算新东西?有开发者扒开看,说 Jev 干的事很多都挺熟:结构化输出、概率校准、蒸馏一个小模型——这些都不是全新的发明。DAMO 开发者矩阵的文章直说「RLCD 不是新东西」。知乎那篇 2400 万人围观的稿子,语气里也带着「大家早就见过」的意思。
第二,架构突破够不够硬?36氪的质疑很直接:TypeSafe 宣称的 parallel sampler 和 System One Model,目前缺少足够的技术细节,很难据此认定它完成了类似 Transformer、Attention、MoE 级别的基础架构突破。
第三,评测是谁做的?目前最完整的评测主要由 TypeSafe 自己完成。公司也承认:测试任务由自己的 model capabilities 团队设计,可能存在偏差;部分参考答案来自强模型生成,而非全部人工标注。
这些质疑不是来拆台的,它们是「Next AI」这个问号最诚实的注脚。Jev 到底是不是下一代 AI,取决于你问的是哪个「Next」:如果你问的是「比 GPT 更聪明的聊天」,那它不是,它连字都不会写;如果你问的是「能信、能用、能自动化的那一种 AI」,那它至少开了一扇新的门——这扇门后面,是确定性工程走到极致的模样。
八、回到那句话:确定性工程
我们聊过很多次「确定性工程」——AI 时代最稀缺的,是「生成结果可被信任」的确定性工程。OpenClaw 用它管安全,Archify 用它管成图,DSPy 用它管 prompt,OpenCodeReview 用它管评审……一路下来,都是在「约束生成」,让生成的结果变得可靠。
而 Jev,走了一条更极端的路:它干脆不做生成了。
不做文本、不做对话,只做「类型安全的决策 + 校准的概率」。这一下,幻觉、类型错误、输出跑偏,这些「生成」附带的顽疾,被从根上拿掉了。这是「确定性」最彻底的一次落地——不是把生成管好,而是把生成这件事本身,替换成了「决策」。
这也是 Jev 这个名字的含义。它致敬经济学家 William Stanley Jevons,那个著名的「杰文斯悖论」:蒸汽机效率提升,反而让煤炭需求暴增。TypeSafe 相信机器智能会走同样的路——智能的成本每下降一个数量级,就解锁一个数量级的新用例。当「做决策」这件事便宜到几乎免费、快到眨眼之间,那些以前被成本卡死的自动化,会像潮水一样涌出来。
JEV,Next AI?我的判断是:它未必是「下一个 GPT」,但它很可能是「AI 真正走进生产线」的那个开始。ChatGPT 教会了机器说话,Jev 想教会的,是机器闭嘴、判断、然后让人放心地把事交给它。这件事要成了,意义不亚于让模型再多考一门试。

▲ 确定性工程的极致:干脆不做生成
参考:TypeSafe AI 官网及博客、TechCrunch、36氪、DAMO 开发者矩阵、LangChain Blog、DataCamp 等对 Jev 的报道与评测
Jev 于 2026 年 9 月 15 日发布,目前处于 early access(早期访问)阶段