ARTICLE · 1051008
Jev 刷屏:当 AI 开始 "沉默",软件反而多做了事
突然刷屏全世界
却让整个硅谷开发者圈吵翻了天。
2026 年 9 月 15 日,一家隐身了整整两年的硅谷公司 TypeSafe AI 第一次露面,同时掏出两样东西:由 DCVC 领投的 4000 万美元种子轮融资(据 Forbes 报道,估值约 2 亿美元),和他们的第一个模型——Jev。
没有发布会。创始人 Diogo Almeida 只在程序员社区 Hacker News 发了个帖子。结果帖子当天冲上全站榜首,一天之内攒出几百条评论;几天之后浏览量超过 420 万、点赞近 2 万,API 刚上线就被涌进来的开发者挤到短暂瘫痪。
评论区迅速裂成两派:一半人兴奋地宣称"新范式来了",另一半人冷笑——"行业又重新发现了分类模型"。
一个不会聊天、不会写代码、连一句完整话都吐不出来的模型,到底凭什么?
Jev 依然基于 Transformer 架构,但它的设计者刻意不让它成为大语言模型。
你丢给它一段信息——一封客服邮件、一个网页的状态、一笔刚提交的订单,再附上一份你提前定义好的选项清单。它不写一个字,直接返回一个结构化的结果:选了哪个、打了几分、是还是否,外加一个置信度概率。
翻来覆去,它只会三种活:
更关键的是,同一次请求里的多个问题共享一份输入、并行作答。比如收到一封"支付服务连续几天连不上"的客户邮件,它可以在一次调用里同时回答:该转给技术部还是账务部?对方有多不满?事情紧不紧急?需不需要人工介入?
每个结果都是强类型的,附带完整的概率分布和置信度。你不用在提示词里写两页纸求它"只输出 JSON、不要废话、别加解释",也不用写解析器,更不用担心它手一抖把答案包进 markdown 代码块。
故事的主角叫 Diogo Almeida,葡萄牙人,TypeSafe AI 的创始人。在创办 TypeSafe 之前,他是 OpenAI 的研究员,也是 2022 年那篇 InstructGPT 论文的主要作者之一——那篇论文奠定的 RLHF(基于人类反馈的强化学习)训练流程,后来成了 ChatGPT 的地基。GPT-4 的贡献名单里,他被列入"Foundational RLHF and InstructGPT work"。
换句话说,今天大模型"能说会道、对齐人类偏好"这件事,他是最早的铺路者之一。
但正是这个人,在行业最热闹的时候越来越怀疑。他后来说:
他花了两年时间琢磨一个问题,这个问题也正是 Jev 全部设计的源头:
为什么世界上的大多数工作
还没有被自动化?
两年前,他和 Erik Gafni、Sasha Sheng 一起离开 OpenAI,在旧金山创办 TypeSafe AI,进入隐身模式,直到今年 9 月 15 日才带着 Jev 和答案露面。
Jev 这三个字母,取自 19 世纪英国经济学家 William Stanley Jevons(威廉·斯坦利·杰文斯,1835—1882)。1865 年,他在《煤炭问题》一书中记下了一个反直觉到今天依然著名的现象。
当时瓦特改良的蒸汽机大规模普及,新机器烧煤的效率比老机器高出一大截。按常识推演:机器越省煤,全国煤耗应该下降才对。
结果恰恰相反——全英国的煤炭消耗量不降反升。
TypeSafe 把这个名字安在自己的模型上,本身就是一篇宣言:
Almeida 设想的未来,不是几个超级 App 垄断一切,而是海量微小的智能判断分散在各处运行——他说,那"更像早期互联网的样子,而不是现在人们努力搭建的那种大型应用"。
要懂 Jev,先得知道普通大模型是怎么出答案的。
GPT、Claude、Gemini 都是自回归模型,原理四个字:单字接龙。它像一个打字员,一个 token 接一个 token 地把回答"敲"出来,敲完一个字才能决定下一个字。输出越长,需要的解码步骤越多,也就越慢、越贵。
举个真实的例子:一个电商 Agent 打开网页,需要决定点哪个按钮。系统真正需要的信息只是"第三个按钮"。但大模型会先郑重其事地生成一整句——"根据当前页面,我应该点击右下角的 Checkout 按钮"——软件再从这段话里把 Checkout 抠出来,才能执行点击。
你要的只是一个答案,来的却是个非要把心路历程吟诵一遍的老学究,而且你还得为这段没人会读的文字按字数付费。
Jev 的做法简单粗暴:把输出空间提前锁死。你规定答案只能是 low / medium / high,它要做的就只是对这三个结果各算一个概率,一次前向计算直接给出,没有逐字推演那一步。再配合官方称为 parallel sampler 的机制,一份输入、多个问题,一次性并行算完。
同样 27 个问题 · 同样的提问顺序
"Revenue impacted?":
{noul:0.85},
"Which unit?":
{choice:"technical",
confidence:0.96},
"Urgency?":
{score:2.77, c:0.77}
}
"Revenue impacted?": true,
"Which unit?": "degraded",
"Account health?": "watch",
"Security risk?": 1,
"Urgency?": 3,
...逐字生成中…
官方口径:快 74.9 倍 · 便宜 171 倍
来源:TypeSafe 官方对比演示(对照模型 gpt-5.6-terra)
一段话,再解析
排队逐字回答
可能格式跑偏
慢思考的"系统二"
选项 / 分数 / 概率
一次并行算完
结构上不可能跑偏
快反射的"系统一"
注意,它不负责生成。开源浏览器 Agent 项目 jev-ultrafast 里,"点哪个按钮"由 Jev 决定,可一旦需要在输入框里填写城市名称,程序会另行调用一个生成文本的小模型。分工,而不是取代——这一点后面还会讲到。
"做判断的小模型"并不是新概念,分类器已经存在了几十年。Jev 之所以偏偏在 2026 年炸场,是因为AI Agent(智能体)爆发了。
把一个复杂的 Agent 任务拆开看,里面是几十次甚至几百次微小的决定:这一步成了没有?选工具 A 还是工具 B?上一段输出里的订单号是多少?十条搜索结果哪条最相关?要不要中止流程?——其中绝大多数是路由、分类、验证和状态判断,不需要写一个字。
如果每个小动作都请千亿参数的大模型出山,会发生三件事:延迟一层层累加,成本迅速失控;更致命的是,只要中间任何一步返回的 JSON 解析失败,整个 Agent 就卡死在半路上。
TypeSafe 由此给整个品类起了名字:System One Model(系统一模型),出自丹尼尔·卡尼曼的《思考,快与慢》——
对应:脊髓的条件反射
Jev 负责的脏活累活
对应:大脑皮层的深思
大模型负责的宏观规划
于是,未来一个现实的 Agent 系统,很可能是一套分层架构,由一个叫 Harness 的工程层负责调度:
先看 TypeSafe 官方口径:端到端延迟 70—500 毫秒,在特定工作流评测中,最高比对照大模型快 193.6 倍、便宜 444.6 倍;输入每百万 token 收费 0.042 美元,输出完全免费,摊到一次决策上约 0.0004 美元。
官方数字之外,第三方平台 OpenRouter 的独立评测(Ori Eval,2026 年 9 月,30 选 1 分类任务,每个模型 200 个样本)更值得看:
实时性最夸张的演示是打游戏。在一场 Pong(乒乓球)对战中,Jev 在 12 秒内做出 47 次操作决策,单次约 227 毫秒;同一时间里 Gemini、Claude、GPT 只做出两三次,单次要 2.5—3.5 秒。TypeSafe 还让它打《DOOM》——每秒约 10 次即时判断,整套推理成本一小时约 7 美元。
发布几天,全球开发者已经晒出了一堆账单(以下为社区自发分享,未经独立核实,看个量级):
企业侧也有了早期证言:Vercel 的工程师称,他们原本用 GPT-5.6 Luna 跑命令安全分类器,换成 Jev 后速度提升 5—18 倍,准确性还更高。也有创业者测试发现 Gemini 准确率略胜一筹,但成本是 Jev 的 10—20 倍。
看出味道了吗?Jev 不是来抢大模型饭碗的——它更像给大模型当"门卫":便宜的高频活它先拦下,真正难的活再往上递。
TypeSafe 官网最醒目的宣传语是 "Zero Hallucinations"(零幻觉)。这很容易让人以为它治好了大模型的祖传顽疾,但它保证的其实只是格式,不是对错。
那它凭什么让人敢用?靠另一项训练方法:RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)。
RLHF 优化的是"回答像不像好人说的",RLVR 靠可验证奖励刷数学和代码,而 RLCD 要解决的是一个更朴素的问题:模型说自己有多大把握,这个概率到底靠不靠谱?
校准良好意味着:它对一批任务都给出 90% 的置信度,其中就应该有约 90% 真的判断正确。这样企业才能搭起自动分流的流水线:
Flask 作者、Earendil 公司 CTO Armin Ronacher 看得很透:这相当于把处理幻觉的责任部分交还给了使用者——"如果概率只有 50%,你可以忽略它;如果到了 95%,你就可以放心利用它。"同理,Jev 还能反过来当"模型路由器":实时判断每个任务该请哪个模型出马,而这件事用大模型本身来做,太贵了。
当然,RLCD 目前同样没有完整论文和独立验证——它到底是一种新范式,还是已有校准方法的工程组合,尚无定论。
过去三年,我们评价大模型的标准越来越像在评价一个人:会不会说漂亮话,有没有情绪价值,像不像人。Jev 把这套规则整个掀翻,反问了一个朴素得惊人的问题——
为什么非得说人话?
Almeida 自己这样定义这家公司:"前沿实验室的主要产物要么是恐惧,要么是炒作。我希望我们的主要产品是智慧——我们不属于那种一门心思创造无限财富、搞宗教式叙事,或者试图在数据中心里造神的实验室。"
回到那个 160 年前的悖论。1865 年,杰文斯盯着一台更省煤的蒸汽机,最终看到的,是一个烧掉更多煤的世界。TypeSafe 赌的是同一个剧本:当一次判断便宜到可以忽略不计,智能就会像水电一样,铺满你看不见的每一个角落。
这个赌注能不能成,现在没人知道。但它至少提醒了我们一件被热闹盖住的事:AI 的终极形态,也许从来都不是一个更会说话的机器人。
AI 少说了很多话,软件却多做了几件事。
数据截至 2026 年 9 月 20 日。开发者账单为社区自发分享、未经独立核实;模型性能以官方及第三方后续披露为准。本文为技术科普,不构成投资建议。