夜雨聆风学习资料网

ARTICLE · 1051008

Jev 刷屏:当 AI 开始 "沉默",软件反而多做了事

Jev 刷屏:当 AI 开始 "沉默",软件反而多做了事
AI 深度科普 · 2026年9月
一个不说话的 AI
突然刷屏全世界
它不会聊天,不会写诗,连一句完整的话都不会说,
却让整个硅谷开发者圈吵翻了天。
一文讲透 Jev:它是什么,从哪来,凭什么。
不写一个字
只做判断题
最快快近200倍
过去三年,所有 AI 都在拼命证明自己"更会说话"。2026 年 9 月,一个反着来的模型火了:它主动砍掉了"说话"这项能力,只保留"判断"。它叫 Jev。要理解它为什么让程序员们集体失眠,得先从一个 160 年前烧煤的故事讲起。
01
发布当天,服务器被挤爆了

2026 年 9 月 15 日,一家隐身了整整两年的硅谷公司 TypeSafe AI 第一次露面,同时掏出两样东西:由 DCVC 领投的 4000 万美元种子轮融资(据 Forbes 报道,估值约 2 亿美元),和他们的第一个模型——Jev

没有发布会。创始人 Diogo Almeida 只在程序员社区 Hacker News 发了个帖子。结果帖子当天冲上全站榜首,一天之内攒出几百条评论;几天之后浏览量超过 420 万、点赞近 2 万,API 刚上线就被涌进来的开发者挤到短暂瘫痪。

420万+
发布帖浏览量
近2万
点赞
No.1
Hacker News 榜首
瘫痪
上线首日 API 被挤爆
数据来源:Latent Space《AI News》9月16日刊、36氪、凤凰网科技

评论区迅速裂成两派:一半人兴奋地宣称"新范式来了",另一半人冷笑——"行业又重新发现了分类模型"。

一个不会聊天、不会写代码、连一句完整话都吐不出来的模型,到底凭什么?

02
一句话:它是个只做"判断题"的 AI
TypeSafe 给它的口号
Decisions, not strings
要决策,不要文本

Jev 依然基于 Transformer 架构,但它的设计者刻意不让它成为大语言模型

你丢给它一段信息——一封客服邮件、一个网页的状态、一笔刚提交的订单,再附上一份你提前定义好的选项清单。它不写一个字,直接返回一个结构化的结果:选了哪个、打了几分、是还是否,外加一个置信度概率。

翻来覆去,它只会三种活:

Choice
选择题
从你定义的列表里挑一个,最多支持 255 个选项。适合工单路由、内容分类。
Score
打分题
4 / 5
在你划定的尺度上打分。适合衡量紧急度、风险、质量。
Noul
是非题
82% 为真
回答是或否,返回为真概率。适合风控、真伪判断。

更关键的是,同一次请求里的多个问题共享一份输入、并行作答。比如收到一封"支付服务连续几天连不上"的客户邮件,它可以在一次调用里同时回答:该转给技术部还是账务部?对方有多不满?事情紧不紧急?需不需要人工介入?

每个结果都是强类型的,附带完整的概率分布和置信度。你不用在提示词里写两页纸求它"只输出 JSON、不要废话、别加解释",也不用写解析器,更不用担心它手一抖把答案包进 markdown 代码块。

最传神的一个比喻
Jev 是一句"AI 原生的 if 语句":传统 if-else 写不出来的模糊判断交给它;同时它又保留着大模型的通用语义理解和零样本能力——换个新任务,不必重新收集数据、重新训练一个分类器。
03
教 ChatGPT 说话的人,做了个"哑巴"

故事的主角叫 Diogo Almeida,葡萄牙人,TypeSafe AI 的创始人。在创办 TypeSafe 之前,他是 OpenAI 的研究员,也是 2022 年那篇 InstructGPT 论文的主要作者之一——那篇论文奠定的 RLHF(基于人类反馈的强化学习)训练流程,后来成了 ChatGPT 的地基。GPT-4 的贡献名单里,他被列入"Foundational RLHF and InstructGPT work"。

换句话说,今天大模型"能说会道、对齐人类偏好"这件事,他是最早的铺路者之一。

但正是这个人,在行业最热闹的时候越来越怀疑。他后来说:

"我们有了一次性成功的创新,却没有把它变成真正有用的东西。四年里,我们把处理人类语言这件事做得极好——但这对自动化并没有用处,因为计算机使用的是另一种语言。"

他花了两年时间琢磨一个问题,这个问题也正是 Jev 全部设计的源头:

如果大模型已经这么聪明,
为什么世界上的大多数工作
还没有被自动化?

两年前,他和 Erik Gafni、Sasha Sheng 一起离开 OpenAI,在旧金山创办 TypeSafe AI,进入隐身模式,直到今年 9 月 15 日才带着 Jev 和答案露面。

2022 InstructGPT 论文发表,RLHF 成为 ChatGPT 地基
2024 离开 OpenAI,创办 TypeSafe AI,进入隐身研发
2026.9 携 4000 万美元种子轮与首个模型 Jev 正式亮相
04
名字里的野心:一台更省煤的蒸汽机

Jev 这三个字母,取自 19 世纪英国经济学家 William Stanley Jevons(威廉·斯坦利·杰文斯,1835—1882)。1865 年,他在《煤炭问题》一书中记下了一个反直觉到今天依然著名的现象。

当时瓦特改良的蒸汽机大规模普及,新机器烧煤的效率比老机器高出一大截。按常识推演:机器越省煤,全国煤耗应该下降才对。

结果恰恰相反——全英国的煤炭消耗量不降反升。

① 效率提升 蒸汽机更省煤,单位动力的煤耗大幅下降
② 成本暴跌 用煤动力变得空前便宜
③ 场景爆发 过去用不起煤的行业——铁路、工厂、轮船——纷纷改用蒸汽机
④ 用量激增 机器数量和运转时长爆炸式增长
⑤ 悖论兑现 单台机器省下的煤,被暴涨的总用量吃得一干二净——全国烧的煤反而更多了
这就是"杰文斯悖论":效率提升 → 成本下降 → 需求爆炸 → 总消耗不降反升。

TypeSafe 把这个名字安在自己的模型上,本身就是一篇宣言:

"煤"换成"智能判断",同样的剧本就会重演——一次判断便宜到可以忽略不计的时候,它就会被塞进互联网和软件的每一个角落:每一封邮件、每一次点击、每一笔交易背后,都跑着一次没人看得见的判断。

Almeida 设想的未来,不是几个超级 App 垄断一切,而是海量微小的智能判断分散在各处运行——他说,那"更像早期互联网的样子,而不是现在人们努力搭建的那种大型应用"

05
它到底怎么干活:不生成,只选择

要懂 Jev,先得知道普通大模型是怎么出答案的。

GPT、Claude、Gemini 都是自回归模型,原理四个字:单字接龙。它像一个打字员,一个 token 接一个 token 地把回答"敲"出来,敲完一个字才能决定下一个字。输出越长,需要的解码步骤越多,也就越慢、越贵。

举个真实的例子:一个电商 Agent 打开网页,需要决定点哪个按钮。系统真正需要的信息只是"第三个按钮"。但大模型会先郑重其事地生成一整句——"根据当前页面,我应该点击右下角的 Checkout 按钮"——软件再从这段话里把 Checkout 抠出来,才能执行点击。

你要的只是一个答案,来的却是个非要把心路历程吟诵一遍的老学究,而且你还得为这段没人会读的文字按字数付费。

Jev 的做法简单粗暴:把输出空间提前锁死。你规定答案只能是 low / medium / high,它要做的就只是对这三个结果各算一个概率,一次前向计算直接给出,没有逐字推演那一步。再配合官方称为 parallel sampler 的机制,一份输入、多个问题,一次性并行算完。

同样 27 个问题 · 同样的提问顺序

TYPESAFE · JEV
{
 "Revenue impacted?":
  {noul:0.85},
 "Which unit?":
  {choice:"technical",
   confidence:0.96},
 "Urgency?":
  {score:2.77, c:0.77}
}
$0.000081 · 0.114秒
传统大模型
{
 "Revenue impacted?": true,
 "Which unit?": "degraded",
 "Account health?": "watch",
 "Security risk?": 1,
 "Urgency?": 3,
 ...逐字生成中…
$0.013880 · 8.566秒

官方口径:快 74.9 倍 · 便宜 171 倍

来源:TypeSafe 官方对比演示(对照模型 gpt-5.6-terra)

大语言模型
逐字接龙生成
一段话,再解析
排队逐字回答
可能格式跑偏
慢思考的"系统二"
Jev
对选项直接算概率
选项 / 分数 / 概率
一次并行算完
结构上不可能跑偏
快反射的"系统一"

注意,它不负责生成。开源浏览器 Agent 项目 jev-ultrafast 里,"点哪个按钮"由 Jev 决定,可一旦需要在输入框里填写城市名称,程序会另行调用一个生成文本的小模型。分工,而不是取代——这一点后面还会讲到。

06
为什么偏偏是现在:Agent 憋了三年的痛

"做判断的小模型"并不是新概念,分类器已经存在了几十年。Jev 之所以偏偏在 2026 年炸场,是因为AI Agent(智能体)爆发了

把一个复杂的 Agent 任务拆开看,里面是几十次甚至几百次微小的决定:这一步成了没有?选工具 A 还是工具 B?上一段输出里的订单号是多少?十条搜索结果哪条最相关?要不要中止流程?——其中绝大多数是路由、分类、验证和状态判断,不需要写一个字。

如果每个小动作都请千亿参数的大模型出山,会发生三件事:延迟一层层累加,成本迅速失控;更致命的是,只要中间任何一步返回的 JSON 解析失败,整个 Agent 就卡死在半路上。

这就像一家公司,连上厕所都要走一遍董事会流程打报告——你会憋死。生产系统真正需要的,是一个特别便宜、特别快、绝对守规矩的决策信号。

TypeSafe 由此给整个品类起了名字:System One Model(系统一模型),出自丹尼尔·卡尼曼的《思考,快与慢》——

系统一 · 快
直觉、反射、毫秒级、不费力
对应:脊髓的条件反射
Jev 负责的脏活累活
系统二 · 慢
深思、推理、秒级、费资源
对应:大脑皮层的深思
大模型负责的宏观规划
主流大模型卷了三年"系统二",Jev 偏去做"系统一"。

于是,未来一个现实的 Agent 系统,很可能是一套分层架构,由一个叫 Harness 的工程层负责调度:

Harness 编排调度层:按任务把请求分给合适的层
L4 前沿大模型 复杂规划 · 长程推理 · 文本生成(慢、贵,调用最少)
L3 Flash 轻量模型 日常推理与生成(按 token 精打细算)
L2 决策模型 Jev 路由 · 分类 · 验证 · 打分(毫秒级,调用最密集)
L1 传统代码 确定性逻辑:if-else、数据库、API(零成本)
越往下,单次成本越低、调用频次越高。Jev 真正插入的位置,是 L1 与 L3 之间那道此前空着的缝。
07
数字到底有多夸张

先看 TypeSafe 官方口径:端到端延迟 70—500 毫秒,在特定工作流评测中,最高比对照大模型快 193.6 倍、便宜 444.6 倍;输入每百万 token 收费 0.042 美元,输出完全免费,摊到一次决策上约 0.0004 美元。

70–500ms
端到端延迟
193.6×
最高提速(官方特定任务)
444.6×
最高成本降幅(官方任务)
$0.0004
单次决策成本,输出免费

官方数字之外,第三方平台 OpenRouter 的独立评测(Ori Eval,2026 年 9 月,30 选 1 分类任务,每个模型 200 个样本)更值得看:

每次决策的中位延迟
越短越好 · 单位毫秒
Jev 1.13154
GPT-5.6 Luna860
DeepSeek V4.1 Flash911
Qwen3.8 Flash914
GLM 5.3 Flash1544
每 1000 次决策的实测成本
越便宜越好 · 单位美元
Qwen3.8 Flash$0.040
Jev 1.13$0.049
DeepSeek V4.1 Flash$0.075
GLM 5.3 Flash$0.083
GPT-5.6 Luna$0.179
成本榜上 Jev 排第二——国产 Qwen Flash 比它还便宜一点。
30 选 1 分类准确率(exact-match)
条形长度按 95%—100% 区间绘制,以放大差异
Jev 1.1398.5%
DeepSeek V4.1 Flash98.5%
Qwen3.8 Flash97.5%
GLM 5.3 Flash97.0%
GPT-5.6 Luna96.5%
来源:OpenRouter Ori Eval,2026年9月。注意:这正是 Jev 最擅长的题型。

实时性最夸张的演示是打游戏。在一场 Pong(乒乓球)对战中,Jev 在 12 秒内做出 47 次操作决策,单次约 227 毫秒;同一时间里 Gemini、Claude、GPT 只做出两三次,单次要 2.5—3.5 秒。TypeSafe 还让它打《DOOM》——每秒约 10 次即时判断,整套推理成本一小时约 7 美元。

08
几美分能干什么:开发者账单大赏

发布几天,全球开发者已经晒出了一堆账单(以下为社区自发分享,未经独立核实,看个量级):

客服邮件分诊
判断部门、紧急度、是否人工,拿不准的再交大模型兜底,流水线准确率 96%
$0.07 / 批
浏览器 Agent 找机票
自主完成苏黎世到伦敦航班的查询设置
7 秒 · $0.0039
3282 条推文分析
400 多万 token,分析增长规律
8分34秒 · $0.128
1018 篇论文分类
按主题自动归类整理论文库
$0.08
724 条实时广告拆解
覆盖 37 个品牌,分析素材与存活周期
40 秒 · $0.09
信息流除草
扫三天帖子、提 8 个问题,剔除诱饵内容和软广
2 秒 · $0.007
即时上下文压缩
给每个工具调用打分,丢掉无关内容,15.6 万 token 上下文秒级瘦身
约 3 秒
自然语言查数据库
有人做成 Postgres 扩展;有人让它同时操控 4 个游戏角色对打,一局几美分
几美分 / 局

企业侧也有了早期证言:Vercel 的工程师称,他们原本用 GPT-5.6 Luna 跑命令安全分类器,换成 Jev 后速度提升 5—18 倍,准确性还更高。也有创业者测试发现 Gemini 准确率略胜一筹,但成本是 Jev 的 10—20 倍。

看出味道了吗?Jev 不是来抢大模型饭碗的——它更像给大模型当"门卫":便宜的高频活它先拦下,真正难的活再往上递。

09
"零幻觉"三个字,别误会

TypeSafe 官网最醒目的宣传语是 "Zero Hallucinations"(零幻觉)。这很容易让人以为它治好了大模型的祖传顽疾,但它保证的其实只是格式,不是对错

它确实做到的
你规定只能在猫 / 狗 / 鸟里选,它绝不会吐出"大象",也不会写一段软件无法解析的话。官方评测中,工具调用的类型错误率为 0%
它没有保证的
图片里明明是一只猫,它可能自信地返回"狗:97%"。没有类型错误,业务结果却完全错误。
控制得住的错误才叫错误,控制不住的叫事故——Jev 消灭的是"事故",不是"错误"。

那它凭什么让人敢用?靠另一项训练方法:RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)。

RLHF 优化的是"回答像不像好人说的",RLVR 靠可验证奖励刷数学和代码,而 RLCD 要解决的是一个更朴素的问题:模型说自己有多大把握,这个概率到底靠不靠谱?

校准良好意味着:它对一批任务都给出 90% 的置信度,其中就应该有约 90% 真的判断正确。这样企业才能搭起自动分流的流水线:

高置信(如 ≥95%) → 机器直接执行,无人值守
中等置信 → 交给更强的大模型复核
低置信(如 ≤50%) → 转人工处理

Flask 作者、Earendil 公司 CTO Armin Ronacher 看得很透:这相当于把处理幻觉的责任部分交还给了使用者——"如果概率只有 50%,你可以忽略它;如果到了 95%,你就可以放心利用它。"同理,Jev 还能反过来当"模型路由器":实时判断每个任务该请哪个模型出马,而这件事用大模型本身来做,太贵了。

当然,RLCD 目前同样没有完整论文和独立验证——它到底是一种新范式,还是已有校准方法的工程组合,尚无定论。

先别急着喊新范式
三盆冷水
冷水一:这不就是个分类器吗?
发布当天就有人在 Reddit 调侃:"行业又重新发现了分类模型。"Jev 与传统分类器的真正区别,是保留了大模型的通用知识和零样本泛化能力,不必为每个新任务重新训练。但它真正的对手也不只是 GPT——今天的 Flash 小模型配合 JSON Schema、约束解码、Function Calling 已能稳定输出结构化结果,embedding 加分类器甚至可能更便宜。把这些方案放进同一批真实任务里横评的独立测试,目前还不存在。
冷水二:成绩单是自己出的
在 TypeSafe 自己的工作流评测中,Jev 平均得分 67.8%,只排第四,前面压着 GPT-5.6 Sol 的 74.1% 和 Claude Opus 5 的 73.1%;题目由自家团队设计,部分"标准答案"干脆由竞品模型生成,而非人工标注。"193.6 倍快、444.6 倍便宜"是特定任务下的极值,而考题恰好全是它最擅长的判断题。一次使用 10984 条真实 A/B 数据的窄测试里,它的正确率为 64.5%;换成没有真实差异的对照组,表现直接掉回随机水平。模型架构、参数规模、训练数据和消融实验,至今全部未公开,外界普遍猜测它是在某个开源大模型基础上改造而来。
冷水三:不解释、不背锅,也还没有客户
它只给一个选项和一个概率,没有理由、没有过程。在金融、医疗这类行业,一个无法被审计的决策就无法被追责。商业上,Jev 目前仍是小范围内测,没有具名客户、没有披露收入,低到尘埃里的定价被质疑是在烧 4000 万美元融资打价格战。另外,该服务尚未向中国大陆地区开放
把模型做小、做快、做确定,确实敲在了行业最疼的地方。但在真实业务最刁钻的极端情况把它跑痛一遍之前,说它"颠覆"了什么,都还太早。
11
从一台蒸汽机到一行开源代码
1865 杰文斯出版《煤炭问题》,"杰文斯悖论"问世
2011 卡尼曼《思考,快与慢》流行,"系统一 / 系统二"成为大众概念
2022 InstructGPT 论文发表,Almeida 参与建立的 RLHF 成为 ChatGPT 地基
2024 Almeida 离开 OpenAI,创办 TypeSafe AI,隐身研发
9.15 Jev 正式发布,4000 万美元种子轮同步公开,当天刷屏
9.19 中国企业 APUS 公布全球最早一批开源复现成果 fast-browser-use(MIT 协议、跨平台、可纯本地离线运行):在 Apple M2 Pro 笔记本上用 Qwen3.5-9B 完成维基百科检索,中位耗时约 18 秒,表单填报、站内导航约 3 秒,全程零云端调用、零 API 费用
从闭源 API 到开源权重加端侧算力,这个范式只用了四天就迎来了第一份代码可复核的独立验证。
12
机器之间,为什么非要说人话?

过去三年,我们评价大模型的标准越来越像在评价一个人:会不会说漂亮话,有没有情绪价值,像不像人。Jev 把这套规则整个掀翻,反问了一个朴素得惊人的问题——

机器和机器之间,
为什么非得说人话?

Almeida 自己这样定义这家公司:"前沿实验室的主要产物要么是恐惧,要么是炒作。我希望我们的主要产品是智慧——我们不属于那种一门心思创造无限财富、搞宗教式叙事,或者试图在数据中心里造神的实验室。"

回到那个 160 年前的悖论。1865 年,杰文斯盯着一台更省煤的蒸汽机,最终看到的,是一个烧掉更多煤的世界。TypeSafe 赌的是同一个剧本:当一次判断便宜到可以忽略不计,智能就会像水电一样,铺满你看不见的每一个角落。

这个赌注能不能成,现在没人知道。但它至少提醒了我们一件被热闹盖住的事:AI 的终极形态,也许从来都不是一个更会说话的机器人。

也许恰恰相反——是一个安静、廉价、从不废话、也不乱来的判断器,藏在你根本看不见的地方,一秒钟,替你做完一万个决定。
AI 少说了很多话,软件却多做了几件事。
资料来源
TypeSafe AI 官方发布材料、评测页及 Hacker News 发布帖;OpenRouter Ori Eval(2026年9月);Ably Pong 公开演示;界面新闻《教ChatGPT说话的人,做了个不说话的模型》;爱范儿/凤凰网科技《刷屏全球的AI新顶流Jev,一句话都不说,到底怎么玩?》;36氪转载腾讯科技《一个"不说话"的AI刷屏,Jev真是新范式吗?》;央广网《Jev模型是什么?TypeSafe"决策模型"爆火后,APUS交出全球首批跨平台开源复现》。
数据截至 2026 年 9 月 20 日。开发者账单为社区自发分享、未经独立核实;模型性能以官方及第三方后续披露为准。本文为技术科普,不构成投资建议。
— 全文完 —

相关学习资料