夜雨聆风学习资料网

ARTICLE · 1049792

Jev:前 OpenAI 核心与一场 4000 万美元的工程反扑

Jev:前 OpenAI 核心与一场 4000 万美元的工程反扑

过去三年,整个人类科技界都在为大模型“越来越能聊”而如痴如醉。但当幻觉的潮水褪去,一个残酷的工业现实浮出水面:没有一家软件工程系统的底层,敢直接依赖一个满嘴跑火车的聊天机器人。

2026 年初秋,前 OpenAI 核心研究员 Diogo Almeida 带着一家隐身两年的实验室,给整个大模型牌桌砸下了一记反常识的重锤——一款被称为 Jev 的全新模型。它不写文章、不编故事、不吐出哪怕一个人类自然语言的字符。

它只做一件事:从非结构化的混沌中,输出确定性的、带严格概率校准的机器决策。


在旧金山的一处闭门演示里,大屏幕上跳动着一行令人错愕的 API 监控日志:平均延迟 78 毫秒,每百万 Token 输入 0.042 美元,输出计费显示为刺眼的数字——0.00 美元

台下的开发者们先是沉默,随即是一场席卷 X 与 GitHub 的震动。

这是被整个硅谷疯传的全新物种:Jev。它的造物主 TypeSafe AI,是一家刚刚浮出水面的隐形独角兽。操盘手 Diogo Almeida 曾在 2022 年参与撰写了那篇开启 ChatGPT 时代的奠基之作《InstructGPT》,是 OpenAI 早期 RLHF(基于人类反馈的强化学习)与 GPT-4 的核心功臣之一。

然而,在离开 OpenAI 的这两年里,Almeida 没有像其他人那样去卷几千亿参数的显存怪兽,而是冷冷地抛出了一个拷问整个 AI 行业的命题:

“大模型在打字聊天上超越人类已经过去这么多年了,工业级的自动化,到底去哪了?”


荒诞的现实:用“火箭引擎”当红绿灯

在过去两年的智能体(Agent)开发狂潮里,全球工程师都在默默忍受一种极度扭曲的架构怪胎。

想象一下,你正在写一段电商退款或风控系统的后端逻辑。业务流程只需要一个极其简单的布尔判断:“这笔订单是否存在刷单嫌疑?”

传统的软件工程里,这只需要一段清晰的 if (risk_score > 0.8)。但在大模型时代,开发者们不得不把厚厚的用户画像、交易记录打包塞进 Prompt,然后向大模型的 API 发起一次长途跋涉的请求:

“请阅读以上信息,严格按照 JSON 格式输出 {"is_risk": true},千万不要输出多余废话!”

紧接着,滑稽的灾难开始了:

  1. 速度地狱
    :自回归 Transformer 必须像老牛拉破车一样,一个 Token、一个 Token 地预测概率矩阵。哪怕只输出十几个字符的 JSON,在网络波动与排队下,中位延迟也直奔 3 到 20 秒。高并发的高频交易或生产流水线在这样的延迟面前直接瘫痪。
  2. 算力浪费与账单倒挂
    :为了得到这句真伪判断,企业不仅要支付高昂的输入成本,还要为那段由模型慢吞吞吐出来的格式字符支付昂贵的输出 Token 费——通常是输入费用的 3 到 5 倍。
  3. 格式坍塌与幻觉暗箭
    :即便各大厂商推出了结构化输出(Structured Outputs),模型偶尔仍会在 Markdown 代码块外多吐一句客套话“Sure, here is your json:”,或者在关键时刻给出一个飘忽不定的概率错觉。

这就像为了让路口的红绿灯变一次颜色,必须点火启动一次重型火箭发动机。昂贵、沉重、迟缓,而且随时可能在半空中抖落一枚螺丝钉。

软件工业界真正需要的,不是一个能跟你谈天说地的哲学家,而是一个绝对服从类型约束、毫秒级响应、且对自己给出的概率绝对诚实的机器开关


Jev 的反向设计:剥离自然语言,重构“系统一”

Jev 走了一条彻底离经叛道的路径。

心理学家丹尼尔·卡尼曼在《思考,快与慢》中,把人类大脑的认知模式划分为两套机制:“系统一”负责快速、直觉、并行的反射本能;“系统二”则负责缓慢、深思熟虑、逻辑链条环环相扣的理性推理。

在 TypeSafe 的定义中,现有的 OpenAI o 系列、DeepSeek 推理版,都是在竭尽全力模拟“慢速推理的系统二”。而 Jev,则是 AI 历史上第一个纯粹的 System One 模型

它的名字,取自 19 世纪英国经济学家威廉·斯坦利·杰文斯(William Stanley Jevons)。著名的“杰文斯悖论”指出:一种资源的利用效率提升,不仅不会减少消耗,反而会因为门槛的暴跌而引发天文数字般的需求激增。

为了达到工业自动化所需的极致效率,Jev 在底层动了三场大手术:

1. 放弃自回归解码:一次采样,全体返回

Jev 根本不包含任何逐词生成的自回归循环。它接收非结构化的复杂上下文(输入上限可达 32K),但输出端被硬性锚定在开发者提前声明的强类型 Schema 上。

当你的状态数据进入模型,底层的注意力矩阵并非在词表(Vocabulary)里寻找下一个概率最高的单词,而是在一个单步前向传播中,直接完成所有维度的分类与打分映射。

输出没有 Token 序列,自然没有流式传输的卡顿。70 到 500 毫秒之间,结果直接打回内存。

2. 只有三种原子原语(Primitives)

在 Jev 的世界里,复杂的现实世界被拆解为三个不可分割的判定积木:

  • Choice
    :从开发者预设的离散集合(最多 255 个选项)中挑出一个答案,并附带全部选项的离散概率分布。
  • Score
    :依据给定的判定准则,对目标文本或状态打出一个连续的分数。
  • Noul
    :一个纯粹的真伪断言,输出一个介于 0.0 到 1.0 之间的标量概率值。

如果你的业务场景极其复杂?Jev 的哲学是:不要让模型在单一黑盒里写复杂的长篇大论,而是把逻辑拆解成 5 个独立的问题,在同一次毫秒级请求中并行返回,交还给 Python 或 Rust 代码去组合。

3. RLCD 革命:把“对齐”做在概率校准上

这是 Diogo Almeida 带来的最致命的一击。

大语言模型之所以常常“一本正经地胡说八道”,是因为它们大多采用 RLHF(基于人类偏好的强化学习)。人类标注员喜欢看到自信、流利、听起来无懈可击的回答,这逼着模型哪怕在不确定的时候,也必须强装镇定。

而 Jev 采用了 TypeSafe 自研的 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)

在 RLCD 的损失函数里,讨好人类没有任何权重。唯一的优化目标是“概率诚实度(Calibration)”: 如果模型给出的判定概率是 0.95,那么在长期的真实验证集中,该命题为真的比例必须无限逼近 95%;如果模型完全拿不准,它必须诚实地给出 0.50,而不是盲目自信。


挪威盲测风暴:0.32 秒对决 26 秒

任何新架构在没有经过中立实测前,都不过是硅谷 VC 幻灯片上的宣传辞令。

2026 年 9 月 18 日,挪威独立开发者 Emil Lindfors 公布了一份详尽的评测报告。他采集了 24 份冗长复杂的挪威语官方听证会答复文本,设置了 192 项严苛的政治立场与事实论点判定,以 Anthropic 顶尖模型 Fable 5.1 的两次盲审交集作为基准,将 Jev 与目前业界最具性价比的开源标杆 DeepSeek V4.1 Flash 拉到了同一张擂台上。

测试结果在 Hacker News 上激起了千层浪:

评估维度
TypeSafe Jev (1.13)
DeepSeek V4.1 Flash (关闭推理)
DeepSeek V4.1 Flash (开启长思维链)
中位延迟0.32 秒
2.7 秒
26.0 秒
最慢长尾耗时1.3 秒
17.9 秒
250 秒
每千份文档成本0.22 美元
1.31 美元
3.08 美元
核心立场一致率
20 / 24
20 / 24
22 / 24
微观论点判定准度
86.0%
89.0%
88.0%

数据揭示了一个残酷的代际落差: 在微观判定的准度上,Jev 与顶尖大模型几乎打成了平手;但为了换取这微不足道的几个百分点,传统大模型开启推理链后,付出了整整 80 倍的延迟代价 与 14 倍的资金成本

更为震撼的是两者的概率可信度检验

在 Emil 的统计中,当 Jev 给出“概率大于 0.9”的判定时,实际正确率高达 98%;当它给出“概率低于 0.1”时,命题为真的概率精准地锁死在 0%

反观开启深度思考的大语言模型,当它们在输出文本中用笃定的口吻声称自己有“70% 到 90% 的把握”时,基准事实的实际同意率仅仅只有 48%——这甚至不如去掷一枚硬币。

在大规模工程系统里,一个“运算极快且知道自己何时不知道”的组件,价值远远超过一个“反应迟缓却盲目自大”的通才。


撕下神话标签:它不是救世主,亦有致命死穴

随着 Jev 在开发者社区呈指数级扩散,关于它的冷水也随之泼下。剥离掉硅谷包装的科幻光环,它在当前的工业实践中暴露出了极其锋利的短板:

第一,解释性彻底蒸发。 在严苛的金融风控、反洗钱或医疗辅助诊断场景中,法律监管不仅要求你给出“是不是”,更要求系统吐出一条逻辑严密、可供人类倒查的“审计轨迹(Audit Trail)”。Jev 给不出任何理由。它不会为你写一段两千字的长篇推导,输入进去的是文本,吐出来的只有冷冰冰的浮点数。一旦判定出错,排查将是一场灾难。

第二,极度挑剔的“字面敏感症”。 实测显示,Jev 对提示词中问题的措辞极其敏感。在大模型上行之有效的那套“委婉、客气、层层铺垫”的 Prompt 工程,在 Jev 身上反而会导致准度暴跌。它像一个极端刻板的单核编译器,只认最赤裸、最单刀直入的字面逻辑。

第三,商业倾销质疑与黑盒壁垒。 0.042 美元的输入成本,加上完全免费的输出,让不少硅谷分析师嗅到了熟悉的“烧 VC 资金换市场”的火药味。TypeSafe 至今未公布 Jev 的网络权重规模、RLCD 损失函数源码,甚至连模型的实际参数量都讳莫如深。当早期访问的数千万美元融资耗尽,这样极端的价格与延迟优势能否持续,仍是一个巨大的问号。


终局推演:AI 工业版图的“左右脑分立”

Jev 的横空出世,并不是要将 GPT、Claude 或 DeepSeek 扫进历史的垃圾堆,恰恰相反,它拉开了 AI 工业化落地中“左右脑真正分立”的序幕。

在此之前,人们试图让一个长满语言神经的大脑去干所有苦活脏活:既要它构思长篇小说,又要它去调度路由器;既要它编写复杂的后端系统,又要它去充当每秒刷新的文本审核网关。

未来的工程范式已经开始清晰: * 前端与中枢:交由 Jev 这样的 System One 模型驻守。以毫秒级的极速与近乎忽略不计的成本,穿梭在成千上万条消息流中,完成分类、粗筛、打分、路由以及护栏校验(Guardrails)。 * 后端与深水区:只有当 Jev 筛选出真正高价值、高度复杂的创造性任务,或者遇到概率落入灰色地带的疑难杂症时,控制权才会移交给昂贵而深邃的大语言模型去开展长思维链推理。

硅谷的这阵风暴给所有身处算力迷局中的人们上了一课: 智能的进化,未必总是朝着“更厚重、更冗长、更善言辞”的方向一路狂奔。有时候,学会何时闭上嘴巴、干脆利落地摁下一个开关,反而是通往真正自动化最坚实的一步。

相关学习资料