ARTICLE · 1090516
Jev模型:让 AI 从「会聊天」到「能决策」
如今,这家低调潜行两年的公司给出了自己的答案——发布首个 System One 模型:一类全新的前沿模型,专为「软件能直接使用的、快速且结构化的决策」而生。它的名字叫 Jev。
01-放弃字符串,换来两个数量级
传统大模型(LLM)本质上是一个「文本生成器」:输入非结构化状态,输出一串字符串。字符串很灵活,可以是聊天回复、代码,也可能是幻觉、拒绝,甚至是类型错误。软件要用它,就得先解析、再校验,永远提防它「跑偏」。
Jev 走了一条截然相反的路——直接放弃字符串生成。它的输入是非结构化状态,输出的是类型安全的结构化值:所有可能的输出和结构都预先定义好,模型永远不会犯类型错误,每个答案都附带校准过的概率和置信度。
System One 模型
System One 模型是一类专为「快速、结构化决策」构建的模型。它不生成文本,而是针对类型化的问题(question)评估状态(state),直接返回代码可以分支、排序、路由的结构化结果。
这一放弃换来的是惊人的性能。在 System One 类任务上,Jev 达到了与现有大模型相当的智能水平,速度却快了两个数量级:
端到端响应时间从大模型的 3 到 329 秒,降到 70ms 到 500ms,同级别智能下快 40 到 200 倍。 输入 token 成本仅 $0.042 / MTok(每十亿 token 42 美元),输出 token 免费(便宜到无需计量)。 采样方式从「逐个 token 串行生成」变成「一次查询并行输出全部结果」。
02-从 RLHF 到 RLCD,训练目标变了
Jev 背后的技术栈是为自动化从零打造的:全新的模型架构、为极致效率设计的并行采样器,以及一种全新的训练方法——RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)。
传统大模型用 RLHF(人类反馈强化学习)优化「人类偏好」,用 RLVR(可验证奖励强化学习)优化「可验证的奖励」。而 RLCD 优化的是校准过的决策:在 System One 任务上给出「认识论上诚实」的概率。
这背后的洞察很关键。一个模型如果 95% 的任务都能做对,却不知道自己在哪 5% 里会出错,那它就永远无法被自动化。Jev 的每一次输出都携带置信度,而且置信度越高、准确率越高——这正是「能进生产系统」和「只能做 demo」的分水岭。
03-三大原语,像搭积木一样决策
TypeSafe 把决策能力抽象成三个「AI 原语」,类似软件原语那样模块化、可组合:
Choice:从列表中选一个选项,返回选择、概率分布和置信度。 Score:按评分标准给状态打分,返回分数、概率分布和置信度。 Noul:判断「这句话是否为真」,返回 0 到 1 的真值。
三种问题类型可以在一次 API 调用中混合,每个问题都针对同一状态并行、独立地评估。增加问题几乎不影响响应时间,也不会产生「上下文腐化」(context-rot)。
为什么这样设计:System One 模型在「每个问题只问一件具体、边界清晰的事」时表现最好。与其问「给这个创业 pitch 打分」,不如拆成市场规模、技术可行性、差异化三个独立问题,再用代码里的公式组合结果。优先级变了,改一个系数就行,而不是重写 prompt。
04-证据:用工作流评估说话
TypeSafe 自称是「怀疑论者」,也欢迎怀疑。他们发明了一种全新的评估方式——工作流评估(Workflow evals):假设存在一个正确的计算图(用代码表示的「工作流」),用最大、最聪明、最昂贵的外部模型(GPT-6 Astra 和 Fable 5.1)的预测作为参考概率,看每个模型在同一工作流下的表现。
结果是惊人的:Jev 独占帕累托前沿近两个数量级,主页上「快 193.6 倍、便宜 444.6 倍」的说法正来源于此。团队也如实标注了局限——这些工作流由内部能力团队制作,可能带一定偏差,且参考答案偏向 OpenAI 和 Anthropic 的模型,可能低估了自家和 DeepSeek 模型的相对表现。
关于「不幻觉」和「类型安全」,团队给出了最硬核的底气:现有模型无论多聪明,仍会幻觉、仍会犯类型错误;而 Jev 的模式匹配是数学上保证的,因此可以自信地把 0% 写进图表。
05-Jev 这个名字,藏着两层深意
「System One」的命名灵感来自丹尼尔·卡尼曼的《思考,快与慢》:快速、直觉的「系统 1」与缓慢、深思的「系统 2」。团队认为,System One 模型可以比它的替代方案更可靠——尽管「系统 1」常被贴上「易出错」的标签。
「Jev」则致敬经济学家威廉·斯坦利·杰文斯。他提出的「杰文斯悖论」指出:蒸汽机效率提升反而导致煤炭需求增加。团队相信机器智能会走同样的路——智能成本每下降一个数量级,就会解锁数量级更多的应用场景。
如今 Jev 已开放 early access,团队正尽快把开发者从等待名单中释放出来。他们想听到你要自动化哪些决策、Jev 在哪里好用、又在哪里力不从心。
总结
TypeSafe 用 Jev 回答了一个被忽略已久的问题:当大模型已经如「超级人类」般聊天多年,自动化为什么还没到来?答案或许不在「更会聊天」,而在「能做出软件可以依靠的决策」。
放弃字符串、采用并行采样、以 RLCD 训练校准决策——这套组合让 Jev 在同等智能下快上两个数量级、输出免费、且不可能幻觉。它不是一个更小的 LLM,而是一类全新的模型:一个「前沿智能的函数调用」——非结构化状态进,类型化概率决策出。
原文链接:https://typesafe.ai/blog/introducing-system-one-models-and-jev
这是一个关注 AI 前沿技术和应用的公众号,我将持续为大家分享有趣、有用的 AI 技术。如果觉得不错,欢迎点赞、转发~