夜雨聆风学习资料网

ARTICLE · 1050651

一个不 GC 的 AI,JEV正在接管“判断”这件事

一个不 GC 的 AI,JEV正在接管“判断”这件事

Jev 是什么、公开实测到底行不行、值不值得现在动手

任何一个跑着 AI 的系统里,每天都有成千上万次这样的动作:

· 这封邮件是投诉、咨询,还是发票?

· 用户这句话,该转给哪个业务机器人?

· 这个工具调用危不危险,拦不拦?

· 这段检索结果,跟问题相关吗?

它们的共同点是:答案很窄,却每次都要请一个大模型来“想一遍”。

大模型很贵,也慢。喂进去几百 token,等它一个字一个字吐出来,再解析 JSON——几百毫秒、几厘钱。一次不多,乘以几百万次,就是一条看不见的成本河。

2026 年 9 月 15 日,一家叫 TypeSafe AI的旧金山公司结束两年隐身,拿出了一条反方向的思路:一个不写字的模型。

它不写文章、不写代码、不能聊天。你给它一段状态、一组问题,它一次性把答案和“我有多确定”还给你。它叫 Jev

这篇文章只聊三件事:它能干嘛、效果到底行不行、值不值得你现在上手。

一、它到底是什么

一句话:它是个“只做决定”的模型,不做“生成”。

官方的说法是“Decisions, not strings”——要决策,不要文本。主流大模型是一个 token 一个 token 地“说”出答案,软件再反过来解析;Jev 把这条链路整段砍掉:给它一段 state(一封邮件、一段 JSON、一条日志),再给它几个类型化的问题,它并行算完,直接返回结构化的值。

输出只有三种问法,但覆盖了绝大多数业务判断:

Choice(选择) 从你预先声明的选项里挑一个,返回选中项、每个选项的概率、以及一个 confidence。比如“该分给哪个部门”。上限 255 个选项。

Score(打分) 在一组有序档位上打分,返回分数、分布和 confidence,可以落在两个档位之间。比如“紧急程度 0–4”。

Noul(判断) 问一个命题成不成立,返回 0–1 之间的概率。比如“用户是不是想退款”。Noul 没有单独的 confidence 字段——概率本身就是。

三个原语可以混在一次请求里,彼此独立、互不影响。加问题的代价极小,因为真正的开销在 state 而不是问题数:业界一句很传神的总结是——你不是按“判断”付费,是按“状态”付费。

几个已经被反复核对过的事实:

· 输入定价 0.042 美元 / 百万 token,输出免费;端到端 70–500 毫秒,OpenRouter 给出的 P50 约 0.23 秒。

· 上下文 32K(state + 最长一个问题),state 与全部问题合计 64K;Choice 超过 255 个选项要用“先打分后选择”的两段式。

· 只吃文本:字符串、JSON 对象、文本数组。不支持图片、音频、视频。

公司背景也值得一提:创始人是 Diogo Almeida,OpenAI 前研究员,InstructGPT 的主要作者之一、RLHF 训练流程的核心构建者。同期官宣 4000 万美元种子轮,DCVC 领投,估值约 2 亿美元。模型名取自经济学家威廉·杰文斯——那位提出“杰文斯悖论”的人:效率提升不会减少消耗,反而会增加消耗。

一句必须讲清的话:类型安全 ≠ 判断正确。答案空间被事先定死,所以它编不出一个不存在的选项,也不会给你一个解析失败的 JSON;但它完全可以自信地选错。

二、它没有“思考过程”,这是设计取舍

大模型做判断时,常常会在心里先推一遍——思维链,像人自言自语地列步骤。Jev 完全没有这一套:它不生成任何文字,工作方式是把候选选项一起塞进模型,一次前向计算,直接给每个选项打分,再做归一化。

打个比方:它不像在做一道需要一步步推导的数学题,更像你看到一张熟悉的脸,下意识就知道是谁,不用分析五官。

这既是它快和便宜的原因,也是它的天花板:

· 它不“想”,它“凭训练出来的经验直接判断”。

· 需要多步推理、需要世界知识、需要现编一套逻辑去对付新情况的事,它做不了。

· 这类判断,仍然要交给大模型的“慢系统”。

对落地来说,这个认知很关键:别把它当小号大模型用。它是“判断层”,不是“智能层”。

三、真正的产品是“置信度”

Jev 的训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)。它优化的不是一个回答“讨不讨人喜欢”,而是概率与真实结果是否对得上:模型说九成把握,一批判断里就该大约九成是对的。

confidence 这个数字,本质上是概率分布“有多集中”的统计量:集中在一个选项上就高,摊开了就低。它的用途不是告诉你“对不对”,而是当路由信号用。

选择性自动化,是这类模型最值钱的玩法:

它说“我很确定” → 机器直接执行;

它说“我不太确定” → 转人工,或升级给大模型。

社区实践里流传的一组分档值得参考:内部打标 0.70 可直接自动处理;Agent 交接 0.80 需重新评估;涉及浏览器 / 工具动作 0.90 要问人工;发布、支付、删除这类不可逆动作,必须有策略加人工两道闸。

铁律:模型可以建议分支,代码决定分支能不能执行。绝不让一个概率绕过权限、预算和不可逆操作的控制。

还有一条工程纪律同样重要:每次外部动作之后必须重建 state,让判断基于最新状态,而不是缓存里的旧世界。

四、效果到底行不行:厂商数字和第三方数字要分开看

先说厂商自己公布的。TypeSafe 的 workflow 评测里,Jev 与参考标签的一致率是 67.8%,单次成本 0.0004 美元,耗时 0.4 秒;同期对比的几个前沿模型在 64%–74% 之间,成本几美分到十几美分,耗时 10 秒到 80 秒不等。

这里有两处必须标注的保留:其一,参考标签不是人工标注,而是两个前沿模型输出的平均;其二,在厂商自己的任务上,Jev 的准确率略低于那几个前沿模型——它赢的是成本和延迟,不是脑子。官方主页上“快 193.6 倍、便宜 444.6 倍”是四个自建 workflow 的上限值,公司自己也承认这是“真实增益的高端”。

第三方独立实测,才是更值得看的部分:

测试
结论
意图路由 + 注入检测
791 条标注,对比 4 个模型
中位快 2.0–3.6 倍,比两个最便宜的小模型便宜 4.7–7.5 倍;8 类路由打平,77 类路由落后前沿模型 5 个点
四个公开分类集
约 1.6 万次调用
在 4 个数据集中的 3 个上持平或优于同档小模型,成本低 5–56 倍;置信的答案 90%–100% 正确,但整篇长文档任务打不过现有小模型
钓鱼 / 垃圾邮件
2000 封 + 18514 封
单个宽问题 62.6%(对比模型 81.3%);拆成 5 个窄问题后升到 95.0%;垃圾邮件集上 98.33%,而朴素 TF-IDF 基线是 98.39%——两行正则就能赢下它的单问题版本
置信度校准
8801 条情感样本
排序能力不错(AUROC 0.83,优于基线模型的 0.72);但系统性过度自信:Noul 平均置信 79.0% 对 72.3% 准确率,Choice 91.4% 对 76.1%

注:以上均为 2026 年 9 月中下旬公开发布的第三方测试结果,条件各不相同,仅作量级参考。

把这些数字放在一起,规律非常清楚:

· 怎么问,比用什么模型更重要。同一个钓鱼邮件任务,问法从“宽”变“窄”,准确率能从 62.6% 跳到 95.0%。

· 越窄、越二元、类别越少、定义越清楚,效果越好。类别一多就退化,77 类任务是明确的分水岭。

· 置信度是排序信号,不是正确性保证。它开箱就过度自信,直接拿 0.85 当阈值用,等于赌博。

· 它是过滤器,不是替代品。实测里最有价值的用法是级联:让 Jev 只处理它有把握的那一半,其余升级给强模型。一份独立测试显示,只自动处理置信度 ≥0.80 的部分、其余交给前沿模型,整体准确率与该前沿模型持平,成本只有 26%–28%,延迟约一半

五、边界在哪:厂商自己列的九条“锯齿”

TypeSafe 官网上有一份叫 jaggedness(锯齿)的文档,逐条列出 Jev 1.13 已知的失败模式和对策。这是整个文档集里最有用的一页,也相当罕见——厂商在发布时就写明自己“太慢、太贵、太笨”。

会翻车的地方
对策
字面理解:回答你写的问题,不是你想的问题;否定词和隐含条件按字面读
把边界条件写进 criteria
数学与计数:数不准,误差随规模增长
一题一项,在代码里求和
日期时间:把日期当文本读,排序和窗口判断不可靠
拆成 Choice 抽取,在代码里比较
间接指代:双重否定、多跳推理掉点
直接写清,指名字段
大段无关状态:噪声会拉低准确率
先在代码里过滤
对抗性内容:state 里的注入指令可以带偏答案
它只能是一层,不能是唯一一层
指令与选项互相矛盾
criteria 与指令口径对齐
结构性不变量:两个相关答案可能自相矛盾
不变量自己用代码校验
生成:它没有文本输出,硬凑很慢且很差
用生成模型抽取,让它来选

· 英文是主训练语言,其他语言表现更弱,非英文场景必须先在自己语料上测。

· 无解释输出。你拿到的是一个数字,永远拿不到理由——这在需要向审计或监管交代的场景里是硬约束。

· 目前不支持微调,且处于 waitlist 早期访问,没有公开的 SLA。

· 架构、参数规模、训练数据都未公开,官方也明确表示不会去刷公开榜单。

六、想自己训一版?开源路线已经跑通了

既然 Jev 不支持微调,真正想“训出自己的判断层”的人该怎么办?答案在开源侧,而且来得很快。

Jev 发布后第 4 天,Bespoke Labs 开源了 Nimble:一个 Qwen3.5-9B 上的 LoRA 适配器(165MiB,Apache 2.0),连同数据配方、训练代码、权重全部开放,两天做出来,没有蒸馏 Jev,也没用强化学习。核心方法叫对比式数据策划(contrastive data curation):把关键事实轻轻改一下让标签翻转,逼模型学会分辨,校准是隐式学到的,训练数据里甚至不需要概率标签。

指标(自建 eval)
基座 Qwen3.5-9B
Nimble
Jev
准确率
66%
90%
93%
typed-decisions 准确率
0.766
0.727
校准误差 ECE
0.081
0.246
单题延迟
约 33ms
约 200–300ms

换句话说:一个 9B 的开源模型,在判断准确率上已经逼近、在校准上已经超过闭源对手,还能跑在消费级显卡和笔记本上,支持 100 多种语言。在 50% 自动放行的阈值下,它的整体准确率可以做到约 92%。

这条路线也有争议:有人指出 Nimble 的做法触碰了 Jev 的使用条款;同时由于这一模型类别尚无标准 benchmark,各家数字都是自建评测,横向可比性有限。

但对工程团队来说,结论已经明确:“决策模型”不再是一家公司的黑盒专利,它成了一件可以用 LoRA 自己造的东西。

七、它的意义:大模型架构被拆出了一层

不是“又多了一个模型”,而是大模型架构被拆出了一层

今天的 Agent 很笨重:每一步都请大模型来想,规划靠它、生成靠它,连“这句是不是抱怨”都要靠它。像一个公司里所有事都找 CEO 签字。

决策模型把“判断”从“生成”里解耦出来:慢系统(大模型)负责规划与创造,快系统(决策模型)负责高频判断和门控。

· 成本结构被重排。当一次判断便宜到接近零,“为了省钱少问几次”的偷懒架构就没必要了;反过来,“每一步都做一次判断和门控”会变成常态。

· 安全变便宜,所以安全可以变密。以前加一道护栏要花一次大模型调用,现在几乎免费,就该处处加。

· 合规的两面性。能本地部署、能固定版本、输出可全程验证,这对金融和医疗很友好;但没有解释、只有概率,在需要向监管说明理由的环节反而是短板——这类场景要提前想清楚证据链怎么补。

生态侧的 adoption 曲线也给了参照:Jev 上线 Vercel AI Gateway 后 24 小时内,接近 13% 的付费团队接入,是该平台史上最快;Cloudflare、LangChain、Langfuse 在三天内完成集成;OpenRouter 上以 typesafe/jev-1.13 提供,第四天就出现了社区 .NET SDK。

它不会取代大模型,但会像几年前的“向量数据库”“RAG”一样,成为 Agent 基础设施里的一层标配——大厂出通用版,垂直领域出专用版。未来组装一个 Agent,大概率会默认带一个“快思考判断层”。

八、今天就能动手的三件事

1. 先算账。你每天有多少次“其实只需要一个判断”的模型调用?这个数字决定整件事值不值得做。

2. 先建基线。找 1000 条真实样本,同时测三个基线:现有方案、一条简单规则、决策模型(Jev 或本地 Nimble)。没有基线,后面所有提升都证明不了。

3. 跑最小闭环。选一个不超过 10 个候选的判断任务,把宽问题拆成几个窄问题,用留出集拟合阈值,画一条“置信度越高、准确率越高”的曲线。看到那根线翘起来,整件事就成立了。

补充两条已经被测出来的经验:问题要原子化——一个判断一个问题,多维度拆开问、在代码里组合;选项要留兜底——加 other / human 选项,把资格规则放在代码里,让模型看不到它不该选的动作。

过去三年,行业都在比“谁写得好”。

现在有人开始比“谁判断得准、判断得便宜、判断得可以被信任”。

前者是内容能力,后者是决策能力。能天天被调几百万次、悄悄改写一家公司成本结构的,往往是后者。

代码负责计算,大模型负责创造,决策模型负责判断。

相关学习资料