ARTICLE · 1050651
一个不 GC 的 AI,JEV正在接管“判断”这件事
Jev 是什么、公开实测到底行不行、值不值得现在动手
任何一个跑着 AI 的系统里,每天都有成千上万次这样的动作:
· 这封邮件是投诉、咨询,还是发票?
· 用户这句话,该转给哪个业务机器人?
· 这个工具调用危不危险,拦不拦?
· 这段检索结果,跟问题相关吗?
它们的共同点是:答案很窄,却每次都要请一个大模型来“想一遍”。
大模型很贵,也慢。喂进去几百 token,等它一个字一个字吐出来,再解析 JSON——几百毫秒、几厘钱。一次不多,乘以几百万次,就是一条看不见的成本河。
2026 年 9 月 15 日,一家叫 TypeSafe AI的旧金山公司结束两年隐身,拿出了一条反方向的思路:一个不写字的模型。
它不写文章、不写代码、不能聊天。你给它一段状态、一组问题,它一次性把答案和“我有多确定”还给你。它叫 Jev。
这篇文章只聊三件事:它能干嘛、效果到底行不行、值不值得你现在上手。
一、它到底是什么
一句话:它是个“只做决定”的模型,不做“生成”。
官方的说法是“Decisions, not strings”——要决策,不要文本。主流大模型是一个 token 一个 token 地“说”出答案,软件再反过来解析;Jev 把这条链路整段砍掉:给它一段 state(一封邮件、一段 JSON、一条日志),再给它几个类型化的问题,它并行算完,直接返回结构化的值。
输出只有三种问法,但覆盖了绝大多数业务判断:
Choice(选择) 从你预先声明的选项里挑一个,返回选中项、每个选项的概率、以及一个 confidence。比如“该分给哪个部门”。上限 255 个选项。
Score(打分) 在一组有序档位上打分,返回分数、分布和 confidence,可以落在两个档位之间。比如“紧急程度 0–4”。
Noul(判断) 问一个命题成不成立,返回 0–1 之间的概率。比如“用户是不是想退款”。Noul 没有单独的 confidence 字段——概率本身就是。
三个原语可以混在一次请求里,彼此独立、互不影响。加问题的代价极小,因为真正的开销在 state 而不是问题数:业界一句很传神的总结是——你不是按“判断”付费,是按“状态”付费。
几个已经被反复核对过的事实:
· 输入定价 0.042 美元 / 百万 token,输出免费;端到端 70–500 毫秒,OpenRouter 给出的 P50 约 0.23 秒。
· 上下文 32K(state + 最长一个问题),state 与全部问题合计 64K;Choice 超过 255 个选项要用“先打分后选择”的两段式。
· 只吃文本:字符串、JSON 对象、文本数组。不支持图片、音频、视频。
公司背景也值得一提:创始人是 Diogo Almeida,OpenAI 前研究员,InstructGPT 的主要作者之一、RLHF 训练流程的核心构建者。同期官宣 4000 万美元种子轮,DCVC 领投,估值约 2 亿美元。模型名取自经济学家威廉·杰文斯——那位提出“杰文斯悖论”的人:效率提升不会减少消耗,反而会增加消耗。
一句必须讲清的话:类型安全 ≠ 判断正确。答案空间被事先定死,所以它编不出一个不存在的选项,也不会给你一个解析失败的 JSON;但它完全可以自信地选错。
二、它没有“思考过程”,这是设计取舍
大模型做判断时,常常会在心里先推一遍——思维链,像人自言自语地列步骤。Jev 完全没有这一套:它不生成任何文字,工作方式是把候选选项一起塞进模型,一次前向计算,直接给每个选项打分,再做归一化。
打个比方:它不像在做一道需要一步步推导的数学题,更像你看到一张熟悉的脸,下意识就知道是谁,不用分析五官。
这既是它快和便宜的原因,也是它的天花板:
· 它不“想”,它“凭训练出来的经验直接判断”。
· 需要多步推理、需要世界知识、需要现编一套逻辑去对付新情况的事,它做不了。
· 这类判断,仍然要交给大模型的“慢系统”。
对落地来说,这个认知很关键:别把它当小号大模型用。它是“判断层”,不是“智能层”。
三、真正的产品是“置信度”
Jev 的训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)。它优化的不是一个回答“讨不讨人喜欢”,而是概率与真实结果是否对得上:模型说九成把握,一批判断里就该大约九成是对的。
confidence 这个数字,本质上是概率分布“有多集中”的统计量:集中在一个选项上就高,摊开了就低。它的用途不是告诉你“对不对”,而是当路由信号用。
选择性自动化,是这类模型最值钱的玩法:
它说“我很确定” → 机器直接执行;
它说“我不太确定” → 转人工,或升级给大模型。
社区实践里流传的一组分档值得参考:内部打标 0.70 可直接自动处理;Agent 交接 0.80 需重新评估;涉及浏览器 / 工具动作 0.90 要问人工;发布、支付、删除这类不可逆动作,必须有策略加人工两道闸。
铁律:模型可以建议分支,代码决定分支能不能执行。绝不让一个概率绕过权限、预算和不可逆操作的控制。
还有一条工程纪律同样重要:每次外部动作之后必须重建 state,让判断基于最新状态,而不是缓存里的旧世界。
四、效果到底行不行:厂商数字和第三方数字要分开看
先说厂商自己公布的。TypeSafe 的 workflow 评测里,Jev 与参考标签的一致率是 67.8%,单次成本 0.0004 美元,耗时 0.4 秒;同期对比的几个前沿模型在 64%–74% 之间,成本几美分到十几美分,耗时 10 秒到 80 秒不等。
这里有两处必须标注的保留:其一,参考标签不是人工标注,而是两个前沿模型输出的平均;其二,在厂商自己的任务上,Jev 的准确率略低于那几个前沿模型——它赢的是成本和延迟,不是脑子。官方主页上“快 193.6 倍、便宜 444.6 倍”是四个自建 workflow 的上限值,公司自己也承认这是“真实增益的高端”。
第三方独立实测,才是更值得看的部分:
791 条标注,对比 4 个模型 | |
约 1.6 万次调用 | |
2000 封 + 18514 封 | |
8801 条情感样本 |
注:以上均为 2026 年 9 月中下旬公开发布的第三方测试结果,条件各不相同,仅作量级参考。
把这些数字放在一起,规律非常清楚:
· 怎么问,比用什么模型更重要。同一个钓鱼邮件任务,问法从“宽”变“窄”,准确率能从 62.6% 跳到 95.0%。
· 越窄、越二元、类别越少、定义越清楚,效果越好。类别一多就退化,77 类任务是明确的分水岭。
· 置信度是排序信号,不是正确性保证。它开箱就过度自信,直接拿 0.85 当阈值用,等于赌博。
· 它是过滤器,不是替代品。实测里最有价值的用法是级联:让 Jev 只处理它有把握的那一半,其余升级给强模型。一份独立测试显示,只自动处理置信度 ≥0.80 的部分、其余交给前沿模型,整体准确率与该前沿模型持平,成本只有 26%–28%,延迟约一半。
五、边界在哪:厂商自己列的九条“锯齿”
TypeSafe 官网上有一份叫 jaggedness(锯齿)的文档,逐条列出 Jev 1.13 已知的失败模式和对策。这是整个文档集里最有用的一页,也相当罕见——厂商在发布时就写明自己“太慢、太贵、太笨”。
· 英文是主训练语言,其他语言表现更弱,非英文场景必须先在自己语料上测。
· 无解释输出。你拿到的是一个数字,永远拿不到理由——这在需要向审计或监管交代的场景里是硬约束。
· 目前不支持微调,且处于 waitlist 早期访问,没有公开的 SLA。
· 架构、参数规模、训练数据都未公开,官方也明确表示不会去刷公开榜单。
六、想自己训一版?开源路线已经跑通了
既然 Jev 不支持微调,真正想“训出自己的判断层”的人该怎么办?答案在开源侧,而且来得很快。
Jev 发布后第 4 天,Bespoke Labs 开源了 Nimble:一个 Qwen3.5-9B 上的 LoRA 适配器(165MiB,Apache 2.0),连同数据配方、训练代码、权重全部开放,两天做出来,没有蒸馏 Jev,也没用强化学习。核心方法叫对比式数据策划(contrastive data curation):把关键事实轻轻改一下让标签翻转,逼模型学会分辨,校准是隐式学到的,训练数据里甚至不需要概率标签。
换句话说:一个 9B 的开源模型,在判断准确率上已经逼近、在校准上已经超过闭源对手,还能跑在消费级显卡和笔记本上,支持 100 多种语言。在 50% 自动放行的阈值下,它的整体准确率可以做到约 92%。
这条路线也有争议:有人指出 Nimble 的做法触碰了 Jev 的使用条款;同时由于这一模型类别尚无标准 benchmark,各家数字都是自建评测,横向可比性有限。
但对工程团队来说,结论已经明确:“决策模型”不再是一家公司的黑盒专利,它成了一件可以用 LoRA 自己造的东西。
七、它的意义:大模型架构被拆出了一层
不是“又多了一个模型”,而是大模型架构被拆出了一层。
今天的 Agent 很笨重:每一步都请大模型来想,规划靠它、生成靠它,连“这句是不是抱怨”都要靠它。像一个公司里所有事都找 CEO 签字。
决策模型把“判断”从“生成”里解耦出来:慢系统(大模型)负责规划与创造,快系统(决策模型)负责高频判断和门控。
· 成本结构被重排。当一次判断便宜到接近零,“为了省钱少问几次”的偷懒架构就没必要了;反过来,“每一步都做一次判断和门控”会变成常态。
· 安全变便宜,所以安全可以变密。以前加一道护栏要花一次大模型调用,现在几乎免费,就该处处加。
· 合规的两面性。能本地部署、能固定版本、输出可全程验证,这对金融和医疗很友好;但没有解释、只有概率,在需要向监管说明理由的环节反而是短板——这类场景要提前想清楚证据链怎么补。
生态侧的 adoption 曲线也给了参照:Jev 上线 Vercel AI Gateway 后 24 小时内,接近 13% 的付费团队接入,是该平台史上最快;Cloudflare、LangChain、Langfuse 在三天内完成集成;OpenRouter 上以 typesafe/jev-1.13 提供,第四天就出现了社区 .NET SDK。
它不会取代大模型,但会像几年前的“向量数据库”“RAG”一样,成为 Agent 基础设施里的一层标配——大厂出通用版,垂直领域出专用版。未来组装一个 Agent,大概率会默认带一个“快思考判断层”。
八、今天就能动手的三件事
1. 先算账。你每天有多少次“其实只需要一个判断”的模型调用?这个数字决定整件事值不值得做。
2. 先建基线。找 1000 条真实样本,同时测三个基线:现有方案、一条简单规则、决策模型(Jev 或本地 Nimble)。没有基线,后面所有提升都证明不了。
3. 跑最小闭环。选一个不超过 10 个候选的判断任务,把宽问题拆成几个窄问题,用留出集拟合阈值,画一条“置信度越高、准确率越高”的曲线。看到那根线翘起来,整件事就成立了。
补充两条已经被测出来的经验:问题要原子化——一个判断一个问题,多维度拆开问、在代码里组合;选项要留兜底——加 other / human 选项,把资格规则放在代码里,让模型看不到它不该选的动作。
过去三年,行业都在比“谁写得好”。
现在有人开始比“谁判断得准、判断得便宜、判断得可以被信任”。
前者是内容能力,后者是决策能力。能天天被调几百万次、悄悄改写一家公司成本结构的,往往是后者。
代码负责计算,大模型负责创造,决策模型负责判断。