夜雨聆风学习资料网

ARTICLE · 1045600

「刚出来的 Jev 是啥?怎么下载?」 这两天被问了十几遍,我把话说明白

「刚出来的 Jev 是啥?怎么下载?」 这两天被问了十几遍,我把话说明白

这两天我的微信里,同一个问题被问了不下十遍。

Jev 是啥?怎么下载?

说实话我一开始没太当回事。AI 圈三天两头冒一个新名字,大部分热闹活不过一个星期。直到有人把截图发给我,说这个跟你现在做的东西好像很搭,我才坐回去把资料翻了一遍。

翻完之后的结论有点反直觉。

这东西确实值得看,但它值得看的理由,跟大多数人以为的不一样。而且它根本就不是一个可以「下载」的东西,你在网上看到的那些「Jev 一键包」,一个都别下。

我按被问到的顺序,一条一条说清楚。

ChatGPT 干的是思考 + 写答案
Jev 干的是高速判断

图 1 · Jev 的输出长这样。没有句子,只有标签、数字和概率。程序拿到就能直接往下走。

1先把它是个什么东西讲清楚

一句话,加上三种问法。

我拿一封客户邮件去问 ChatGPT,帮我看看这是不是投诉、急不急、该转给谁。

它会读,会分析,然后写一段话给我。写得挺好,但那段话是给人看的,程序读不懂,得再解析一遍。

Jev 不这样写,它更倾向直接返回另一种。

我把同样一封邮件丢给它,同时问几个问题,它一次全部答完,直接返回,类型是投诉,概率 0.94,紧急,概率 0.92,该给售后,概率 0.87,风险等级 4 分。

一个字都没有。全是标签和数字。

这就是它的全部本事。官方文档里给的三种问法,就三种,多一种都没有。

还有个细节值得记住。所有问题共享同一份输入,并行算完,所以多问几个问题几乎不增加延迟。官方给过一组对比,13 个问题合并进一次请求,比拆成 13 次单独调用,便宜 11.5 倍,快 9.6 倍

图 2 · 三种原语。是/否、选一个、打分。三种之外没有第四种,它连一句完整的话都不肯说。

官方给这一类模型起了个名字,叫 System One Model,系统一模型。名字来自卡尼曼那本《思考,快与慢》,系统一是快的、直觉的、不假思索的判断,系统二是慢的、费劲的推理。带思维链的推理模型更像系统二,Jev 想当系统一。

Jev 这个名字本身取自经济学家杰文斯,赌的是杰文斯悖论。意思是效率提升会让资源消耗增加,而不是减少。

翻译到 AI 上,它的赌注是这样的。当一次判断便宜到可以忽略不计,开发者就会开始往以前根本舍不得调模型的地方塞 AI。一条日志要不要报警,一封邮件属于哪一类,一个 agent 是不是真的干完了活。这些微小的判断,加起来可能会变成下一代软件里最大的算力消耗。

这个名字起得挺讲究的。一个模型名字背后压着一个经济学赌注,比那些叫 X1、X2、Pro Max 的强多了。

2它凭什么刷屏,数字说话

快和便宜,这两个是真的。

70-500ms

端到端响应。对照前沿大模型的 3 到 329 秒,官方口径 40 到 200 倍

$0.042

每百万输入 token。输出按官方定价免费,折合每十亿 token 42 美元

1863

发布当天冲上 Hacker News 榜首,491 条评论,创始人本人在评论区逐条答疑

但这里我必须马上补一句,不然就是帮着吹。

官网首页最醒目的那组数字,193.6 倍更快、444.6 倍更便宜,来自 TypeSafe 自己设计的四条工作流评测。出题的是他们,当裁判的也是他们。

好在这家公司自己在博客里把偏差写清楚了,工作流是自家能力团队设计的,参考答案用的是 GPT-6 Astra 和 Claude Fable 5.1 的平均,被测的大模型还用了官方提供的结构化输出 wrapper。他们原话是,这些数字处在预计实际收益的高端区间。

这份自我披露值得给好评。但它确实不是独立基准,你拿它做决策的时候心里要有数。

那第三方测出来是什么样?我挑三组数据比较完整的。

测试方
测法
结果
Every.to
Mike Taylor
27 篇自己的旧文 + 10 篇刻意模仿 AI 腔的对照文,共 37 篇,同时问 21 个「这段像不像 AI 写的」问题
777 次判断,0.7 秒内跑完,成本约四分之一美分
Every.to
Dan Shipper
4 条写作检查 × 12 段合成文本,其中 6 段故意埋了问题
每段中位 0.35 秒,对照 Fable 5.1 高推理的 8.83 秒,快约 25 倍、成本低约 580 倍。7 处缺陷抓到 6 处,漏 1 处,Fable 全抓到
Browser Use
官方集成
把浏览器 agent 的动作空间做成「操作 + 目标」两组选择题,一次网络往返出两个决策,全程不截图
搜一遍苏黎世到伦敦的机票,7.1 秒跑完

这三行里我觉得最值钱的是第三行。它说明一件事,Jev 的正确用法不是让它去看页面,而是把动作空间变成选择题,让它来选。这个思路换到别的场景一样成立。

再看一个反向的例子。开源复现项目 SemIf 做了个很干净的对照,同一个 Qwen3.5-4B,同一张 RTX 3090,同一份输入,同样 21 个是/否判断。直接读概率头的中位数是 1.023 秒,逐 token 写 JSON 的中位数是 5.332 秒。

5.21 倍,听着很爽对吧。

但这两条路跑出来的答案,只有 18/21 个是一样的。也就是说,省掉生成循环确实快,可快出来的那部分,并不全是白捡的。

快和便宜,站得住。但「快 193 倍」这种数字,目前还没有独立复现。

3这层窗户纸必须捅破

零幻觉,不等于不会答错。这是全文最重要的一段。

官网最显眼的四个字是 Zero Hallucinations,零幻觉。配图上工具调用的类型错误率写着 0%。

很多人看到这句,第一反应是这东西不会错。

不是的。

先把这个 0% 说清楚。官方自己在同一段里注明了,这个数不是实测出来的,是 schema matching 的保证。意思是,它不会编造我给的选项之外的东西。我给的选项里只有三个部门,它绝不可能还我第四个。字段不会多,格式不会错,选项不会凭空长出来。这一层确实是数学保证的,官方原话是「这用任何一个反例就能推翻,但它数学上不可能」。

但它完全可以在你给的选项里,高置信度地选错

有一份独立实测我觉得比任何评测都值得看。一个博主拿德州扑克的 GTO 求解器当标准答案,150 个决策点,逐点和 Jev 对答案。

其中一个牌面,他手上是 K 高顺子,当前场上最好的牌。正确动作是过牌,因为这时候推全下,只会被更好的牌跟注。

Jev 跑了 16 次。

16 次全部选择全下。

150 个决策点整体跑下来,它和求解器最优解的吻合率是 63%。

但最扎心的还不是这个数字,是它的置信度倒过来了。在它错得最离谱的那个决策点上,它给出的置信度是 0.86。在它最接近正确答案的地方,置信度反而只有 0.09。

而且这个错法高度可复现,反复跑还是错。这不是噪声,是系统性的偏差。

把 turn 换成黑桃,顺子已经输给任何同花了,它还是以大约六成概率推全下。哪怕把对手的精确手牌直接写进输入,它的决策也不改。

那它什么时候改判的?

把「对手手牌等于 A 高同花」「我方当前落后」「我方 0 张补牌」这些已经得出结论的字段喂进去之后,它才改成过牌。

图 3 · 扑克实测。Jev 需要你把结论喂到嘴边才改判,它不会自己从原始信息里推。这是它最硬的边界。

这句话我读了两遍才反应过来它的分量。

它不算牌,它只读你写好的结论。

所以 Jev 的能力上限,其实是你写指令的能力上限。你把问题描述得有多清楚,它就有多准。指望它替你做推理,一定会失望。

还有两个细节我记一下。有 Hacker News 用户发现它连单步迷宫都解不稳,推测训练分布里压根没有空间推理。扑克实测的作者更狠,他说一个「能过牌就过牌」的一行规则,都能打赢 Jev。

官方文档里最诚实的一句话校准是跨预测群体衡量的,不保证单条答案正确。翻译成大白话就是,一组标着 90% 置信度的预测,长期平均正确率接近九成。但你手上这一条,不代表有九成把握。阈值必须在你自己的数据上重新调。

顺带说一句,网上有人拿「这不就是 BERT 吗」来质疑它。我觉得这个质疑有一半道理,架构层面确实没有革命性的东西。但真正难的不是架构,是把「够聪明、够便宜、够快、够省事」四样凑齐,以前确实做不到。

4那到底怎么用,三条路

先澄清一件事,然后给你能直接跑的步骤。

第一件事必须先说清楚,Jev 模型本身下载不了。它是闭源的,走 TypeSafe 托管的 API。你在网上看到的任何「Jev 本地版」「Jev 一键包」,一个都别下,那大概率是拿别的开源模型套了个壳。

如果你就是想要一个能下载到本地跑的东西,现在有两个开源替代品可以看。

一个是 SemIf,一开始叫 OpenJev。它拿 Qwen3、MiniCPM5 这些开放模型直接读候选选项的 logits,再归一化成概率,浏览器版走 WebGPU 本地推理。作者在 README 里把界限写得很清楚,重制的是这套接口形态,不是 Jev 那个没公开的模型和训练方法。

另一个是 Laya,Hugging Face 上权重是公开的,4.21 亿参数,用 ModernBERT 当 encoder,单题 p50 延迟 38.4 毫秒,输入长度上限 512 token。它和 TypeSafe 的关系有点微妙,作者说自己在 2025 年 3 月就发过相关论文,公开指责 Jev 抄了非自回归决策架构,TypeSafe 没公开回应。这个瓜还没落地,我不站队。

但有一件事必须提醒。Laya 的 README 把自己 83.8% 的准确率和 Jev 官方那个 67.8% 的四工作流汇总摆在一起,说高出 16 个百分点。这两个数不能相减。一个是在任务内分布上测的,一个是四个完全不同工作流的汇总,数据集、标注方法、任务分布全都不一样。谁把这两个数放一起比,谁就是在带节奏。

还有一组更值得看的数据,是 Laya 自己留的反例。它拿了四个完全没参与训练的陌生任务各测 600 题,一共 2400 题,整体准确率掉到 65.1%,校准误差 ECE 是 0.204。

翻译一下。模型在一个场景里校准得好,不代表换个场景还能信。这一条对 Jev 同样成立。

下面是三条正路,按上手难度排。

1。官方 API,最正统

去 typesafe.ai 申请 early access,然后在 console 里生成 API key。接口极简,一个 POST 到 /v1/systemone,模型别名填 jev-latest。适合你要把它写进自己产品里的时候。

2。社区命令行工具 jev,我推荐先玩这个

装上就能用,一行代码都不用写。一个开源作者做的单文件 CLI,只依赖 Python 标准库,背后调的也是 TypeSafe 官方 API。这是非官方项目,作者自己在 README 里写明了。

3。装成 Agent Skill,让 agent 自己调用

如果你在用 Claude Code、Codex 或者 Cursor,可以直接把它装成一个 skill。装完之后,你只要说一句「用 jev 判断这张工单是不是要退款」,agent 就会自己去调。

第二条路我展开说一下,因为它最快能出结果。

macOS 或者 Linux 下,一条命令装完。

# 先下载脚本,看清楚再执行curl --proto '=https' --tlsv1.2 -fLsS \   https://github.com/okooo5km/jev/releases/download/v0.3.2/install.sh -o /tmp/jev-install.sh sh /tmp/jev-install.sh export PATH="$HOME/.local/bin:$PATH"# 配 key,输入不回显,不会进命令历史jev auth set

装完之后就有五种动词可以用。

jev yes "用户在要求退款吗" -s "这软件一打开就崩,退款"yes	0.97jev pick "这事该谁处理" code="写或改代码" research="要联网查资料" --other -s "帮我写个 Python 脚本"codejev score "打几星" --range 1-5 -s "还不错,就是有些小毛病"3.73	4# 一次问一堆问题,返回对齐的表格jev run mail -s "Subject: 你的应用审核已通过..."

五种动词分别是,是/否、选一个、打分、语义过滤、批量问一组问题。够用了。

第三条路,agent skill,一行命令。

# 社区版,装完直接让 agent 调用 Jev 做判断npx skills add okooo5km/jev -g# 官方版,帮你把 TypeSafe 集成进自己的应用代码npx skills add typesafe-ai/skills --skill typesafe-ai

这两个定位不一样,别装混了。社区那个是「装完就能用」,官方那个是「教你怎么写集成代码」。

Windows 用户的坑,我自己就踩在这上面那个命令行工具的 README 里写得很直白,Windows 未测试,请用 WSL。所以 Windows 的朋友要么开 WSL,要么老老实实走官方 API 自己写两行代码。别硬试,省得折腾一晚上。

还有一个成本上的细节值得记住。单次调用每次都要新建连接,所以第一次会慢一点,大概 0.5 到 1 秒。但如果你用批量模式,连接会复用,之后每次就掉到 0.3 到 0.4 秒,这才是官方说的那个 70 到 500 毫秒。

所以别在 shell 里循环调单个请求,用批量模式。

5我的真实判断

值得研究的不是「又一个新模型」,是它站的那个位置。

坦率讲,Jev 最值得看的,不是它作为一个模型有多强。

是它站的那个位置。

我这两年手上在做的那些东西,机械图纸审核、GD&T 的教学工具、贸易 ERP、客户系统、美妆设备选型,你把它们摊开来看,真正吃算力的部分几乎都不是「写一篇文章」。

是判断。分类。打分。风险门控。路由。决定这一步要不要升级给更强的模型,或者交给人。

先看三个别人已经跑出来的案例,你就知道这个位置在哪了。

第一个是宝可梦对战。X 上有人拿 Jev 当对战决策器,打赢了 Opus 5,成本大约是它的八百二十分之一,速度快十倍。更有意思的是作者说,它给出的第二、第三候选,往往也是合理战术。

第二个是 Claude Code 的上下文压缩插件。这个思路我觉得特别聪明。它不找大模型写那种有损的压缩小作文,而是把整个对话当成 state,对每一个工具调用并行问两个是/否问题,这个调用还有用吗,这个结果还需要原文吗。然后按置信度决定保留、截断还是删除。留下来的内容百分之百是原文,路径、报错、命令一个字都不丢。

第三个是模型路由。用 Jev 判断意图和难度,简单的丢给便宜模型,难的升级给贵的。这是 Hacker News 上公认最稳的用法。

你发现没有,这三个案例里,Jev 一个字都没写。

图 4 · 一个 agent 里,判断该分给谁。Jev 占的是中间那格,量最大、单次最便宜、也最容易被忽略的一格。

我的图纸审核系统里,有 28 条基线规则。现在的做法是把图纸信息打包丢给大模型,让它一次性把所有规则判完,再让它写审核报告。

这个做法有几个地方很难受。它慢,它贵,而且每一步都要把上下文重新读一遍。更麻烦的是,判断和表达混在一起,模型既要想清楚有没有违规,又要想怎么把话说漂亮,这两件事互相干扰。

换成 Jev 的思路,链路会变成另一个样子。

图 5 · 如果换成 Jev 的架构,我那条链路大概长这样。贵的模型只负责写人话,几十次高频判断交给便宜到可以忽略的东西。

这条链路里最关键的改变是,判断和表达被拆开了。判断交给一个便宜、快、不会跑偏的东西,表达留给大模型。各干各的。

我觉得这才是 Jev 真正的价值所在。

不是「又一个新模型」,是「智能 if 语句」。是把 AI 从聊天框里拽出来,塞进代码的 if 分支里。

TypeSafe 自己在博客里也是这么说的,他们想成为的,是藏在软件流程里那些微小判断背后的基础设施。

6但我不打算直接上生产

说完成绩说顾虑,三条。

第一条,中文。官方文档写得很直白,它只吃文本,图像音频都不支持,而且训练以英语为主,中文本能用,但准确率更低。这个「更低」到底低多少,官方没给数字,我也没找到任何一份靠谱的中文实测。对我来说这条是实打实的减分项,因为我手上全是中文场景。

第二条,它没有思维链,没有测试时计算。有分析文章推测它的智能上限被锁在「非推理模型」那一档,不要指望它自己能长出新的智能。我觉得这个判断有道理,扑克那个实测就是最好的佐证。

第三条,也是最重要的一条。置信度不等于单条正确。官方文档自己写明了,校准是群体口径。所以那个阈值不能照抄,必须在我自己的数据上重新调。

所以我不会直接上生产。

我打算这么验证先从我那 28 条规则里挑 5 条最适合的,拿真实的图纸样本,做一次 GPT-5.6 对 Jev 的小实测。只看三件事,准确率差多少,校准曲线长什么样,单次判断的成本差多少。样本量不用大,几十张图就够我判断方向。

结果出来我会写出来,好的坏的都写。

官方在评测页给的四工作流汇总准确率是 67.8%。这个数字的参考答案,不是人工标注,是 GPT-6 Astra 和 Claude Fable 5.1 开高推理模式的平均。官方自己也承认,这些数字处在预计实际收益的高端区间。

所以它是接近,而不是超越。这种情况下,拿自己的真实数据跑一遍,比看十篇评测都管用。

回到最开始那个问题

Jev 是啥,怎么下载。

它是给软件用的判断题引擎,不是给你聊天用的。它下载不了,但你可以用一条命令把它接进你的命令行,或者接进你的 agent。

至于它值不值得你花时间。

我的答案是分两种情况。如果你手上有一堆每天要判断几十万次的小决策,值得,而且可能比你想的还值得。如果你只是想找一个更聪明的聊天模型,那它帮不上你。

它连一句完整的话都不肯说。

如果这篇帮你省下了一晚上的搜索时间
随手点个赞和在看,转发给那个也在问你 Jev 的朋友

相关学习资料