夜雨聆风学习资料网

ARTICLE · 1051478

全球爆火JEV,他更可能是另外一个OpenClaw时刻,当“决策”被抽象为数据,判断变成概率,他只是理想状态的演绎

全球爆火JEV,他更可能是另外一个OpenClaw时刻,当“决策”被抽象为数据,判断变成概率,他只是理想状态的演绎
AI 决策实战 · 第 02 篇

作者前言:

全球爆火JEV,他更可能是另外一个OpenClaw时刻,当“决策”被抽象为数据,判断变成概率,他只是理想状态的演绎。

AI在不停地发展,似乎总是有许多新的概念出现在我们面前,本来是机构与资本的竞逐,但普通人的“焦虑”,“欲望”,“变好的想法”被化身为新时代的“鞭子”,抽动着每个人不由自主地将自己情绪落在具体的行为上,我们成价值本身,这是一个好的时代,但又是被演绎的时代。

JEV 是什么、插在流程哪一步,以及我把它落到自己流水线上的完整方案。

先不看概念,看一个具体的动作。

你的 Agent(Intelligent Agent,智能体,能自己决定下一步做什么的程序)每决定下一步干什么,都要让大语言模型吐一段 JSON(JavaScript Object Notation,JavaScript 对象表示法,一种用文本表示结构化数据的格式),再把它解析成代码能用的东西。

这一步慢、贵,而且格式一歪就解析失败。

JEV 换掉的就是这一步。

它不是更聪明的模型,是更便宜的判断函数。

JEV 是 TypeSafe 公司的 System One 判定模型。它只做一件事:读一段状态,返回一个带概率的类型化答案。它不写文章、不写代码、不解释理由。

先说清这篇的成色:21 个开源项目,我实读了 17 个仓库的原文,另 4 个只看到介绍;我自己那部分是真做过的事,但这条流水线我只出了方案、还没上线

SCENE 01
先分清三件事:生成、判断、执行

现在的 Agent 里,这三件事是混在一起的——笼统地说,都是"问大模型"。

JEV 把它们拆开:

干什么
举例
大模型
生成
写文案、出候选、想方案
JEV
判断
从候选里选、打分、判真假
代码
执行
真正动手、记账、算术

JEV 手里只有三把工具,官方叫三种原语:

01Choice(选择原语,从一组命名选项里选一个,返回每个选项的概率)。不是"你觉得哪个好",是"从这五个里挑一个"——候选是代码给的,不是模型想出来的。
02Score(打分原语,在一个描述清楚的有序档位上给出位置)。不是"这东西好吗",是"在 0 到 4 这五档里,它落在第几档"。
03Noul(判定原语,给一个命题返回"为真"的校准概率)。不是"分析一下",是"这句话是真是假"。

三种答案形状:选中一个 / 定在某一档 / 开或关

生成归大模型,判断归 JEV,执行归代码。

三条原语有一个共同点:只输出类型化答案 + 概率 + 置信度,不生成任何文本。

这句话要念两遍——它替掉的是"让大模型吐 JSON 再解析"这个环节,不是大模型本身。你要写文案、想方案,还是得靠大模型。JEV 只是把那些本来就不该由生成模型负责的微决策,从生成里摘出来。

SCENE 02
它插在流程哪一步:我读到的只有五种位置

把 Agent 的循环摊成一条时间轴,JEV 的介入位置可以归成五种。

位置
一句话
① 分流 Route
循环入口
这件事归谁做、走哪条路、用哪一档模型
② 择一 Choose
循环内每一步
从此刻真实可用的候选里,选一个
③ 过滤 Filter
信息流入处
这条信息还值不值得留在上下文里
④ 判分 Judge
循环旁路
给一件事打分、分级、排序
⑤ 核验 Verify
循环出口
真做完了吗、证据够不够

五个介入位,沿 Agent 循环的时间轴排开

21 个案例里,最值得先动手的还是"每步选一个"——它占了 10 个。

② 最多不是巧合。Agent 里最高频的动作就是"每步选下一步干什么",而它又恰好是"让大模型吐 JSON 再解析"用得最密的地方。你要找一个改造点,从这里开始,命中率最高。

小心五种不是穷举证明。我只能说,我读过的这 21 个项目,全部落在这五格里。换一个项目集会不会冒出第六种,我不知道——任何人告诉你"就这五种",都该被追问一句:你的样本是什么?
SCENE 03
四个真实项目怎么用

每个都按同一个套路看:送什么 → 问什么 → 拿到答案怎么走。

状态进 → 判定 → 答案出:四个案例共用同一条流水线

01jev-ultrafast(② 择一),仓库 browser-use/jev-ultrafast

:当前页面所有真实存在且可交互的元素的编号表([1] button · Change ticket type[2] combobox · Where from?……)
:一次请求,同时问"用哪个操作"和"目标是谁"
:只执行与所选操作匹配的那一个目标;只有操作为"打字"时,才叫小模型写文字

数字上,它报过同一任务的浏览器协议调用从 1092 次降到 101 次、中位耗时从 9.450 秒降到 7.092 秒。它自己注明了:这是同一任务、同一浏览器配置下的重复测量,不是通用可靠性基准

02jev-codex-router(① 分流),仓库 0xNatoshi/jev-codex-router

:各模型的能力先验 + 当前请求 + 最近的助手意图 + 可用的工具结果
:一个 Choice,在 15 个「模型档位 × 推理深度」组合里一次性选定
:合法决策原样执行,即使多个组合很接近;另有影子模式(只记录不生效)和急停开关

它明确拒绝了一堆机械规则:没有关键词规则、没有低置信度回落。它报出的 −60% 是历史模拟,作者自己标注"不是实测节省的配额"——这句必须带上。

03Winnow(③ 过滤),仓库 GhalebDweikat/winnow

:一段工具输出,切成约 25 行一块
:每块一条 Noul——"这段对当前任务还需要吗"
低于 0.1 才隐藏,0.1 到 0.5 之间的一律保留;被隐藏的原文缓存起来,附一个恢复命令

它和"摘要式压缩"的区别是根本性的:摘要会丢东西(一个路径、一条报错、一个约束),筛子不会——只删不改,删错了能捞回来

04Canny(⑤ 核验),仓库 qkal/Canny

:一份证据账本(文件变没变、命令跑没跑、退出码是多少)+ 最后一条消息
:这条消息算不算在"宣称完工"
:算 → 拦;至少 90% 确定不算 → 放行

它的 README 开篇记了一个真实场景:某个编码 Agent 用 shell 写了文件、什么都没跑,然后报告「Done. Skipped tests」。

④ 判分那一型,最好的样本是 monteduro/killmyidea:8 个维度各打 0–4 分,加权平均后给 KILL / FIX / SHIP。它有一个最该抄的设计——清晰度闸门:如果"这段需求能不能被理解"低于 0.3,它不给分也不给结论,只要求补充信息。

把"看不懂"和"不好"分开,是打分系统最容易犯的错。
SCENE 04
真正的门槛不在模型,在把状态整理成证据

JEV 只吃文本 state(状态,喂给判定模型的全部输入)。送进去什么,决定答案对不对。

真正的门槛:从杂乱的一堆里,只挑出少数几条送进去

state 只放证据,不放结论。jev-trader 特意把"自己的仓位"和"上一次的决策"从 state 里删掉——怕模型被自己的持仓带偏。你把结论塞进去,模型只会顺着你的结论走。
一维一题,权重留在代码里。不要问"这个项目怎么样"。拆成八个原子维度分别打分,加权平均由代码算——以后调权重改代码就行,不用重写提示词。
候选必须互斥。typesafe-computer-use 的作者原话大意是:构建过程中每一次卡死,都源于两个含义重叠的选项。置信度衡量的是答案的集中度,选项含义重叠,它必然读作犹豫。
送进去的证据,得你自己重建。大模型能免费做的推理(比如从截图里直接读出日期并比较),判定模型做不到——它需要你把日期解析好、算好差值,再作为事实送进去。
把 state 写成具名字段,别写成一段散文。与其写"用户很着急,订单还出了问题",不如写成带 urgency、order_status 这样的具名 JSON 字段——别让模型先解析你的叙述,才能开始判断。另外,选项后面的说明必须写全:把每个选项"适合什么"讲清楚,并且永远留一个"都不匹配"的选项,别逼它在错的选项里挑一个。
「前沿模型免费做到的每一分推理,在这里都要重建为确定性 state。」
—— typesafe-computer-use 的作者自己写下的一句话
SCENE 05
一条最该抄的纪律

Canny 把它的核心规则写成了一句话,我认为这是整个生态里最值钱的一条:

事实归代码,判断归模型,只有事实能否决。

硬闸门(只有事实能否决)与软阀门(模型只能放宽)

拆开看:文件变了没有、命令跑了没有、退出码是 1 还是 0、正则数得出几个残留标签——这些是事实,代码离线就能判,不需要联网、不需要 API Key(Application Programming Interface Key,应用程序编程接口密钥,调用服务时用来验证身份的凭证)。

这条消息算不算在宣称完工、这句话会不会踩广告法的极限词——这些是判断,交模型。

怎么分?就问三句:

1这件事,代码离线能不能算出来?
2能不能用一句话说成真或假,而且不需要理解上下文?
3答错了,能不能确定地补救回来?

三个都答"能",它就是事实——留在代码里,别交给模型。

关键在最后半句:拦截权归确定性的规则,模型只能让门禁更宽松,不能更严。Canny 自己就是这么钉的——模型唯一能碰门禁的地方是它可以放行。

这样设计的好处是,模型出错的最坏结果是少拦一次,而不是乱拦

SCENE 06
我自己怎么用:拿公众号流水线开刀

上面全是别人的项目。下面是真做过的事——我把跑过的 7 篇文章的返工记录翻出来,9 条真实返工按"事实 / 判断"二分,5 条是事实

幻觉类型
症状
处方
A 事实型
数字、版本、章节数记错
JEV 治不了,只能正文带来源锚点 + 脚本回源核对
B 归属型
把从代码反推的推断,说成作者原话
⑤ 核验,治得最干净
C 取舍型
最硬的证据没进场
③ 过滤,只删不改
先写脚本,再接模型。九条返工里五条是事实——字数、格式、标题关键字、术语位置、配图黑屏。这些全是正则和字数统计能查的。把确定性的事交给模型,是纯亏:花着钱,换来的是概率。
七个环节里,只有五处该给 JEV。排版质检那一格绝不能给——它检查的全是事实。
这篇文章本身就是这么做的。动笔之前,我先建了一份给 JEV 的数据集:22 条待发表的论断、21 个候选案例、5 处大字标语的候选句。跑完之后有三条结果直接改了稿子。
改稿我原本要写"介入位置只有五种"。判定结果是"说过头",我改成"我读到的只有五种",并补了上面那句提醒。
改稿我原本要写"候选是真实节点编号,所以选择器幻觉被结构性地消灭了"。同样判"说过头"——原文只说候选是真实节点,没说幻觉被消灭。我把它改成了事实陈述。
改稿我原本打算把重点案例给一个成本数字最亮的项目。判定说它"重复了已有机制",反而把另一个做过滤的项目判成 0.94 分——我因此换了案例,这篇的五型覆盖才完整。
它没有让文章更有文采,它让文章少说了三句不该说的话。
SCENE 07
你可以在哪里用上

按可行性分三档,从近到远:

01排版母版自动选择。我这儿有两套排版母版,一篇稿子该用哪套,取决于"这是产品向还是叙事向"。这个判断高频、原子、选项封闭(就两个),零风险、当天可验。
02发布前合规质检。但必须分工:残留标签数量、图片是不是 http 地址、字数、标题里有没有 AI——这些全是事实,交代码;只有"这段表述会不会踩极限词"才交模型。
03选题评分卡。抄 killmyidea 的结构,含它的清晰度闸门:选题本身没说清时,不给分,先要求补细节。

反过来,这些别交给它:

反模式
为什么错
把它当"更便宜的 GPT"
它不生成文本,写文案一定失败
一个请求问"这篇写得好不好"
拿到一个无法定位、无法调参的模糊分
让模型决定"要不要拦"
模型出错时乱拦,比不拦更糟
需要算术或日期比较
这是它公认的短板,留在代码里
需要多跳推理或间接指代
减跳数,或直接把 state 里的字段指给它
SCENE 08
收尾

三句话:

它不是更便宜的 GPT。它不生成,只判断。
它只做一维判断。一次一件事,多维的组合逻辑留在代码里。
它的价值是把"我反复改五轮"换成"一次过 + 少量标注"。

三个坑:当便宜 GPT 用、问综合大问题、让模型决定拦不拦。

判断这件事,越早从生成里拆出来,越省钱;但它治不了事实错误——那是代码的活。
附录 A
21 个案例与仓库链接

标 ⭐ 的是我实读过仓库原文并做了拆解的;没标的只看到项目介绍。按介入位置分组。

微信正文里的外链不可点。想访问就复制 github.com/ 再加上表里的仓库名。

项目
一句话
位置
browser-use/jev-ultrafast ⭐
浏览器 Agent,每步选「操作 + 元素」
awlevin/typesafe-computer-use ⭐
桌面操作,每步约 $0.0002
lahfir/agent-desktop ⭐
读无障碍树,风险分级门槛 0.70 / 0.90 / 0.55
fhshaik/typesafe-mario ⭐
不看截图读内存玩马里奥,一次请求三个判断
jexp/neo4jev ⭐
知识图谱逐跳导航,概率做 beam search
ellipsis-dev/blink ⭐
100 个行者走文件树,输出「多少比例落在这里」
vercel-labs/json-render ⭐
生成式 UI,只选组件不写 JSON(未发布)
RomanSlack/jev-drone
无人机,飞控管稳定、模型管上层决定
emrickgarrett/OneVOneJev
浏览器 1v1 FPS,每 tick 一次选择
itsmostafa/typesafe-mcp ⭐
一条命令接进各种 Agent 宿主,随工具下发使用指导
② 底座
tamaratran/fast-jev-compaction ⭐
换掉摘要式压缩,只删不改
GhalebDweikat/winnow ⭐
工具结果进上下文之前逐块筛,不确定一律保留
AkashPriyadarshii/jev-curate ⭐
筛训练数据,1500+ 行/秒,失败关闭式过滤
monteduro/killmyidea ⭐
创业点子 8 维打分,含清晰度闸门
devagrawal09/jev-review ⭐
五段判断链,先选证据再评严重度
④⑤
jarrodwatts/jev-trader ⭐
每区块一次决策,300ms 预算只留 2 次 RPC
irfndi/prism-liquidity-agent
只判断市场状态,不直接下单
sharziki/semdecide ⭐
把判断做成 Unix 命令,「不确定」有自己的退出码
③④⑤
qkal/Canny ⭐
防 Agent 谎报完工,只有事实能否决
0xNatoshi/jev-codex-router ⭐
每轮判难度,决定模型档位 × 推理深度
jkudish/jev-mcp
现成的 Agent 判断工具箱
①–⑤

另有 harshwasan/pi-jev-sentinel(入口守卫 + 前置脱敏 + 失败关闭),不在原始清单里,但值得单独看。

附录 B
术语速查表
术语
全称
中文 / 在本篇里指什么
AI
Artificial Intelligence
人工智能,让机器完成需要人判断的任务
Agent
Intelligent Agent
智能体,能自己决定下一步做什么的程序
JEV
TypeSafe 的 System One 判定模型,只输出类型化判断与概率,不生成文本
LLM
Large Language Model
大语言模型,靠海量文本训练出来、能续写文字的模型
JSON
JavaScript Object Notation
JavaScript 对象表示法,一种用文本表示结构化数据的格式
state
状态,喂给判定模型的全部输入
Choice
选择原语,从命名选项里选一个,返回每个选项的概率
Score
打分原语,在一个描述清楚的有序档位上给出位置
Noul
判定原语,给一个命题返回"为真"的校准概率
API
Application Programming Interface
应用程序编程接口,程序之间互相调用的通道
API Key
Application Programming Interface Key
接口密钥,调用服务时用来验证身份的凭证
README
Read Me
项目自述文件,作者写给使用者的说明书
RPC
Remote Procedure Call
远程过程调用,像调本地函数一样调远端服务
MCP
Model Context Protocol
模型上下文协议,让 Agent 挂载外部工具的通用接口
OCR
Optical Character Recognition
光学字符识别,把图片里的文字读成可编辑文本
OUTRO
聊两句

这篇里的东西,一半是读别人代码读出来的,一半是我自己流水线上真踩的坑,肯定不是最优解。

如果你也在做 Agent 或者 AI 内容——路由、上下文压缩、质检、打分——欢迎在评论区说说你卡在哪一步。"模型不够聪明"只是表象,底下的该不该让模型决定每家都不一样,你的情况可能比我的更有意思。

如果你想让 AI 判断层落到自己的业务流程里,或者想先把那部分"其实该用代码写的检查"补齐,也可以直接联系我。这种事聊开了才有答案,欢迎找我一探究竟。

ABOUT
聂无双
AI 的信徒

信的不是 AI 有多强,是一个普通人用 AI 能把手伸多远。

FOLLOW

扫码关注「青山杂谈二三事」

一个普通人用 AI 做内容的真实记录。不吹不黑,踩过的坑都写下来。

NEXT EPISODE

这一篇讲的是判断层该插在哪、以及我落地方案的思路。

下一篇我把第 0 步做出来:写一份能跑的质检脚本,把"事实"从稿子里全部扫一遍,看它当年漏掉了多少。

成色与边界

一手实践(我做的):公众号流水线的 7 篇返工复盘、三型幻觉的划分、这张五型地图的整理方式,以及"先写脚本再接模型"这个结论。文中提到的我那套流水线改造方案,只出了方案、没有上线,相关推论请按"待验证"读。

整理 + 推演(别人的):21 个案例与五型地图,来自对第三方仓库原文的阅读和一条社交媒体帖子的整理。其中 17 个我实读了仓库原文;jkudish/jev-mcp、RomanSlack/jev-drone、emrickgarrett/OneVOneJev、irfndi/prism-liquidity-agent 只看到项目介绍,没有读到原文,附录 A 里已用未标 ⭐ 区分。文中所有成本、延迟、比例等数字,除官方定价外全部来自各项目作者自测,没有第三方复现;jev-codex-router 的 −60% 作者自己标注为"历史模拟,不是实测节省的配额"。

关于文中的判定结果:我对 JEV 的判断是用一份自建数据集跑出来的(22 条论断核验 + 21 个案例分诊 + 标题与标语选择 + 成稿逐节判分),原始输入输出都留了档。但要说清:证据文本是我准备的,它只能判断"论断有没有超出我给的证据",判断不了"我把证据截得对不对"

平台提醒:各平台的界面与规则会变,以你操作时看到的为准。

版权:本文原创,转载请注明出处。© 2026 聂无双 · 青山杂谈二三事

相关学习资料