夜雨聆风学习资料网

ARTICLE · 1081991

Jev 和 Laya:AI 不再"说话",只做判断 -- System One 模型的应用与替代

Jev 和 Laya:AI 不再"说话",只做判断 -- System One 模型的应用与替代

引言

九月中旬,一个"不会聊天、不会写代码"的 AI 模型在开发者圈子里爆火——原帖 3700 多万浏览量,Vercel、Cloudflare、LangChain 三天内全部接入。它叫 Jev,来自 OpenAI 前研究员 Diogo Almeida 创办的 TypeSafe AI。

它的特别之处只有一句话:一个字都不说,只做判断。

你给它一段文本和一组预设选项,它只返回结论和概率:"这条邮件属于 billing 类,置信度 0.93"、"要不要转人工?yes,0.71"。没有 markdown,没有"希望这有帮助",没有 JSON 解析失败。

随之而来的是开源平替 Laya——421M 参数,Apache 2.0 协议,一次前向 33 毫秒,比 Jev 快 4 倍。本文讲清楚这类"System One 模型"是什么、能用在哪、怎么自己部署一个,以及它们的替代方案。


一、什么是 System One Model

1.1 快思考与慢思考

心理学家卡尼曼在《思考,快与慢》里把人的认知分成两套系统:

系统
特点
对应能力
System 1
快速、直觉、并行、几乎无成本
识别、分类、判断"是什么"
System 2
慢速、推理、串行、高耗能
规划、创作、解决"怎么办"

当前的 LLM(GPT、Claude、Qwen、DeepSeek)全部沿着 System 2 演化:写得更长、推得更深、思考更多 token。但你的 智能体里 90% 的决策点根本不需要"想"——调哪个工具、这条命令危不危险、这个工单分给谁、要不要重试。

这些决策点过去全丢给聊天模型,等于花作家的钱,雇了个文书员。

1.2 Jev 的三类原语

Jev 砍掉了全部文本生成能力,只保留三个判断原语:

原语
功能
示例
**Choice**
从候选列表里挑一个(最多 255 个)
"这封邮件属于哪类?" → billing (0.93)
**Score**
在有序量表上打分
"这段代码的严重程度" → 7.3/10
**Noul**
判断一个命题成立的概率
"需要人工介入吗?" → P(yes)=0.71

你可以把它理解成一个带概率校准的语义逻辑门:输入非结构化文本 + 限定答案类型的问题,输出决策结果 + 置信度,交给代码继续执行。

1.3 为什么快、为什么便宜

传统 LLM 回答"A"也要逐 token 生成,还要花大量 token 解释理由(或者烧在思考链上)。Jev 是非自回归架构:一次前向传播直接输出全部判断结果,同一个输入里的多个独立问题还能并行处理。

省掉"把答案写出来"这一步后:

  • 端到端响应 70~500 毫秒,比前沿模型快 20~200 倍
  • 便宜 40~400 倍
  • 输出 token 永久免费(因为压根没有输出 token),输入每百万 token 仅 $0.042
  • 一万次日决策的账单对比:Jev 约 $120/月,同准确率的前沿模型约 $35,000/月

1.4 训练方法:RLCD

Jev 用了一种新训练范式 RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)。与 RLHF(奖励人类偏好的回答)、RLVR(奖励可验证的正确结果)不同,RLCD 优化的目标是让模型输出的概率值匹配真实发生频率——标 0.2 的事就约 20% 发生,标 1 就是几乎必然。

这一步决定了置信度数字有实际工程价值:你可以拿 0.9 当自动化阈值、0.5 以下进人工队列,而不是看着一个不知道含义的数字发呆。

关于"零幻觉":官方说法有水分。Jev 保证的是类型正确——给 A/B/C 三个选项,它绝不会编出 D。但正确答案是 A 它照样可能选 B。所以准确说是"零格式幻觉,不保证事实正确"。


二、应用场景:哪里该用,哪里别碰

2.1 五个已验证的真实用法

① 收件箱/工单第一道分拣

实测 8 封混合邮件,类型分类 8/8 全对。价值不在替代人,在于把一千封信按类型摞成八摞,人只看其中两摞。配合概率阈值:0.9 以上自动归档,以下进人工待看。

② 智能体的安全闸门(最被看好的用法)

每条要执行的命令、每个要跳的 URL,先过一遍"危不危险"。实测风险判断 7/8,延迟 12 毫秒——挂在 智能体 前面几乎无感。原来用大模型当安全分类器的(比如 Vercel 的 fx 自动模式,原用 GPT-5.6 Luna),换 Jev 后快 5~18 倍且准确率更高。Hermes 的命令审批系统、tirith 安全扫描这类场景天然匹配。

③ 内容批量打标

几千条文本按主题归类,逐条问大模型太贵。决策模型几毫秒一条,开源版自己部署零成本。

④ 大数据集前置过滤

十万条工单找"疑似违规",先粗筛,概率 > 0.8 的挑出来人工核。宁可漏几个,比全人工快百倍。

⑤ 模型路由 + LLM 验收员

  • 路由
    :先让 Jev 判断请求难度,简单任务走快模型,难题才请昂贵的推理模型。这就是模型路由层的"智能调度"升级版
  • 验收
    :智能体 宣称任务完成后,用 Jev 低成本复核一遍结果对不对——System 2 干活,System 1 验收,两种模型的巧妙组合

2.2 四个已踩实的坑

坑
实测数据
原因
**别让它排优先级**
四档优先级 8 封只对 4,全往中间塞
识别有客观特征,分级需要权衡
**别让它决定"要不要人介入"**
非题 8 对 3,倾向于什么都管
同上
**选项别超过 10 个**
26 个选项时 24 个概率是 0.0,对错误答案置信度 0.9999
不是不确定,是非常确定地答错
**问题语言要和正文一致**
中文正文配英文问题,准确率断崖下跌
跨语言对齐能力弱

另有一条铁律:低置信度可以当信号,高置信度不能当保证——实测有置信度 0.9779 依然选错的案例(把钓鱼跳转判成"安全导航")。

一句话总结能力边界:它做"这是什么"(识别),不做"该拿它怎么办"(权衡)。


三、开源替代:Laya 与 Nimble

Jev 闭源且接口在别人服务器上,开源社区很快给了两个平替。

3.1 Laya:421M 参数的原生决策模型

维度
Laya
说明
协议
Apache 2.0
商用无忧
参数量
421M
CPU 都能跑
速度
一次前向 33ms,热请求 11~13ms
比 Jev 快 4 倍
部署
权重在 HuggingFace(含 GGUF/MLX/CoreML/ONNX 版本),PyPI 一条命令
`pip install laya`
训练
同样是 RLCD(强化学习 + 严格适当评分规则)
置信度可校准
原语
choice / score / noul 三种
与 Jev 对齐

本地部署两条命令:

Bashpipinstalllayapython-mlayaserve--checkpoint./checkpoints/typed-decisions

模型约 2GB。注意冷启动第一条请求约 400ms(重建路由),接实时链路要么预热、要么常驻内存。

Laya 与 Jev 同源性:两者都是非自回归架构,一次前向出全部答案,都用 RLCD 训练,都支持 choice/score/noul 三种问题类型。

3.2 Nimble:LoRA 微调路线的开源替代

另一个开源项目 Nimble(bespokelabsai)走的是不同路线:基于 Qwen3.5-9B 做 LoRA 微调,模型适配器 Apache 2.0 发布,训练数据和方法全部开源。

训练思路很有意思——让 AI"找不同":构造两份几乎一样的材料,只改一个关键事实,答案正确与否随之翻转。想答对,模型必须抓住真正影响判断的核心信息。

模型
与参考标签一致率
Qwen3.5-9B 基座
66.36%
Nimble(LoRA 微调后)
90.12%
Jev(闭源)
93.21%

Nimble 略逊 Jev,但比基座强很多,且可以装进本地、可以改训练数据。这条路线的启示是:不需要从头训一个新架构,在现有开源 LLM 上做定向 LoRA 也能逼近专业决策模型的效果。

3.3 三者怎么选

场景
推荐
理由
快速验证想法、愿意付费
Jev API
效果最好(93.21%),输出免费
本地部署、数据不出门
Laya
原生架构最快(33ms),2GB 模型 CPU 可跑
已有 Qwen 群、想自己控制训练数据
Nimble
LoRA 路线,数据方法全开源,可迭代
企业内网、合规敏感
Laya 或 Nimble
数据不出本机

四、与 LLM 的分工:不是替代,是编排

最重要的认知:决策模型不是来抢 LLM 饭碗的,是来分工的。

> 聊天模型是笔杆子,决策模型是分拣员。笔杆子你请他写方案,分拣员你请他看一千封信哪封要回。你当然可以逼笔杆子去分信,他只是会一边分一边给你写感想,你还得付稿费。

一个现代智能体的理想结构:

Text用户请求|v[Jev/Laya:路由判断]--简单任务-->[快模型/规则引擎]--结果-->返回||判断为复杂任务v[LLM(System2):推理/生成]|v[执行工具/命令]|v[Jev/Laya:安全闸门]--危险-->拦截+人工审批|安全v[Jev/Laya:结果验收]--不合格-->重试/上报|合格v返回结果

三个决策点(路由、安全、验收)全是高频率、低复杂度判断,全部交给 System One 模型;只有真正需要推理和生成的环节才请 LLM 出场。有意思的对照实验:开发者 Hassan 让 Jev 和 GLM 5.3 下棋,Jev 每步 0.3 秒、成本不到 $0.0001,GLM 5.3 每步 5.8 秒、$0.008——最后 GLM 5.3 赢了。下得快,未必想得深。 但如果比的是"该不该走这一步"而不是"怎么赢",快的那位完胜。

4.1 一个实际的落地案例:Hermes 的结晶引擎思路印证

Hermes 智能体 的结晶反射引擎(四层反射架构 L0-L3,90% 常见请求不过大模型)本质上就是同样的思想:高频经验蒸馏为快速反射规则,L3 才是大模型兜底。Jev/Laya 的出现等于把"反射层"从自建规则升级成了带概率校准的通用判断器——结晶引擎的规则库可以用 Laya 做在线判断,置信度低于阈值自动回落到大模型,两者天然互补。


五、部署实操:十分钟跑起来 Laya

5.1 安装与启动

Bash# 创建环境python-mvenvlaya-env&&sourcelaya-env/bin/activatepipinstalllaya# 启动服务(自动下载 checkpoint)python-mlayaserve--checkpoint./checkpoints/typed-decisions--port8300

5.2 Python 调用示例

PythonfromlayaimportClientclient=Client("http://localhost:8300")# Choice: 从候选里选result=client.choice(context="用户说:这周第三次宕机了,我要退款",options=["billing","retention","close_chat","file_bug"],question="该把这条消息路由给哪个队列?")print(result.answer,result.probability)# → retention 0.68# Score: 打分score=client.score(context="p99 延迟 4.2 秒,错误率 2.1%,三个区域受影响",scale=(0,10),question="这次故障的严重程度?")print(score.value)#7.x(注意:分级类任务建议微调后再用)# Noul: 判断概率prob=client.noul(context="rm -rf /data/tmp/* --force",question="这条命令是否危险?")print(prob.p_true)#0.97

5.3 挂到智能体前当安全闸门(伪代码)

Pythondefguarded_execute(command:str)->str:    # System 1: 快速安全判断(12ms, 成本≈0)risk=client.noul(context=command,question="这条命令是否危险?")ifrisk.p_true>0.85:return"已拦截:高危命令,需人工审批"elifrisk.p_true>0.5:returnhandle_approval_flow(command)#System2:人工/LLM审批    # 低风险,直接执行returnshell.run(command)

六、成本与选型速查表

场景
过去方案
月成本
System One 方案
月成本
降幅
1万次日决策
前沿 LLM API
~$35,000
Jev API
~$120
290x
邮件分类 8 封/批
Gemini
10-20x
Jev/Laya
1x
10-20x
智能体 安全闸门
GPT-5.6 Luna
-
Jev
快5-18x且更准
-
本地批量打标 10万条
LLM API
数百美元
Laya 本地
电费
-

七、总结

1. Jev 的火不是因为它更强,而是它提醒了整个行业:智能体里那些"选择"节点,一直在用最贵的工具干最便宜的活。 2. 决策模型做识别,不做权衡。分类、打标、筛选、安全闸门放心用;优先级排序、是否人工介入、多步规划别碰。 3. 它不是 LLM 的替代品,是 LLM 的前置过滤器。正确的架构是 System 1 挡在前面处理 90% 的快决策,System 2 只处理真正需要深思的 10%。 4. 开源平替已经可用:Laya(原生 421M,33ms)适合本地部署;Nimble(Qwen3.5-9B + LoRA,90.12%)适合想自己控制训练数据的团队。 5. 选择的关键问题只有一个:这件事需要模型"说话"吗? 大部分不需要。


*参考来源:*

  • *量子位《输出token永久免费!Jev爆火后,开源版也跟着火了》 https://zhuanlan.zhihu.com/p/2085035796738879756*
  • *陈文茂《Jev 开源平替模型 Laya 实测》 https://zhuanlan.zhihu.com/p/2085559011349362295*
  • *TypeSafe AI 官方文档 https://docs.typesafe.ai/introduction*
  • *TechCrunch 报道 https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/*
  • *Nimble 开源仓库 https://github.com/bespokelabsai/nimble*

相关学习资料