夜雨聆风学习资料网

ARTICLE · 1041141

Jev:面向软件的快速决策模型

Jev:面向软件的快速决策模型

Jev 是 TypeSafe 推出的 System One 模型,主要做决策判断。它可以给信息分类、对内容评分、筛选资料,或者选择下一步交给哪个工具。输入是文本材料和问题,输出是选择、分数和概率。[1]

我们常用的生成式大语言模型(Large Language Model,LLM)可以写文章、生成代码、解释问题。Jev 不生成这些自由文本,它从应用提供的答案范围中作判断。例如,同样收到一条新闻,LLM 可以写一段分析;Jev 对它进行判断,判断它与公司有多相关、是否值得继续研究。

对比点
常见生成式 LLM
Jev
输入
材料与任务要求
材料、明确的问题、选项或评分标准
做的内容
写作、解释、推理,也可以分类
分类、选择、评分和核验
输出
通常逐个生成 token(文字片段),组成文字或结构化结果
返回选择、分数和概率;同一次请求中的多道题可以并行计算
工作方式
可以生成方案、回复和代码
提供判断结果,由程序继续处理

Jev 的特点在于,它专门面向这类判断设计,省去了生成答案文本的过程。[5]

TypeSafe 将 Jev 描述为利用预训练语言能力、并利用RL后训练对判断任务训练的模型。预训练让模型获得理解语言的基础,后续训练再使它适应不同任务。[13]

模型接口:把自然语言理解变成程序可用的值

Jev 的一次请求包含两部分:state 是待判断的材料与相关事实,questions 定义问题及答案标准。可以把 state 理解成共同阅读的材料,把 questions 理解成针对这份材料提出的不同题目。

例如,state 可以同时包含下面两条信息。这里使用一个虚构例子:

公司情况:我们提供在线会议服务,关注会议记录和团队协作。 
新闻内容:竞品 A 宣布上线 AI 会议摘要,可以自动整理会议待办事项。 

针对这份相同的材料,可以一次提出三道题,分别使用官方提供的三种输出类型:[3]

类型
问什么
答案标准
Choice:选择
这条新闻主要讲什么?
产品更新 / 融资 / 人事变动 / 其他
Score:评分
与我们的业务有多相关?
0=无关,1=间接相关,2=直接相关
Noul:判断是否成立
正文是否提到了竞品推出的新功能?
是 / 否,返回“是”的概率

Choice 返回选中的类别及各选项概率;Score 返回按标准评出的分数及等级分布;Noul 返回 0 到 1 之间的概率。三道题使用同一份材料,第一题看事件类型,第二题比较新闻与公司业务,第三题检查是否出现指定信息。它们不依赖彼此的答案,可以在同一次请求中并行判断。

使用接口时,每道题都要分别写明题目、输出类型和判断标准,再放进同一个 questions 字段。给问题起的名字只是方便程序取结果,具体要判断什么仍要在题目中写清楚。[3]

标签和标准由每次请求定义。同一个模型可以先判断新闻,再选择工具,随后检查某段引文是否支持结论。[4]

Noul 返回 0.5,表示模型对“是”和“否”同样不确定;Score 衡量的是程度。比如“与业务是否相关”返回 0,表示无关。

应用方向:从业务自动化到 Agent 内部判断

TypeSafe 的官方应用地图将主要方向分为五类。它们都可以使用上面的提问方式,只是输入材料和要作出的判断不同。[2]

Jev 的五个应用方向:AI 自动化软件、实时应用、大规模数据处理、核验与检查、Agent 运行框架

AI 自动化软件。 处理客服消息、工单或申请材料时,判断用户想做什么、资料是否齐全、应该交给哪个部门。流程可以提前写好,但用户的表达各不相同,需要模型理解内容。

实时应用。 游戏或交互助手不断把当前状态交给 Jev,让它从可用动作中选择响应。官方 Doom 演示就采用了这种方式,不过它提供的是文本化的游戏状态,画面识别并不由 Jev 完成。[5]

大规模数据处理。 给大量新闻分类、筛选搜索结果、检查程序运行记录,也可以把文本中的特征变成数字。例如“评论是否提到价格”“满意程度是多少”,每条评论都回答同一组问题,就能得到一张可分析的数据表。官方还展示了让 LLM 提出问题、Jev 批量回答,再把结果交给另一个预测模型的做法。[6]

核验与检查。 把一段结论和它引用的原文一起交给 Jev,询问“原文是否支持这句话”。也可以检查另一个模型的回答有没有漏掉要求、准备调用的工具是否符合任务。这些检查可以挑出需要复核的内容,但仍可能漏判或误判。

Agent 运行框架。 Agent 可以理解成能调用工具完成任务的 AI 程序。它需要选择模型、查找合适的技能、决定哪些资料要放进输入。Jev 可以承担这些选择。官方示例先从 182 个技能中筛选候选,再读取前三个的详细信息进行复核,也允许一个都不选。[7]

所有需要决策的应用都可以在适当的时候接入Jev,提供状态和问题定义即可。

效率来源:减少生成、重复输入与串行等待

Jev 的效率优势首先来自输出方式。对于只需要类别、分数或概率的任务,它直接返回判断结果,无须逐个生成组成答案的 token。

同一份 state 还可以供多个问题共同使用。前面的新闻例子中,三道题分开问,就要提交三次材料;放在一次请求里,只需提交一次材料和三道题。模型并行判断,程序分别读取答案。

如果后续处理有不同分支,也可以提前把可能用到的问题一起问完。例如,新闻系统收到“产品更新”后需要检查新功能,收到“融资消息”后需要检查资金用途。只要正文已经提供这些信息,两道题就可以与新闻分类一起提交。类别确定后,由具体的应用程序针对相关的判断进行处理。[8]

只要决策点的输入的状态信息一次,就可以一次请求问完;只有依赖新的数据的时候才需要串行进行询问。[3]

并行和串行的请求价格差异:对同一篇文档提出 13 个问题,单次合并请求平均约 0.27 秒、0.000497 美元;拆成 13 次顺序调用约 2.71 秒、0.006090 美元。[9]

截至 2026 年 9 月 19 日,官方列出的 Jev 1.13 输入价格为每百万 token 0.042 美元,输出不收费。[4] 

Newsjack:把新闻粗筛交给 Jev

让我们从一个开源库里面看Jev的能力。Newsjack 是一个开源公关工作工具集,它让系统拿到新闻线索后,先用 Jev 做第一轮筛选,挑出值得继续处理的内容。[10]

每条线索调用一次,一次问六个问题:保留、观察还是丢弃,原因属于哪一类,是否属于新闻,与业务是否有关,是否为推广内容,以及是否存在风险。每道题都读取同一条线索和公司的相关信息。

具体的执行流程由程序控制,Jev只做决策判断。例如,模型不太确定是否应该丢弃一条线索,代码就把它改成“继续观察”。把相关报道归在一起、核查来源、撰写报告,则继续交给其他组件。

作者报告的一次真实 API 测试,使用 jev-1.13.0 处理 176 条线索,在 8 并发下用时 8.3 秒,估算模型费用约 0.013 美元,单调用延迟中位数约 260 毫秒。[10]

与原先负责筛选的 LLM 相比,Jev 在“保留还是丢弃”上的一致率为 76.7%,低于项目设置的 85% 门槛。也就是说,两个系统对一部分新闻作出了不同选择。但是项目中并没有对准确率做出判断,所以Jev的决策准确率还有待完整评估。(貌似说英文还行,但是中文不咋地)[11]

RLCD:优化概率判断,业务标准仍需设计

TypeSafe 将其训练方法称为 RLCD,即 Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习。它希望模型不仅作出选择,还能给出与实际结果相符的概率。[13]

常见的模型后训练方法还包括从人类反馈中进行强化学习(Reinforcement Learning from Human Feedback,RLHF),以及使用可验证奖励进行强化学习(Reinforcement Learning with Verifiable Rewards,RLVR)。前者常用于让回答更符合人的偏好,后者根据答案等结果是否正确提供奖励。

TypeSafe 创始人 Diogo Almeida 曾参与 InstructGPT 的研究。他在 Jev 发布文章中提出一个问题:语言模型已经很擅长与人交流,为什么大规模自动化仍然没有随之出现?他的判断是,软件中大量需要 AI 的地方,只需要一次分类、选择或评分,因此值得为这些任务专门设计模型。[5]

这也改变了模型的训练目标。按照 TypeSafe 的解释,人觉得满意的回答,未必就是程序可以可靠采用的判断。自动化系统除了需要答案,还需要知道何时应该继续执行、何时应该交给更强的模型或人工处理。因此,Jev 希望通过 RLCD,让输出的概率更好地反映判断的不确定性。[13]

例如,模型对一组新闻都给出“80% 的概率与业务相关”,实际相关的比例就应接近 80%。如果这种对应关系在业务数据上成立,程序就有依据设置自动处理与复核的条件。

能力边界:问题可以变化,判断必须有依据

Jev 可以回答“这几条新闻中,哪些值得研究”,也可以在应用给出的几个计划之间评分。但“为公司设计一套新闻监测方案”还涉及寻找信息源、确定要问什么、安排步骤和生成新方案。整体的执行规划和流程需要外部设计。

官方建议每道题只问一个聚焦判断。把复杂目标拆成什么问题、提供哪些材料,都会影响最后的效果。[3]

Jev 已有公开的工作流评测。TypeSafe 将安全事件处理、Agent 运行记录检查、发票处理和客户服务四类任务,拆成多道 Choice、Noul、Score 问题,再由代码组合答案、决定后续处理。四类任务等权平均后,Jev 的得分约为 67.8%,GPT-5.6 Terra 约为 67.9%,GPT-5.6 Sol 约为 74.1%。在这组测试中,Jev 的平均表现接近 Terra,但不同任务的差异明显:发票处理上,Jev 为 61.8%,Sol 为 79.1%。[17]

Computer Use任务中,对于DOM点击点判断,一些截图需要文字识别或者视觉模型处理的,可以交给Jev,从提供的元素和动作中进行决策,极大提升了Computer Use的效率,而且显著降低了token的消耗成本。[1]

现在Jev还不擅长精确计算、日期比较和多步推理,而且提供的无关对结果的判断影响较大,针对不同题目的答案也可能互相矛盾。[15] 而且它的主要训练语言是英文,其他语言任务需要等后续测试效果(但是看到一个中文demo效果一般)[4] 此外,已经有成熟专用分类器的任务未必适合替换:Parallel 的测试发现,Jev 在部分重排任务上接近其内部系统,但在两类分类任务及每篇文档费用上没有超过专用方案。[16]

实际使用时,可以让 LLM 负责提出方案、生成内容和处理复杂问题,让 Jev 负责已经明确的分类、选择与评分,再由代码连接流程、执行操作和检查结果。新闻筛选以后再生成分析报告,就是这种分工。对判断量大、问题清楚的工作,这样的组合有机会减少成本和等待,同时保留处理复杂任务的能力。

参考资料

1.System One - https://docs.typesafe.ai/concepts/system-one
2.Example use cases - https://docs.typesafe.ai/concepts/use-case-map
3.Primitives - https://docs.typesafe.ai/primitives
4.Models - https://docs.typesafe.ai/models
5.Introducing System One Models & Jev - https://typesafe.ai/blog/introducing-system-one-models-and-jev
6.Autoresearch feature discovery - https://docs.typesafe.ai/cookbooks/autoresearch_feature_discovery
7.Skill suggestion - https://docs.typesafe.ai/cookbooks/skill_suggestion
8.Speculative fan-out - https://docs.typesafe.ai/patterns/fan-out
9.Parallel questions - https://docs.typesafe.ai/cookbooks/parallel_questions
10.Newsjack 接入与测试记录 - https://github.com/elvisun/newsjack/blob/bdb41b8d1f9a9e27221cc86102cbfe1a748fc123/docs/2026-09-18-jev-coarse-filter-plan.md
11.Newsjack 一致性评测说明 - https://github.com/elvisun/newsjack/blob/bdb41b8d1f9a9e27221cc86102cbfe1a748fc123/eval/jev-coarse-agreement/README.md
12.News Desk Dealer - https://github.com/elvisun/newsjack/blob/bdb41b8d1f9a9e27221cc86102cbfe1a748fc123/demos/news-desk-dealer/README.md
13.AI primer - https://docs.typesafe.ai/introduction/machine-learning-primer
14.Confidence - https://docs.typesafe.ai/confidence
15.Jev 1.13 jaggedness - https://docs.typesafe.ai/model-jaggedness/jev-1.13
16.Parallel 的使用测试 - https://parallel.ai/blog/testing-jev
17.TypeSafe 官方工作流评测 - https://evals.typesafe.ai/
18.Learn Jev:成本与评测整理 - https://learnjev.com/tutorials/cost-and-benchmarks

相关学习资料