夜雨聆风学习资料网

ARTICLE · 1097095

比ChatGPT快200倍!这个AI不写文章,只帮软件做决定

比ChatGPT快200倍!这个AI不写文章,只帮软件做决定

最近有个叫Jev AI的东西,挺有意思。

它不聊天,不写文章,也不帮你编代码。它专门干一件事:帮软件做决定。

咱们平时用的ChatGPT、Claude、Gemini,不管多厉害,底子都是“文字接龙”。你给它一段话,它一个词一个词往外蹦,最后生成一段回复。但Jev走的是另一条路——你给它应用程序的状态和几个结构化的问题,它直接返回带概率的决策,软件拿过来就能用。

他们自己总结得挺到位:“非结构化状态进去,类型化概率决策出来。”

说白了,它更像一个给软件用的AI决策接口,而不是一个陪你聊天的机器人。

它到底是干嘛的?

举个例子就清楚了。

假设有个AI客服系统,客户说:“我包裹到了,但是坏了,我要退款。”

普通大模型可能会生成一大段话,告诉客服应该怎么处理。但软件系统真正需要的,可能只是三个判断:

  • 转给哪个队列?——账单
  • 优先级?——高
  • 要不要走退款审核?——要

Jev就是干这个的。它不生成文字让你再去解析,而是直接给出带概率和置信度的结构化决策。

跟普通大模型根本不是一回事

这一点我觉得是最值得说的。Jev不能简单理解成“小号LLM”。

传统大模型是自回归的,一个词一个词往外蹦。生成一串文本之后,你还得解析、验证,最后才能变成软件能用的决定。

Jev是直接冲着结构化决策去的。它可以并行评估多个问题,而不是每个问题都生成一串文本。这种架构上的差别,也是它敢说自己快、便宜的核心原因。

“系统一模型”是什么鬼?

这个名字来自丹尼尔·卡尼曼的《思考,快与慢》。

TypeSafe AI认为,AI应用里的工作分两种。一种需要复杂推理和开放式生成,比如写文章、头脑风暴,这适合传统大模型。另一种就简单多了:

  • 要不要重试?
  • 该调用哪个工具?
  • 这个请求有风险吗?
  • 该给哪个队列?
  • 要不要转人工?
  • 这个回答满足要求吗?

这些都是决策问题。系统一模型,就是专门对付这类问题的。

三种决策,就这么简单

Jev的API围绕类型化问题展开,主要就三类:

第一类,选择。从预设选项里挑一个。比如“这个工单给哪个队列?”选项有账单、技术、物流、人工审核。模型会返回一个结构化选择,外加概率信息。常用于分类、路由、工具选择这些。

第二类,评分。按有序量表打分。比如“这个支持请求有多紧急?1到5分。”常用于风险评估、质量评估、优先级排序。

第三类,布尔,或者叫Noul。就是是/否判断。比如“是否已退款?答案:是。”结果同样带概率。他们管这个叫Noul,本质上就是个二选一。

它还会告诉你“我有多确定”

这一点跟普通LLM API很不一样。Jev的输出是围绕不确定性设计的。

比如,Jev收到一个客户请求后,软件可以设一个阈值:

  • 置信度大于0.90:自动处理
  • 置信度小于0.90:转人工

这样开发者就能明确界定:什么时候信AI,什么时候叫人。他们说自己返回的决策都带校准过的概率和置信度。

最大的不同:并行采样

传统自回归模型是串行的:Token 1,Token 2,Token 3……生成长回答需要一连串操作。

Jev不一样。如果应用程序有多个独立问题:

  • 这个工单紧急吗?
  • 需要升级吗?
  • 该哪个部门处理?
  • 需要退款吗?

Jev可以并行评估这些问题,所有这些决策都能在同一次评估里从同一个状态生成。他们自己说,这种并行采样架构是Jev延迟远低于传统LLM工作流的原因之一。

技术架构和RLCD

TypeSafe AI披露了一些架构原则,但没公开参数数量,也没公开详细的神经网络架构。

他们说Jev主要由三部分组成:新的模型架构、并行采样器,还有一个新的训练方法,叫RLCD,全称是“面向校准决策的强化学习”。

RLCD的重点是产生校准过的决策,而不是像传统聊天LLM那样,主要优化人类偏好的文本回复。

传统指令模型通常用RLHF,就是基于人类反馈的强化学习。这些方法优化的是“有用的回复”或者“可验证的输出”。而RLCD的目标不是“给出人们喜欢的答案”,而是“给出决策,并准确传达模型对这个决策的置信度”。当模型嵌在自动化软件里的时候,这个区别就很重要了。

为什么“类型安全”很重要?

假设你让一个LLM返回:{ "decision": "refund" }。就算你用了结构化输出或者JSON模式,底层模型还是在生成一串Token,最后必须符合某个模式。

Jev的做法不一样。可能的输出是由问题本身定义的。比如选择:退款、换货、人工审核。模型不可能凭空发明一个不在声明结构里的新选项。所以他们管Jev叫“类型安全”,说模式匹配是有保证的,不会出现传统结构化输出里的类型错误。

当然,这不代表Jev永远不会做错决定。它仍然可能选错预定义选项。区别在于,模型的输出始终在软件预期的结构之内。

快,是真快,但别全信

这是Jev比较抓眼球的地方。

他们报告说,在系统一类型的任务上,Jev能达到跟现有前沿LLM相似的智能水平,同时更快、更便宜。

公布的数据是:

  • 端到端响应时间:70到500毫秒
  • 对比前沿LLM的约3到329秒
  • 在工作流评估中,最高提升:193.6倍速度,444.6倍成本优势

不过这些数字看看就好。是他们自家工作流跑出来的,不是随便什么任务都这样。别当成“Jev在所有任务上都比所有LLM快几百倍”的普遍结论。

价格和参数,我扒了一下

Jev的价格确实有点猛。

他们标的是:每百万输入Token 0.042美元,约合每十亿输入Token 42美元。输出Token免费,因为它不生成传统文本。

Vercel的AI Gateway目前列出的Jev价格大约是每百万输入Token 0.04美元。这跟传统推理模型的经济账完全不一样,后者输出往往占总推理成本的一大部分。

至于大家关心的规格参数,目前官方没公开参数数量,也没公开详细神经网络架构。Vercel的模型列表里,上下文窗口那一栏也写着“未指定”。

所以一个靠谱的规格表不应该去编造这些:参数量、层数、隐藏维度、注意力头数、上下文长度、模型权重、训练Token数。这些目前都没公开。

我直接列一下目前已知的信息,方便你扫一眼:

  • 模型:Jev
  • 开发者:TypeSafe AI
  • 模型类别:System One Model
  • 发布:2026年9月15日
  • 可用性:早期访问
  • 主要用途:AI驱动的软件决策
  • 输入:应用程序状态 + 类型化问题
  • 输出:类型化概率决策
  • 决策类型:Choice、Score、Boolean/Noul
  • 采样:并行
  • 训练方法:RLCD
  • 架构:新架构,未公开细节
  • 参数量:未公开
  • 权重:未发布
  • 上下文窗口:未公开
  • 输入定价:0.042美元/百万Token(TypeSafe),约0.04美元/百万Token(Vercel)
  • 输出定价:免费
  • 延迟:70-500毫秒
  • 工作流提升:最高193.6倍速度,444.6倍成本优势
  • 主要应用:分类、路由、评分、验证、护栏、AI智能体决策
  • 模型输出:带概率/置信度的结构化决策
  • 传统文本生成:无
在AI智能体里怎么用?

一个很典型的场景是智能体编排。假设有个AI编程助手,传统LLM可能包揽所有工作:用户提问,LLM推理,选择工具,调用工具,再推理,决定重试还是继续。

但其中很多中间决策并不需要长篇大论的文本生成。Jev可以负责这些:

  • 智能体该重试吗?
  • 该调用另一个工具吗?
  • 该问用户吗?
  • 该停下吗?
  • 该调用哪个子智能体?

大型推理模型继续负责复杂推理,Jev负责快速的 structured decisions。这就形成了一个混合架构:前沿LLM做复杂推理,Jev做快速决策,工具执行动作,最终更新智能体状态。

Vercel特别强调了工具选择、智能体路由、重试/停止决策、风险评分、验证和护栏这些潜在的Jev用例。

它还能验证其他LLM

这可能是最实用的应用之一。

假设一个大LLM生成了一个答案。与其直接返回给用户,另一个系统可以评估:

  • 答案是否得到了提供的上下文支持?
  • 答案安全吗?
  • 是否符合要求的格式?
  • 这个回复应该发给用户吗?
  • 回复是否包含违规内容?

Jev可以充当一个快速的验证层。架构变成:用户,LLM,生成回复,Jev,然后接受、拒绝或者人工审核。这对于生产环境的AI系统尤其有价值,因为可靠性比生成华丽的文本更重要。

跟实时AI的结合

延迟是另一个关键点。

如果一个传统LLM需要几秒钟才能做出决定,在应用程序里反复调用它就会变得又贵又慢。而一个能在几十到几百毫秒内运行的模型,可以支持更具交互性的工作流。

官方把实时应用列为系统一架构的目标用例之一。潜在应用包括:实时路由、欺诈/风险评分、客服自动化、AI智能体控制循环、推荐决策、内容验证、护栏、高并发分类、工作流自动化等等。

它不是来取代GPT、Claude或Gemini的

这一点很重要。

Jev不是为了取代通用LLM来做这些事的:写文章、生成代码、对话AI、创意写作、长篇推理、开放式回答。

它瞄准的是AI技术栈的另一个层面。可以这样理解:

  • LLM:把智能表达成语言
  • Jev:把智能暴露成决策

未来的AI应用可能会两者兼用。LLM负责复杂推理,Jev提供围绕它的快速决策层。

最后聊两句我的看法

Jev最有趣的地方,不光是价格或者延迟。而是这个理念:AI并不总是需要生成文本。

多年来,AI的主流交互界面一直是:提示词进,文本出。

而TypeSafe提出了另一种:状态加问题进,决策加概率出。

这听起来像是个小小的API改动,但在架构上意义挺大。软件天然消费的不是段落,而是:真/假、分数、类别、ID、动作、概率、结构化状态。Jev从一开始就是围绕这些原语设计的。

我现在不会说它能取代谁,但要是真能把决策延迟压到几百毫秒,那在客服路由、风控、智能体控制这些场景里,确实挺有想象空间。

相关学习资料