ARTICLE · 1047746
有些AI工作,先改成一道选择题
让AI“分析这封客户邮件,给出最佳处理方案”,看起来很完整。可写进工作流时,后面的程序可能只想知道:这封邮件该交给谁?缺不缺必要信息?现在能继续,还是需要补问?
不少工作卡在这里:我们给AI出了一道作文题,实际需要的却是几个明确的判断。
一个专门做判断的模型,受到了关注
9月18日,Vercel公布了一项平台数据:Jev上线AI Gateway后的24小时内,已被该平台所统计的近13%付费团队使用。Jev由TypeSafe AI推出,模型最初发布于9月15日,Vercel的接入公告发布于9月16日。这次的新信息是首日使用情况。

图1:Vercel于2026年9月18日发布的首日使用数据,“近13%”是特定平台的付费团队口径。
首日使用还不足以证明客户会长期留下,也不能证明工作效率提高了多少。Vercel这篇文章没有披露付费团队的绝对样本数,阅读这个数字需要保留这层限制。
对设计工作流的人来说,更有用的是看它怎样接活。按TypeSafe官方文档,应用提交上下文和问题后,Jev直接返回受约束的结果:从已给选项中选择、按给定标准评分,或估计某个判断为真的概率。它不负责生成一大段自由文本。
对业务人员来说,这提供了一个有用的观察角度:哪些工作可以先把判断标准写清楚,再交给AI处理?
把“处理一封邮件”拆到能检查
以下用一个假设的客服分流流程说明,不是Jev的实测结果。
假设一家软件公司的客服收到来信:“昨天付款后一直无法登录,今天下午的培训要用。”如果只让AI判断“是否紧急”,模型需要猜测公司的业务标准。换一种问法,先拆开几个问题,结果就容易检查了。
先问主要问题属于哪类:账号访问、账单争议、使用咨询,还是现有分类无法确定。这里的“付款后”提供了背景,不能仅凭出现付款二字,就把邮件送到账单队列。
再单独判断,来信是否明确表示当前无法使用服务。接着识别是否提到了使用期限。若要计算离期限还有多久,就把明确的时间交给程序计算;遇到“下午”却没有日期、时区等必要信息时,流程应要求补充。
最后,由企业事先写好的处理规则决定队列与优先级。例如,“服务不可用且临近约定使用时间”的请求应怎样处理,要由业务负责人定义;AI负责在信中判断相关条件是否成立。
拆开之后,出了错也更容易找原因:是把问题分类错了,还是漏识别了使用障碍,又或是企业根本没有规定这类情况的优先级?继续往提示词里追加“请更专业一些”,解决不了最后一种问题。
这里也有边界。如果客户同时要求修改合同条款、协商赔偿并解释多轮争议,任务可能需要连贯推理和沟通。把它硬压成一个选项,会丢掉必要的信息。
选项写得清楚,AI才知道在判断什么
许多提示词的问题,藏在“重要”“合适”“有风险”这类词里。人看见它们,会带入自己的经验;模型则只能根据上下文推断含义。
以“需要优先处理”为例,合同里约定的响应时间、客户是否已经无法使用产品,以及客户语气是否激动,是不同的维度。企业可以分别识别,再按业务规则决定优先级。把它们揉成一个模糊分数,会让后续解释和调整都变难。
TypeSafe文档同样建议,一个问题只询问一个范围明确的判断,多个因素分别提问,再用程序组合结果。它还提醒,选项覆盖不全时,应加入“其他”或“以上皆非”。

图2:TypeSafe官方文档关于单个问题范围的说明,文档强调把不同判断拆开,再通过代码组合。
我的建议是,把“无法确定”当成一个正常结果来设计。只列出几个看起来常见的选项,遗漏了真实来信可能落在选项之外的情况,系统就容易把一个本该补问的问题,变成一次看似确定的分流。
选择之后的动作也要写清楚。“客户在申请退款”只是对来信意图的判断,不能直接等同于“这笔退款符合条件,且已获得执行授权”。识别、校验和执行,应各自对应明确的依据。
答案规整,判断依然可能出错
Jev的官方资料有一个很有用的补充:它专门列出当前版本的弱项。
9月17日复核的Jev 1.13说明写到,模型在算术、计数、日期比较和多层间接推理上存在困难;无关上下文太多也会降低判断质量。模型文档另称,英语是当前表现最好的语言,中文等非英语任务需要用自己的内容验证。

图3:TypeSafe的Jev 1.13已知弱项页面,本文的中文客服示例用于解释流程。
所以,“只能从A、B、C里选”解决了输出形式的问题,却没有替你验证它选得对不对。模型给出较高置信度,也不保证这一次判断正确。要用自己的业务样本检查:它给出高分时,实际错在什么地方,再决定分数达到什么条件才能继续执行。
TypeSafe的置信度文档也说明,阈值应根据具体领域及任务表现调整。
准备尝试这类方法,可以先拿一批已处理、有复核结论的历史工单,分出用于修改规则的样本,以及不参与调整的检查样本。用同一套固定规则检查后者,看看最容易漏掉什么,多少来信被误分到其他队列,以及人工返工是否减少。
选一项具体工作开始,比一次接管整个客服流程更容易判断效果。即便暂时不接入Jev,把问题改写成可检查的判断,也能帮助团队看清:哪些标准已经一致,哪些标准只是没有说出口的个人经验。
明天给AI写提示词前,可以先把一句“请帮我处理好”改成一个同事能够独立回答、答案能被另一位同事核查的问题。如果人都对选项的含义争论不休,团队还有一段规则需要先说明白。