ARTICLE · 1027103
AI终于不聊天了,下一步它要钻进软件后台
AI终于不聊天了,下一步它要钻进软件后台最近有家 AI 公司,刚结束两年隐身,拿了一笔 4000 万美元的种子轮融资。这个数在 AI 圈不算很大,但它发的第一个模型卖点特别怪。 这个模型不会聊天。 你问它问题,它不搭理你。你让它写篇文章,它一个字都吐不出来。它甚至没法像 ChatGPT 那样,顺着你的话往下接。它只干一件事,在你事先给好的一堆选项里,挑一个,然后告诉你,它有几成把握。 这家公司叫 TypeSafe,模型叫 Jev。创始人 Diogo Almeida,前 OpenAI 研究员,ChatGPT 背后那套关键技术 RLHF 和 InstructGPT 的共同发明人之一。 他写过一句话,说模型在聊天这件事上,早就超过人类了,那自动化去哪儿了?这是他过去四年一直追问的问题。 他还有一句说得更直白。我花了好几年,做的就是让 AI 更会跟人打交道的模型。但如果 AI 要真正改变工作方式,人就不能是智能唯一的消费者。大部分智能,最终应该活在软件里,在后台安安静静地跑。 这家公司的口号也很有意思,Build prod, not God,大意是,我们造的是生产环境,不是神。 它到底是什么?过去我们怎么用 AI,几乎所有人都熟。打开 ChatGPT 或者元宝、豆包 ,敲一句话,它回你一段文字,你把这段文字读一遍,再决定怎么放进工作里。人始终站在中间,模型负责把话说漂亮,人负责把话说进流程里。 Jev 走的是另一条路。它接的是一份工单、一条订单记录,或者一截日志、一段文档,吐出来的是程序能直接用的东西,比如这个工单该转给哪个部门、这笔订单风险有多高,还有这条内容要不要拦下来。前面是给人看的,后面是给软件看的。 用他们自己的说法,Jev 像一个前沿智能的函数调用,乱七八糟的状态塞进去,带类型的概率决策吐出来。 这里有个词得解释一下,类型。写程序的人都知道,类型就是给数据划边界,整数就是整数,字符串就是字符串,不能乱来。Jev 的输出从格式上被卡死了,它只能在你给的范围里选,没法凭空编一个新选项出来。这跟 ChatGPT 不一样,ChatGPT 想输出啥输出啥,格式对不对得靠后面再解析。 所以你看,它压根不产文字,聊天这个功能从一开始就没给装上。 他非要放弃聊天,还有个更硬的理由。现在这些大模型,是靠人给答案打分一点点训出来的,这套方法把模型训得特别会说话,但也顺手训出了两个毛病,一是自信得过头,二是时不时胡编。搁在客服聊天里,这些毛病有人兜着,问题不大。可你要是把它塞进一条每秒跑几百次的自动化流水线,一个自信过头的错误判断,就是白花花的损失。所以你看,聊天这条路走到头,AI 还是离不开人。 聊到这,可能有人要问了,那这东西到底能拿来干嘛? 你想想你公司里那些天天在跑的判断。一封客服邮件来了,转给售后还是转给销售。一张发票进来,跟订单对得上还是对不上。一个 Agent 干完活,它这步做得对不对。这些事,其实全是一堆小的判断。 普通代码很擅长处理规则清楚的判断,金额大于一万就走人工,小于一万就自动过。可现实里大量判断是糊的。这封邮件是生气还是着急,这条评论是正常吐槽还是在引战,这张发票的品类写得规不规范。规则写不全,写死了又容易错。 那就上大模型呗。大模型能读懂,问题是它慢,它贵,而且它回你一大段话,你还得想办法把那段话变成程序能用的数。为了一个 yes or no 的判断,让模型先写篇小作文,怎么想都不划算。 Jev 想填的就是这条缝隙。规则写不全、大模型又太重的那些判断,交给它。它像一个受约束的判断节点,只做选择题和打分,做完把概率一起给你,代码拿到概率,自己决定是直接执行还是升级给人。 这里插一句它挺有意思的事,它这个模型类别叫 System One,借的是心理学家卡尼曼《思考,快与慢》里的说法,System 1 是快思考,那种不用想、瞬间的反应,System 2 是慢思考,坐下来慢慢推理。现在的大模型更像在模拟慢思考,一句话想半天,Jev 专做快思考那类瞬间决策。当然这个 System One 是他们自家的命名,不是行业里的通用标准。 客服工单路由、发票和订单审核,Agent 输出的质检、模型路由,内容安全判断、海量文档分类,这些场景都能对上。但这些还都是设想里的场景,TypeSafe 刚发布没几天,早期访问还是排队制,它们还没被大规模验证过,不要当成已经跑通的客户案例。 这就要说到大模型干活的方式了。一般大模型,是一个词一个词往外蹦的,蹦完一个再算下一个,前后有依赖,所以慢,而且输出越贵。Jev 不做这个,它不生成句子,所有的输出在一次计算里并行出来,你要问一百个问题,它一次性把一百个答案的概率都给你。 官方给的口径是这样的,端到端延迟在 70 到 500 毫秒,针对它说的那类工作负载,比前沿大模型快 20 到 200 倍,便宜 40 到 400 倍。价格也摆在明面上,输入每百万 token 是 0.042 美元,输出直接免费,官方说便宜到懒得计费。拿它跟顶配的 Fable 5.1 比,输入价格能低 238 倍。官网首页还挂着两个更具体的数,193.6 倍更快、444.6 倍更便宜。 这两个数是特定评测里跑出来的结果,官方自己在发布文里也承认,这属于实际收益的上限端,不能当成保证。而且那套评测是他们自己团队做的,参考答案用的是 GPT-6 Astra 和 Fable 5.1 两个模型答案的平均,等于拿最聪明最贵的大模型当标尺。有没有偏向,得等第三方独立复现。 官方还放了个演示,让 Jev 玩 Doom (毁灭战士,第一人称射击(FPS)游戏)。喂给它的是整理成结构化数据的游戏状态,不是像素画面,让它实时做决策,一秒十次查询,成本折下来大概一小时七美元。看着挺不错,也确实是发布当天传得最广的东西。 不过 The Register 那边补了一刀,说 Jev 自称没有幻觉,这个比较其实不公平,因为它压根不输出自然语言,你拿一个不做文本生成的东西去比文本生成的幻觉率,意义有限。 所以别误会,Jev 不是来干掉传统大模型的。 更可能的位置是这样:一个请求进来,Jev 先判断它的意图和风险,代码根据这个判断决定调哪个模型或者哪个工具,大模型把结果生成出来,Jev 再回头检查一遍合不合规,最后代码拍板,是执行、拦截,还是升级给真人。 判断、权限和执行,三样东西拆开了。ChatGPT 干的是中间生成那一环,Jev 干的是前后判断那一环。它更像一个潜在的后台组件,而不是一个拿来陪你聊天的产品。 社区里有个人说得挺损,说 Jev 不会取代 GPT 和 Claude,它就是个特别聪明的 switch 语句,等于把 2016 年的分类器,喂到了 2026 年的智力水平。 这话是调侃,但方向没大错。switch 语句就是程序里那套 if 就怎样、否则怎样的判断。说它聪明,是因为它靠的是真读懂了语义再判断,不是手写的死规则。说它是 switch,是因为它的活就是判断,不生产内容。 说实话,第一遍读那个发布文,我也没完全看懂。这些词一个个拆开才顺过来,所以我才花心思把它们讲得这么啰嗦。 发布文里最抓眼球的一个词,是零幻觉。说 Jev 可以做到不幻觉。 零幻觉?这不吹牛呢吗。 先别急着下结论,这三个字其实经不起仔细看,但也不全是吹牛。掰开了讲,是三回事。 第一,类型安全不等于判断正确。Jev 的输出格式是数学上保证对的,它不会编出一个不存在的字段,也不会吐一个非法的类型。但格式对,不代表选的选项对。官方自己也承认,它仍然可能选错类别,只是不会凭空造字段。 第二,校准概率不等于事实真相。它每个答案都带一个置信度,说这件事有九成把握。这个置信度靠不靠谱,得在具体任务、真实数据上验证。模型说九成,是不是真的十次对九次,这是另一码事。 第三,特定任务上的速度,不等于所有工作流都快 200 倍。前面说过,那个倍数是特定评测的上限端。 还有几个质疑,我觉得值得摆出来,发布时没有独立的第三方评测,没有论文,也没有可复现的权重,外面的实验室没法自己跑一遍。官方还明确说,他们故意不发公开 跑分的成绩,有人揪着这句问,说要是分数好看,他们会不发吗? 这些都不是要一棒子打死。其实,官方在发布文里那些罕见的坦诚,反而让我对这家公司多了点好感。他们主动说了这个速度是在西海岸的笔记本上跑的,说了定价没法证明没有折扣,说了评测可能有偏差,这种提前打预防针的做法在这个圈子里真不多见。 最后落到一个更实际的问题上。真要把它接进自己的业务,该看什么。 几个问题可以先问自己。这活儿是不是高频,边界是不是清楚,错一次的代价有多大,手上有没有历史数据能验证,置信度低的时候谁来接手,权限和审计由谁管,每次出错能不能追溯。 这几条,比宣传页上那些倍数重要得多。 我的判断是这样,Jev 最可能适合的,是那种规则写不全、上大模型又显得太重的判断任务。它不该在没有验证、没有兜底的情况下,直接接管高风险的审批,也不能替代那些需要解释、协商和生成内容的任务。 Every 的头号评测人 Mike Taylor 做了个挺有意思的实验。他把自己写的 27 篇文章,加上 10 篇故意用 AI 味写出来的对照,一共 37 篇,一次喂给 Jev,同时问 21 个问题,检查有没有 AI 写作的痕迹。结果 0.7 秒跑完,出了 777 个判断,成本大概四分之一美分。他还提到 Every 的老板 Dan Shipper 另测过一版,Jev 每篇中位 0.35 秒,Fable 5.1 要 8.83 秒,快 25 倍,成本低 580 倍,但 Jev 抓到了七个故意埋的缺陷里的六个,Fable 全抓到了。 快是真快,便宜是真便宜,但也确实会漏,这就是它现在真实的样子。 说回开头那个问题,一个不会聊天的模型,凭什么叫前沿。 我觉得它最有意思的地方,是逼着我们去想一件事,我们是不是把 AI 想窄了。 过去这几年,大家默认 AI 越像人,就离未来越近。会聊天、会写,还会安慰你,这些全都指向同一个方向,把机器做得越来越像人。Jev 提出了另一种可能,AI 可以不跟人说话,只在软件深处安安静静地做一堆小判断。 这让我想到它名字的由来。Jev 取自一个经济学家,威廉·杰文斯。他有个著名的悖论,蒸汽机效率提高了,煤炭消耗反而更多了,因为效率一高,大家就更大手大脚地用。TypeSafe 赌的是同一件事,智能的成本每降一个数量级,被解锁的用例就多一个数量级。 还有个更贴的类比。早期工厂把蒸汽机换成电动机,厂房格局一点没变,还是一个大马达带一屋子机器。真正的变化发生在几十年后,电动机小到能塞进每个工位,整条生产线的设计才被彻底重写。TypeSafe 想把 AI 做成那个小马达,而不是坐在车间正中间的大助手。 这个判断能不能成,现在谁也说不好。Jev 还没证明自己是新的前沿智能,它甚至还没拿出一个独立评测。但它提出的这个问题,值得盯着,下一场竞争,也许不只是比谁更会聊天,也在比谁能把智能更便宜、更稳地,接进真实世界的流程里。 那个不会聊天的模型,说不定才是第一个真正为软件而生的大脑。 以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。