ARTICLE · 1067958
最近爆火的那个AI,一句话都不会说
最近爆火的那个AI,一句话都不会说
AI圈最近火了一个很奇怪的模型。 它不聊天,不写代码,不写文案,不画图,也不解释。 你问它什么,它一个字都不生成。 它只做一件事——判断。 这个模型叫Jev,来自一家叫TypeSafe AI的创业公司。 创始人是Diogo Almeida,前OpenAI研究员,GPT-4论文的共同作者之一。 公司潜行研发了两年,出来的时候带着4000万美元种子轮。 上线几天,从Hacker News到中文社区,所有人都在讨论它。 不是因为它有多聪明,而是因为它太反常了。 一个不会说话的AI,居然能火。 这事本身就够反常的。 一 先说说Jev到底是个什么东西。 它给自己起了个名字叫「系统一模型」。 这个名字来自卡尼曼的那本《思考,快与慢》——系统一是直觉判断,不过脑子直接出结果;系统二是慢思考,一步步推理。 Jev的逻辑是这样的: 过去这些年,所有人都在做「系统二」模型——会思考、会写长文、会解释、会一步步推理。 ChatGPT是这样,Claude是这样,几乎所有大模型都是这样。 但软件里真正需要的判断,大多数是「系统一」级别的。 你不需要AI给你写八百字小作文,你就需要它给个准话。 举个例子。 一封邮件过来,你需要知道:这是垃圾邮件吗? 你不需要AI分析半天这封邮件为什么是垃圾邮件,你只需要它告诉你——是,或者不是,有几成把握。 再举个例子。 一条用户消息过来,你需要知道:该转给哪个部门? 你不需要AI帮你写回复,你只需要它从五个选项里选一个。 再再举个例子。 一段程序日志跳出来,你需要知道:这个报错严重吗? 你不需要AI给你讲这个错误的原理,你只需要它在1到10的刻度上给个分。 这些判断,以前要么靠人来做,要么靠写死的规则。 靠人做,太慢太贵。 靠规则,太笨太僵化。 Jev就专门干这个。 它只会答三种题: Choice:从最多255个选项里选一个 Score:在2到10级的刻度上给分 Noul:给出0到1之间的是/否概率 三种题可以混着问,并行算,问一个和问四个,延迟几乎一样。 它不解释,不啰嗦,不给你扯没用的。 直接给数,给完就走。 二 Jev有几个特点,挺有意思的。 第一个,快。 普通大模型是一个字一个字往外蹦,生成多久取决于要写多长。 写一百个字和写一万个字,耗时差远了。 Jev不一样。 它不写字,答案的范围事先就定死了,算一遍每个选项的概率就完事。 官方数字是端到端响应70到500毫秒。 什么概念?一眨眼的功夫。 你还没反应过来,它已经算完了。 第二个,便宜。 有多便宜? 输入每百万token 0.042美元,输出免费。 单次判断的成本,压到了万分之一美元的量级。 万分之一美元是什么概念? 人民币不到一分钱。 以前你觉得「这么小的判断也值得调用一次AI?太浪费了」,现在Jev告诉你——值得,非常值得。 这就引出了一个很有意思的概念,叫「杰文斯悖论」。 Jev这个名字,就是从这儿来的。 杰文斯悖论说的是——蒸汽机效率提高了,每吨煤更便宜了,结果煤炭的总消耗反而涨了,因为便宜的动力被用到了更多地方。 放在AI身上也是一样。 以前AI太贵了,只有重要的问题才值得调用。 现在Jev把单次判断压到了几乎免费,结果就是——调用量会爆炸式增长,因为你可以把AI用到所有以前觉得「不值得」的地方。 以前一封邮件,你不会花几分钱让AI判断是不是垃圾邮件。 现在一次判断不到一分钱,你不仅要判断是不是垃圾邮件,还要判断优先级、分类、情绪、该转给谁……一道题变成了十道题。 越便宜,用得越多。 用得越多,总量越大。 这就是Jev赌的方向。 第三个,没有幻觉。 等等,AI怎么可能没有幻觉? 别急,它的「零幻觉」是有前提的。 它绝对不会给出你选项之外的答案,绝不会拼错字段,绝不会胡说八道一些不存在的东西。 因为它只能从你给的选项里选。 当然,它可能选错。 但它不会「编」。 这一点非常重要。 很多企业不敢用AI,就是怕AI胡说八道,怕它编造事实,怕它输出不可控的内容。 Jev把输出限制在固定选项里,从根本上解决了这个问题。 你给它255个选项,它就只会在这255个里面选。 多一个都不会有。 【广告位】 三 那Jev具体能用在什么地方? 说几个已经有人在用的场景,你感受一下。 微信消息自动处理。 这个是国内开发者最先想到的。 微信里每天那么多消息,哪些需要回、哪些可以忽略、哪些该转给同事、哪些是垃圾广告……以前全靠人手动筛。 现在把Jev接上,让它给每条消息打标签、分级、分类。 它不会替你回复,但它能帮你把信息整理好,你只需要处理最重要的那几条。 工单系统自动分诊。 客服每天收到几百张工单,第一步就是分类——这个问题归哪个部门?是技术问题还是财务问题?是bug还是功能请求?优先级高不高? 以前靠一线客服手动分,慢,而且容易错。 Jev来做,几毫秒一张,准确率不比人差,成本几乎可以忽略。 代码审查辅助。 每次提交代码,让Jev先过一遍——这段代码有没有明显的安全问题?有没有常见的bug?需不需要让人重点看一下? 它不能替代代码审查,但它能帮你把最明显的问题先筛出来,节省工程师的时间。 内容风控。 用户发一条评论,让Jev判断——有没有违规?是哪一类违规?严重程度几级? 以前要么靠关键词匹配(太笨),要么调大模型(太贵太慢)。 Jev的速度和成本,刚好卡在中间,刚好够用。 还有邮件分类、数据标注质量检查、异常检测、推荐排序重排…… 只要是「判断」类的问题,理论上它都能干。 而且越频繁、越琐碎、越怕说错话的场景,它就越合适。 四 说到这里,可能有人会问——Jev会不会取代大模型? 不会。完全不会。 Jev和ChatGPT、Claude这些大模型,根本就不是一类东西。 它们解决的是完全不同的问题。 大模型是「通才」——什么都能干,什么都能聊,什么都能生成,但贵、慢、有时候胡说八道。 Jev是「专才」——只会做判断,别的一概不会,但快、便宜、输出可控。 正确的用法,不是二选一,而是搭配着用。 比如,你有一个复杂的业务问题。 先让大模型帮你想清楚——判断规则应该怎么定、有哪些维度、每个维度的选项是什么。 等规则定好了,再让Jev在生产环境里高频、低价、稳定地执行。 大模型负责「制定规则」,Jev负责「执行规则」。 大模型负责「思考」,Jev负责「判断」。 大模型做系统二,Jev做系统一。 一个动脑,一个动手。 配在一起,刚好。 其实这个思路,跟人类大脑的工作方式挺像的。 我们的大脑也是这样——简单的、重复的、熟悉的判断,交给直觉系统,快但容易出错。 复杂的、陌生的、重要的问题,交给理性系统,慢但更准确。 以前的AI,只有理性系统。 现在Jev补上了直觉系统这一块。 这可能才是它真正的意义——不是取代大模型,而是让AI的能力栈变得更完整了。 五 最后聊聊Jev爆火这件事本身。 为什么一个不会说话的模型,能引起这么大的关注? 我觉得,是因为它戳中了行业里一个大家都隐约感觉到、但没人说破的问题—— 我们真的需要那么多会说话的AI吗? 这两年,所有AI公司都在比——谁生成的文字更流畅,谁画的图更逼真,谁做的视频更像真人。 大家都在往「更像人」的方向卷。 但Jev告诉我们—— 不是所有AI都需要像人一样说话。 不是所有场景都需要长篇大论的解释。 很多时候,你只需要一个结果,一个数字,一个判断。 越快越好,越便宜越好,越准越好。 AI不一定要会聊天。 AI不一定要有「人格」。 AI不一定要能跟你做朋友。 很多AI,安安静静地在后台干活,不出声,不抢镜,把事情办明白就行。 就像你公司里那些沉默寡言但办事靠谱的同事。 你可能跟他们没什么话说,但你知道,有他们在,事情就不会出问题。 以后的AI世界,可能不是一个超级AI包揽所有事情。 而是成千上万的「哑巴AI」,在各个地方默默做着判断。 它们不说话,你甚至感觉不到它们的存在。 但你的邮件被它们分拣过,你的评论被它们审核过,你的订单被它们处理过,你看到的推荐被它们排过序。 它们无处不在,但又悄无声息。 这可能才是AI真正融入生活的样子。 不是一个无所不能的机器人站在你面前跟你聊天。 而是无数看不见的小判断,在后台默默运行,让整个世界转得更顺畅一点。 参考资料: 36氪《最火哑巴模型Jev加上微信,直接治好了我的低情商》 TypeSafe AI 官方文档及Jev产品介绍 智源社区「哑巴模型」相关报道 AIToolsRecap 9月21日AI新闻 Vercel AI Gateway相关数据 新智元相关资讯
