夜雨聆风学习资料网

ARTICLE · 1053327

Jev 概念爆火,给AI大模型降本的新风口来了?

Jev 概念爆火,给AI大模型降本的新风口来了?

最近 AI 圈冒出来个挺反常识的新模型,叫 Jev

估计不少人第一眼看到都懵:这又是哪家的大模型?参数多少?能写代码还是能画图?哎,恰恰相反,这玩意儿最 “不按套路出牌” 的地方就是 —— 它不跟你闲聊,不给你写长文,也不帮你敲代码

它这辈子就爱干一件事:做判断题

给它一堆信息,问 “这文件跟任务有关吗?” 它给你个概率;问 “A、B、C 选哪个?” 它直接给答案;问 “这操作风险高不高?” 它给你打个分

就这么个看起来 “功能单一” 的模型,上线几天直接炸了 Vercel

9 月 15 号,一家叫 TypeSafe AI 的公司刚结束两年隐身,正式发布了 Jev,顺便掏出了 4000 万美元的种子轮融资,DCVC 领投

创始人 Diogo Almeida 是正儿八经 OpenAI 出身的研究员,InstructGPT、ChatGPT、GPT-4 早期的工作他都参与过

这履历往 AI 创业圈一放,本身就自带流量,但真正让它爆的,还是产品本身的狠活

发布第二天它就进了 Vercel AI Gateway

到 9 月 18 号,Vercel 甩出来的数据直接惊了一群人:Jev 上线 24 小时,就有接近 13% 的付费团队用过它,是 Vercel AI Gateway 历史上蹿红最快的新模型,首日团队采用率直接是 GPT-5.6 系列同期的两倍还多

OpenRouter 也紧跟着上了线

目前 Jev 1.13 的公开价是:每 100 万输入 Token 0.042 美元,输出免费,上下文窗口 32K

这价格有多离谱?后面咱们细说

问题来了,过去这几年,整个 AI 行业都在铆着劲让模型 “多才多艺”:写文案、敲代码、解数学、看图片、控电脑、长链条推理…… 恨不能一个模型承包一整个公司的活

怎么突然冒出来个 Jev,主动把自己的工作范围缩得这么窄?一个只会做 “判断题” 的 AI,怎么就突然成了香饽饽?

AI 真的开始下地干活之后,行业终于撞上了一个特别现实的问题:我们造出来了绝顶聪明的大脑,然后发现,让这么金贵的大脑天天处理鸡毛蒜皮的破事,实在是太烧钱了

AI 越能干,账单越吓人

就从现在火得一塌糊涂的 Coding Agent 说起

像 Claude Code、Cursor 这类东西,早就不是当年 “你问一句它答一句” 的聊天机器人了

你扔给它一句 “登录功能崩了,帮我找找原因修好”,接下来它能自己搜代码、开文件、读报错、跑命令、改代码、做测试,测不过就接着分析,自己干到完事儿为止

听着很爽对吧?但爽是有代价的

这种 Agent 要想连轴转,就得全程记住前面发生了什么

用户最开始提了啥要求?已经打开过哪些文件?刚才跑了什么命令?哪些方案试过不行?测试返回了什么错误?项目里有啥开发规范?这些信息会一股脑全堆进模型的 Context—— 也就是上下文里

你可以把 Context 理解成:模型这一轮思考时,办公桌上摆的所有资料

任务刚开场,桌上可能就十几页纸;干上一个小时,上面就堆满了聊天记录、代码片段、日志、搜索结果、工具说明、还有各种失败尝试

模型下一次接着干,还得把这些东西全过一遍,这就意味着大量烧 Token

所以 AI Agent 有个特别反直觉的成本结构:你最后看到的答案可能就几百个字,但真正烧掉的海量 Token,全藏在整个过程里 —— 模型反复读、反复理解、反复维护上下文的环节

贵,太贵了

Context 越堆越大之后,现在行业一般有俩解法

一个叫压缩(compaction),就是把早期的历史总结成摘要,给后面腾地方

这好理解,就像会议纪要太厚了,找人缩成三页纸

但问题是:做总结的时候,没人知道未来会用到什么,今天看着没用的一句话,俩小时后可能就是解题的关键

另一个路子叫模型路由:复杂问题给最强的模型,简单问题切到便宜的,理论上能降本,但这里有个坑,也是 TypeSafe 在文档里点透的:换模型之后,新模型一样得先理解任务背景啊

当一个 Agent 已经攒了一大堆 Context,你从贵的模型切到便宜的,待会儿再切回来,中间重新处理上下文的成本,搞不好直接把省下来的模型钱全吃光了

就像公司为了省钱,找实习生来干半小时活,结果高级工程师先花一小时给他讲项目背景,实习生干完了,又花半小时听汇报,省了个寂寞

于是行业的问题悄悄变了

一开始大家都在研究:该用哪个模型?现在多了个越来越要命的问题:这一次,到底该让模型看到多少东西?

Jev,刚好就卡在这个口子上

Jev,本质是个超便宜的 “判断层”

Jev 的核心逻辑说穿了特别简单:很多软件任务,根本不需要大模型在那洋洋洒洒写小作文,程序真正需要的,往往就是一个决定

举个最直观的例子

一个 Coding Agent 要修登录 Bug,项目里有 5000 个文件,真正相关的可能也就十几个

但大模型得自己一个个找,搜索要消耗 Token,读文件要消耗 Token,判断哪个值得往下看,还得消耗 Token

如果前面加一层 Jev 呢?事情就变成了:先把搜出来的 100 个候选文件扔给 Jev,让它判断每个文件和 “修登录 Bug” 这件事的相关性。它可能直接返回:

  • auth.ts,97% 相关
  • session.ts,94% 相关
  • user.ts,83% 相关
  • payment.ts,6% 相关
  • analytics.ts,2% 相关

得,后面那几十个低相关的文件,贵的大模型压根就不用看了,优先读前三个就行,省下来的 Token,海了去了

同样的逻辑,套在哪都好使

比如工具调用

假设一个复杂 Agent 接了 300 个工具,每个工具都有自己的说明、参数、用法,全提前塞给模型,不光占大量上下文,工具多了大模型自己都容易挑花眼

Jev 可以先根据当前任务判断 “最可能用哪几个”,系统只加载这几个的完整定义就行

再比如历史记录

一个 Agent 已经连干三小时,攒了一大堆对话、代码、日志、工具结果,现在用户突然问了个前端问题

Jev 可以先筛一遍过去哪些信息和当前问题有关,只把真正有用的部分送给大模型

所以你说 Jev 是个 “省 Token 插件”,方向是对的,但格局小了

它更像一个极其便宜的判断层,专门帮昂贵的大模型干那些 “没技术含量但又不得不做” 的筛选和简单决策

TypeSafe 给这类模型起了个名,叫 System One Model,借的是心理学里 “快思考” 的概念 —— 就像人看到红灯踩刹车,看到危险下意识躲开,不用先在脑子里写篇论文

Jev 想干的,就是软件系统里的这种 “快思考”

开发者提前给好候选答案,它直接返回选择、评分、概率,还能一次并行处理好几个问题

Vercel 对它的介绍也特别直白:普通大模型是一个 Token 一个 Token 往外蹦字,应用还得再去解析这些文字;Jev 直接返回结构化的答案和概率,天生就适合干工具选择、Agent 下一步动作、重试、停止、各种路由判断这些活

再配上它的价格,这事儿就更有意思了

刚才说的,每百万输入 Token 0.042 美元,输出还免费

这是什么概念?5 美元,理论上能买差不多 1.2 亿个输入 Token

便宜到什么程度?以前开发者会纠结:“这个地方真的值得调用一次 AI 吗?”以后可能就变成:“反正几乎不要钱,那每一步都判断一下好了。”

于是一个 Agent 干完一项任务,可能只调用十几次 Claude 或者 GPT,但背后能调用 Jev 几百次:这个文件相关吗?这个工具合适吗?这个结果有价值吗?这个任务简单到能交给便宜模型吗?这个操作风险高吗?这个子任务还要继续吗?这段信息还需要留着吗?

你就这么想:Claude 是公司里最贵的高级工程师,Jev 就是坐在门口的一支超高速助理团队

助理帮你筛快递、分文件、挑工具、做初步判断,高级工程师终于不用亲自拆开公司收到的每一个包裹了

野心更大:重新设计 Agent 的 “记忆和调度系统”

如果 Jev 的故事只停留在 “省 Token”,那它已经是个很明确的好产品了

但 TypeSafe 那份《thoughts on a typesafe coding agent》文档里透出来的想法,明显比这大得多

整篇文档一直在追问一个问题:

为什么现在的 Agent,都要维护一条越来越长、所有人共用的 Context?

现在大多数 Agent 的工作方式,说粗暴点,就是一条不断增长的聊天记录

模型读了东西,结果加入 Context;模型调用工具,返回结果加入 Context;模型思考完继续行动,新的东西接着往里堆

时间久了就压缩,压缩完了接着堆

像个越滚越大的雪球

TypeSafe 提出了个很有意思的概念:Meta-attention

普通的 attention,你可以简单理解成 “大模型看完一堆资料,决定重点看哪儿”

Meta-attention 往前多走了一步:在资料真正送进大模型之前,先判断这一次到底该给它看哪些

假设一个 Agent 的全部历史信息拆成了 1000 个小块:用户聊天、代码片段、搜索结果、工具输出、内部状态、项目规则…… 现在用户要修一个前端 Bug,Jev 可以先给这 1000 块做个相关性排序,挑出最有用的几十块,临时拼成当前任务的 Context

十分钟后,任务切换成数据库性能问题,系统又重新拼出另一套 Context

于是 Agent 的 “记忆”,从一个越滚越大的雪球,变成了一个可以动态查询、随时拼装的资料库

这个区别,可太大了

打个比方

现在的 Agent 架构,有点像要求律师从接案子第一天起,就把所有文件一直抱在怀里 —— 合同、邮件、证据、会议记录,一个都不能放下

文件太多了,就让助理把前面的总结一下

TypeSafe 想象的方式,更像一个现代档案系统:律师今天研究税务问题,系统自动把税务相关的材料摆到桌上;下午研究劳动纠纷,桌上的资料自动换一批

所有原始信息都好好存着,但当前的工作区,永远尽量保持干净

一旦 Context 能这么动态管理,现在 Agent 里很多头疼的事,都会跟着变

模型路由会更自然

简单任务交给便宜模型时,就同时给它一份精简的 Context;高级模型处理复杂任务时,再加载更全的信息

子 Agent(Sub-agent)也更好用了,现在启动一个子 Agent,最头疼的就是该给它哪些背景资料,干完了又该把哪些结果合并回来

有了廉价的判断系统专门做相关性筛选,几十个子 Agent 并行干活的成本和混乱程度,都能降下来

工具系统也可能变天

现在很多 Agent 得提前知道自己有哪些工具,一大堆工具定义会占掉好多 Context

以后可以只放一层简短的 “工具目录”,等系统判断确实需要某个工具了,再动态加载完整说明

理论上,一个 Agent 可以拥有几百甚至几千个工具,却不用每次思考都背着一本《全球工具黄页》

再往前一步,Jev 甚至能参与决定整个 Agent 的下一步动作:

该搜索?该调用工具?该启动子 Agent?该换模型?该问用户?该接着试?还是任务已经可以结束了?

到这时候,它的角色已经很像 Agent 的调度系统了

大型模型负责复杂的深度推理,Jev 这样的决策模型负责大量快速选择,传统代码负责那些有明确规则的确定性工作。模型之间一旦有了分工,AI 软件就会越来越像一支真正的团队:专家负责解决难题,调度员负责分派任务,档案系统负责管理资料,工具负责执行落地

这可能才是 TypeSafe 这套思路里最值得关注的地方

过去几年,整个行业把海量资源砸在了 “把大脑做得更聪明” 上;等 Agent 真的开始进生产环境干活了,新的工程问题就变成了:怎么让这个昂贵的大脑,只在真正值得的时候工作

Jev 会有多重要?能带起新一波热潮吗?

现在给 Jev 下结论还太早,毕竟它才刚发布没几天

但乐观的信号已经很明显了

首先,它精准踩中了一个真实存在、而且越来越严重的痛点

AI 模型能力越来越强的同时,Agent 的调用次数、上下文长度、工具数量都在疯涨,推理成本已经成了开发者必须认真抠的东西

Vercel 之前的数据也显示,今年模型的平均 Token 成本确实在快速下降,但企业也越来越积极地把不同任务分给不同价格、不同能力的模型

其次,它的早期采用速度确实夸张

24 小时覆盖近 13% 的 Vercel 付费团队,至少说明 “极廉价的结构化决策模型” 这个概念,直接戳中了好多开发者的痒点

再往远了看,我觉得 Jev 有两种可能的未来

第一种比较朴素:它最终变成 AI 技术栈里的一个常用基础组件,地位就像现在的 embedding、reranker、缓存、搜索模块一样

普通用户可能永远不知道自己用的软件背后调用了 Jev,但开发者会用它做邮件分类、工具路由、风险判断、内容筛选、Agent 上下文管理

能到这个地步,商业价值就已经足够大了

第二种就大了

如果 TypeSafe 最终证明,“高级推理模型 + 高频廉价决策模型” 这套组合,能让 Agent 的速度、成本、稳定性出现数量级的改善,那今天 Agent 的典型架构,可能真的会被重新设计

以后大家评价一个 Agent,除了关心它用的是 GPT、Claude 还是 Gemini,还会关心它怎么管理 Context、怎么选择模型、怎么分配工具、怎么组织多个 Agent、怎么控制每一步的成本

到那时候,“System One + System Two” 很可能会变成热门概念 —— 强模型负责深度思考,大量廉价的决策模型负责日常判断

AI 系统的竞争,也会从单纯比 “大脑智商”,扩展到比整个组织系统的运行效率

当然,这个故事现在还有好几个大大的问号

首当其冲的就是准确率

Jev 的输出可以特别规整,选选项就返回选项,打分就返回分数,但格式规整不代表判断就对

如果系统让 Jev 判断哪些 Context 可以丢掉,结果它刚好把一句关键警告给过滤掉了,那后面的大模型就会在一份 “特别干净、特别省 Token、但缺了关键信息” 的上下文里,一本正经地胡说八道

其次,TypeSafe 自己公布的性能数字相当惊人 —— 官方说在自家的工作流评测里,Jev 最高能做到 193.6 倍速度提升、444.6 倍成本降低

但这些毕竟是厂商自己测的,还得等更多独立开发者、更多真实生产环境来验证

第三,大模型本身也在持续降价

今天觉得必须抠掉的 Token 成本,两年后可能就不值钱了。所以 Jev 最终能站到多大的位置,最终还是要看它带来的收益,能不能持续盖过增加的系统复杂度

所以接下来,真正值得观察的信号特别简单:

有没有人能用 Jev 做出一个明显更好的 Agent?比如同样完成一个 Coding 任务,Token 消耗直接降 70%、80%,速度还明显更快;比如一个 Agent 能连续跑几个小时,Context 依然干干净净;比如它能同时接几百个工具,模型却不会被工具说明淹没;比如几十个子 Agent 能并行工作,每个都自动拿到恰到好处的上下文

如果这类案例真的出现,而且效果足够夸张,那 Jev 很可能从 “这周 AI 圈一个挺有意思的新模型”,迅速升级成一套新的 Agent 架构叙事

过去好几年,整个 AI 行业都在教机器怎么想得更多:更多参数、更长上下文、更深推理、更复杂的 Agent

现在大家终于开始认真研究另一个问题:一个已经足够聪明的大脑,怎样才能少看废话、少做杂事,把昂贵的思考,留给真正困难的问题?

Jev 给出的答案特别朴素:找一个便宜到几乎可以随便调用的小脑袋,在旁边不停做判断题

如果这条路最终真的走通了,那 AI 下一阶段很重要的一步进步,可能就来自这件听上去有点滑稽的事 ——我们花了好多年让 AI 学会深度思考,接下来,还得教它学会什么时候别想那么多

相关学习资料