ARTICLE · 1050425
Jev 到底是个啥?这个只做判断的 AI,让我研究到半夜(附教程)
昨晚半夜,我还在填 Jev 的候补名单
今天一早,就看到它开放使用的消息。昨天还在排队,今天就能进去试了?我索性拿自己的录音跑了一遍
上一次让我这样睡不着、想继续研究的,还是年初的龙虾 OpenClaw,和后来被大家叫作“爱马仕”的 Hermes 智能体
有人说,龙虾不是已经凉了吗?No no no,我还一直用着呢。一个名字不再天天刷屏,不代表它带来的东西消失了。OpenClaw 的创始人 Peter Steinberger 已经宣布加入 OpenAI,而我也越来越习惯让智能体接手具体工作
这次让我兴奋的 Jev,又有点不一样:它不写文章,不写代码,专门做判断
听起来是不是有点奇怪?现在的 AI 已经什么都想做了,怎么又冒出来一个,主动把自己能做的事情缩小了?
我越研究,越觉得这件事有意思

你可以把它想成一家内容公司的分拣员
每天进来一堆东西:一段录音、一份会议纪要、一个客户的问题,还有你走路时突然冒出来的想法。写文章的人已经有了,做分析、写代码的人也有了,但这些材料该给谁?哪些值得继续做?哪些先放着?
Jev 就负责先看一眼,按你给的标准作判断:这是内容素材,里面有待办,值得深加工,下一步可以交给写作流程
用技术一点的话说,它是 TypeSafe AI 做的一个决策模型。你给它材料、问题和可选答案,它返回分类、评分,或者对“是不是”的判断。结果有固定格式,后面的程序比较容易接着用
把它和其他 AI 配合起来,就容易理解了:Jev 先判断这份材料值得做什么,再由 ChatGPT、Claude 或其他工具去分析、写作、执行。真正把东西送过去,还需要你接好流程
它的用处,也就在这些小小的岔路口上
比如做内容的人,可以判断一段录音更适合写文章、做课程案例,还是留作个人笔记;做客户服务的人,可以先分清一条消息属于咨询、投诉还是售后;经常开会的人,可以先筛出哪些纪要值得继续提取任务
如果你每天只问 AI 一两个问题,未必需要专门用它。但当材料越来越多,你发现自己每天都在重复“看一眼,再决定怎么办”,它就开始有意思了
我今天拿来试的,是自己一段 3 分钟左右的录音。里面聊到 Jev,也聊到我正在做的 AI 原生工作台,以及把这些思考写成文章的想法
先把录音转成文字,再放进 Jev。我一次设了 8 个问题:主要意图是什么,有没有待办,是否需要尽快处理,有没有可复用的洞察,等等
它返回的结果里,有几项很直观:内容创作 96%,存在待办 91%,需要尽快行动 91%,有可复用洞察 85%,建议下一步写成文章 85%

界面上显示的计时是 114ms + 356ms,两项加起来不到半秒。这是这一次判断的界面计时,不包括前面的录音转写,更不包括后面写文章的时间
速度确实让我兴奋。不过,这些百分比是模型给出的判断值,不能直接理解为“准确率就是这么高”。这次测试里,它给“教学价值”的评分只有 1.88/5,我就不能看见一个数字,便把它当成最终结论
同一份材料,对谁有价值,拿来做什么,评价标准是什么,都要说清楚。判断够不够好,最后还得回到自己的材料上验证
但这个体验,已经让我看到了下一步
我平时用 PLAUD 录音,积累了不少讨论和想法。以前,录音转成文字,只算完成了一半:里面哪些值得写,哪些是行动,哪些能留作教学素材,还得继续整理
以后我想接成这样:新录音先转文字,Jev 做初步判断;适合写文章的送去写作,包含明确任务的继续提取待办,有长期价值的留下来。最后,成品和过程都回到我的工作台
这条自动化我还没有全部接通,目前完成的是手动测试。但下一步该验证什么,已经比之前清楚多了

说到这里,就得聊聊我最近越来越确定的一个名字:AI 原生工作台
以前我叫它 AI 工作台,中途还叫过 AI 超级工作台。最近我发现,“原生”这两个字更准确,因为我在整理材料的时候,首先想的是:AI 下次能不能找到,能不能看懂,能不能接着干活
这个工作台当然也能给人看,也能用来协作。但它最核心的使用者,是 AI
比如我让 AI 写一篇公众号文章,它知道要去哪里找我的写作风格;开始做某个项目,它知道先读项目背景、当前进度和下一步动作;涉及某种方法,它再去读对应的说明
其实,这里面已经有路由的思路了:涉及什么,就去哪里查,按需读取需要的材料
Jev 让我想到的是另一类路由:一份新材料进来,先判断它是什么,值得做什么,再决定进入哪个流程。它和工作台里已有的目录、索引、读取规则,可以配合起来
当然,几万份文件里怎样找到相关内容,仍然需要搜索和索引。Jev 不会一装上,就自动拥有你的全部记忆
我更在意的是,过去做过的事情能够留下来。下一次做文章、做课程、做产品,AI 可以接着用这些背景、方法和经验。换一个模型,也有机会继续接上,不必每次从头解释
研究到这里,我才明白自己为什么这么兴奋:AI 越来越会干活之后,怎样组织这些能力,就变成了一个值得认真做的问题
为什么偏偏是现在?我觉得,时机很重要
前几年,我们更关心模型到底能不能完成任务。现在,很多日常场景里,它已经相当好用了。智能体能执行任务,Skill 可以保存做事方法,MCP 等连接方式让工具接入更方便,随之而来的问题就具体了:这一步要不要调用 AI?该调用谁?哪些可以快一点,哪些必须认真核对?
这是我理解的 Jev 出现的背景。当然,复杂任务仍然需要更强的模型,执行中的难题也可能需要深度思考,不能简单地按“思考用贵的,执行用便宜的”一刀切
TypeSafe 创始人 Diogo Almeida 曾在 OpenAI 工作。他在发布文章中说,团队经过了两年的隐身研发。官方把这类模型叫作 System One,灵感来自丹尼尔·卡尼曼《思考,快与慢》中的系统 1 和系统 2:前者快速、直觉,后者更慢、更审慎
这个类比很好懂。你看到一条“明天下午之前给我”的消息,往往马上就能意识到它有时限,不必先写一篇分析报告。Jev 希望把类似的快速判断,放进软件的工作流程里
这不意味着普通大模型每次都在深度推理,也不意味着 Jev 复制了人的直觉。它让我看到的是:有些地方需要长时间思考,有些地方需要快速、明确地作出一个小判断
它的名字也很有意思
Jev,致敬的是经济学家威廉·斯坦利·杰文斯。看到这里,我一下就想起来了:杰文斯悖论!我今年读书时读到过,几个月前还跟我老婆聊过
蒸汽机更省煤,整个社会就会少用煤吗?未必。使用成本降低了,原来用不起、不值得用的地方也开始用了,最后煤的总消耗反而可能增加。这就是杰文斯悖论所揭示的现象
TypeSafe 用这个名字,表达的也是一种期待:当智能判断足够便宜,更多以前不值得交给 AI 的小事,也可以交给它
目前官方列出的价格是每百万输入 token 0.042 美元,输出 token 不收费。token 可以先粗略理解为模型处理文本时使用的计量单位,不直接等于中文字数;这些价格也只算 Jev 的判断,后续转写、写作和其他工具另算
原来,一条信息进来,我们可能觉得“算了,自己看一眼吧”。当这一步足够快、足够便宜,每条录音、每份文档都先经过一次分类,才更有可能变成日常动作
这个思路也让我重新想起一个老问题:AI 越来越聪明,还需要知识博主吗?
我自己就是教 AI 的。如果提供的价值,只是比别人早知道一条新闻,压力确实会越来越大。但信息多了,判断和验证并不会自动消失。AI 给了你五个方案,哪个适合你的情况?哪个看起来很好,做起来却不合适?
想想搜索引擎就容易理解。搜到一个答案,和知道怎样判断、怎样用,中间还有距离;互联网也让我们更容易找到真正有经验的人。AI 时代,我觉得这件事会继续存在
对我来说,值得继续积累的,就是自己试过什么,怎样判断,做成了什么,哪些地方走了弯路。把这些留下来,再教给别人
所以,Jev 让我研究到半夜,最后落到的还是很具体的一件事:把今天这段录音用起来,把值得保留的想法留下来,让下一次工作可以接着往前走
下面把第一次上手的步骤也放上来。你可以找一小段自己的材料,试试看它会怎么判断
附:普通人第一次怎么用 Jev
这次先用网页里的 Playground,也就是测试区。不用写程序,也不用先搭自动化。官方快速上手

1.进入官网,完成注册
打开 TypeSafe 控制台,按页面提供的方式登录或注册
我这次进入时,先遇到了使用条款,随后填写个人信息、工作背景和组织信息。自己体验也可以创建一个个人使用的组织;人数、地区等按实际情况填写,不用为了测试编一家公司的资料
完成引导后,进入 Playground。界面和赠送额度可能调整,以你账户里实际显示的为准
2.把材料放进 State
State,就是“这次要让它看的材料”
先用下面这段示例也可以,之后再换成自己的录音转写。Jev 当前接收的是文字,录音需要先转写,不能直接把音频塞进去
我想写一篇公众号文章,介绍 Jev 能做什么。今天先整理自己的录音测试结果,明天下午之前完成初稿。其中关于 AI 原生工作台的思考,也想留作以后的课程素材。如果页面切到了 JSON 编辑模式,可以把同一段文字放在一个字段里:
{"transcript": "我想写一篇公众号文章,介绍 Jev 能做什么。今天先整理自己的录音测试结果,明天下午之前完成初稿。其中关于 AI 原生工作台的思考,也想留作以后的课程素材。"}3.在 Questions 里添加问题
点击 Add Question,先认识三种题型:Choice 是“选哪一类”,Noul 是“是不是”,Score 是“按标准打几分”
第一次可以只选 Noul,在 Instructions 里填下面这句话:
Does the transcript contain an explicit action that someone intends or is asked to carry out?意思是:这段文字里,有没有明确打算执行、或者被要求执行的行动?
能跑通这一题后,再加一题 Choice,让它判断主要用途:内容创作、任务规划,还是个人思考
如果你看到的 Questions 是代码编辑框,直接把下面这整段复制进去,替换原有内容,就同时设好了这两题。instructions 是问题,criteria 是选项和说明,不需要自己研究怎么写代码
{"has_action": {"type": "noul","instructions": "Does the transcript contain an explicit action that someone intends or is asked to carry out?" },"primary_purpose": {"type": "choice","instructions": "What is the primary purpose of this transcript? Choose the best matching option.","criteria": {"content_creation": "Preparing an article, video, course or other content","task_planning": "Mainly planning concrete work or next actions","personal_reflection": "Mainly recording thoughts without a specific production plan" } }}这里的问题和选项用英文,材料可以先保留中文。官方说明当前英文表现最好,中文场景更需要拿自己的材料多试几次,不能只看一条漂亮结果。语言支持说明
想体验 Score 时,记得同时写清每一档的含义。比如“时间要求有多明确”:0 表示没有时间要求,1 表示只说稍后、尽快这类模糊要求,2 表示给出了具体日期或时间。不要只丢一句“打个分”,再把数字当客观事实
4.点击 Run,先看它判得对不对
下面是我最开始做分类时的真实界面,和前面那次 8 个问题的录音测试是不同的一轮

左边放材料、设问题,右边看结果。先检查:类别有没有选错,明明没有待办时会不会硬判成有,文字里的“以后想做”和“明天必须做”能不能分清
你也可以故意把示例里的“明天下午之前完成”删掉,再运行一次,观察变化。这样比盯着某个百分比更容易弄懂它
5.把结果用在一件小事上
如果它判断这段录音适合写文章,你就把原始转写交给常用的写作 AI,加上自己的要求,先完成一篇草稿
等你试过一批真实材料,知道哪些判断可靠,再考虑通过 API 把流程接起来。Jev 判断“有待办”,并不等于它已经替你提取了待办;判断“适合写文章”,也不等于文章已经写完
今天先做一件事就够了:找一段你一直没整理的录音,看看它能不能帮你决定,下一步值得做什么