ARTICLE · 1157792
AI 不写答案了,开始替软件做选择
见微 FAIN 决策模型 · 约 9 分钟读完
一封客户邮件进来,你需要 AI 做什么?
过去,我们习惯把邮件接进聊天框,等它写出一段分析:客户在抱怨什么,情绪怎么样,建议怎么回复。读完之后,再由我们决定把邮件转给谁。
但很多时候,你真正想要的只是一个答案:这封邮件该交给售后、技术支持,还是财务?
最近出现的两个模型,就是为这类问题准备的。
一个是 TypeSafe 推出的决策模型 Jev。你给它一段信息、一个问题和几个明确的选项,它返回其中一个选择,以及每个选项的概率。问题也可以是判断某个条件是否成立,或者按给定标准打分。[1]
另一个是 Cloudflare 开源的 Clef,还有一个更轻量的版本 Clef-Flash。和通过服务调用的 Jev 相比,Clef 开放了模型权重,开发者可以自己部署;它还支持结合图像做判断。[2]
它们吸引我的地方,是输出不再是一段给人读的文字,而是软件能直接用的判断。
模型返回「技术支持」,邮件系统就把邮件分过去;模型判断一条内容命中过滤条件,页面就把它折叠起来。人不用每次都夹在模型和软件中间,读完答案再手动执行。
当然,返回一个干脆的选项,不代表它选对了;附带的概率,也不等于可靠性的保证。这一点后面会细说。
但这种用法,让我重新审视了自己正在做的一件事。
01 / 05
一篇日报背后,是一连串选择
我在搭一个 AI 资讯流程:广泛收集候选信息,筛出值得深挖的内容,打开官方原文核对事实、合并重复事件,最后生成一份待审的速递。
表面上,最后交付的是一篇文章。拆开看,写作只占其中一小部分,更多的是判断:
这条新闻是不是新的?它是普通的产品更新,还是值得关注的能力变化?几家媒体说的是不是同一件事?标题里的融资金额有没有原始出处?这件事值得今天写,还是先放进跟踪池?
这些判断,决定了日报里最终出现什么。前面选错了,后面写得再流畅,也只是把一条普通新闻包装得很漂亮。
所以 Jev 和 Clef 让我在意的,不是它们能不能再写一篇稿子,而是能不能接手这些高频、重复、又很难单靠关键词解决的判断。
已经有人在这么用了。
02 / 05
两个案例:一个替你挑内容,一个替你打游戏
第一个是开源浏览器扩展 hide-the-annoying。它可以接入 Jev 或 Clef,按用户设定的主题和规则给 X 上的帖子分类,然后隐藏、折叠或打上标记,还提供白名单和缓存机制。[3]
在这里,AI 不需要读完帖子再写一段总结,它的判断直接决定页面上显示什么。过去我们是看完内容再请 AI 帮忙理解,现在,模型被放到了内容抵达用户之前。
我的资讯流程里也有这样一个位置:候选信息进入深度研究之前,要先判断哪些值得花时间。
不过,扩展能跑起来,不等于筛得准。这个项目没有给出能证明整体准确率的独立评测。它证明的是这种产品形态已经可以实现,而不是筛选效果已经过关。
第二个案例更有意思:开发者 Christian Mathiesen 让 Jev 玩通了《宝可梦红》。[4]
但细看项目记录会发现,这不是让模型盯着游戏画面、独自理解整个世界。外围程序负责读取游戏状态、整理可选动作,还提供寻路、进度管理和防止反复卡住的机制。Jev 是在这些条件之下做决策。
通关是这个案例吸引人的地方,但更值得借鉴的是它怎么通关:模型的判断被放进一套程序里,有程序替它准备信息、限定动作、处理失败。游戏状态不是凭空得来的,可选动作不是无限的,选错了也有办法恢复。
所以我更愿意把 Jev 和 Clef 看成工作流里的一个零件。它们能承担局部判断,但整条流程好不好用,仍然取决于其他环节有没有把信息备好、把问题定义清楚。
放回资讯场景也一样:模型再擅长分类,也读不出标题里没写的事实。原文研究这一层,依然省不掉。
03 / 05
软件会认真执行一个错误的答案
模型只是聊天时,答错了问题不大。我们可以追问,要它补证据,或者自己检查结论。
可一旦模型返回的是标签,软件可能立刻执行:隐藏一条内容,排除一个候选,或者把任务交给下一个环节。中间没有人再看一眼。
这时候,漂亮的演示就不够了。至少有三件事要想清楚。
第一,同样的概率,在不同任务里分量不同。
Running Dolphins 做过一组公开测试,每项任务 500 条样本,只看 Jev 给所选答案打出至少 0.9 概率的那些结果。即使门槛一样,不同任务的实际准确率仍然差别明显:垃圾短信识别是 99.8%,合同条款分类是 86.7%,五星评分预测只有 81.6%。而且能过这个门槛的答案本身也越来越少,在垃圾短信里占 80.6%,在评分预测里只剩 51.2%。[5]
概率有用,但不能拿到一个 0.9,就默认它在所有业务里都代表同样的可靠程度。
第二,选项怎么写,会影响模型怎么选。
一位开发者用 Clef-Flash 搭了一个摄像头演示,其中一组问题是判断镜头前的人出的是石头、剪刀还是布。[6] 作者在搭这些问题时记录了一个教训:面对一个空房间,兜底选项写成「没有手势」时,模型反而把「石头」选成了概率最高的答案,约 40%。把兜底选项改成「没有人向镜头举手」,同时把问题改成「镜头前举着的是哪种手势(如果有的话)」之后,模型选「没有」的概率升到了 96%。
这只是个案,不是系统性评测,但它说明了一件事:模型省掉了写长答案的过程,却没有替开发者省掉定义问题的工作。
「这条新闻有没有价值」就是一个典型的含糊问题。对产品经理有价值,对投资研究有价值,对普通读者有意思,是三套不同的标准。标准没说清楚,返回的小数再精确,也消除不了分歧。
第三,不同型号不能默认互换。
开发者 Cho Yin Yong 做了一套 400 道题的决策评测 DecideBench,报告的整体准确率是 Jev 98.0%、Clef 94.8%、Clef-Flash 85.8%。[7] 这套题由 AI 模型编写,经过结构检查和抽查,规模有限,作者也承认有几道题的标准答案值得商榷,不能当成通用排名。但它至少提醒我们:更轻、更快的版本,需要重新验证。
对资讯来说,这些差距很要命。「讨论融资」和「完成融资」,「计划推出」和「已经交付」,字面上差不多,意思却差得很远。决定一条新闻值不值得写的,往往正是这些细节。
04 / 05
对资讯筛选来说,最难发现的错误是遗漏
所以,我不会把这些案例理解成「可以拿它替换现有的筛选」。
目前我的流程还没有接入 Jev 或 Clef。真要试,我会先让它和现有流程并行判断,看看双方在哪些地方意见不一致,尤其是那些模型认为可以丢掉、人工最后却选中的内容。
道理很简单。多收一条普通新闻,代价是多看一眼;漏掉一条重要新闻,后面的原文研究、事实核查和分析,都没有机会发生。
更麻烦的是,遗漏很难被发现。日报照样写得完整流畅,你根本不知道自己错过了什么。
所以我关心的不是模型能帮我删掉多少候选,而是在减少阅读量的同时,保住了多少真正值得研究的信息。
落到流程里,我会这样分工:
日期、数量、格式,交给程序检查;
主题归类、重复线索、是否有新进展,可以试着交给决策模型;
涉及金额、性能、订单和投资链条的判断,继续走原文研究和人工复核。
至于便不便宜,也要算整条流程的账。
一篇用 Jev 复现七项政治学研究的预印本发现,Jev 的准确率和主流大模型相当或接近,但和按 OpenAI 批处理价格计费的 GPT-6 Luna 相比,并没有成本优势。作者的结论是,除非确实需要速度,Jev 最明显的优势只是能直接拿到各个选项的概率。[8] 这个结论有特定的任务和价格条件,但也说明,实时响应和每天跑一次的日报,本来就是两种需求。
如果一个模型单次调用很便宜,却让大量结果需要返工和人工复核,省下的调用费未必能变成真正的节省。反过来,如果它能稳定处理一部分边界清楚的判断,让昂贵的研究只花在值得研究的内容上,那才是我愿意把它接进流程的理由。
05 / 05
AI 的答案,开始变成软件的下一步
Jev 和 Clef 让人期待的地方,是很多过去难以写成固定规则的小判断,现在有了新的实现方式。
它们不必包办整个任务,也不必每次都写出一段解释。一次分类、一个评分、一个「要不要继续」的判断,就可能让软件自己走完下一步。
但当答案开始驱动流程,评估模型的方式也得跟着变:
不只看答对了多少,还要看错掉的是什么;
不只看单次调用有多快,还要看整件事有没有更快做完;
不只看概率有多高,还要看这个数字在自己的业务里靠不靠得住。
对我的 AI 资讯来说,最后要验证的事情很具体:
它能不能让我少读一些没用的信息,同时不漏掉那些真正该读到的东西。
参考资料
[1] Jev 官方介绍:typesafe.ai/blog/introducing-system-one-models-and-jev
[2] Clef 官方介绍:blog.cloudflare.com/clef-decision-models
[3] hide-the-annoying 项目源码:github.com/turkerdev/hide-the-annoying
[4] jev-pokemon 项目记录:github.com/christianmat/jev-pokemon
[5] Running Dolphins 测试方法与结果:github.com/Running-Dolphins/jev-bench
[6] Clef-Flash 实测记录:github.com/tehtommeh/clef-demo
[7] DecideBench 评测与局限:huggingface.co/datasets/choyiny/decidebench
[8] Denney & DiGiuseppe, JEV versus LLMs: Accuracy, Cost and Calibration on Seven Political Science Replications:arxiv.org/abs/2610.06625
见微 FAIN
见微知著,看清 AI 这门生意