夜雨聆风学习资料网

ARTICLE · 1120643

AI回答问题之前,先要学会做选择

AI回答问题之前,先要学会做选择

「订单已经被重复扣款两次,但系统仍然显示未支付。」一条客服工单摆在AI面前,等着它处理。它要做的不是写一封道歉信,而是三件更小的事:这笔投诉分给哪个团队、多久之内必须响应、严重程度算哪一级。

一家成立不到五个月的国内AI公司,在9月30日发布了一款专门干这件事的模型。在一份38项基准的公开测试里,它有31项成绩超过此前占据榜单头名的对手,综合得分63.88对57.91,领先近6分;与对手模型对弈国际象棋36局,赢下35局,全程不借助额外搜索。五档规格全部开源,小的那一档,装进一台普通电脑绰绰有余。

一、生成和判断,是两种活

过去两年,很多团队默认一个做法:既然大模型什么都能干,那就什么都问它。写文案问它,做分类问它,判断该走哪条流程也问它。

把一次智能体任务的调用记录拆开看,会发现大量请求短小得近乎琐碎:是不是、三选一、五级评分、该点哪个按钮。这些问题不需要文采,也用不着长篇推理,只需要一个准的、快的、便宜的选择。

生成考验的是模型会什么,判断考验的是模型选什么。这两件事对算力的要求完全不在一个量级,混在一起干,等于让一位主厨去盯后厨的门禁。

这家公司给出的分层方式相当直白:大参数模型留在通用层,负责理解与规划;高频的小判断,交给专门的小模型;记忆与工具调度各有归属。判断层一次请求同时完成三项输出,从收到工单到给出结论,不需要先生成一段话再让程序去解析。

二、小判断攒起来是大成本

速度是这个方向成立的前提。在单卡环境下,中档规格的模型一次回答三个问题平均耗时26毫秒,小规格那一档只要12.2毫秒。做到这一步靠的不是一味缩小模型,而是工程上的精打细算:把多次计算合并成一次前向,减少重复开销,用更快的算子缩短每一步的等待。

一个长期运行的智能体,一天可能要过几千个判断节点。每个节点省下几十毫秒,整条链路的响应速度和运行账单都会跟着改写。

这也是为什么这份榜单值得从业者细看:38项基准里31项易主,说明判断能力的差距不是玄学,而是可测量的工程指标。对做产品的人来说,账本因此变得清晰——把调用拆开,哪些留给大模型,哪些交给小模型,每一层都有各自的性价比。

三、判断之后,还敢不敢信

只给一个答案还不够。这类模型能同时输出候选项的概率分布:置信度足够高,系统直接往下走;几个候选概率咬得很近,就补充信息、交给更强的模型,或者转给人工。支付、删除、权限变更这类操作,授权确认那一步不会被省掉。

自动化与可控之间,边界画在人身上,而不是画在模型身上。

把这套思路变成可以核对的动作,只需三个问题:

1. 这个请求的答案,是不是有限个选项?

2. 同类请求一天要出现多少次?

3. 答错了,代价兜不兜得住?

三问里有两个答案是肯定的,这个环节就值得从大模型手里挪出去,交给更小的模型。

会说话的模型吸引注意力,会做选择的模型替人省时间。

想做AI获客别盲目找外包,先去公众号「智扣AI」看看现成落地方案,能少走很多弯路。

你手上的AI系统里,有多少次调用其实只需要一个「是」或「否」?

相关学习资料