乐于分享
好东西不私藏

AI助手上线,先看看它有没有通过这几关

AI助手上线,先看看它有没有通过这几关
在做企业智能问答项目时,经常会被问到一个问题:
“现在模型回答准确率已经达到95%了,是不是可以上线了?”
听起来,这个数字确实很不错。100个问题里有95个能回答正确,用户应该会觉得挺好用。
但真正参与过AI项目落地后,我逐渐发现:一个系统能不能上线,准确率并不是唯一的答案。有时候,一个准确率看起来很高的系统,也不适合直接交给业务人员使用。
AI项目和普通软件不太一样。传统系统更多关注功能有没有实现、按钮能不能点击、流程能不能正常跑通;但AI系统面对的是开放的问题,用户会怎么问、会问些什么、什么时候出现异常情况,很难提前全部穷举。
所以,上线前真正需要验证的,不只是“它会不会回答”,而是“它能不能稳定地答对那些重要的问题”。

准确率高,不代表风险低

我们曾经测试过一个智能问答系统,整体结果很好。大部分产品介绍、业务规则和常见问题,它都能准确回答。从测试报告来看,准确率接近95%。如果只看这个数字,项目似乎已经具备了上线条件。
但把测试结果继续拆开以后,我们发现了一些问题。
比如,“这款产品的风险等级是什么”“投资范围有哪些”“最低持有期多久”,这些问题基本都能回答准确。即使偶尔出现错误,影响也相对有限。
但换成另外一些问题,情况就完全不同了:
“这个产品现在可以赎回吗?”
“今天申请赎回,什么时候到账?”
“这个收益是不是一定能达到?”
如果系统把开放规则理解错了,把到账时间说错了,或者把业绩比较基准说成收益承诺,带来的就不只是体验问题,还可能影响用户判断,甚至带来业务和合规风险。
所以,95%的准确率背后,可能藏着5%的高风险错误。而这5%,有时候比前面的95%更值得关注。

不是所有错误,都应该被同样对待

后来,我们调整了评测方式,不再只统计100个问题里答对了多少个,而是按照问题的影响程度进行分级。
第一类是普通问题,比如“这款产品属于什么类型”“产品管理人是谁”“主要投资范围是什么”。这类问题偶尔答错,影响相对可控,可以在系统运行过程中持续优化。
第二类是重要问题,比如“产品最低持有期是多久”“申购和赎回规则是什么”“产品包含哪些费用”。这些信息会直接影响用户对产品的理解,需要重点验证。
第三类是高风险问题,比如“现在能不能赎回”“预计什么时候到账”“产品收益是否有保障”。这类问题一旦回答错误,可能直接影响业务决策,甚至产生合规风险。
因此,一个真正具备上线条件的AI系统,不是要求所有问题都拿到100分,而是关键问题不能出现严重错误。

测试集不是找答案,而是模拟真实用户

刚开始做评测时,我也犯过一个错误:测试问题全部是提前准备好的标准问法。
例如:
“财富牛产品的风险等级是多少?”
“这款产品的期限是多少?”
这类问题表达清楚、条件完整,模型当然比较容易回答。
但真实用户不会一直这样提问。他们更可能说:
“这个产品安全吗?”
“我买了三个月,现在想拿出来可以吗?”
“最近收益怎么下降了?”
“这个和另外一个相比哪个好?”
这些问题更接近真实的使用场景。因此,评测不能只准备标准问题,还要模拟用户可能出现的各种问法,包括口语化表达、错别字、信息不完整,以及把好几个问题揉在一起的情况。
比如用户问:“财富牛那个产品最近怎么样?”
这句话里其实包含了很多不确定信息。具体是哪一期产品?用户关注的是收益还是风险?他想了解净值表现,还是想知道近期市场变化的原因?
一个可靠的系统,不应该看到“最近怎么样”就急着编一个看似完整的答案,而应该知道什么时候需要追问用户。

真正重要的是“不会回答的时候”

很多团队测试AI时,只关注它回答正确的时候。但实际项目中,更应该关注它不会回答的时候会怎么处理。
没有拿到最新净值数据时,它会不会随便引用历史数据?
没有找到对应业务规则时,它会不会参考相似产品进行猜测?
用户的问题不够明确时,它会不会自信地给出一个模糊答案?
这些情况往往比普通的答错更危险。
一个成熟的AI助手,不是所有问题都要回答,而是知道哪些问题可以直接回答,哪些问题需要补充信息,哪些只能先提供部分内容,以及哪些情况必须明确拒绝或转交人工处理。

上线前,还要看用户是不是真的愿意用

除了回答准确性,还有一个经常被忽略的问题:业务人员真的愿意使用这个系统吗?
我们见过一些系统,技术测试结果不错,测试人员也觉得效果很好,但业务人员真正使用时却发现,回答太长,很难快速找到重点;答案没有清楚标明数据来源,不敢直接引用;遇到稍微复杂的问题,仍然需要人工再次确认;整个操作流程甚至比自己搜索资料还要麻烦。
最后,系统虽然上线了,实际使用率却很低。
所以,AI产品最终要看的不只是模型指标,还要看用户提问后是否真正解决了问题,回答能不能被业务人员直接使用,是否减少了重复工作,以及是否真的提升了工作效率。

后来

后来,我们重新调整了系统的验收标准。除了整体准确率,还增加了高频问题覆盖率、关键问题准确率、高风险错误数量、无法回答率、人工转接比例,以及业务人员的实际使用反馈。
因为一个企业AI系统真正具备上线条件,不是因为它的演示效果很好,也不是因为测试报告上的分数足够漂亮,而是因为业务人员愿意相信它。
他们知道什么时候可以直接采用AI给出的答案,什么时候需要进一步确认,也知道系统会在无法判断时主动告诉他们:
“这个问题我暂时还不能确定。”
AI项目最难的地方,从来不是让它回答更多问题,而是让它在该回答的时候回答,在不确定的时候保持谨慎。
一个真正让人放心的AI,不是永远都能给出答案,而是清楚地知道自己的边界在哪里。