ARTICLE · 1067163
给 AI 项目定指标,别先问「准不准」
给 AI 项目定指标,别先问「准不准」
给 AI 项目定指标,别先问「准不准」
去年我们跟第三方合作做合同审查,快收尾时对方递来一份报告:准确率 90% 以上。数字挺漂亮,我差点就照这个验收了。
后来让业务同事自己动手造了一批合同,专门往里埋风险坑。结果一测,该标红的风险漏了一大半,召回率不到 50%。
不是模型不行,是指标定错了方向。合同里正常条款占大头,模型只要全说正常,准确率照样高。可真正要命的是少数带风险的条款,漏一个可能就是个大坑。拿「准确率」去量一个「漏不得」的东西,量出来的全是虚的。
所以定指标得先问:漏了能不能接受?像合同审查这种活,抓错最多让人多看一眼,漏掉就是真金白银的损失。宁可多报几条疑似风险,也不许漏。
而且评测样本不能随手抽,得让懂行的业务方刻意造。把真实发生过的坑一条条埋进去,用历史数据回放一遍,看它到底能拦住多少。最后需求、技术、测试三方坐一块对齐,这项目才谈得上落地。
原文给 AI 项目定指标,别先问「准不准」,先问「漏了能不能接受」
收录于企业AI实践
北京,4小时前,