乐于分享
好东西不私藏

AI能解释报销异常吗?一次从命中规则到人工复核的完整实验

AI能解释报销异常吗?一次从命中规则到人工复核的完整实验

做费用审计时,真正让人疲惫的往往不是没有异常,而是异常太多。

模型跑完以后,屏幕上可能同时出现“同金额”“周末发生”“同一商户高频消费”“出差日期不一致”等一批提示。每条提示看起来都有道理,但审计人员仍要逐笔打开单据、核对制度、追问业务背景,最后才能判断:这是流程差异、数据质量问题,还是值得继续追查的风险线索。

于是,一个很自然的问题出现了:能不能让AI先解释这些异常,替审计人员把线索整理清楚?

答案是可以,但前提是把AI放在正确的位置上。AI适合承担的,不是“自动认定违规”,而是把模型命中的结构化信号翻译成可理解、可核验的风险说明,并帮助审计人员设计下一步核验路径。

为了把这件事说清楚,我们设计了一次小型演示实验。文中的人员、商户、金额和单据均为模拟信息,不对应任何真实企业或个人。

## 一、先把实验边界说清楚

演示数据包含报销人、部门、申请时间、消费时间、金额、商户、发票号码、费用类型、出差申请、支付账户等字段。我们预先配置了四类基础规则:

- 同一人员在较短时间内提交金额相同或接近的费用;

- 同一发票号码、票面代码或影像指纹被重复使用;

- 消费时间处于周末、节假日、深夜等非典型时段;

- 报销地点、出差地点、商户所在地或费用类型之间存在明显偏离。

其中一条演示记录同时命中了三个信号:员工在周六晚间于本地餐饮商户消费;费用被填入“异地客户招待”;同一商户在当天出现两笔金额接近、报销人相同的申请。

仅看这些信号,还不能得出重复报销或虚假报销的结论。周末招待可能有真实业务背景,两笔金额接近也可能是分桌结算,地点差异还可能来自商户主数据错误。模型完成的只是筛查,它告诉我们“这里与通常模式不同”,而不是“这里已经违规”。

这也是实验的第一条控制原则:AI接收的是规则命中结果和必要的上下文,不直接拥有最终判断权。

## 二、第一步,不让AI漫无目的地“看单据”

如果把大量原始报销单直接交给AI,再问一句“请找出异常”,结果通常很难稳定。AI可能关注偶然出现的细节,却忽略企业真正关心的制度要求。

更可靠的做法,是先由规则模型完成结构化筛查,再让AI解释规则为什么被触发。

我们给AI的输入被压缩为五类信息:命中的规则名称、相关字段值、同组记录的比较结果、对应制度条款摘要,以及禁止AI自行推断的边界。例如:不得把“周末消费”等同于违规;不得猜测员工动机;缺少合同、行程、审批记录时必须明确提示证据不足。

AI不再凭空寻找风险,而是围绕明确的信号完成三件事:翻译规则、连接信号、列出支持或否定风险判断的证据。

模型负责保持筛查口径一致,AI负责缩短“命中规则”和“理解问题”之间的距离。两者分工清楚,后续的人工复核才有稳定起点。

## 三、第二步,让AI解释“为什么值得查”

针对上述演示记录,AI没有输出“存在虚假报销”,而是生成了一段风险解释草稿:

> 该记录同时存在消费时段、费用场景和同组金额三个偏离信号。周末消费本身不能证明异常,但申请填报为异地客户招待,而商户信息显示消费发生在报销人常驻城市,需要核对实际接待对象、业务事项及地点字段是否准确。同日同商户还有一笔金额接近的申请,建议结合发票号码、支付流水、参与人员和审批附件,排除重复提交或拆分报销的可能。

这段解释的价值,不在于语言听起来像审计报告,而在于它完成了三次转换。

第一次,是把规则代码转换成业务问题,解释时间、地点和费用场景为什么不一致。第二次,是连接孤立信号:单独的周末消费或金额接近未必重要,多项偏离同时出现时,核验优先级才可能上升。第三次,是把风险描述转换成证据需求,形成发票、支付流水、接待对象和审批附件等核验清单。

但这段文字仍然只是“解释草稿”。它可能受到输入字段错误、制度摘要不完整或上下文缺失的影响。任何听起来很完整的叙述,都不能替代原始凭证和业务事实。

## 四、第三步,把AI解释交回证据链

接下来进入人工复核。我们把核验过程分为四步。

第一步,核对数据来源。确认消费时间来自发票、支付流水还是人工填报;确认商户所在地是否为可靠主数据;检查是否存在字段映射错误。很多看似复杂的异常,最后可能只是日期格式、城市代码或费用分类出了问题。

第二步,核对单据一致性。比对发票号码、票面信息、影像内容、支付金额和报销金额,查看两笔接近金额是否对应不同消费。若两笔记录拥有不同发票、不同支付流水和清晰的参与人员说明,重复报销风险会明显下降。

第三步,核对业务背景。检查客户接待申请、出差计划、会议安排、参与人员和审批链,确认周末活动是否真实发生,费用类型是否填报准确。审计人员不仅要问“有没有附件”,还要判断附件之间能否互相印证。

第四步,形成处置结论。结论可以是确认异常、合理解释、数据问题或证据不足。即使暂时无法定性,也应记录缺少哪些证据、由谁补充、何时再次复核,避免线索停留在“已关注”状态。

在这条演示记录中,如果发票与支付流水均唯一、客户活动能够被会议记录和参与人员证明,那么它可能只是地点字段填报错误;如果两笔申请使用相同发票影像,且无法说明拆分原因,则需要进一步追查重复提交或规避审批阈值的可能。

同一条模型命中,因为证据不同,可以走向完全不同的判断。这正是AI不能直接下结论的根本原因。

## 五、AI真正有价值的地方,是缩短“解释距离”

传统异常清单常见两个问题:一是信息太技术化,业务人员看不懂规则为什么命中;二是线索太零散,审计人员需要自己拼接记录、制度和证据。

AI可以在中间增加一个解释层:向上连接规则与数据,向下连接证据与核验动作。它可以批量生成结构一致的风险摘要,按照命中组合归类问题,帮助审计人员准备访谈提纲,也可以把最终核验结果整理成模型反馈。

例如,多条“周末消费”最终被证明是特定业务场景,就不应机械地维持高风险权重;地点偏离频繁来自商户主数据错误,则应优先治理数据;只有组合出现才有意义的信号,应调整为组合规则。

因此,完整闭环不是“AI解释完就结束”,而是:模型筛查、AI整理、人工核验、原因分析、整改跟踪、规则优化。AI的输出只有进入这个闭环,才可能从漂亮文字变成审计生产力。

## 六、三个必须保留的人控点

第一个人控点是输入。谁决定使用哪些字段、哪些制度和哪些规则,谁就影响AI能够看到的事实边界。涉及员工、客户、供应商或支付账户的信息,应遵循必要、授权、脱敏和最小化原则,不能为了“让AI更聪明”而无边界收集数据。

第二个人控点是证据。AI可以建议核对什么,却不能证明证据真实、完整和相关。原始凭证、系统日志、审批记录、访谈结果及其相互印证,仍需审计人员评价。

第三个人控点是结论。异常等级、问题性质、责任认定和整改要求会影响人员与业务,必须由具备授权和专业能力的人作出。AI可以生成草稿,但最终结论应保留复核人、依据、模型版本和处理记录。

还要警惕一种隐蔽风险:AI越会表达,人越容易把“解释得通”误认为“事实成立”。面对完整而肯定的输出,审计人员更要寻找反证,检查是否跳过缺失字段、混淆时间关系或把相关性写成因果关系。

## 结语:让AI站在线索与判断之间

AI当然可以解释报销异常,但它最合适的位置,不是审计结论的终点,而是规则命中与人工判断之间的工作层。

好的AI审计应用,应该让每条解释都能回到数据字段,让每个风险判断都能指向核验证据,让每次人工结论都能反过来优化模型。它不替人承担责任,却能帮助人更快地看懂线索、更有方向地寻找证据。

当我们把AI放在这个位置上,问题就不再是“它能不能代替审计人员”,而是“它能不能让专业判断建立在更清楚、更完整、更可追溯的信息之上”。这才是AI进入费用审计最值得期待的一步。