如果你参加过足够多的预算绩效评价项目,你会对一个场景再熟悉不过:第三方机构的评价组坐在会议室里,面前摊着几十份项目单位自评表,每份表格上密密麻麻地填着“产出数量达标率100%”“社会效益显著”“服务对象满意度≥90%”——然后评价组用两天时间逐一打分,出具一份80页的评价报告。第二年,同样的流程再来一遍。
这不是绩效评价,这是形式主义的生产线。
2026年,情况正在发生微妙但不可逆的变化。浙江在预算一体化系统中嵌入了AI绩效指标智能推荐和智能审核双智能体,辅助100余家预算单位精准引用指标1018条,覆盖235个项目,编制时长缩短超过50%,财政部门在1天内完成810个项目的审核——这在以前需要数周。广西建立了覆盖区、市、县三级的绩效综合管理服务平台,汇集管理指标8.2万条、汇聚数据超500万条。山东李沧区的绩效指标引用次数已达362次,绩效目标编制的专业化水平显著提升。
这些数字背后,是一场静悄悄的革命:预算绩效管理正在从“手工业时代”进入“工业化时代”。本文试图厘清这场变革的技术逻辑、制度含义和潜在风险。
一、传统绩效评价的四个“不可能三角”
在引入AI之前,预算绩效评价面临四个根深蒂固的结构性矛盾:
矛盾一:全覆盖vs深度审。全面实施预算绩效管理意味着“每一分钱都要评”,但财政部门的人力是有限的。浙江2026年预算编制季,省级及杭州市本级有810个项目需要审核——靠人工审,大概需要10个科室的人干两周。结果就是:要么只审重点(放弃全覆盖),要么走过场(放弃深度)。
矛盾二:标准化vs个性化。绩效指标需要可比性(标准化),但每个项目的业务逻辑完全不同(个性化)。现行的做法是“一指标套万物”——用一个笼统的“社会效益显著性”指标去评学校建设、医院建设、道路建设,结果当然是“都显著”。
矛盾三:客观性vs低成本。真正客观的绩效评价需要深度调研、数据核实、实地走访——成本极高。低成本的评价靠自评表和办公室审查——客观性极差。第三方评价机构为什么总被诟病“走马观花”?因为深度评价的成本与合同金额不匹配。
矛盾四:结果应用vs激励相容。理论上,绩效评价结果应该与预算安排挂钩。但现实中,如果评价结果真的导致某部门预算被砍,下一次自评时这个部门会怎么做?当然是给自己打满分——这就是经典的“古德哈特定律”:当一个指标成为目标,它就不再是好指标。
表1:传统绩效评价的四个矛盾与AI突破口
二、AI+绩效的五个落地场景
截至2026年中,AI在预算绩效管理中的应用已经不是“畅想”而是“实践”。以下五个场景已经可以看到实质性的突破:
场景一:绩效指标的智能推荐。浙江的AI智能体可以自动解析项目属性、匹配同类历史数据,个性化推荐核心绩效指标,并纵横比对指标数值的合理性。比如,当某日常运行经费项目提交的绩效目标中,“人均运行费用”比上年度自评完成值低了30%,AI会自动预警。这个场景的技术门槛并不高——本质上是一个“检索增强生成(RAG)”系统,基于指标库做语义匹配和异常检测——但效果立竿见影。
场景二:预算执行的智能监控。浙江打造了“AI+预算执行常态化监督”应用场景,突破了传统系统仅依赖固定关键词触发预警的局限,AI预警精准度达到68%,较传统系统预警提高44个百分点。传统预算执行监控的痛点在于:如果只靠关键词(“违规”“超标”“异常”)触发预警,漏网之鱼太多;如果放宽阈值,又全是误报。AI通过异常检测(anomaly detection)算法,结合历史执行数据和同类项目横向比对,自动识别“不该慢的慢了”“不该快的快了”,精准度大幅提升。
场景三:财政票据的智能预审。浙江的票据监管AI智能体可以自动解析票面及附件信息,关联政策依据开展合规预审,单笔业务审核时长从5-10分钟压缩至1分钟以内,预审准确率达90%以上。形式上是效率提升,实质上是审核逻辑的标准化——从“人脑判断”升级为“规则引擎+语义理解”。
场景四:政策全生命周期管理。浙江在预算一体化系统中设置了重大政策全生命周期功能模块,将省级重大政策纳入全生命周期绩效管理,全面展示政策实施周期、资金分配因素、周期绩效情况等信息,开发预警功能提醒主管部门及时开展到期绩效评价。这个场景的核心不是AI技术本身,而是“数据打通”——把发改、财政、统计部门的数据联通后,AI才能发挥“全景式分析”的优势。
场景五:第三方评价机构的智能画像。浙江搭建了第三方管理平台,归集整理第三方机构和主评人执业质量打分、评价案例、行业政策等数据,构建机构画像库、评价案例库、政策文件库“三库”。平台已有注册机构102家,录入绩效评价案例337个,相关政策文件215个。这个场景解决的是另一个层面的问题:不是“项目好不好”,而是“评价者靠不靠谱”。
三、技术路径:从RAG到Agent
当前AI+绩效管理的技术路线可以用“三层金字塔”来描述:
| L1:基础应用 | ||||
| L2:中级应用 | ||||
| L3:高级应用 |
表2:AI+绩效管理的三层技术架构
2026年的主流实践集中在L1层。这本身就是一个重要的信号:不需要等到强人工智能(AGI)出现,仅用现有的RAG技术+规则引擎,就已经可以在“指标推荐”“智能审核”“异常检测”三个环节产生显著的效率提升。浙江推行的“AI智能预审+人工重点复核”工作机制,本质上是L1层应用的制度化。
L2层的潜力在于解决“评价质量”问题。当AI能够自动解析自评报告的文本、交叉比对多源数据、识别逻辑矛盾时,就可以从根本上改变“自评自说自话”“第三方机构走马观花”的顽疾。但L2层的推行需要两个前提条件:一是各业务系统的数据打通(发改、财政、统计、行业主管部门的数据需要在一个平台上融通),二是足够的标注数据来训练NLP模型。
L3层——让AI自主完成绩效评价并给出预算安排建议——在今天看来仍然激进,但并非科幻。技术上,Agent框架已经具备了任务规划、工具调用、结果合成的基本能力;制度上,最大的障碍不是技术不成熟,而是“责任归属”——如果AI建议砍掉某部门的预算,出了问题谁来负责?
四、制度风险:数字赋能不能替代制度设计
对AI+绩效管理,必须保持一种“审慎的乐观”——技术可以解决效率问题,但不一定能解决制度问题。以下四个风险值得警惕:
风险一:算法黑箱强化了技术官僚的权力。当绩效评价从“人评”变成“机评”,表面上看减少了人为干预,但算法本身的逻辑、参数设定、训练数据的选择,都蕴含着设计者的价值判断。如果AI模型给出的效率排名被直接用于预算分配,而这些排名背后的方法论(比如采用了哪个DEA模型、投入产出指标如何选择)不透明,那么“数据驱动”实际上变成了“设计者驱动”。
风险二:数字化加大了“行为扭曲”的空间。古德哈特定律在数字化时代只会更严重,不会更轻微。当各单位知道了AI的审核逻辑(比如异常值检测的阈值、指标匹配的相似度算法),他们就可以“反向优化”——不是真的提升绩效,而是产出看起来符合AI预期的数据。传统绩效评价至少还有人的直觉和经验作为防线,全AI审核可能会让虚假数据的“通过率”反而更高。
风险三:“数据孤岛”不是技术问题,是利益问题。AI+绩效管理的全部效能,取决于数据打通的程度。但中国政府部门之间的数据壁垒,从来就不是技术能力不够——是“我的数据凭什么给你用”的问题。广西在建立绩效综合管理服务平台的过程中特别强调“打通发改、财政、统计等部门数据渠道”,这恰恰说明在大多数地方,这些渠道至今没有真正打通。
风险四:投入成本与边际收益的不对称。AI系统不是一次性投入——持续维护、数据更新、模型调优、安全防护都需要资源。一个县级财政部门花500万建了一套AI绩效审核系统,但每年涉及的专项资金可能只有2亿元——投入产出比是否合理?浙江是发达省份,可以做“AI+绩效”的深度试点;但对于财力薄弱的中西部地区,可能更需要的是先把“人工绩效评价”做到及格线以上。
五、推进策略的四条建议
基于以上分析,对于AI+绩效管理的推进节奏,我提四条建议:
第一,以省为单位建设共享平台,避免重复投入。每个市甚至每个县都自己做一套AI绩效系统,是巨大的浪费。浙江省的实践表明,省级统一搭建平台、市县接入使用,是最经济的模式。在此基础上,建立省级指标库和案例库的共享机制——山东的“政策和项目预算绩效指标标准体系”已被嵌入预算一体化系统,各市县可以强制引用,这就是一个标杆做法。
第二,AI不做最终决策,只做辅助推荐。在现阶段,AI的角色应该是“预审员”而不是“裁判员”。浙江“AI智能预审+人工重点复核”的模式值得推广——AI负责快速筛查“明显有问题”的项目(指标缺失、数值偏离过大、逻辑矛盾),人负责做定性判断(政策合理性、政治可行性、创新性评估)。这个定位既保护了AI不承担它不该承担的责任,也确保了评价的最终解释权在人手中。
第三,AI方法论的公开透明是底线。AI绩效审核所使用的指标匹配逻辑、异常值检测算法、效率评分方法,都应该向评价对象公开。只有公开方法论,“算法黑箱”才不至于演变成“算法霸权”。更进一步,建议引入“AI可解释性”技术要求——对于每一个被AI判定为“低效”或“预警”的项目,系统必须输出可追溯的理由,而不是一个冷冰冰的分数。
第四,数字化必须与制度改革同步推进。技术从来不是万能的。如果不改变“自评自说自话”“评价结果不敢用”“预算与绩效两张皮”这些制度性问题,再先进的AI系统也只是把低质量的评价做得更快而已。零基预算改革(浙江、重庆、山西等地正在推进)、成本预算绩效管理(上海各区2026-2028方案)、预算执行常态化监督——这些制度改革为AI应用提供了制度土壤。反过来,AI工具也能降低这些改革的执行成本。两者的关系是相互赋能,不是替代。
六、结语
1950年,图灵在《计算机器与智能》中提出了一个至今仍在被讨论的问题:机器能思考吗?76年后,在预算绩效管理这个看似传统的公共财政领域,我们看到了“机器的思考”正在以最务实的方式渗透进来——不是哲学辩论,而是帮人做指标匹配、做异常检测、做交叉验证。
但这篇文章想说的不是“AI很厉害”。恰恰相反——AI最强大的地方,不在于它能替代人的判断,而在于它能暴露人过去根本没有做过判断。当一个AI在1天内发现810个项目中有252个存在问题、而人工审核过去的检出率只有个位数时,它揭示的不是AI有多聪明,而是过去的“人工审核”有多敷衍。
AI+绩效管理的“图灵时刻”,不是机器超越了人,而是机器让人不得不面对一个尴尬的事实:在没有机器的年代,我们可能从来没有真正重视过绩效。
参考信源: 1. 浙江:应用人工智能赋能财政科学管理(财政部《中国财政》,2026年) 2. 浙江:加强预算绩效管理 激活内生发展动力(中国财政,2026年) 3. 财政科学管理专题·数字赋能转型加速落地(搜狐财经转载,2026年) 4. 广西:以人工智能赋能绩效管理(当代广西,2026年) 5. 青岛市李沧区:深化财政科学管理改革 提升预算绩效管理成效(2026年7月) 6. 重庆:全面深化零基预算改革集中财力促发展惠民生(重庆财政局,2026年8月3日) 7. Turing, A.M. (1950). Computing Machinery and Intelligence. Mind, 59(236), 433-460. 8. Goodhart, C.A.E. (1975). Problems of Monetary Management: The UK Experience. Papers in Monetary Economics.
学员及证书管理:

• 预算绩效评价高端人才-学员应按培养流程参加学习,北京国家会计学院负责培训期间学员的日常管理,建立学员档案,学习系统将记载学员在培训期间的学习等情况。
• 学员完成培训,综合测评合格后准予毕业。
学习附加价值
• 学习期间,学员可免费参加北京国家会计学院举办的预算绩效评价领域相关论坛。
• 参加本培训的学时,可申请当年的会计人员继续教育对接证书。
• 报名北京国家会计学院预算绩效评价高端人才项目,可获得价值1998元的“国会在线”VIP金卡,享一年期免费学习所有线上精品课程。

报名方式:扫描二维码即可报名

邀请您一起动一动发财的小手,转发给身边的朋友或者行业群,我们一起学习,共同进步!

声明:“内控绩效研究院”微信公号刊载此文,是出于传递更多信息之目的。若侵犯了您的合法权益,欢迎致电13681131100,我们将及时处理。
夜雨聆风