

智能体的安全问题分析
当AI开始自主决策
金融业务如何守住安全边界?




在银行APP中输入“查一下本月信用卡账单,20日前帮我还款”,智能体可能需要读取账户信息、核对账单、选择付款账户,再调用支付接口完成操作。这与普通智能客服有明显区别:客服回答错误,影响通常停留在内容层面;智能体判断错误,可能继续调用工具,把错误转化为真实业务操作。
美国国家标准与技术研究院(NIST)在2026年发布的智能体安全征求意见材料中指出,AI智能体能够规划并采取影响真实系统或环境的自主行动,其特有风险来自模型输出与软件系统功能的结合,包括接触对抗性数据、使用被污染的模型,以及在没有外部攻击时因目标错配作出有害操作。对金融机构而言,关注点也由“模型会不会答错”,进一步延伸到“智能体会不会做错、越权做和带着数据做”。
本文所举金融业务情形均为安全测试场景,用于说明风险机理,不对应已经发生的真实事件。


一
智能体的风险为什么更复杂?
一个典型智能体通常包含模型、任务规划、记忆、知识库、工具和身份凭证等组件。用户给出目标后,模型拆解任务、选择工具并读取外部信息,执行结果又会进入下一轮判断。风险因此不再集中于某一次模型回答,而是沿着“目标理解—决策规划—工具调用—结果反馈”的链路传递。前一步的细小偏差,可能在后续自动执行中被逐步放大。
这条执行链路离不开底层计算平台。2025年8月发布、2026年2月实施的GB/T 45958—2025《网络安全技术 人工智能计算平台安全框架》,从安全功能和安全保障两个方面提出人工智能计算平台安全框架。智能体运行涉及模型、数据、算力资源和工具接口;如果基础环境在安全功能或安全保障方面存在薄弱环节,上层的任务约束再严密,也可能在执行过程中失效。因此,智能体测评不能只检查模型回答和工具调用,还要把承载其运行的计算平台纳入范围。
OWASP于2025年12月发布智能体应用十大风险,列出了智能体目标劫持、工具误用、身份与权限滥用、智能体供应链漏洞等问题。结合金融业务涉及敏感数据和真实资金操作的特点,自主决策、权限使用和数据流转尤其值得关注。


二
自主决策风险:从“答错”变成“做错”
智能体需要把自然语言目标转换为可执行步骤,但用户表达往往并不完整。例如,“选择收益高一点的产品”没有明确风险等级和投资期限,“帮我处理异常账户”也没有说明可以查询还是可以冻结。如果系统自动补全缺失条件,模型幻觉、规则理解偏差或目标错配就可能影响后续操作。对于授信审批、投资建议、交易处置等场景,关键条件不完整时应暂停任务并请求确认,不能由模型自行推定。
外部数据还可能改变智能体原有目标。攻击者可以把恶意指令藏在网页、邮件、附件或知识库内容中,等待智能体读取;系统如果不能区分可信指令和不可信数据,就可能发生间接提示注入,也称智能体劫持。NIST下属人工智能标准与创新中心(CAISI)使用AgentDojo模拟环境开展测试时,针对特定模型设计的新攻击,使最强攻击的成功率由基线方法的11%升至81%;将五类攻击分别重复25次后,平均成功率由单次测试的57%升至80%。这些数据仅代表特定模型和模拟环境,不能推断金融行业整体风险水平,但说明智能体测试不能只跑一次,也不能长期沿用固定攻击样本。


三
权限滥用风险:为完成任务,智能体拿到了多少权限?
智能体查询客户资料、调用风控服务或操作业务系统,都要使用账号、令牌或密钥。如果多个任务共用长期凭证,或者为了接入方便直接授予较大权限,原本只需查询的任务就可能具备修改、删除甚至交易能力。多智能体协作还会带来权限转委托问题:上游智能体有权调用下游工具,并不代表下游智能体可以继承全部权限。
NIST国家网络安全卓越中心在2026年2月发布的概念文件中,将智能体身份识别、授权、审计和不可否认性列为需要解决的问题。落实到金融业务,应为智能体建立独立身份,按照任务、工具、数据范围和有效时间授予最小权限;高风险操作应在执行前进行人工确认,任务结束后及时回收临时凭证。测评时不能只验证正常功能,还要使用越权工具、过期令牌、已撤销授权和跨智能体转委托等用例,确认控制措施是否真正生效。


四
数据泄露风险:信息进入智能体后去了哪里?
客户身份信息、账户与交易数据、内部制度以及工具返回结果,都可能进入提示词、检索增强知识库、短期上下文、长期记忆或运行日志。泄露也不一定表现为批量下载:模型回答多带出一段客户信息,工具参数写入了不必要字段,调试日志记录访问令牌,都属于需要检查的数据暴露。
记忆模块会让风险延后出现。MITRE ATLAS已将“AI智能体上下文投毒”“AI智能体工具数据投毒”等列入AI系统攻击技术矩阵。未经验证的内容一旦写入长期记忆,可能在之后的其他任务中被再次检索。测评可以在不使用真实客户信息的前提下放入唯一识别标记,沿着输入、知识库、记忆、工具和日志追踪标记去向;也可以写入与系统规则冲突的内容,观察智能体把它作为参考资料,还是误当成新的执行命令。


五
智能体安全应该怎么测?
智能体安全测评应从完整业务任务出发,而不是只向模型提问。测试需要记录目标来源、规划步骤、模型版本、工具选择、调用参数、权限变化、人工确认和执行结果,观察信息不足时系统是否停止,越权请求能否被拒绝,敏感数据是否流入无关组件,异常发生后能否中止任务并还原过程。
金融行业已有可供衔接的算法评价和信息披露基础。2021年发布的JR/T 0221—2021《人工智能算法金融应用评价规范》,规定了金融领域人工智能算法的基本要求、评价方法和判定准则;2023年发布的JR/T 0287—2023《人工智能算法金融应用信息披露指南》,从披露原则、形式和内容入手,推动提高金融算法应用的透明度与可解释性。两项标准主要面向算法金融应用,智能体则把算法输出进一步接入工具和业务流程。相应地,测评对象也要从算法结果延伸到目标解析、规划过程、工具选择、权限使用、人工确认和最终执行结果。
自主决策方面,可通过模糊目标、冲突条件、间接提示注入和重复执行检查决策稳定性;权限方面,可通过超范围查询、跨工具调用、凭证过期和授权撤销验证最小权限;数据方面,可通过敏感标记、记忆污染和日志检查追踪信息流向。任务约束遵循率、越权操作成功率、敏感信息泄露率、人工干预有效率和审计记录完整率可以作为候选指标,但应先明确场景、样本和计算口径,再用于结果比较,不能脱离测试条件给出笼统结论。

写在最后
智能体安全测评并非另起炉灶。国家金融科技测评中心(银行卡检测中心BCTC,国家金融IC卡安全检测中心,工商注册名称:北京银联金卡科技有限公司,以下简称中心)目前参与并持续推进多项人工智能相关国家标准、行业标准和企业标准研制工作。已公开发布的代表性标准包括GB/T 45958—2025《网络安全技术 人工智能计算平台安全框架》、JR/T 0221—2021《人工智能算法金融应用评价规范》和JR/T 0287—2023《人工智能算法金融应用信息披露指南》。三项标准分别从计算平台安全、金融算法评价和信息披露切入,为智能体安全测评提供了可以衔接的标准基础。
在此基础上,中心已建立包含测评标准、数据集、工具和流程的大模型金融应用测评体系,支持从安全与功能两个方面开展金融场景测评。公开资料显示,相关场景应用工作已覆盖用户交互准确性与适应性、金融领域应用效能、运行效率与功耗等内容,并可对5类31种内容安全风险开展评估。
智能体在模型之外增加了规划、工具、权限、记忆和环境交互,现有大模型测评不能直接替代智能体安全测评。中心正在开展智能体支付安全检测能力建设,搭建面向行业的检测平台和测评体系,并将既有的大模型测评、金融业务测试和信息安全测评能力向智能体场景延伸。同时欢迎正在开展智能客服升级、智能运营、风险分析、投顾辅助及业务流程自动化的金融机构和技术企业,与我们交流测评需求,共同验证智能体应用的安全边界。

【资料来源】:
以下资料均来自监管机构、标准组织或官方网站,查询日期为2026年8月6日。
NIST CAISI:《CAISI Issues Request for Information About Securing AI Agent Systems》,2026年1月12日。
NIST CAISI:《Technical Blog: Strengthening AI Agent Hijacking Evaluations》,2025年1月17日发布、2025年12月19日更新。文中11%、81%、57%和80%均来自该机构在AgentDojo模拟环境中的特定实验。
NIST NCCoE:《Accelerating the Adoption of Software and AI Agent Identity and Authorization Concept Paper》,2026年2月5日。该文件为初始公开草案。
OWASP GenAI Security Project:《OWASP Top 10 for Agentic Applications》,2025年12月9日。
MITRE:MITRE ATLAS AI Systems Threat Matrix。
银行卡检测中心:《国家金融科技测评中心(银行卡检测中心)提供人工智能算法金融应用测评服务》,2021年4月2日。
中国银联:《银联金卡推进大模型测评技术护航金融数智化创新》,2025年8月26日。
银行卡检测中心:官方网站人工智能大模型测评服务介绍。
全国标准信息公共服务平台:《GB/T 45958—2025 网络安全技术 人工智能计算平台安全框架》,2025年8月1日发布、2026年2月1日实施。
全国标准信息公共服务平台:《JR/T 0221—2021 人工智能算法金融应用评价规范》,2021年3月26日发布并实施。
全国标准信息公共服务平台:《JR/T 0287—2023 人工智能算法金融应用信息披露指南》,2023年11月8日发布并实施。
银行卡检测中心:《2024年服贸会|银联金卡展厅亮点纷呈》,2024年9月12日。文中披露公司深度参与JR/T 0221—2021、JR/T 0287—2023等行业标准编制。
银行卡检测中心:《21财经丨专访国家金融科技测评中心副总经理谭颖:以安全底座支撑金融创新》,2026年5月27日。文中披露中心正在开展智能体支付安全检测能力建设,搭建面向行业的检测平台和测评体系。
注:智能体技术及相关标准仍在持续演进,涉及产品能力和服务范围的内容,以相关机构正式发布为准。

夜雨聆风