ARTICLE · 1102838
金融,缘何成为AI云公司的试金石?
给金融AI以冷静思考,管用的是一串数字。麻省理工学院2025年一项针对企业级生成式AI的研究发现:约95%的试点,最终没能真正跑进生产、算不出可衡量的收益。放回金融行业,一个更严峻的判断是——眼下满屏的“AI助手”,很多并没有改变原来的业务流程,只是挂在旧系统外面的一个入口。
9月的杭州,云栖大会——“可信智行”2026金融智能体实战峰会,正是围绕着这个落差展开。台上是险企、券商、支付机构、财富管理平台的技术与业务负责人,演示的都是金融行业本身的业务——办一笔理赔、审一段代码、配一份资产、跟一次盘,朴素得谈不上惊艳。阿里云智能公共云事业部副总裁、新金融行业总经理张翅记下了一个变化:一年前,客户问他的是“能不能做”;今年,问题换成了“出了事谁负责”。同一个客户,问的题变了。客户没有变挑剔,是金融这个行业的底色正压到AI头上——它是整个经济体里监管最严、对可追溯与责任到人要求最高的地方。金融这道题,本质上是一次万米深潜——越往深处,水压越大、越错不起,也越能验出谁真正扛得住。
峰会明面从数据、底座、平台到应用四个方面讲金融机构怎么用AI,底下其实也回答了另一道题:一家AI云公司到底行不行,金融这块试金石很能说明问题。监管严格、容错空间小,每一笔都要算得清、出了错要找得到人——成本、容错、工程、交付、治理——五道硬门槛一次全压了上来。谁跨得过,谁才算真有本事。
01
第一道题 · 成本:
先把"投入产出比"问到底
金融给AI云公司出的第一道题,是成本。平安科技总经理助理曹峰在峰会现场披露的那组数字,就是一份答卷:过去一年,平安日均Token用量从300亿涨到超3000亿,算力规模却只从800PF增到1500PF——不到两倍的投入,撑起了十倍增长,靠的是一整套全栈优化:单位算力Token产出提升368%,单位Token成本下降76%。
这组数字的分量,不在“增长快”,而在“没同比例买单”。过去两年,金融机构对AI普遍的顾虑是调用量一涨、成本就同步攀升,试点越多、账单越厚。平安给出的答案,是模型、推理引擎、算力调度的全栈优化,把Token的增长摊薄。成本曲线一旦向下,一些原本“算不过账”的场景就有了投产的资格——平安的快捷服务“一句话办事”,据企业公开分享数据,上线四个月,覆盖交易、融资、理赔等三百多项高频服务,使用人次破亿,端到端解决率92%,平均办理时长比传统模式省下一半以上。只有当单位成本降到一定程度,规模化才从一句PPT上的话,变成一笔能在财务模型里跑通的账。

02
第二道题 · 容错:
一次都错不起
第二道题更硬:AI云敢不敢让智能体去碰钱。中国银联云计算中心高级总监任明描述的,是一个对失误零容忍的战场。银联连着两千五百家机构、六千万商户,任何一次自动决策都直接触达资金。今年,银联承接了国家人工智能应用中试基地里金融行业入选的代表性中试基地,把合规、评测、安全护栏做成了公共能力。
在支付这个场景里,Agent不能只会“完成任务”,还得知道什么时候该停。任明给出的护栏指标很具体:据峰会现场披露,平均响应时间降低35%,交易吞吐提升40%,违规检测能力提高50%。涉及敏感数据,则用隐私计算严格锁定数据边界——模型可以学,数据不出域。金融业对“机器碰钱”的警惕,有深刻的行业记忆。一次失控的自动交易,足以在几十分钟里吞掉一家机构。这不是修辞,是写进风控手册的沉痛案例。所以当AI从“给建议”走到“下指令”,安全护栏、独立评测和可回滚,就不再是加分项,而是入场券。在金融业,评判AI的标准并不按能力排序,而按底线排序——一次不犯错,远比一次更聪明,更给云厂商加分。
03
第三道题 · 工程:
把 Demo 逼成交付
张翅把这场变化概括成一句话:从会回答,到能交付。演示里答得漂亮,和生产里把业务真正做成,是两回事。张翅的判断是,金融机构的AI正从“对话”走向“执行”,这个过程中,可信是关键。他把支撑这一步的工程要求拆成五个可信智能体框架:业务本体、智能体工程体系、评测体系、运行框架,以及数据与计算的融合。
这五层要求,每一层都对应一个真实的坑。任务跑长会“漂移”——超过两千步的长流程,模型会忘记自己是谁、要干什么,于是要有企业级的上下文管理;输出要能被审计,就得把客户经理脑子里的隐性经验,变成可执行、可校验的结构;评测不能只考结果,还要考过程,还得有一套专门检验漏洞的对抗评测集。
监管部门此前发布的银行业保险业人工智能安全开发应用相关指导意见,把“谁使用谁负责”写成了制度。这道监管红线,恰好和行业自己的直觉重合:技术可以借用,责任不能外包。张翅把成熟度分成五级,从能对话、能执行,到可溯源、可计算可交付,最后到能持续迭代——不少机构的Agent,还停留在前两级,上线很快,转正很难。难的不是让Agent稳定运行一次,而是让它连续跑一万次都不衰减。这中间隔着的,不是更贵的模型,是工程。
张翅讲的这套工程能力,阿里云把它沉淀成一个有名字的底座—— Hybrid Intelligence Cloud,混合智能云。它要做的,是把模型那种“大概率正确”的概率智能,压成金融业务能审、能溯、能兜底的逻辑智能。
底座分三层。最底下是混合算力(Hybrid Infra):公共云与本地、国产与非国产的算力被统一纳管,按业务负载动态调度——供给侧跟得上用量持续攀升,规模化交付才成为可能。
中间是混合模型(Hybrid Model):非敏感、高并发的场景走千问 API,数据敏感的留在本地私有化部署,专业场景再用机构自己的数据做后训练,把金融垂直模型逐步校准。
最上面是混合智能体(Hybrid Agent),也是“把 Demo 逼成交付”真正落地的那层。它分两类角色:Coding Agent 把 AI 铺进编码、测试这些研发环节,平安的 AI Coding 生成率从 30% 提到了 80%;Working Agent 把智能体嵌进营销、服务、风控的核心流程,让它从“答一句”变成“办一单”,一年辅助成交 573.13 亿元。

04
第四道题 · 交付:
只认办成的事
第四道题不看参数,只看结果:客户有没有少打一个电话、少跑一次柜台、少填一份表单。中泰证券把这条标准落在了“投资者的一天”里。CIO张勇的描述是,盘前问行情、盘中追个股、收盘看复盘,原本散落在多个应用里的动作,被智能体串成一条线。员工侧配齐九类投顾工具,为客户提供全旅程、全时段的陪伴服务。支撑这一切的是一套叫“仓颉”的平台,跑了二十多个千问系列模型、上百个场景。张勇的说法很客观——AI代码评审采纳率85%,需求交付周期缩短三成,都是“辅助”人,不是替代人。他留下一句更值得琢磨的话:AI不会让所有券商变得一样,反而会放大每一家券商原本的专业积累。
05
第五道题 · 治理:
AI 被推上董事会
第五道题,也是更深的一道,是治理。峰会次日清晨,还有一场规格更高的闭门研讨。阿里云联合中国金融四十人论坛(CF40),将金融顶级智库搬进了云栖——议题为“智能体落地:实践、治理与决策边界”。参会的是国有大行、头部股份行、头部险企和券商的技术掌舵者,参与过AI相关监管规则制定的银行家也在场。
这场闭门真正争论的核心,不是模型参数,是“决策边界”:AI该由谁来管。监管部门此前发布的8号文给出的方向,是把人工智能风险纳入全面风险管理体系,并要求董事会指定专门委员会,为AI的开发与应用负责。几位参会者分享的落地动作更进一层——委员会由一把手挂帅,把“不计成本上算力”换成“每个Token都要算ROI”。还有一条共识并不迎合热度:智能体报出来的漂亮数字,多半是特定产品、特定场景里的结果,参考价值有限;连一线的人都承认,两个业务画像一致时小模型就够,只有两者结论相左时,才值得动用大模型。闭门会把问题从“AI能干什么”,抬到了“谁有权让它干、能走到哪一步”。这条“决策边界”,比一次漂亮的演示更能决定金融AI能走多远。
06
五道题做下来,谁站得住
五道题做下来,一个画面浮了出来:这些彼此竞争的机构,其实共用着同一层地基——那层被金融验过、又能陪它们走远的底座。阿里云把答卷交成了“混合智能云”的三层,正好逐条对上金融出过的题:算力层解成本这道题,把Token做便宜、把供给做弹性;模型层解“该用哪个大脑”这道题,非敏感、高并发的走公共云API,数据敏感的本地部署,专业场景基于机构自己的数据做后续训练;智能体层解工程与交付这道题,一边提研发效率,一边上业务速度。它不承诺一个包打天下的大模型,而是把选择权按场景交到机构手里。平安、银联、中泰、盈米、九方,都跑在这套架构上。
市场的坐标也值得一提。IDC口径下,阿里云连续第七年拿下金融云第一,并在金融AI全栈云首次报告中居首;沙利文对金融通用智能体的评估里,阿里云同样份额第一。三家政策性银行、十二家股份制银行、八大保险集团,已全线使用千问大模型。但张翅在峰会收尾时,反复强调的反而不是这些数字。他说,云厂商可以提供工具,不能替金融机构作答。什么数据能进模型、什么任务必须留在本地、什么结果需要人工复核——这些问题,最终只能由机构自己回答。
被金融这块试金石验过的能力,才算数。阿里云想争的,不是“我参数最高”,而是“在金融这里,我经得住检验”。

结语
一场峰会开下来,反直觉的地方,是它几乎不谈“智能”,全程都在谈“信任”。金融这道题,考的从来不是模型在榜单上排第几,而是一家AI云公司敢不敢把自己的能力,放进一条每一笔都算得清、出了错找得到人的流程里。
成本、容错、工程、交付、治理——五道题全答对,才配得上“能干”两个字。而对金融业来说,AI真正的成人礼,也不是它答得多漂亮,是它办完一单之后,有人能翻着记录说清楚:这一步谁做的,出了错谁担。


广告