作者按:从交易所到证券公司,长期从事监管科技、金融科技工作,有十年多应用系统及数据规划和建设经验,在人工智能、大数据等技术和场景深度结合上有丰富的实战项目。曾亲手(非挂名)主导多个AI属性的大型平台和系统的建设,绝大部分项目均为公司首个同类型项目,对行业技术演进和现状有深刻的洞察,全面负责AI基础设施和重点场景建设,负责公司中后台系统的规划建设、主导自研的各类数字化系统在行业斩获多项大奖,负责研发的风险管理平台更是全行业独一无二的业务风险数字化平台。
「AI重塑证券业」之一:证券公司AI全景图——九大领域成熟度扫描
「AI重塑证券业」之二:AI如何重塑研究能力——从信息搬运到认知增强
「AI重塑证券业」之三:AI驱动的投资决策——从信号到执行的智能链路
「AI重塑证券业」之四:AI让财富管理更懂客户——客户旅程的智能化重构
「AI重塑证券业」之五:AI赋能投行业务——从项目承揽到存续管理的效率革命
券商AI的真正分水岭,不在于谁率先用上了大模型,而在于谁能让大模型7×24小时稳定跑在生产环境。从PoC到生产,中间隔着一条"死亡之谷"。
一、领域现状:券商AI基础设施的三重挑战
2025年初,DeepSeek横空出世,不到一个月便有近二十家券商完成本地化部署,堪称券商科技史上少见的"军备竞赛"。到2026年4月DeepSeek V4(1.6T参数)发布,行业已从"抢部署"进入"比应用深度"的新阶段。但"部署"和"生产"之间,隔着一道深不见底的鸿沟——部署一个开源大模型,一个工程师半天就能搞定;让它稳定服务上千名投研人员、日均调用十万级、幻觉率压到可接受范围——这才刚刚开始。

券商AI基础设施面临三重结构性挑战:
挑战一:算力——自建vs云vs混合的取舍
| 自建GPU集群 | |||
| 公有云API | |||
| 混合部署 |
多数券商走了"混合"路线,但"混合"二字背后是棘手的工程问题——模型如何在不同算力间无缝切换?数据如何在本地与云端间安全流转?推理请求如何在多云间智能路由?没有标准答案,只能在工程实践中反复打磨。
国信证券2025年2月即采用本地+云端混合部署策略——本地部署DeepSeek-R1-Distill-32B保障数据安全与响应速度,同时引入云端DeepSeek-V3和R1提供更强推理能力,构建"1+N"技术底座体系。
一年后的V4部署潮中,行业策略已明显分化。国泰海通2026年4月24日在DeepSeek V4发布当日即完成国产芯片(昇腾)适配及本地化部署,成为业内首家Day0接入的券商,V4已在其自研Novastation研究工作台与代码助手中展开场景验证(来源:财联社2026.04.24;上证报2026.04.24)。国泰海通采用"1+N"模型矩阵——1个通用大模型为基石,共建行业垂类大模型"君弘灵犀",辅以N个场景模型——整体走的是本地化为主、多模型并行的路线,与国信的混合部署策略形成鲜明对比。
挑战二:平台——AI中台的定位与边界
AI中台是近两年券商科技建设的高频词,但容易陷入两种误区:
误区一:中台=所有AI能力的集合。 把NLP引擎、OCR服务、知识图谱、大模型推理一股脑塞进"中台",结果变成什么都管但什么都不精的"大杂烩"。 误区二:中台=模型托管平台。 只管模型部署和API分发,忽略了数据治理、应用开发、运营监控等关键环节。
真正有效的AI中台,应当是一个AI能力的工厂而非仓库——不存储能力,而是生产、编排和交付能力。
挑战三:工程——从PoC到生产环境的死亡之谷
据行业估算,券商大模型项目从PoC到生产部署的转化率普遍偏低,多数项目卡在了以下环节:

| 稳定性 | ||
| 可观测性 | ||
| 安全性 | ||
| 可维护性 | ||
| 合规性 |
从PoC到生产,不是功能的叠加,而是工程体系的建设。 这正是本篇要拆解的核心命题。
二、核心场景
场景1:大模型平台建设
大模型平台是AI基础设施的"操作系统"——不直接解决业务问题,但决定了上层应用能否稳定运行。
模型选型与评测
券商大模型选型已从"谁最强"转向"谁最合适"。关键不在于某个榜单上的分数,而在于:你的场景需要什么能力?你的算力能撑多大的模型?你的数据能支撑多深的微调?
当前主流国产大模型在券商场景的适配对比:
| DeepSeek(V4/V3.1/R1) | ||||
| 通义千问(Qwen3.6) | ||||
| Kimi(K2.6/K2.5) | ||||
| MiniMax(M2.7/M2.5) | ||||
| 智谱GLM-5.1 |
券商已不再追求"一个模型打天下",而是根据场景选择最合适的模型——投研用大参数模型保证深度,客服用小模型保证速度。DeepSeek在推理能力和性价比上优势突出,V4发布后性能进一步跃升,适合对思考深度要求高的场景;通义千问在开源生态与多尺寸覆盖上适配面最广,适合作为"主力模型";Kimi在超长上下文和编程能力上有独到优势;MiniMax的线性注意力架构在推理效率和超长上下文场景有差异化价值;智谱GLM-5.1在代码生成和长程自动化任务上表现优异。
推理服务部署
生产级推理服务部署需要解决三个核心问题:
性能保障: 单次推理延迟控制在500ms以内(流式输出首Token<200ms),支持并发调用。主流推理框架各有侧重:
| vLLM | ||
| SGLang | ||
| TensorRT-LLM | ||
| LMDeploy | ||
| Ollama |
西南证券自研大语言模型中台时,即采用vLLM+TensorRT-LLM双引擎架构,实现统一量化加速与推理并发提升。
资源调度: GPU是稀缺资源,核心思路是GPU池化——将物理GPU切分为多个虚拟实例,按需分配。据已实施GPU池化的券商反馈,算力利用率可从偏低水平获得显著改善。
高可用设计: 多副本部署、自动扩缩容、故障自动切换、降级容错。一个容易被忽视的细节——大模型推理进程的OOM(内存溢出)风险远高于传统微服务,需要专门的内存监控与熔断机制。
私有化部署vs API调用的策略选择
| 数据安全 | ||
| 响应延迟 | ||
| 定制化 | ||
| 初始成本 | ||
| 长期成本 | ||
| 更新速度 |
行业共识:核心业务场景(投研、合规、风控)必须私有化部署;边缘场景(办公助手、知识问答)可采用API+数据脱敏方式。
DeepSeek在券商的适配实践
DeepSeek在券商的部署经历了两波浪潮:2025年初V3/R1引发"抢部署"潮,近二十家券商在一个月内完成本地化部署;2026年4月V4(1.6T参数)发布后,行业进入"比应用深度"阶段,国泰海通在发布当日即完成V4本地化部署,兴业证券、国投证券、中泰证券、国金证券、山西证券等紧随其后(来源:财联社2026.04.04;证券时报2026.04.08)。
截至2026年5月,券商对DeepSeek的应用深度已形成明显梯队:
| 深度应用 | ||
| 场景探索 | ||
| 基础部署 |
东吴证券的路径更具代表性——自研"秀财大模型"(2023年12月发布,2024年4月完成行业首个自研大模型算法备案),基于海量金融语料训练(2.2万亿Tokens通用语料+4000亿Tokens金融语料),实现了"大模型能力+小模型效率"的兼顾(来源:新华网江苏2023.12.12;头条2024.04.13)。
场景2:AI中台架构
AI中台是券商AI基础设施的核心骨架。一个成熟的AI中台应包含三层架构:

能力层:AI能力的生产车间
| NLP引擎 | ||
| CV引擎 | ||
| 语音引擎 | ||
| 知识图谱 | ||
| 大模型 |
应用层:低码智能体平台
低码智能体平台是AI中台价值释放的关键出口——让业务人员通过拖拽组件、配置流程即可构建AI智能体,不必排队等开发资源。
典型能力清单:
Prompt模板管理: 将高频Prompt封装为可复用模板,支持版本管理与效果对比 RAG流水线编排: 可视化配置文档解析→向量化→检索→生成全流程 Agent工作流设计: 支持多Agent协作编排 应用发布与管理: 一键发布、灰度上线、使用量统计
招商证券在"AI证券公司"战略中,采用"一超多强"模型矩阵——千亿级基础模型+多套百亿级领域模型+Agent平台,其"数字员工"矩阵正是基于统一平台快速产出的成果(来源:国资委官网2025.03.28)。
运营层:模型注册、监控、A/B测试
运营层是AI中台最容易被忽略、却最关键的层次。没有运营层的AI中台,就像没有仪表盘的汽车——能开,但不知道什么时候会出事。
| 模型注册中心 | ||
| 实时监控 | ||
| 漂移检测 | ||
| A/B测试 | ||
| 成本分摊 |
场景3:MLOps与模型治理
如果说AI中台解决了"能力生产"问题,MLOps解决的则是"能力可持续"问题——模型不是部署完就万事大吉,它需要持续监控、持续迭代、持续治理。
模型全生命周期管理
| 开发 | ||
| 测试 | ||
| 上线 | ||
| 监控 | ||
| 下线 |
模型风险治理框架
金融行业的特殊性在于,模型风险不仅仅是技术问题,更是合规问题。2020年银保监会发布的《商业银行互联网贷款管理暂行办法》首次在金融监管中引入"模型风险管理"要求,证券行业虽尚无专项规定,但趋势已很明确。
券商模型风险治理框架应至少包含:
| 模型准入 | ||
| 模型监控 | ||
| 模型审计 | ||
| 模型应急 |
合规审计追踪
当监管问"这个投资建议是基于什么模型、什么数据、什么逻辑生成的"时,券商必须能给出完整的、可追溯的回答。
核心审计能力:
输入溯源: 记录每次模型调用的完整输入(Prompt+上下文+检索文档) 输出留痕: 存储每次模型输出的完整文本及元信息(模型版本、温度参数、时间戳) 链路追踪: RAG场景中,记录"检索了哪些文档→生成了什么内容"的完整链路 人工审核节点: 关键场景须保留人工审核确认记录
场景4:数据底座
数据是AI的燃料,但"有数据"和"数据AI就绪"之间差距巨大。很多券商坐拥海量数据,却发现这些数据"喂不进"大模型——格式不统一、质量参差不齐、权限边界模糊。
AI就绪的数据架构
| 特征库 | ||
| 向量数据库 | ||
| 文档知识库 | ||
| 数据质量治理 |
向量数据库是当前券商AI基础设施的重点投入方向。主流选型对比:
| Milvus | |||
| Weaviate | |||
| Pinecone | |||
| Qdrant |
券商选择建议: 优先考虑Milvus——开源可控、可私有化部署、金融社区案例丰富。西南证券在智能合规助手中即采用向量数据库+知识图谱+传统检索的多重召回方案,取得良好效果。
金融数据的安全分级与AI使用边界
| L1-公开 | ||
| L2-内部 | ||
| L3-敏感 | ||
| L4-机密 |
三、技术解构
GPU算力调度与虚拟化
GPU是券商AI基础设施中最昂贵、最稀缺的资源。一台8卡推理服务器动辄百万,但实际利用率往往偏低——训练任务独占整卡、推理服务低峰闲置、开发测试占着不放。算力调度与虚拟化技术的目标,就是让每一张GPU卡"人尽其用"。

当前主流的GPU共享技术,按隔离粒度从粗到细排列:
| 时间切片(Time-Slicing) | ||||
| CUDA MPS | ||||
| MIG(NVIDIA) | ||||
| vNPU(昇腾) | ||||
| vGPU |
调度层: 在共享技术之上,还需要调度层决定"哪个任务分到哪张卡"。当前主流方案:
| Kubernetes + GPU Device Plugin | ||
| NVIDIA Triton Inference Server | ||
| GPU池化(远程调度) | ||
| 昇腾CCE AI套件 |
现实困境: 多位券商IT负责人反映,GPU集群平均利用率偏低,核心瓶颈不在技术而在管理——缺乏算力计费机制,业务团队"占着不用"现象严重。技术上,昇腾NPU算力切分已可实现利用率超90%(来源:新浪财经2026.05.12),但管理机制的配套仍是关键。
四、落地挑战
挑战一:算力成本——GPU采购与运营的经济账
一个满足中型券商推理需求的最小GPU集群,投入即超数百万元,这还不包括机房、电力、运维等持续成本。更关键的是,GPU迭代速度极快——两年前采购的设备,今天在推理性价比上可能已落后于新款。**"买还是租""买多少""何时换"**是每个券商CTO的必答题。
一个务实的成本模型(基于2026年5月市场数据估算):
2025-2026年国产模型API价格大幅下降,DeepSeek V4 Flash缓存命中低至$0.0028/百万token,使得中小券商"先用API验证、再自建投产"的路径成本远低于预期。但需注意:API调用量大时年费可能反超自建,且数据出域/出境的合规风险无法回避。
挑战二:国产替代——信创要求下的AI基础设施适配
信创是券商IT建设的硬约束。国有券商新增AI基础设施须优先采购国产方案,但国产AI芯片在金融场景的适配仍有差距:推理性能、软件生态成熟度、模型兼容性三个维度上,国产方案仍在追赶中。
不过,国产算力生态正在加速闭环。2026年4月DeepSeek V4发布当日,华为昇腾、寒武纪、海光信息、摩尔线程、沐曦股份、百度昆仑芯、阿里平头哥、天数智芯等8家国产AI芯片厂商同步完成Day0适配——这打破了以往"新模型只有NVIDIA卡能跑"的格局。智源研究院牵头的众智FlagOS社区也在Day0完成了V4-Flash在8款以上国产芯片的全量适配与推理部署,推出FP8和BF16两种适配版本(来源:51CTO 2026.04.24;南方网 2026.05.13)。
国产算力生态当前格局:
| 华为昇腾、阿里平头哥、寒武纪、海光信息 | |
| 摩尔线程、沐曦股份、天数智芯 | |
| 众智FlagOS社区、百度昆仑芯 |
务实建议: 核心推理场景可在国产芯片方案积累经验后逐步切换;非核心场景可率先使用昇腾等成熟方案;同时积极参与信创AI生态建设,利用FlagOS等跨芯片适配框架降低迁移成本。
挑战三:技术人才——AI工程化人才的极度短缺
券商AI人才短缺,最缺的不是算法研究员,而是AI工程师——能把模型跑进生产环境的人。
多位券商科技负责人反映,AI工程化岗位招聘困难,核心原因在于券商的薪酬体系和技术文化对这类人才吸引力不足。
五、趋势判断
趋势1:从"多模型编排"到"智能体平台"——券商AI基础设施的二次跃迁
置信度:高
2025年,券商完成了多模型编排的普及——简单问答走轻量模型、投研分析走大参数模型、推理任务走DeepSeek-R1类推理模型,"模型路由器"已成头部券商标配。
2026年,行业正在经历第二次跃迁:从"多模型编排"走向"智能体平台"。区别在于:多模型编排解决的是"哪个模型回答这个问题",智能体平台解决的是"如何让AI自主完成一个多步骤的业务流程"。前者是路由问题,后者是编排问题。
头部券商已率先落地:
| 国泰海通 | ||
| 招商证券 | ||
| 中金公司 | ||
| 中泰证券 |
中型券商则在走"统一底座、分层推进"的路径——先从中后台辅助场景(合规监控、运营审核)切入,沉淀平台能力(模型接入、知识管理、智能体开发框架),再向业务前中台延展(来源:每日经济新闻2026.04.17)。
这一趋势对券商AI基础设施提出新要求:平台不仅要管理模型,还要管理工具调用权限、多智能体协作流程、长期记忆与上下文、安全边界与人工接管机制。
趋势2:MLOps将从"技术实践"升级为"合规要求"
置信度:高
随着大模型在券商核心业务场景的渗透加深,监管对AI治理的要求将从"倡导"升级为"强制"。证券行业出台AI模型治理相关指引已是趋势,核心内容将包括模型全生命周期文档化、输出可审计可追溯、关键场景失效应急预案、第三方模型评估与认证等要求。
提前布局MLOps,不是技术前瞻,而是合规刚需。
趋势3:信创AI基础设施已跨过"可用"门槛,进入"好用"攻坚期
置信度:高
2026年4月DeepSeek V4发布当日,8家国产AI芯片厂商同步完成Day0适配,标志着信创AI基础设施已跨过"可用"门槛——主流国产大模型在国产芯片上的推理部署不再是"能不能跑"的问题,而是"跑得多稳、多快、多省"的问题。
华为昇腾生态已形成较完整的工具链(CANN+MindIE+CCE AI套件),阿里平头哥真武PPU芯片累计交付超47万片、服务400+企业客户(含金融服务),寒武纪、海光信息在推理场景已有金融行业部署案例。众智FlagOS等跨芯片适配框架进一步降低了多芯片环境的运维成本。
但"可用"不等于"好用"。生产环境所需的稳定性、可观测性、故障排查工具链,以及训练场景的性能与显存效率,仍与NVIDIA方案存在差距。券商当前策略应是:推理场景优先使用国产方案,训练场景暂以NVIDIA为主、国产方案逐步验证,通过实战积累运维经验,为全面切换做准备。
六、AI工作方式变革
AI基础设施的建设,不仅改变了技术架构,更深刻地重塑了科技团队的工作方式——从"支撑者"到"赋能者"再到"编排者"的三段跃迁。

6.1 系统运维者→AI能力运营者
传统IT团队的核心工作是"保证系统不宕机"——监控服务器、巡检数据库、处理工单。大模型平台上线后,科技团队的职责从"运维系统"变为"运营AI能力":模型版本何时切换?RAG检索效果下降是文档质量问题还是模型漂移?GPU利用率低是因为业务量不足还是路由策略不对?这些问题的答案不是"重启一下就好",而是需要持续观测、分析和调优。科技团队从被动响应变为主动运营。
6.2 技术交付者→业务共创者
传统模式下,科技团队等需求文档、排期开发、交付验收——"你提需求,我写代码"。AI时代,这种模式失灵了——因为业务部门自己也不清楚"AI能帮我做什么"。科技团队必须走到业务前面:了解投研流程、体验客服痛点、参与合规审查——然后提出"AI可以帮你做这个"的方案。角色从"代码交付者"变为"业务问题解决者"。
6.3 资源管理者→算力调度师
GPU是AI时代最昂贵的生产资料。传统IT团队的资源管理是"申请-审批-分配"的静态模式,GPU买了就放在那里,谁用谁占。大模型时代的算力管理是动态调度——推理服务有早晚高峰、训练任务可以错峰、不同模型对GPU型号有偏好。科技团队需要像调度飞机起降一样调度GPU资源,核心指标从"系统可用率"变为"算力利用效率"。
6.4 组织层面的跃迁难度
AI基础设施最难建设的不是平台,而是运营平台的人。从"装好就行"到"跑好才行",中间的差距比部署一个大模型大得多。
七、AI成熟度评分卡
| 场景成熟度 | ||
| 技术就绪度 | ||
| 数据基础 | ||
| 组织适配度 | ||
| 监管友好度 |
综合评分:2.8/5 —— 发展阶段,头部券商已建成平台并生产运行,但整体分化显著,多数仍在建设中
评分依据
评分标准:1分=探索阶段仅有PoC;2分=起步阶段有试点落地;3分=发展阶段多个场景生产运行;4分=成熟阶段核心业务流程AI化;5分=领先阶段AI驱动业务创新。与第01篇总览篇评分体系一致。
深度案例
案例A:华泰证券——大模型平台建设实践
背景: 2023年起,华泰证券将大模型AI提升至公司级战略,由高管层牵头推进。华泰的核心策略是"不自建基础大模型,聚焦应用层落地"——等应用侧成熟后借助第三方基础大模型,自身聚焦场景适配与工程化交付(来源:21世纪经济报道2025.07.25)。
架构策略: 华泰采用"多模型编排+统一中台"的架构思路——不自建基础大模型,而是借助第三方基础大模型,自身聚焦场景适配与工程化交付。典型的大模型平台架构如下:
┌────────────────────────────────────────────────┐│ 应用层 ││ 投研Copilot 智能客服 合规审查 代码助手 │├────────────────────────────────────────────────┤│ AI中台 ││ ┌──────────┐ ┌──────────┐ ┌──────────┐ ││ │模型路由 │ │Prompt管理│ │RAG流水线 │ ││ └──────────┘ └──────────┘ └──────────┘ ││ ┌──────────┐ ┌──────────┐ ┌──────────┐ ││ │Agent编排 │ │监控告警 │ │A/B测试 │ ││ └──────────┘ └──────────┘ └──────────┘ │├────────────────────────────────────────────────┤│ 模型层 ││ 通用大模型(投研/合规) 推理模型(深度推理) ││ 轻量模型(快速问答) 多模态模型(图表理解) │├────────────────────────────────────────────────┤│ 算力层 ││ 自建GPU集群 + 弹性云扩容 │├────────────────────────────────────────────────┤│ 数据层 ││ 向量数据库 + 特征库 + 文档知识库 │└────────────────────────────────────────────────┘注:上图为券商大模型平台的典型分层架构,非华泰证券官方披露的具体架构。模型层的具体选型因各券商策略而异。
应用落地情况: 据公开报道,华泰已在大模型平台上线投研Copilot、智能客服、合规审查、代码助手等应用,覆盖投研、客服、合规、研发四大场景(来源:21世纪经济报道2025.07.25)。2025年10月,华泰发布行业首款AI原生交易终端"AI涨乐",经历100天迭代后服务用户突破240万,2026年1月正式发布1.0版本(来源:新华财经2026.01)。
注:华泰未公开披露各应用的具体调用量与量化效果数据。
关键经验:
先选场景再选模型,而非反过来。场景决定了模型的能力边界要求,模型选型应服务于场景需求。 模型路由是核心能力,没有路由的平台只是模型托管,称不上"平台"。 监控从Day 1就要建,不能等出了问题再补。 合规审计日志的成本不可低估——全链路审计日志存储约占推理服务总成本的相当比例,但这是必须投入。
简要提及:同业AI基础设施实践
| 国泰海通 | ||
| 华泰证券 | ||
| 国信证券 | ||
| 东吴证券 | ||
| 西南证券 | ||
| 招商证券 |
本篇核心观点: 券商AI的基础设施建设,不是"搭个平台、部署个模型"的技术活,而是一项涉及算力规划、架构设计、工程体系、治理框架的系统性工程。从PoC到生产的死亡之谷,不会因为换一个更强的模型而自动跨越——唯有扎实的工程化能力,才能让大模型真正成为券商的生产力而非PPT上的亮点。
下一篇,我们将从基础设施回到人本身——AI型组织如何建设?人、架构与文化的系统变革,才是AI落地真正的"最后一公里"。
本文为「AI重塑证券业」系列第十篇。系列共十二篇,持续更新中。
数据来源与事实核查说明:
本文引用数据来源包括:(1)券商公开财报与年报中披露的AI投入及基础设施情况;(2)财联社、证券时报、21世纪经济报道、新华网等行业媒体报道;(3)行业会议与论坛中券商科技负责人公开分享的实践数据;(4)券商官方发布渠道(如国信证券搜狐官方号、光大证券东方财富网发布等);(5)行业研究机构报告及金科创新社等科技社区案例。本文已对核心事实陈述进行来源核查,对于无法找到公开出处的重要数据,已改为定性描述,不呈现具体数字以避免误导读者。
「AI重塑证券业」之一:证券公司AI全景图——九大领域成熟度扫描
「AI重塑证券业」之二:AI如何重塑研究能力——从信息搬运到认知增强
「AI重塑证券业」之三:AI驱动的投资决策——从信号到执行的智能链路
「AI重塑证券业」之四:AI让财富管理更懂客户——客户旅程的智能化重构
「AI重塑证券业」之五:AI赋能投行业务——从项目承揽到存续管理的效率革命
夜雨聆风