乐于分享
好东西不私藏

「AI重塑证券业」之十:AI基础设施与平台建设——让大模型稳定跑在生产环境

「AI重塑证券业」之十:AI基础设施与平台建设——让大模型稳定跑在生产环境

作者按:从交易所到证券公司,长期从事监管科技、金融科技工作,有十年多应用系统及数据规划和建设经验,在人工智能、大数据等技术和场景深度结合上有丰富的实战项目。曾亲手(非挂名)主导多个AI属性的大型平台和系统的建设,绝大部分项目均为公司首个同类型项目,对行业技术演进和现状有深刻的洞察,全面负责AI基础设施和重点场景建设,负责公司中后台系统的规划建设、主导自研的各类数字化系统在行业斩获多项大奖,负责研发的风险管理平台更是全行业独一无二的业务风险数字化平台。

「AI重塑证券业」之一:证券公司AI全景图——九大领域成熟度扫描

「AI重塑证券业」之二:AI如何重塑研究能力——从信息搬运到认知增强

「AI重塑证券业」之三:AI驱动的投资决策——从信号到执行的智能链路

「AI重塑证券业」之四:AI让财富管理更懂客户——客户旅程的智能化重构

「AI重塑证券业」之五:AI赋能投行业务——从项目承揽到存续管理的效率革命

「AI重塑证券业」之六:AI在资产管理中的实践——投研风控运营的智能化中台
「AI重塑证券业」之七:AI重构中后台运营——算得清ROI的智能化替代
「AI重塑证券业」之八:AI让合规更主动——从事后检查到事前预判的范式转移
AI重塑证券业之九:智能风险感知——从人工盯盘到全景穿透

券商AI的真正分水岭,不在于谁率先用上了大模型,而在于谁能让大模型7×24小时稳定跑在生产环境。从PoC到生产,中间隔着一条"死亡之谷"。


一、领域现状:券商AI基础设施的三重挑战

2025年初,DeepSeek横空出世,不到一个月便有近二十家券商完成本地化部署,堪称券商科技史上少见的"军备竞赛"。到2026年4月DeepSeek V4(1.6T参数)发布,行业已从"抢部署"进入"比应用深度"的新阶段。但"部署"和"生产"之间,隔着一道深不见底的鸿沟——部署一个开源大模型,一个工程师半天就能搞定;让它稳定服务上千名投研人员、日均调用十万级、幻觉率压到可接受范围——这才刚刚开始。

券商AI基础设施面临三重结构性挑战:

挑战一:算力——自建vs云vs混合的取舍

模式
优势
劣势
适用券商
自建GPU集群
数据不出域、延迟可控、长期成本低
初期投入大、运维门槛高
头部5-8家
公有云API
零运维、弹性扩展、按量计费
数据出域/出境风险、大用量时成本反超自建
中小型券商试点阶段
混合部署
核心数据本地、弹性需求上云
架构复杂度翻倍、需要统一调度层
中大型券商主流选择

多数券商走了"混合"路线,但"混合"二字背后是棘手的工程问题——模型如何在不同算力间无缝切换?数据如何在本地与云端间安全流转?推理请求如何在多云间智能路由?没有标准答案,只能在工程实践中反复打磨。

国信证券2025年2月即采用本地+云端混合部署策略——本地部署DeepSeek-R1-Distill-32B保障数据安全与响应速度,同时引入云端DeepSeek-V3和R1提供更强推理能力,构建"1+N"技术底座体系。

一年后的V4部署潮中,行业策略已明显分化。国泰海通2026年4月24日在DeepSeek V4发布当日即完成国产芯片(昇腾)适配及本地化部署,成为业内首家Day0接入的券商,V4已在其自研Novastation研究工作台与代码助手中展开场景验证(来源:财联社2026.04.24;上证报2026.04.24)。国泰海通采用"1+N"模型矩阵——1个通用大模型为基石,共建行业垂类大模型"君弘灵犀",辅以N个场景模型——整体走的是本地化为主、多模型并行的路线,与国信的混合部署策略形成鲜明对比。

挑战二:平台——AI中台的定位与边界

AI中台是近两年券商科技建设的高频词,但容易陷入两种误区:

  • 误区一:中台=所有AI能力的集合。 把NLP引擎、OCR服务、知识图谱、大模型推理一股脑塞进"中台",结果变成什么都管但什么都不精的"大杂烩"。
  • 误区二:中台=模型托管平台。 只管模型部署和API分发,忽略了数据治理、应用开发、运营监控等关键环节。

真正有效的AI中台,应当是一个AI能力的工厂而非仓库——不存储能力,而是生产、编排和交付能力。

挑战三:工程——从PoC到生产环境的死亡之谷

据行业估算,券商大模型项目从PoC到生产部署的转化率普遍偏低,多数项目卡在了以下环节:

卡点
具体表现
根因
稳定性
PoC时10次调用9次正确,生产环境1万次调用就崩溃
缺乏负载测试、容错机制、降级策略
可观测性
模型输出质量下降但无人发现
缺乏模型监控、漂移检测、告警体系
安全性
生成内容包含未授权信息或偏见
缺乏输出过滤、内容安全审核机制
可维护性
模型更新需要停机、全量替换
缺乏灰度发布、A/B测试、版本回滚能力
合规性
无法追溯"这个回答是哪个模型、哪个版本、基于哪些数据生成的"
缺乏全链路审计日志

从PoC到生产,不是功能的叠加,而是工程体系的建设。 这正是本篇要拆解的核心命题。


二、核心场景

场景1:大模型平台建设

大模型平台是AI基础设施的"操作系统"——不直接解决业务问题,但决定了上层应用能否稳定运行。

模型选型与评测

券商大模型选型已从"谁最强"转向"谁最合适"。关键不在于某个榜单上的分数,而在于:你的场景需要什么能力?你的算力能撑多大的模型?你的数据能支撑多深的微调?

当前主流国产大模型在券商场景的适配对比:

模型
参数量
金融场景优势
局限性
适配场景
DeepSeek(V4/V3.1/R1)
V4-Pro:1.6T/49B激活; V4-Flash:284B/13B激活; V3.1:671B; R1-0528
推理能力强(R1)、V4性能大幅跃升、全系开源(MIT)、性价比极高
V4-Pro部署资源需求极大(1.6T)、大参数版本需多卡推理
深度推理、投研分析、代码生成
通义千问(Qwen3.6)
Max-Preview(闭源); 35B-A3B(MoE); 27B(稠密多模态)
开源生态最成熟、尺寸覆盖最广(0.8B至397B)、金融微调社区活跃、Agent能力突出
原生金融能力需微调增强、Max版本闭源
投研分析、合规审查等综合场景(主力模型)
Kimi(K2.6/K2.5)
K2.6:1T/32B激活(MoE); K2.5:万亿级
超长上下文(256K)、编程能力突出、K2.6已开源(Modified MIT)
金融垂域微调案例较少、K2.5仅API
长文档研报处理、投研代码生成
MiniMax(M2.7/M2.5)
M2.7:230B(MoE); M2.5:开源; 01:456B/46B激活
线性注意力架构推理效率高、超长上下文(400万token)、多智能体协作
M2.7开源禁止商用、金融场景验证少
多Agent协作、超长文档处理
智谱GLM-5.1
754B(MoE)
代码能力突出(SWE-Bench Pro开源第一)、长程任务稳定(8小时自主工作)、MIT开源
金融垂域微调案例相对少、部署资源需求大
代码生成、长程自动化任务、投研工具开发

券商已不再追求"一个模型打天下",而是根据场景选择最合适的模型——投研用大参数模型保证深度,客服用小模型保证速度。DeepSeek在推理能力和性价比上优势突出,V4发布后性能进一步跃升,适合对思考深度要求高的场景;通义千问在开源生态与多尺寸覆盖上适配面最广,适合作为"主力模型";Kimi在超长上下文和编程能力上有独到优势;MiniMax的线性注意力架构在推理效率和超长上下文场景有差异化价值;智谱GLM-5.1在代码生成和长程自动化任务上表现优异。

推理服务部署

生产级推理服务部署需要解决三个核心问题:

性能保障: 单次推理延迟控制在500ms以内(流式输出首Token<200ms),支持并发调用。主流推理框架各有侧重:

框架
核心特点
适用场景
vLLM
PagedAttention+Continuous Batching,生态最成熟,模型支持最广
高并发单轮推理,生产环境首选
SGLang
RadixAttention前缀缓存,多轮对话缓存命中率提升3-5倍
多轮对话、Agent场景、高并发交互
TensorRT-LLM
NVIDIA官方加速方案,深度硬件优化,量化推理性能最优
NVIDIA GPU环境,对延迟极度敏感的场景
LMDeploy
TurboMind引擎,量化支持最强(FP4/FP8/AWQ/GPTQ),显存效率高
量化部署、显存受限场景
Ollama
一条命令部署,开发者体验最好
开发调试、本地试用、快速验证

西南证券自研大语言模型中台时,即采用vLLM+TensorRT-LLM双引擎架构,实现统一量化加速与推理并发提升。

资源调度: GPU是稀缺资源,核心思路是GPU池化——将物理GPU切分为多个虚拟实例,按需分配。据已实施GPU池化的券商反馈,算力利用率可从偏低水平获得显著改善。

高可用设计: 多副本部署、自动扩缩容、故障自动切换、降级容错。一个容易被忽视的细节——大模型推理进程的OOM(内存溢出)风险远高于传统微服务,需要专门的内存监控与熔断机制。

私有化部署vs API调用的策略选择

维度
私有化部署
API调用
数据安全
数据不出域,满足监管要求
数据出域/出境,存在合规风险
响应延迟
内网调用,延迟可控
依赖公网,延迟波动大
定制化
可深度微调、融合业务知识
仅能通过Prompt定制
初始成本
GPU采购+运维,百万级起步
按量付费,零门槛
长期成本
大规模使用下边际成本趋近于零
调用量大时年费可达数百万
更新速度
需自行评估和迁移新版本
自动获取最新模型

行业共识:核心业务场景(投研、合规、风控)必须私有化部署;边缘场景(办公助手、知识问答)可采用API+数据脱敏方式。

DeepSeek在券商的适配实践

DeepSeek在券商的部署经历了两波浪潮:2025年初V3/R1引发"抢部署"潮,近二十家券商在一个月内完成本地化部署;2026年4月V4(1.6T参数)发布后,行业进入"比应用深度"阶段,国泰海通在发布当日即完成V4本地化部署,兴业证券、国投证券、中泰证券、国金证券、山西证券等紧随其后(来源:财联社2026.04.04;证券时报2026.04.08)。

截至2026年5月,券商对DeepSeek的应用深度已形成明显梯队:

阶段
券商代表
特征
深度应用
国泰海通(V4 Day0部署)、长城证券十余项业务场景
已在核心业务场景跑通闭环,持续跟进模型迭代
场景探索
国信证券、东方证券、兴业证券
多场景并行验证,局部生产,V4部署评估中
基础部署
多家中型券商
完成V3/R1部署,应用仍在PoC阶段,V4尚在评估

东吴证券的路径更具代表性——自研"秀财大模型"(2023年12月发布,2024年4月完成行业首个自研大模型算法备案),基于海量金融语料训练(2.2万亿Tokens通用语料+4000亿Tokens金融语料),实现了"大模型能力+小模型效率"的兼顾(来源:新华网江苏2023.12.12;头条2024.04.13)。

场景2:AI中台架构

AI中台是券商AI基础设施的核心骨架。一个成熟的AI中台应包含三层架构:

能力层:AI能力的生产车间

能力模块
核心功能
生产就绪度
NLP引擎
文本分类、实体识别、情感分析、摘要生成
★★★★☆(成熟)
CV引擎
票据OCR、证照识别、图表理解
★★★★☆(成熟)
语音引擎
语音转写、语音合成、声纹识别
★★★☆☆(可用)
知识图谱
产业链图谱、公司关系网络、法规关联
★★★☆☆(可用)
大模型
文本生成、多轮对话、代码生成、推理分析
★★★☆☆(快速迭代中)

应用层:低码智能体平台

低码智能体平台是AI中台价值释放的关键出口——让业务人员通过拖拽组件、配置流程即可构建AI智能体,不必排队等开发资源。

典型能力清单:

  • Prompt模板管理: 将高频Prompt封装为可复用模板,支持版本管理与效果对比
  • RAG流水线编排: 可视化配置文档解析→向量化→检索→生成全流程
  • Agent工作流设计: 支持多Agent协作编排
  • 应用发布与管理: 一键发布、灰度上线、使用量统计

招商证券在"AI证券公司"战略中,采用"一超多强"模型矩阵——千亿级基础模型+多套百亿级领域模型+Agent平台,其"数字员工"矩阵正是基于统一平台快速产出的成果(来源:国资委官网2025.03.28)。

运营层:模型注册、监控、A/B测试

运营层是AI中台最容易被忽略、却最关键的层次。没有运营层的AI中台,就像没有仪表盘的汽车——能开,但不知道什么时候会出事。

运营能力
说明
生产环境必要性
模型注册中心
统一管理所有AI模型的元信息(版本、参数、训练数据、评测指标)
必须
实时监控
调用量、延迟、错误率、Token消耗、输出质量评分
必须
漂移检测
自动检测模型输出分布变化,预警性能衰减
必须
A/B测试
新旧模型版本灰度对比,数据驱动上线决策
推荐
成本分摊
按业务线统计AI资源消耗,支撑内部结算
推荐

场景3:MLOps与模型治理

如果说AI中台解决了"能力生产"问题,MLOps解决的则是"能力可持续"问题——模型不是部署完就万事大吉,它需要持续监控、持续迭代、持续治理。

模型全生命周期管理

阶段
核心工作
常见问题
开发
数据准备、模型选型、训练/微调、效果评测
金融数据标注成本高、质量难保证
测试
功能测试、性能测试、安全测试、合规测试
缺乏标准化评测基准和自动化测试框架
上线
模型部署、流量切换、灰度发布、回滚预案
灰度发布机制不完善,全量切换风险高
监控
输出质量监控、性能监控、数据漂移检测
监控指标不统一,告警阈值缺乏经验值
下线
版本退役、数据清理、依赖关系梳理
缺乏模型退役流程,历史版本堆积

模型风险治理框架

金融行业的特殊性在于,模型风险不仅仅是技术问题,更是合规问题。2020年银保监会发布的《商业银行互联网贷款管理暂行办法》首次在金融监管中引入"模型风险管理"要求,证券行业虽尚无专项规定,但趋势已很明确。

券商模型风险治理框架应至少包含:

治理维度
具体要求
责任方
模型准入
新模型上线前须经独立评审,包括效果、安全、公平性评估
科技部+合规部+业务部门
模型监控
建立模型性能KPI,定期评估输出质量
科技部
模型审计
保留模型全生命周期操作日志,支持监管审查
法务部+科技部
模型应急
制定模型失效应急预案,包括人工替代流程
业务部门+科技部

合规审计追踪

当监管问"这个投资建议是基于什么模型、什么数据、什么逻辑生成的"时,券商必须能给出完整的、可追溯的回答。

核心审计能力:

  • 输入溯源: 记录每次模型调用的完整输入(Prompt+上下文+检索文档)
  • 输出留痕: 存储每次模型输出的完整文本及元信息(模型版本、温度参数、时间戳)
  • 链路追踪: RAG场景中,记录"检索了哪些文档→生成了什么内容"的完整链路
  • 人工审核节点: 关键场景须保留人工审核确认记录

场景4:数据底座

数据是AI的燃料,但"有数据"和"数据AI就绪"之间差距巨大。很多券商坐拥海量数据,却发现这些数据"喂不进"大模型——格式不统一、质量参差不齐、权限边界模糊。

AI就绪的数据架构

数据组件
作用
券商建设现状
特征库
存储结构化特征,服务传统ML模型
★★★★☆ 多数券商已建设
向量数据库
存储文本/图像的向量嵌入,支撑RAG检索
★★☆☆☆ 仅头部券商部署
文档知识库
非结构化文档的解析、切片、索引、更新
★★★☆☆ 建设中
数据质量治理
数据完整性、一致性、时效性的自动检测与修复
★★☆☆☆ 刚起步

向量数据库是当前券商AI基础设施的重点投入方向。主流选型对比:

向量数据库
优势
劣势
适合场景
Milvus
开源、社区活跃、支持GPU加速
运维复杂度高
大规模生产环境
Weaviate
混合查询(向量+关键词)、GraphQL接口
大数据量时性能有瓶颈
中小规模、混合检索需求
Pinecone
全托管、零运维
闭源SaaS、数据出域/出境风险
快速验证、非敏感数据
Qdrant
Rust实现、性能优、过滤查询强
社区生态较新
对性能敏感的场景

券商选择建议: 优先考虑Milvus——开源可控、可私有化部署、金融社区案例丰富。西南证券在智能合规助手中即采用向量数据库+知识图谱+传统检索的多重召回方案,取得良好效果。

金融数据的安全分级与AI使用边界

数据级别
典型数据
AI使用边界
L1-公开
市场行情、公开公告
可使用云端API、无需特殊脱敏
L2-内部
研报草稿、内部通讯
须私有化部署模型、输出须经合规审查
L3-敏感
客户交易数据、持仓信息
仅限本地推理、数据须脱敏后使用
L4-机密
投资策略、风控模型参数
原则上不接入AI系统;如需使用,须经专项审批+全程审计

三、技术解构

GPU算力调度与虚拟化

GPU是券商AI基础设施中最昂贵、最稀缺的资源。一台8卡推理服务器动辄百万,但实际利用率往往偏低——训练任务独占整卡、推理服务低峰闲置、开发测试占着不放。算力调度与虚拟化技术的目标,就是让每一张GPU卡"人尽其用"。

当前主流的GPU共享技术,按隔离粒度从粗到细排列:

技术
原理
隔离性
性能损耗
适用场景
时间切片(Time-Slicing)
多任务按时间片轮流使用GPU
较高(上下文切换开销)
开发测试、低优先级任务
CUDA MPS
多进程共享同一CUDA Context,并行执行
同构推理任务并行
MIG(NVIDIA)
硬件级将A100/H100切分为独立GPU实例
极低
推理场景多租户隔离
vNPU(昇腾)
硬件级将昇腾NPU切分为虚拟NPU实例
极低
信创环境推理多租户隔离
vGPU
虚拟化层GPU共享,每个VM获得虚拟GPU
VDI、开发测试环境

调度层: 在共享技术之上,还需要调度层决定"哪个任务分到哪张卡"。当前主流方案:

方案
特点
适用环境
Kubernetes + GPU Device Plugin
容器级GPU调度,与K8s生态无缝集成
已容器化部署的券商
NVIDIA Triton Inference Server
多框架模型推理统一调度,支持动态batching
生产级推理服务管理
GPU池化(远程调度)
跨节点GPU池化调度,按需分配,支持跨业务线共享
多业务线争抢GPU资源的中大型券商
昇腾CCE AI套件
华为云原生调度,支持vNPU自动切分与编排
昇腾算力环境

现实困境: 多位券商IT负责人反映,GPU集群平均利用率偏低,核心瓶颈不在技术而在管理——缺乏算力计费机制,业务团队"占着不用"现象严重。技术上,昇腾NPU算力切分已可实现利用率超90%(来源:新浪财经2026.05.12),但管理机制的配套仍是关键。


四、落地挑战

挑战一:算力成本——GPU采购与运营的经济账

一个满足中型券商推理需求的最小GPU集群,投入即超数百万元,这还不包括机房、电力、运维等持续成本。更关键的是,GPU迭代速度极快——两年前采购的设备,今天在推理性价比上可能已落后于新款。**"买还是租""买多少""何时换"**是每个券商CTO的必答题。

一个务实的成本模型(基于2026年5月市场数据估算):

场景
月调用量
推荐方案
月均成本(估算)
说明
试点验证
<10万次
API调用
¥3,000-10,000
DeepSeek V4 Flash约¥0.4/百万输入token,10万次调用月费仅数百元;GPT-4o级约¥2-3万
小规模生产
10-50万次
1台8卡推理服务器
6-10万元(含折旧)
8卡A100整机约¥80-150万、8卡昇腾910B约¥60-100万,3年折旧;加电费运维约¥1-2万/月
中等规模
50-200万次
2-3台8卡推理服务器
15-30万元(含折旧)
多模型并行(如Qwen3.6-27B+DeepSeek-R1),需GPU池化调度
大规模生产
>200万次
混合架构(自建+弹性上云)
需个案测算
核心场景本地部署保障安全与延迟,峰值需求弹性上云;国产芯片方案可降低30%-40%硬件成本

2025-2026年国产模型API价格大幅下降,DeepSeek V4 Flash缓存命中低至$0.0028/百万token,使得中小券商"先用API验证、再自建投产"的路径成本远低于预期。但需注意:API调用量大时年费可能反超自建,且数据出域/出境的合规风险无法回避。

挑战二:国产替代——信创要求下的AI基础设施适配

信创是券商IT建设的硬约束。国有券商新增AI基础设施须优先采购国产方案,但国产AI芯片在金融场景的适配仍有差距:推理性能、软件生态成熟度、模型兼容性三个维度上,国产方案仍在追赶中。

不过,国产算力生态正在加速闭环。2026年4月DeepSeek V4发布当日,华为昇腾、寒武纪、海光信息、摩尔线程、沐曦股份、百度昆仑芯、阿里平头哥、天数智芯等8家国产AI芯片厂商同步完成Day0适配——这打破了以往"新模型只有NVIDIA卡能跑"的格局。智源研究院牵头的众智FlagOS社区也在Day0完成了V4-Flash在8款以上国产芯片的全量适配与推理部署,推出FP8和BF16两种适配版本(来源:51CTO 2026.04.24;南方网 2026.05.13)。

国产算力生态当前格局:

代表厂商
特点
华为昇腾、阿里平头哥、寒武纪、海光信息
出货量大(平头哥累计交付超47万片,来源:阿里云官网2026.02)、金融场景已有部署案例(如光大证券华为NPU方案,来源:东方财富网2025.02.08)、Day0适配能力已验证(来源:51CTO 2026.04.24)
摩尔线程、沐曦股份、天数智芯
通用GPU/专用加速卡,适配能力快速提升,部分场景可用
众智FlagOS社区、百度昆仑芯
提供跨芯片适配层与推理部署框架,降低多芯片适配成本

务实建议: 核心推理场景可在国产芯片方案积累经验后逐步切换;非核心场景可率先使用昇腾等成熟方案;同时积极参与信创AI生态建设,利用FlagOS等跨芯片适配框架降低迁移成本。

挑战三:技术人才——AI工程化人才的极度短缺

券商AI人才短缺,最缺的不是算法研究员,而是AI工程师——能把模型跑进生产环境的人。

人才类型
稀缺度
券商吸引力
大模型算法研究员
★★★☆
中(互联网大厂竞争)
AI工程化工程师
★★★★★
低(互联网/创业公司更灵活)
MLOps工程师
★★★★★
低(岗位认知度低)
AI产品经理
★★★★
中(业务理解是券商优势)

多位券商科技负责人反映,AI工程化岗位招聘困难,核心原因在于券商的薪酬体系和技术文化对这类人才吸引力不足。


五、趋势判断

趋势1:从"多模型编排"到"智能体平台"——券商AI基础设施的二次跃迁

置信度:高

2025年,券商完成了多模型编排的普及——简单问答走轻量模型、投研分析走大参数模型、推理任务走DeepSeek-R1类推理模型,"模型路由器"已成头部券商标配。

2026年,行业正在经历第二次跃迁:从"多模型编排"走向"智能体平台"。区别在于:多模型编排解决的是"哪个模型回答这个问题",智能体平台解决的是"如何让AI自主完成一个多步骤的业务流程"。前者是路由问题,后者是编排问题。

头部券商已率先落地:

券商
智能体平台/产品
形态
国泰海通
Novastation研究工作台 + "智鉴"投行AI平台
面向投研与投行的全流程智能体
招商证券
"招小顾"营销助手 + "AI研究所" + "招小数/招小聚"办公助手
覆盖营销、研究、办公的多Agent矩阵(来源:今日头条2025.06.06;国资委官网2025.03.28;财联社2026.03.28)
中金公司
RITAS数字化平台 + 投顾助手
问答形态+投顾助手(来源:新浪财经2025.10.19)
中泰证券
"仓颉大模型平台底座"
多模型联动+业务应用编排(来源:新浪财经2026.04.26)

中型券商则在走"统一底座、分层推进"的路径——先从中后台辅助场景(合规监控、运营审核)切入,沉淀平台能力(模型接入、知识管理、智能体开发框架),再向业务前中台延展(来源:每日经济新闻2026.04.17)。

这一趋势对券商AI基础设施提出新要求:平台不仅要管理模型,还要管理工具调用权限、多智能体协作流程、长期记忆与上下文、安全边界与人工接管机制

趋势2:MLOps将从"技术实践"升级为"合规要求"

置信度:高

随着大模型在券商核心业务场景的渗透加深,监管对AI治理的要求将从"倡导"升级为"强制"。证券行业出台AI模型治理相关指引已是趋势,核心内容将包括模型全生命周期文档化、输出可审计可追溯、关键场景失效应急预案、第三方模型评估与认证等要求。

提前布局MLOps,不是技术前瞻,而是合规刚需。

趋势3:信创AI基础设施已跨过"可用"门槛,进入"好用"攻坚期

置信度:高

2026年4月DeepSeek V4发布当日,8家国产AI芯片厂商同步完成Day0适配,标志着信创AI基础设施已跨过"可用"门槛——主流国产大模型在国产芯片上的推理部署不再是"能不能跑"的问题,而是"跑得多稳、多快、多省"的问题。

华为昇腾生态已形成较完整的工具链(CANN+MindIE+CCE AI套件),阿里平头哥真武PPU芯片累计交付超47万片、服务400+企业客户(含金融服务),寒武纪、海光信息在推理场景已有金融行业部署案例。众智FlagOS等跨芯片适配框架进一步降低了多芯片环境的运维成本。

但"可用"不等于"好用"。生产环境所需的稳定性、可观测性、故障排查工具链,以及训练场景的性能与显存效率,仍与NVIDIA方案存在差距。券商当前策略应是:推理场景优先使用国产方案,训练场景暂以NVIDIA为主、国产方案逐步验证,通过实战积累运维经验,为全面切换做准备。


六、AI工作方式变革

AI基础设施的建设,不仅改变了技术架构,更深刻地重塑了科技团队的工作方式——从"支撑者"到"赋能者"再到"编排者"的三段跃迁。

6.1 系统运维者→AI能力运营者

传统IT团队的核心工作是"保证系统不宕机"——监控服务器、巡检数据库、处理工单。大模型平台上线后,科技团队的职责从"运维系统"变为"运营AI能力":模型版本何时切换?RAG检索效果下降是文档质量问题还是模型漂移?GPU利用率低是因为业务量不足还是路由策略不对?这些问题的答案不是"重启一下就好",而是需要持续观测、分析和调优。科技团队从被动响应变为主动运营。

6.2 技术交付者→业务共创者

传统模式下,科技团队等需求文档、排期开发、交付验收——"你提需求,我写代码"。AI时代,这种模式失灵了——因为业务部门自己也不清楚"AI能帮我做什么"。科技团队必须走到业务前面:了解投研流程、体验客服痛点、参与合规审查——然后提出"AI可以帮你做这个"的方案。角色从"代码交付者"变为"业务问题解决者"。

6.3 资源管理者→算力调度师

GPU是AI时代最昂贵的生产资料。传统IT团队的资源管理是"申请-审批-分配"的静态模式,GPU买了就放在那里,谁用谁占。大模型时代的算力管理是动态调度——推理服务有早晚高峰、训练任务可以错峰、不同模型对GPU型号有偏好。科技团队需要像调度飞机起降一样调度GPU资源,核心指标从"系统可用率"变为"算力利用效率"。

6.4 组织层面的跃迁难度

跃迁方向
核心能力要求
跃迁难度
关键障碍
运维者→运营者
模型运营+数据感知能力
★★★
从"管机器"到"管模型",思维方式需根本转变
交付者→共创者
业务理解+AI方案设计
★★★★
需同时懂技术和业务的复合型人才,券商科技团队普遍缺乏
管理者→调度师
算力经济学+动态优化能力
★★★☆
缺乏算力计费和调度经验,需从互联网行业借鉴

AI基础设施最难建设的不是平台,而是运营平台的人。从"装好就行"到"跑好才行",中间的差距比部署一个大模型大得多。


七、AI成熟度评分卡

评估维度
评分
说明
场景成熟度
★★★☆☆
头部5-8家券商已初步建成大模型平台并投入生产运行;多数中小券商仍处于选型评估或平台搭建初期,呈现显著分化(科技底座AI渗透率行业估算10%-25%,与第01篇一致)
技术就绪度
★★★☆☆
大模型技术本身已趋成熟,MLOps、向量数据库等支撑技术可用,但工程化配套(监控、治理、编排)尚在完善
数据基础
★★★☆☆
结构化数据基础较好;非结构化数据的AI就绪度逐步改善;向量数据库、特征库等AI数据组件建设正在推进
组织适配度
★★☆☆☆
AI工程化人才极度短缺,GPU算力管理粗放,业务与科技协作机制尚不成熟
监管友好度
★★★☆☆
监管对AI应用持开放态度,信创要求明确但过渡期合理;模型治理规范尚在制定中

综合评分:2.8/5 —— 发展阶段,头部券商已建成平台并生产运行,但整体分化显著,多数仍在建设中

评分依据

维度
分值
评分逻辑
场景成熟度
3
头部5-8家券商(华泰、国泰海通、国信等)已建成大模型平台并投入生产运行(与第01篇"科技底座呈现显著分化"判断一致);多数中小券商仍处于选型评估或搭建初期
技术就绪度
3
大模型技术本身已趋成熟(DeepSeek、通义千问等已可商用);MLOps、向量数据库等支撑技术可用;但工程化配套(监控、治理、多模型编排)尚在完善
数据基础
3
结构化数据(行情、交易、持仓)基础较好;非结构化数据(研报、合同)AI就绪度逐步改善;向量数据库已在头部券商部署,特征库多数券商已建设
组织适配度
2
AI工程化人才极度短缺(MLOps工程师、AI工程化工程师最为紧缺);GPU算力管理粗放(利用率偏低);业务与科技协作机制尚不成熟
监管友好度
3
监管对AI应用持开放态度;信创要求明确但过渡期合理;模型治理规范尚在制定中;AI工程化将逐步升级为合规要求

评分标准:1分=探索阶段仅有PoC;2分=起步阶段有试点落地;3分=发展阶段多个场景生产运行;4分=成熟阶段核心业务流程AI化;5分=领先阶段AI驱动业务创新。与第01篇总览篇评分体系一致。


深度案例

案例A:华泰证券——大模型平台建设实践

背景: 2023年起,华泰证券将大模型AI提升至公司级战略,由高管层牵头推进。华泰的核心策略是"不自建基础大模型,聚焦应用层落地"——等应用侧成熟后借助第三方基础大模型,自身聚焦场景适配与工程化交付(来源:21世纪经济报道2025.07.25)。

架构策略: 华泰采用"多模型编排+统一中台"的架构思路——不自建基础大模型,而是借助第三方基础大模型,自身聚焦场景适配与工程化交付。典型的大模型平台架构如下:

┌────────────────────────────────────────────────┐│              应用层                              ││   投研Copilot  智能客服  合规审查  代码助手        │├────────────────────────────────────────────────┤│              AI中台                              ││   ┌──────────┐ ┌──────────┐ ┌──────────┐       ││   │模型路由   │ │Prompt管理│ │RAG流水线 │       ││   └──────────┘ └──────────┘ └──────────┘       ││   ┌──────────┐ ┌──────────┐ ┌──────────┐       ││   │Agent编排  │ │监控告警   │ │A/B测试   │       ││   └──────────┘ └──────────┘ └──────────┘       │├────────────────────────────────────────────────┤│              模型层                              ││   通用大模型(投研/合规)  推理模型(深度推理)        ││   轻量模型(快速问答)     多模态模型(图表理解)      │├────────────────────────────────────────────────┤│              算力层                              ││   自建GPU集群 + 弹性云扩容                        │├────────────────────────────────────────────────┤│              数据层                              ││   向量数据库 + 特征库 + 文档知识库                 │└────────────────────────────────────────────────┘

注:上图为券商大模型平台的典型分层架构,非华泰证券官方披露的具体架构。模型层的具体选型因各券商策略而异。

应用落地情况: 据公开报道,华泰已在大模型平台上线投研Copilot、智能客服、合规审查、代码助手等应用,覆盖投研、客服、合规、研发四大场景(来源:21世纪经济报道2025.07.25)。2025年10月,华泰发布行业首款AI原生交易终端"AI涨乐",经历100天迭代后服务用户突破240万,2026年1月正式发布1.0版本(来源:新华财经2026.01)。

注:华泰未公开披露各应用的具体调用量与量化效果数据。

关键经验:

  1. 先选场景再选模型,而非反过来。场景决定了模型的能力边界要求,模型选型应服务于场景需求。
  2. 模型路由是核心能力,没有路由的平台只是模型托管,称不上"平台"。
  3. 监控从Day 1就要建,不能等出了问题再补。
  4. 合规审计日志的成本不可低估——全链路审计日志存储约占推理服务总成本的相当比例,但这是必须投入。

简要提及:同业AI基础设施实践

机构
AI基础设施方向
要点
国泰海通
千亿参数证券垂类大模型
2024年7月发布"君弘灵犀大模型",2025年1月完成DeepSeek本地化部署,投研/客服/合规场景逐步铺开(来源:中证网2025.02;财联社2025.05.09)
华泰证券
ALL in AI战略+AI原生应用
2025年10月发布"AI涨乐"APP(AI原生交易应用,2026年1月正式发布1.0版本);做市策略已引入Agent信号研究;大模型平台建设详见案例A(来源:百度百家号2026.03;21世纪经济报道2025.07.25)
国信证券
"1+N"AI技术底座
2025年春节后首日完成DeepSeek-R1-Distill-32B本地部署+云端V3/R1双版本,1个技术底座+N个业务场景,金太阳APP/财富管理/投研分析等场景推进(来源:搜狐2025.02.08;新华网2025.03.02)
东吴证券
自研大模型+知识蒸馏
"秀财大模型"2023年12月发布,行业首个自研大模型算法备案(2024.04),通过海量金融语料训练实现"大模型能力+小模型效率"兼顾(来源:新华网江苏2023.12.12;证券时报2024.04.13)
西南证券
大语言模型中台
四层架构(训练→开发→部署→应用),部署层落地vLLM、TensorRT-LLM等分布式推理加速框架,RAG多重召回(向量+图谱+传统检索)(来源:金科创新社2024.06.13)
招商证券
"一超多强"模型矩阵
千亿级基础模型+多套百亿级领域模型+Agent平台,"招证天启"大模型体系全量本地私有化部署(来源:百度百家号2025.06.30;国资委官网2025.03.28提及"AI证券公司"战略但未提"一超多强"表述)

本篇核心观点: 券商AI的基础设施建设,不是"搭个平台、部署个模型"的技术活,而是一项涉及算力规划、架构设计、工程体系、治理框架的系统性工程。从PoC到生产的死亡之谷,不会因为换一个更强的模型而自动跨越——唯有扎实的工程化能力,才能让大模型真正成为券商的生产力而非PPT上的亮点。

下一篇,我们将从基础设施回到人本身——AI型组织如何建设?人、架构与文化的系统变革,才是AI落地真正的"最后一公里"。


本文为「AI重塑证券业」系列第十篇。系列共十二篇,持续更新中。


数据来源与事实核查说明

本文引用数据来源包括:(1)券商公开财报与年报中披露的AI投入及基础设施情况;(2)财联社、证券时报、21世纪经济报道、新华网等行业媒体报道;(3)行业会议与论坛中券商科技负责人公开分享的实践数据;(4)券商官方发布渠道(如国信证券搜狐官方号、光大证券东方财富网发布等);(5)行业研究机构报告及金科创新社等科技社区案例。本文已对核心事实陈述进行来源核查,对于无法找到公开出处的重要数据,已改为定性描述,不呈现具体数字以避免误导读者。

「AI重塑证券业」之一:证券公司AI全景图——九大领域成熟度扫描

「AI重塑证券业」之二:AI如何重塑研究能力——从信息搬运到认知增强

「AI重塑证券业」之三:AI驱动的投资决策——从信号到执行的智能链路

「AI重塑证券业」之四:AI让财富管理更懂客户——客户旅程的智能化重构

「AI重塑证券业」之五:AI赋能投行业务——从项目承揽到存续管理的效率革命

「AI重塑证券业」之六:AI在资产管理中的实践——投研风控运营的智能化中台
「AI重塑证券业」之七:AI重构中后台运营——算得清ROI的智能化替代
「AI重塑证券业」之八:AI让合规更主动——从事后检查到事前预判的范式转移
AI重塑证券业之九:智能风险感知——从人工盯盘到全景穿透