乐于分享
好东西不私藏

AI造出3000万个应用,你的数据库架构还扛得住吗

AI造出3000万个应用,你的数据库架构还扛得住吗

蚂蚁的"灵光"平台,今年已经承载了3000万个AI生成的"闪应用"。什么叫闪应用?你对着屏幕用大白话说一句"我要一个管报销的小工具",AI 几分钟内给你吐出一个能跑的应用。大多数人扫一眼这个数字就划走了,但做后端、做架构的人,我劝你多盯两秒——3000万个应用正在拆掉数据库行业几十年来最稳的一张桌子。

过去几十年,数据库架构有个默认前提:应用是稀缺的。一家公司养几十个、上百个应用,每个应用背后几张表、几十张表,架构师精心设计,DBA小心维护,天下太平。这个前提,被 AI 一脚踹翻了。当应用能从"手工作坊"变成"流水线产物",数量直接从三位数跳到八位数,底座的承重结构都在咯吱响。

这种成本坍塌,历史上只发生过几次。智能手机起来那几年,App 从大厂专属变成人人能写,结果后端被逼着重构了一轮;再往前,PC 普及、互联网爆发,每一次应用的量产,都跟着一次底座的革命。AI 这次也一样,只是量产的速度快了不止一个量级。

应用数量从"几十个"跳到"几千万个","一应用一物理表"这套老规矩就彻底废了。

为什么废?每建一张物理表,你都得付三笔账:元数据的账、存储的账、运维的账。几千万个应用,就是几千万套表结构。元数据堆到那个量级,神仙来了也得跪。 元数据先崩,存储再崩,SQL 计算最后跟着崩。更麻烦的是,这些闪应用大多生命周期极短——今天建、下个月可能就没人用了,可它的表结构还赖在系统里占着坑,账怎么算都是亏的。

OceanBase 给灵光开的药方是一个词——逻辑表。不给每个应用单独建库,也不把数据塞进一个查不动的大 JSON 池,而是让每个闪应用在操作层面保有独立表结构:能建表、能插数据、能跑 SQL,用起来跟独立数据库一模一样,底层却共享物理存储、受控计算。应用层感觉独享一切,物理层一分钱没多花。

这套思路真正值钱的地方,在于它把"海量应用"和"有限资源"这对冤家,头一回摁在了同一张谈判桌上。而且它不是 PPT 概念——中国联通拿它搭统一 RAG 架构,硬件资源省了约三成;货拉拉拿它做资损代码识别和数仓答疑,砍掉了一堆独立向量组件。能落地的东西,才配叫架构,不然只能叫情怀。

———

别以为这是蚂蚁一家的内务。放大看,这就是眼下 AI 落地最扎心的那个矛盾:模型越来越能打,数据底座却原地踏步。Databricks 的调查说,只有 37% 的高管认为自家生成式 AI 应用已经够格上生产。剩下那六成多,卡在哪?卡在数据压根没就绪——找不到、看不懂、不敢喂。

这就是业内说的"第一公里"难题。模型可以随时下载,但你的数据散在十几个孤岛里,字段对不上、口径不一致、质量一塌糊涂,喂进去出来的全是幻觉。很多 AI 项目第一版不难,难的是三个月以后它还在正常运行。

再往深说,瓶颈不在算力,在口径。同一个"订单金额",业务算含税、财务算不含税、数据团队算优惠后——三套口径摆一块,模型听谁的?听谁的都得错。口径对不齐,模型再牛也是白搭。

所以今年 DTCC 这种老牌数据库大会上,最热的词既不是某款新引擎,也不是某个新协议,而是"AI 数据底座"和"DBA 转型"。风向已经变了:数据库不再是 AI 的旁观者,而是 AI 落地的最后一道坎。

在 AI 这条链路上,谁握住数据这一层,谁就掐住了模型的喉咙。

听着像给数据库戴高帽,你算笔账就懂了。模型的推理能力是公开的、同质化的,几个月的领先很快被抹平;真正拉不开差距的,是你用多低的成本、多稳的架构,把海量应用和海量数据伺候舒服。OceanBase 敢把灵光这套架构公开,赌的就是一件事:这一层的经验,比模型参数难抄一百倍。

企业 IT 这几十年,走的是一条向上的路:先是流程电子化,把纸面搬到系统里;再是数据资产化,把散数据攒起来;接着算法赋能,让数据会说话;现在轮到智能体自主,让系统自己会办事。每一步,数据库都在底下托着。只是前几步它当背景板,这一步它站到了台前。

———

对做技术的人,这波最该想明白的,是你的位置站在哪一侧。

还在纠结"选 MySQL 还是 PostgreSQL"的人,选到天荒地老也选不出优势。数据库选型这件事,早就被过度神化了。 护城河跟你挑了哪款数据库没关系,跟你敢不敢重新画数据的边界才有关系。

会写 CRUD 的人不会失业,AI 应用再爆炸,总得有人接住它们倒出来的数据。但只会写 CRUD 的人,会。 接下来最抢手的,从会写 SQL 的那双手,换成了能想清楚"数据怎么喂给 AI"的那颗脑袋。

所以别把力气全花在背新框架上。接下来吃香的人,是那种既看得懂执行计划,又说得清"这条数据该不该进模型、进去之后怎么保证不烂"的人。这种横跨数据和 AI 的中间地带,才是接下来溢价最高的坑。

这句话不好听,但你去翻最近的招聘就知道:带 AI 数据底座、Agent 数据链路、多模数据经验的岗位,溢价明明白白摆在那。AI 没抢 DBA 的饭碗,它只是把饭碗里的饭,换成了更难吃的一碗。

旧的稳妥正在失效。过去十年,架构师最大的安全感来自"稳定"——少变更、少折腾、别出错。可 AI 应用的需求是分钟级上线、天级迭代,你的架构要是还按半年一个大版本的节奏走,早晚被业务的节奏抛下。稳定正在从你的护身符,变成你的催命符。

———

当然,也别急着推倒重来。逻辑表也好、湖库一体也好,本质都只是手段。它真正要做的,是逼你重想一个问题:当应用的边界被 AI 冲垮,数据和计算该在哪一层合拢、在哪一层放开。

想通这一层的人,已经在往下一个坑位挪了;没想通的人,还在为"这周数据库该打哪个补丁"抠头皮。旧架构不会一夜暴毙,但会慢慢把你饿死。

而且这不是中国厂商的孤例。海外的 Databricks、Snowflake 都在往同一个方向狂奔——把数据湖、数仓、AI 打成一个整体,让数据从"存起来"直接变成"给模型用"。谁先把这条路趟平,谁就拿到 AI 时代的数据入场券。

AI 时代最先被重写的,从来不是应用本身,是底座。应用会一路贬值,底座,才是真值钱的那头。

3000万个闪应用,只是开了个头。等这个数字滚到3亿,你手里那套老架构,还接得住吗?

码上谈兵 · 讲人话的技术