乐于分享
好东西不私藏

AI 时代,大数据不是落幕,是更重要了 —— 论"湖仓一体"数据战略

AI 时代,大数据不是落幕,是更重要了 —— 论"湖仓一体"数据战略

AI 越强,数据越贵。

当业界把聚光灯全部打在大模型、算力、智能体上时,真正决定模型上限、决定企业能否把 AI 真正落到生产的,是底座那一层"不性感"的大数据。大数据没有死,它正从"搞基建"的阶段,跃迁到"数据运营、数据治理、数据质量"的新阶段。对大公司而言,建设 AI 就绪的湖仓一体(Lakehouse)底座,已经不是技术选型问题,而是企业级战略问题。


一、先破除一个迷思:大数据"已死"了吗?

过去两年,"大数据已死""大数据吃灰""大数据凉了"之类的标题反复出现。支持者的核心论据来自谷歌 BigQuery 创始工程师 Jordan Tigani 的论断:数据大小不重要,大多数企业并没有真正的大数据,海量数据大多只存不用,反而成了负债,Hadoop 生态的黄金期已然过去。

但这些说法混淆了一个本质概念:某一种大数据技术(如 Hadoop 套件)的红利消退 ≠ 大数据本身的价值消亡

恰恰相反,在 AI 时代,大数据的地位不是下降,而是升维了。

一线从业者的感受最直观:某创业公司 CTO 在 AI 技术沙龙上坦言,如今大模型研发的成本结构里,80% 花在找数据、清洗数据、标注数据上,模型训练本身反而是小头。DeepSeek 在数学推理上的突破更是给行业上了一课:它不是靠更多参数或更大算力,而是靠更精细的数据设计——训练数据不仅要求答案正确,更要求解题步骤的规范性与逻辑链的完整性。这种"质量上的革命"而非"数量上的堆积",让模型的抽象思维能力实现了质的飞跃。

所以正确的判断不是"数据已亡",而是"数据为后":模型训练的硬件成本在持续下降,但高质量数据的获取成本却在持续上升。就像盖房子,砖头水泥便宜了,但好地段、好设计、好建材的价格却在疯涨。

旧时代的大数据,比拼的是"存得下、算得动";新时代的大数据,比拼的是"用得好、质量高、能支撑智能决策"。前者的红利确实在消退,后者的战争才刚刚开始。


二、梁文锋判断的启示:硬件可平替,数据无捷径

近期流出的 DeepSeek 投资者交流会上,创始人梁文锋对国产算力的判断,恰好可以作为我们讨论数据层价值的参照坐标。

他的核心观点非常明确:国产 AI 芯片在硬件和生态上"没有问题,唯一有问题的是产能"。华为 950 超节点在性能和价格上可以完全平替英伟达 GB200/GB300;四张华为卡顶一张英伟达卡,落后两年,但只要价格和生态能平替,这个差距完全可以接受。他甚至直言,英伟达 CUDA 的护城河正在快速瓦解——AI 本身可以自主编写代码、快速完善适配生态,新型高级编程语言大幅降低了算子重写门槛,AI 计算卡的市场规模已经超越游戏卡,多重因素叠加正在消解英伟达的生态壁垒。

这段话对我们讨论数据战略有三点关键启示:

第一,硬件代差可以被工程与代码能力弥补,但数据质量无法靠代码凭空生成。算力不足可以靠架构优化、并行调度、软件栈追平;但数据不准、主数据混乱、血缘不清,再强的模型训练出来也是错误结论,对企业决策是致命的。

第二,硬件、模型、数据三者不是零和博弈,而是相辅相成。梁文锋谈的是"硬件  应用"的补偿关系;而数据层处在更基础的位置:它既是被 AI 消耗的燃料(Data for AI),也是被 AI 反哺治理的对象(AI for Data)。两者螺旋上升,而非此消彼长。

第三,当算力不再是不可逾越的瓶颈时,数据就会成为真正的核心护城河。未来企业之间的 AI 能力差距,很大概率不会差在模型参数和算力规模上,而差在有没有高质量的私域数据、有没有统一可信的数据底座、有没有持续沉淀数据资产的治理体系。


三、全栈视角:为什么数据处在"承上启下"的枢纽位

把整个 AI 时代的产业价值链拉开看,是一条清晰的传导链条:

逐层拆解,每一层都依赖下一层,而数据层是唯一同时被上下两层双向依赖的枢纽:

一句话:没有扎实的大数据底座,所有光鲜的大模型应用都是空中楼阁。

这也解释了为什么"垃圾进,垃圾出(Garbage in, Garbage out)"在大模型时代被反复验证。德州农工大学与德州大学奥斯汀分校的研究团队提出的"LLM 脑腐(Brain Rot)假说"指出:模型长期暴露在低质量文本中,会出现注意力衰退、推理链断裂、认知能力持续退化,且这种损伤具有结构性、不可逆性,后续即使追加干净数据微调也难以完全恢复。

数据质量,直接决定 AI 的命运。

进入智能体(Agent)时代后,数据底座的价值还在进一步放大。Cloudera 的观察指出,湖仓正在从"支撑决策的报表存储库",演变为自主智能体的高性能上下文层——它为企业 Agent 提供治理框架、语义上下文和运营智能,支持 RAG 管道、AI 特征存储和实时流管道,让智能体可以基于统一可信的数据自主行动,而不是在零散的数据孤岛里反复碰壁。


四、湖仓一体:大数据在 AI 时代的"再上一层楼"

如果说十年前的"大数据"关键词是拼硬件、搞基建、堆 Hadoop 集群,那么今天的关键词已经变成:数据运营、数据治理、数据质量、AI 就绪。而承载这一跃迁的最佳架构形态,就是湖仓一体(Lakehouse)。

4.1 湖仓一体到底是什么

它不是某一款具体软件,而是一种融合型架构理念——把"数据湖"的灵活海量存储,与"数据仓库"的规范管理和高性能分析捏合在一起,形成统一的数据管理平台。

  • 数据仓库像"精装房":只装结构化数据,管理规范、查询快,但成本高、不接受杂乱数据。
  • 数据湖像"毛坯仓库":啥格式都能存(图片、日志、视频),成本低、容量大,但质量乱、分析效率低,管不好就成"数据沼泽"。
  • 湖仓一体像"智能精装仓库":既保留数据湖的低成本海量存储,又加入数据仓库的规范管理与高性能分析,让一份数据既能支撑 AI 训练,又能直接服务业务报表。

其核心优势可归纳为四点:

  1. 数据不搬家
    全量数据存统一平台,避免多系统间的数据冗余与不一致;
  2. 实时响应快
    支持数据实时流入、实时分析,告别"T+1"离线等待;
  3. 开放不锁定
    以 Parquet / ORC 等通用格式存储,可对接 Spark、Flink 等多种计算引擎;
  4. 可靠有保障
    通过 Iceberg / Paimon / Delta Lake 等技术实现 ACID 事务,多人并发读写仍能保证数据准确。

技术内核上,它以存算分离为基础,统一元数据为中枢,协同离线与实时多类计算引擎,最终向上对接 AI 与分析场景。

4.2 Data for AI:湖仓是大模型的"高质量训练数据底座"

大模型时代的竞争,本质是高质量数据集的竞争。现代高质量数据集至少有"三张面孔":

  • 模态维度:文本、图像、音频之外,更需要思维链数据、多模态融合数据、IoT 实时流数据;
  • 阶段维度:预训练(通识教育)、指令微调(专业训练)、评测(考试)各有使命;
  • 应用维度:通识 → 行业通识 → 行业专识,构成金字塔结构。

湖仓一体正好能统一纳管这些多模态、多阶段、多层级的数据,并通过智能治理保障质量:用 NLP 自动识别敏感信息、用机器学习实时监控空值/格式异常/数据漂移、用知识图谱梳理数据血缘。这让 AI 训练的数据底座从"混乱的湖"变成"可信的仓"。

更重要的是,传统架构里做一次 AI 训练,要经历数据抽取、清洗、格式转换、跨系统搬运,流程长、副本多、一致性差。而在湖仓一体架构下,可以直接在湖内完成数据采样、特征工程、模型训练与推理,无需数据迁移,大幅缩短从数据到模型的链路。

4.3 AI for Data:AI 反向驱动数据治理与价值挖掘

大数据"升级"的另一半,是 AI 不只是消费者,更是治理者:

  • 对话式分析
    大语言模型 + 语义解析 + 查询优化,业务人员用自然语言提问即可生成 SQL 并得到可视化结果,数据分析门槛降到零;
  • 智能建模与计算优化
    AI 通过分析数据分布自动推荐建模方案,用强化学习优化器动态调整计算参数,复杂查询执行速度可提升 40%–70%;
  • 智能数据治理
    AI 让数据治理实现"全自动、高精度",人力成本降低 50% 以上,问题排查时间从小时级缩短到分钟级;
  • Agentic 治理范式
    数据治理正从"以人为中心"向"以 AI 为中心"演进,通过元数据底座 + 治理智能体,以自底向上、分布式、持续迭代的方式,让私域数据更好地为 AI 服务。

Data for AI 与 AI for Data,不是先后关系,而是并行螺旋上升。大数据没有落幕,它从"被建设的基建"变成了"被 AI 反哺、又喂给 AI 的活引擎"。


五、大厂已经在用脚投票:湖仓一体成为标配

这不是 PPT 上的概念。从阿里、腾讯、字节到 Databend、Snowflake,湖仓一体已在真实生产中大规模落地,且收益可观。

5.1 阿里云"AI 驱动的智能数据湖仓"实践

2025 云栖大会上公布的多个企业案例,已经充分验证了湖仓一体 + AI 的价值:

阿里云的观察很有代表性:企业数据平台正在从"分析平台"向"AI 操作系统"演进,湖仓就是这个系统的基座。

5.2 Databend:存算分离重构传统大数据

Databend 联合创始人吴炳锡在 DTCC 2025 上分享的案例,更能体现湖仓一体对传统大数据架构的颠覆:

  • 某客户拥有 2.6 万亿条记录,未压缩数据量 7PB,原对象存储每月成本高达数百万美金;通过湖仓架构与高压缩比,成本降至原来的三分之一。
  • 省级人口库场景中,传统"各部门互推数据"的模式导致单省存储冗余达 300TB–1PB,每天运行 30–40 万同步任务;采用湖仓数据共享机制后,存储需求降至 100TB,数十万同步任务与专门的数据核对团队被整体取消。

他提出的架构哲学很值得深思:"正确性大于高性能"——优先保证数据稳定与准确,再追求成本优化。这恰恰是 AI 时代数据底座最该有的价值观:模型可以迭代,算力可以扩容,但数据一旦错了,所有上层智能都会跑偏

5.3 为什么大厂不约而同选择湖仓一体

帆软在《构建数据中台,为什么"湖仓一体"成了大厂标配》中总结了四个实打实的理由,放在 AI 时代依然成立:

  1. 数据来源太多,仓库装不下了
    小程序日志、音视频、IoT 传感器、爬虫、第三方平台对接,格式五花八门,无法直接塞进结构化仓库;
  2. 分析需求变复杂,仓库应付不过来
    推荐算法、用户行为路径、机器学习训练、海量日志挖掘,这些都不是传统数仓擅长的事;
  3. 成本差异显著
    对象存储远比数仓便宜,冷数据先入湖,可以大幅降低存储成本;
  4. 不同角色用数方式不同
    BI 分析师和管理层要干净统一的数据,用仓;算法工程师和数据科学家要全量原始数据,用湖。

不是大厂"爱折腾",而是业务发展到了这一步,数据底座必须跟上。


六、把"数据底座"写进公司战略议程

基于以上论证,对有一定规模的企业,我们给出六条可执行的数据战略建议:

1. 把数据战略上升为企业级战略,而非 IT 部门的 KPI

AI 时代的核心竞争力,正从"拥有数据"转向"用好数据"。数据底座建设(湖仓一体)应被视为与算力采购同等重要的战略投资,由 C 级高管直接牵头,而不是下沉为技术团队的内部事务。

2. 先治理,后智能——死守"主数据"与"数据质量"

企业主数据(客户、产品、组织、物料)一旦不准,AI 决策就是建立在流沙上。建立以准确性、完整性、一致性、多样性、真实性、合规性、动态评估为维度的数据质量体系,把"数据质量决定 AI 命运"当作铁律。不要在脏数据上建漂亮的模型,那是自欺欺人。

3. 采用存算分离、开放格式的湖仓一体架构

优先选择 Iceberg / Hudi / Delta Lake 等开放表格式与对象存储底座,避免厂商锁定;建设统一的元数据中心,让"湖里的数据看得懂、仓里的数据信得过"。架构目标不是"技术先进",而是"数据资产可积累、可复用、可演进"。

4. 同时布局 Data for AI 与 AI for Data

双向发力,形成闭环:

  • Data for AI
    建设高质量、多模态、带血缘的数据集,直接对接训练、微调、评测的完整闭环;
  • AI for Data
    引入智能治理 Agent,降低治理人力成本,让数据实现"自描述、自修复、自治理"。

5. 以"AI 就绪(AI-Ready)"为验收标准

衡量数据平台成败的指标,要从"存了多少数据"转向"能否支撑实时特征、向量检索、RAG 上下文工程、模型回归训练"。聚水潭式的"零副本、零 ETL、业务数仓一体化",应当成为目标形态。

6. 警惕"伪需求 / demo 陷阱"

任何脱离真实、准确、全量数据的"大模型应用",都只是炫技 demo。落到生产、真正提升人效与决策质量,才是大数据 + AI 的终局。不要为了赶 AI 热点而架空数据底座,那样的智能走不远。


七、结语

回到开头的问题:AI 时代,大数据是落幕了吗?

答案是否定的。大数据不是退场,而是升舱——从"夯土基建"的 1.0 时代,进化为"数据运营 + 治理 + 质量 + AI 协同"的 2.0 时代。

梁文锋让我们看到,硬件代差可以被工程与代码补足;但数据层的代差,没有任何捷径可走。它只能靠日复一日的主数据管理、数据治理与高质量积累来填平。

在硬件/电能 → 大数据集群 → 大模型 → 应用 → 用户交互这条链路上,大数据集群是那个沉默却不可替代的枢纽。对大公司而言,今天不建设 AI 就绪的湖仓一体底座,明天就会在"模型很聪明、决策很愚蠢"的悖论里,为数据质量的欠账买单。

大数据没有落幕。它只是换了一件更智能的外衣,站到了舞台更中心的位置。


参考资料

[1] 36氪:《大数据已死?谷歌十年老兵吐槽:收起 PPT 吧,数据大小不重要了》[2] 腾讯云开发者社区:《数据质量决定AI命运》[3] 电子工程专辑:《DeepSeek梁文锋:英伟达CUDA正自掘坟墓 华为可完全平替英伟达》[4] 澎湃新闻:《喂垃圾数据=毁模型?最新研究:AI 脑腐不可逆,清洗也救不回来》[5] 阿里云开发者社区:《告别"垃圾进垃圾出":打造高质量数据集的完整指南》[6] 腾讯云开发者社区:《一文读懂湖仓一体:AI时代的大数据架构革命》[7] 腾讯云开发者社区:《AI 时代下的湖仓一体化平台建设的思考》(吴炳锡,DTCC 2025)[8] 阿里云开发者社区:《AI驱动的智能数据湖仓,高性能实时分析与深度洞察》(2025 云栖大会)[9] 腾讯云开发者社区:《构建数据中台,为什么"湖仓一体"成了大厂标配?》[10] Cloudera:《从分析平台到 AI 操作系统:智能体 AI 时代的数据湖仓》