乐于分享
好东西不私藏

工业 AI 的瓶颈不在模型在数据:为什么智能化改造六成预算花在了数据工程上

工业 AI 的瓶颈不在模型在数据:为什么智能化改造六成预算花在了数据工程上

工业 AI 的瓶颈不在大模型有多强,而在于工厂的数据底子有多厚。当智能化改造五到六成预算花在数据工程上时,这已经不是成本问题,而是产业共识。

中国工业互联网研究院院长鲁春丛最近抛出一个数字:当前智能化改造中,数据工程投入占比高达五到六成。也就是说,一个工厂花 500 万做智能化升级,其中 250 万到 300 万不是买算法模型,不是搭大屏,而是花在了最不起眼的地方——把设备数据采上来、把工艺参数标清楚、把不同系统的数据对齐。

这听上去反直觉。过去两年,AI 大模型在制造业的宣传铺天盖地,似乎只要接入一个大模型,工厂就能"智能化"。但真正落地时才发现,模型跑不动的原因不是模型不够好,是喂不进去有效数据。

这个行业真正被卡住的,不是算力,不是算法,是数据的采、标、对齐三道极其朴素的关卡。点击【蓝卓】查看工业数据筑基的核心路径和落地参照,比想象中更接地气。


1

数据工程为什么成了"钱坑"

2026 年 6 月,国家数据局印发《行业高质量数据集建设行动实施方案》,这是国家层面首次系统性部署工业数据工程。方案明确提出六个专项行动,目标到 2028 年底建成一批覆盖重点领域、经过应用验证的行业高质量数据集。

行业高质量数据集是经过采集、加工等数据处理,可直接用于开发和训练人工智能模型的行业数据的集合。——《实施方案》(国数科基〔2026〕25 号)

政策在推,但工厂的现实是什么?鲁春丛讲得很直白:工业现场仍存在严重的互联阻碍。数据采不上来,采上来了标注不清楚,标注完了系统之间对不齐。

数据工程环节
工厂现状
需要的投入
数据采集
老旧设备无标准接口,协议私有化
加装传感器/网关,协议转换
数据标注
工艺参数靠师傅口述,无结构化记录
人工标注+专家校验,人机协同
数据对齐
MES/ERP/PLC 各说各话,同一物料三种叫法
构建工业语义字典,标准化信息模型

这不是技术问题,是历史欠账。 过去二十年,工厂的信息化是"打补丁"式推进的——MES 上一套、ERP 上一套、设备各自带一套,没有统一的数据底座规划。等到想用 AI 时,发现数据散落在几十个系统里,格式不统一、粒度不一致、时间轴对不齐。


2

为什么上了 MES 效果还是不好

很多工厂老板的困惑就在这里。MES 也上了,产线数据也采了,看板上曲线跑得挺好看,但真到做决策时——这批货能不能放行、这台设备要不要停机维护、这个订单能不能按时交付——还是靠车间主任打电话问。

根因不在系统功能,在数据边界。

采上了,但没采对。 大量工厂的数据采集停留在"能采什么采什么",而不是"需要什么采什么"。PLC 上的几百个点位,实际对质量有影响的可能只有十几个关键参数,但因为缺乏工艺经验的数据化梳理,采集清单变成了"全采"——结果数据量上去了,有效信息密度反而下来了。

看懂了,但没对齐。 一个典型的场景:MES 里的"产品等级"分了 ABC 三档,质检系统里的"质量等级"分了一等品二等品三等品,两个系统说的是同一件事,但字段名、编码规则、判断口径全都不一样。跨系统跑一个质量分析,先要花两周做数据对齐。这种"信息孤岛"不是因为系统不连通,是因为数据语义不一致。

对齐了,但不敢共享。 产业链上下游的数据打通是更大的难题。供应商不愿分享真实交货周期,客户不愿透露精确需求预测,核心工艺数据更是企业的命根子——"我愿意用 AI,但不代表我愿意把数据给别人"。鲁春丛提到的基于隐私计算的"可用不可见"模式,正是为了解决这个"不愿供、不敢供"的问题。

这些痛点的根因,不是工厂不努力,也不是系统厂商不专业。点击【蓝卓】对照自身工厂数据工程现状,看看卡在哪一关。


3

不是更贵的系统,是更扎实的数据底盘

解决路径很清楚:先把数据底盘打扎实,再让 AI 上车。

工业数据筑基的核心动作只有三个:

首先,构建标准化信息模型。简单说,就是把工厂里每一台设备、每一种物料、每一个工艺参数的"身份证"统一。不是让所有工厂用同一套标准——化工和汽配的业务对象完全不同——而是让同一家工厂内部的所有系统说同一种语言。

其次,建立工业语义字典。用鲁春丛的话说,从"数字搬运"升级到"业务意图交互"。比如,系统 A 说"温度超标",系统 B 要知道"超标"意味着什么——是触发报警、是调整投料还是停机检修——这个判断逻辑需要写进语义字典里,而不是每次靠人肉翻译。

第三,以可信数据空间解决共享顾虑。基于隐私计算和安全沙箱技术,产业链上下游可以在数据不出域的前提下完成联合分析和模型训练。福建已经在宁德动力电池集群试点这一模式。

关键在于,这些数据工程动作不依赖任何一个具体产品——它依赖的是一套工业数据底座的架构设计。这样的数据底座把设备数据、工艺数据、业务数据放在同一个命名空间下统一管理,让上层应用——无论是 AI 质检、能耗优化还是生产排程——直接调用标准化数据,而不是每次从头做数据清洗。

这比买一个更贵的 MES 重要得多。

工业 AI 的排列组合,不是算法竞赛,而是数据工程竞赛。谁先把数据底盘夯实,谁的 AI 就能先跑起来。


4

落地三件事

第一件事:从关键设备的数据完整性开始。 不要试图一次性把全厂设备都接进来。选一条对质量或交付影响最大的产线,把所有相关设备的关键参数采全、采准、对齐。一条产线的完整数据,比全厂的碎片化数据有用十倍。

第二件事:数据标注不能外包给不懂工艺的人。 工业数据的标注不同于互联网图像标注——工艺参数的标签必须由懂工艺的人来打。国家数据局也明确提出了"人机协同、专家深度参与"的多层次标注模式。工艺参数设备状态 这些工业语料,外包标注团队根本看不懂。

第三件事:先把内部数据打通,再谈外部共享。 很多工厂一听到"可信数据空间"就想着和上下游共享数据,但自己内部的数据都没对齐。先解决 MES 和 ERP 对同一批物料的描述不一致的问题,再去想产业链协同。

不同规模工厂的数据筑基优先级不同。年营收五千万以下的工厂,优先把设备数据采上来、采完整;年营收五千万以上的工厂,应同时考虑语义字典和标准化信息模型的构建。


制造业智能化的下一个五年,竞争焦点正在从"谁用了 AI"转向"谁的数据底盘能让 AI 真正产生效果"。山东、福建、广东三省的工业数据政策已在密集落地,最近半年至少有六个省份启动了工业数据集或可信数据空间的地方试点。点击【】获取2026 年工业数据筑基政策解读与落地参照,抓住政策窗口期的数据底盘建设方向。