夜雨聆风学习资料网

ARTICLE · 1156552

第五篇章——25.AI+监测:从“工具”到“引擎”的升维之路

第五篇章——25.AI+监测:从“工具”到“引擎”的升维之路
生态环境监测监管深度系列 · 第 25 篇

引擎已经轰鸣,油箱为什么还没加满

—— AI+监测的升维之路,与它绕不开的那块地基

▲ 引擎启动、燃料不足:这一轮数智化最典型的浪费,是只采购引擎、不建设油箱

2026 年 8 月 13 日,国新办发布会给“十五五”数智化定下一组硬指标:到 2030 年,国家监测网重点业务领域人工参与度下降 70%、效率提升 5 倍以上。引擎的轰鸣声已经听得见。而就在三个月前,生态环境部审议 AI 行动方案时,通稿里排在第一位的部署却是——“加强高质量数据供给”。这一篇讲的就是这件事:引擎造出来了,油箱还没加满。
01
引擎已经轰鸣:AI 在这些场景里跑通了

先看成绩单。下面这些不是演示厅里的概念,是已经在业务化运行的东西。

水。生态环境部信息中心的“碧水精灵”智能体,可提供政策解读、数据问答、趋势预测、症结问询等服务,自动生成流域水生态环境情况报告,实现 1794 个国控断面水质高精度预测,准确率 85% 以上。

气。上海依托大模型打造工业园区大气污染溯源智能体,2026 年试点运行期间累计推送污染预警线索 66 条,溯源结果有效率近 85%,在多家疑似企业中精准锁定异常排放主体。

常州更进一步:依托 XGBoost 机器学习算法与 DeepSeek 大模型,上线空气质量逐时预报系统,实现 PM2.5、臭氧 0 至 72 小时的逐小时滚动预报——24 小时臭氧预报与实测相关系数稳定在 0.9 以上,PM2.5 达 0.8 以上;系统上线以来成功预测 4 个污染过程、15 个短时升高过程,助力常州“抢回”3 个优良天。4 月 1 日至 2 日那次 PM2.5 与臭氧“双污染”过程中,系统提前 18 小时精准预报峰值时段,当日两项污染物浓度比预测值还低 7 微克/立方米和 20 微克/立方米。

1794 个

国控断面水质预测

85% 以上

“碧水精灵”预测准确率

抢回 3 个

常州多出来的优良天

国家层面的同类能力也已成形:生态环境部自主研制的 PM2.5 与臭氧协同防控立体监测预警平台,实现“公里—小时”级精准预报,72 小时空气质量模式预报准确率从约 60% 提升至 75% 以上——这正是“十五五”要把 72 小时 PM2.5 超标天预报准确率推到 80% 以上的起点。

生态。江苏在 20 个观测站安装 98 台鸟叫声识别设备,已录到243 种鸟类、近 44 万条数据,人力成本直接降低 90%。这件事的性质变化比数字更重要:过去一年才能做一次的鸟类、植物种类调查,现在全年可以连续进行。

执法。融合排污许可数据的智能执法技术能自动生成执法线索,用大模型识别机动车检测站造假、重型货车违法排放,目前发现问题的准确率超过 70%,筛选的数据量达到千亿条级别。

固废。全国危险废物全过程环境管理信息系统 2025 年 12 月上线,支撑超 66 万家企业注册,依托物联网数据与 10 类非现场监管模型,实现“一码贯通”全程追溯。背后是国家科技重大项目已部署 90 多个涉及人工智能等新技术的研究项目。

AI 完成了一次身份转变从“展品”变成了“同事”

—— 这些能力真实、可用、已经上岗 ——

但更关键的问题在后面:这些跑通的场景,共同点是什么?

02
共同点:它们都站在一份干净的数据上

把上面每个案例拆开,会发现同一个前提。

常州能做出逐小时预报,是因为它整合了气象与监测的多维数据,而且这些数据是本地长期连续的;“碧水精灵”能预测 1794 个断面,是因为背后有国控断面多年积累的标准化数据;鸟声识别能快速跑通,是因为 98 台设备采集的是统一规格的音频数据。

AI 不是凭空长出来的能力,它是被数据喂养出来的能力。

这一点,官方口径自己也说得很直白。行动的出台节奏本身就值得注意:2026 年 5 月 18 日经部常务会议审议通过,6 月 1 日以环厅〔2026〕30 号文印发,上位依据是《国务院关于深入实施“人工智能+”行动的意见》(国发〔2025〕11 号)。方案划定四大场景——绿色低碳、污染防治、生态安全与核安全、生态环境治理能力,和三个能力——AI 驱动的监测预测、模拟推演、问题处置,最终建成生态环境领域“一干多支”的多样化智慧化应用体系。

而它的核心逻辑被概括为八个字——“数据为基、场景为要、模型为核、安全为底”,数据排在第一位。方案审议时,会议通稿里的部署顺序同样是“加强高质量数据供给”在前、场景建设在后。

行业里的说法更不留情面。首创环保集团副总经理黄绵松有个判断:“没有高质量的数据,人工智能就是无米之炊。”他把行业数据的困境概括成三个“不”:不能用、不会用、不愿用——数据散落在政府、企业、科研机构手中,标准不一、权属不清、流通壁垒高。中国科学院院士李景虹的表述几乎和本篇的题眼重合:“高质量数据是 AI 赋能生态治理的‘燃料’与‘基石’。”他调研发现行业大模型面临三重困境——高质量专业数据缺口明显、数据治理规则尚不健全、部门间数据壁垒普遍存在,并用八个字形容后果:“数据孤岛与飞轮失灵并存。”

燃料不够,引擎再先进也转不动。而这件事在监测领域,还有一个更棘手的版本。

03
AI 赋能底数的四条路径

先看前景。AI 究竟怎么帮我们“把底数摸清”?四条路径已经清晰。

第一条,多源数据融合——把分散的碎片拼成一张图。自行监测数据、遥感影像、用电数据、排污许可数据,过去各在各的库里。AI 的价值在于交叉校验与相互补全:一家企业用电量突然上升而排污数据纹丝不动,模型会标记异常;一个区域遥感发现裸土扰动而水土保持记录为空,模型会生成线索。单一数据源看不出问题,多源交叉才能让问题自己浮出来。

第二条,智能识别预警——从“人盯屏幕”到“数据找人”。常州的做法是个样本:基于孤立森林、独立主成分分析等无监督算法,对全市监测站点分钟级数据全天候扫描,智能捕捉“毛刺”“偏高”两类异常,解决人工盯屏效率低、夜间有盲区的问题。这套逻辑放大到流域尺度,就是“数据→预警→溯源→响应”的完整闭环。

第三条,低成本采集——卫星一张图,胜过千人入户。固废非法倾倒排查、自然保护地人为活动监测,过去靠人工巡查,现在靠米级、亚米级卫星常态化遥感排查。成本结构完全不同——这也是第 12 篇讲的“第三次污普”最值得期待的技术变量。

第四条,动态更新——从“十年一更新”到“实时更新”。这一条与主线的距离最近。污染源普查十年一次,是法定安排;但企业的产排污状况每年都在变。AI 模型持续学习新数据,底数才有可能从“十年一张照片”变成“实时一帧视频”。

📌 四条路径都成立,但它们同时被三个瓶颈卡着——而且这三个瓶颈,没有一个是 AI 自己的问题。
04
三个瓶颈:AI 的短板,其实都不在 AI 身上

第一,数据质量瓶颈——垃圾进,垃圾出。模型的判断力上限,由训练数据的质量决定。用低质量数据训练 AI,等于用泥巴建高楼。而现实是:386.7 万家排污单位中,开展自行监测的仅 37 万家,这 37 万家的数据质量还参差不齐。第 18 篇拆过的造假产业链、第 19 篇算过的 2% 参数联网覆盖率——这些问题在 AI 时代会有一个新后果:脏数据不只是让报表不好看,它会让模型学坏。一个用篡改数据训练出来的预警模型,只会把“造假的方式”学成“正常的规律”。

386.7 万家

排污单位总数

37 万家

开展自行监测

2%

设备参数联网覆盖率

第二,数据连通瓶颈——有脑子,没眼睛。AI 需要多源数据融合——水质、气象、排污、遥感、用电。但部门分割之下,这些数据分属不同部门、不同层级、不同系统。李景虹说的“飞轮失灵”就是这个意思:数据不流动,模型就转不起来。第 10 篇分析过的三重壁垒(不愿共享、不敢共享、不会共享),在 AI 场景里被放大了——因为 AI 对数据的需求是“全量、连续、多源”的,传统统计分析可以拿样本凑合,AI 不行,缺一环,整条判断链就断。

第三,数据制度瓶颈——能算,不能用。AI 产出的预测、预警、溯源结果,能否作为管理决策和执法依据?法律地位仍不明确。更深一层是可解释性:算法识别结果“既无法保证完全准确,也缺乏充分的可解释性”,一旦误判,责任如何界定?方案把“安全”列为底线,提出建立 AI 应用伦理规范、防范算法偏见、明确责任界定——方向是对的,但具体的制度接口还在路上。

05
一个容易被忽略的陷阱:AI 也会“水土不服”

方案在现实挑战分析里有一条很少被提及,却直接决定“底数清”这件事的性质:AI 模型泛化性不足——在 A 地区训练的模型,到 B 地区会因环境差异而准确率大幅下降。

▲ 模型是通用件,数据是定制件:换了地方,同一套算法未必认得当地的河

这一条的分量很重。它意味着:一个全国通用的模型,解决不了地方的具体问题。每个地方都需要用自己的数据,去训练适配自己的模型。模型可以买、可以复制,但数据只能自己攒——数据是有地理属性的资产。

所以“底数清”不是一次全国性的普查动作就能完成的,它是地方性的、持续性的基础设施。地方底数不清,AI 在地方就跑不准。这不是算法的问题,是没有燃料。

模型可以买,数据只能自己攒只采购引擎、不建设油箱,是这一轮数智化最典型的浪费

—— 买了大模型却用不起来的那些地方,缺的从来不是算法 ——

06
一笔成本账:AI 不是买来就能用

技术瓶颈之外,还有一道更现实的门槛:钱。

一套区域 AI 监测系统的投入超过千万元;传感器、无人机、智能设备的年维护成本可达数十万元;而环保领域 AI 投资的回报周期是 5 至 8 年。对中小城市和中小企业来说,这三项加起来就是一道过不去的坎。

超千万元

一套区域 AI 监测系统

数十万元

智能设备年维护成本

5—8 年

环保 AI 投资回报周期

结果是两个后果。一是“重试点、轻推广”——示范项目做得漂亮,却复制不到第二个地方,这不是技术问题,是成本结构问题。二是更隐蔽的浪费:买了引擎,却没人给它加油。平台建起来了,模型部署了,但本地数据没有治理、没有标注、没有持续更新,模型跑几个月就“不准了”,最后沦为演示工具。

破解的方向也很清楚——集约化。方案把“应用场景体系”列为核心支撑之一,路径是“试点示范—总结推广—全面普及”;行业里更具体的建议是“省级统一底座、省建市用、市县适度扩展”:全省复用省级智能底座,避免市县重复建设、模型孤岛与分散投资;省级侧重底座运维、公共智能体与知识库,市县聚焦一线应用与本地场景适配。

这个分层设计的价值,恰恰在于它把“数据底座”和“应用”分开了——底座要集约,应用要贴近。而底座之所以必须省级统筹,正是因为它就是那个“油箱”:一个市县修不起、也不该单独修的油箱。第 13 篇讲过的投资低效,在这里有了一个具体的解法。
07
范式视角:引擎与燃料

把这一篇放回系列主线。第五篇章回答的是“为什么好技术建不起来、怎么才能建起来”:第 23 篇讲路径依赖,第 24 篇讲网络建在哪里、建多密。这一篇要回答最后一个问题——AI 能不能补上“网外”那部分底数?

答案是:能补一部分,但前提是先有燃料。完整的价值链是这样一条链——

▲ 数据即燃料:折线、点位、影像与业务记录汇聚成流,注入的才是引擎

底数清 → 数据真 → 数据通 → AI 赋能 → 动态底数

每一环都是前一环的兑现条件——底数不清,数据无源;数据不真,模型学坏;数据不通,智能空转;不做 AI 赋能,底数就只能停在“十年一更新”;而动态底数,又反过来为下一轮模型训练提供更好的燃料。这是一个闭环,也是一个因果链:它从“底数清”开始,最终又回到“底数更清”。

智能化是引擎,数据底座是燃料没有燃料,引擎就是摆设

—— 加满油箱靠的不是再买一个更大的引擎 ——

在 AI 飞速发展的黄金时代,以最低成本、动态、持续获得“真准全”数据的技术条件已经具备。缺的不是技术,是制度设计和数据底座——这正是第五篇章和第六篇章要接着谈的。

08
对行业的启示

① 数据治理是比模型开发更靠前的生意。高质量数据集建设已有明确标准依据(如 HJ 966-2018《生态环境信息基本数据集编制规范》),要按“时空完整、标准统一、多源融合”的原则做汇聚整合、标准化处理、分层质控。这一层的市场,比模型层更刚需、更持久。

② 本地化数据能力是最深的护城河。模型泛化性不足这一条,决定了“本地数据+本地模型”的组合不可替代。谁能帮一个地方把数据资产沉淀下来并持续运营,谁就锁定了这个市场的长期位置。

③ 警惕“重模型、轻数据”的新一轮重复建设。买大模型、上大屏、建展厅,但数据仍是碎片——验收标准应该是“模型在本地跑得准不准”,不是“平台有多少功能”。

④ 产品逻辑是“接入”不是“替换”。第 23 篇说“协议网关是第一道门”,在 AI 场景里依然成立——能不能把不同品牌、不同年代、不同协议的数据低成本接进来并保证质量,决定了上层智能能不能落地。

⑤ 数据的合规与安全是准入门槛。方案明确“统筹发展和安全”,生态环境数据涉及公共安全,“数据不出域”是硬约束——这既是限制,也是机会:能提供合规、可控、可审计数据服务的厂商,会拿到优先级。

AI 已经学会了预报天气、识别鸟叫、锁定造假、追溯危废。这些能力真实、可用、已经在值班。但所有这些能力,都站在同一块地基上。引擎的轰鸣声已经听得见,油箱却还没加满。而加满油箱这件事,靠的不是再买一个更大的引擎——是回到最基础的那件事上:把每一个点位、每一台设备、每一家企业的数据,做真、做完、做通。这听起来一点都不性感,但所有的智能,最终都要从这里长出来。

抢回 3 个优良天,是引擎的力量;但引擎能跑多远,取决于油箱里有多少燃料。把数据做真、做完、做通,才是所有智能的地基。

📚 下一篇预告|《数据沉睡与制度等待:技术等制度,数据未成资产》——底数清了,不等于底数“活”了。

你们那儿上的大模型,跑了几个月之后还准吗?评论区聊聊——是模型的问题,还是燃料的问题。

— 点个“赞”,让数据底座这件事被看见 —

相关学习资料