乐于分享
好东西不私藏

创业观|工业场景里,AI 的“幻觉”为什么不可容忍

创业观|工业场景里,AI 的“幻觉”为什么不可容忍

问题不是让大模型永不犯错,而是不让未经验证的生成结果进入控制回路

· 工 业 智 能 体 系 列

在许多消费级 AI 应用中,一次错误回答通常意味着重新提问、人工核对,或者放弃这次生成。它消耗的是时间,影响的主要是信息质量。

工业场景完全不同。

 AI 连接设备、生产系统和控制接口后,它输出的可能不再是一段文字,而是调整设定值、改变设备状态、启动执行机构,甚至触发一组连续操作。此时,一个听起来十分确定的错误,可能直接变成设备停机、产品报废、环境风险或者人身事故。

工业 AI 真正的工程目标,不是消灭模型层面的所有幻觉,而是

把幻觉隔离在不会产生物理后果的边界之外

一、从信息错误到物理后果

大模型生成的是概率意义上最合适的回答。表达流畅,不代表事实正确;语气自信,也不代表操作安全。

在工业系统中,“幻觉”不只表现为编造知识,还可能表现为:

✗ 引用了不存在的设备位号

✗ 混淆压力、温度、流量等参数单位

✗ 忽略设备当前所处的运行状态

✗ 遗漏操作前置条件

✗ 把正确步骤放在错误顺序中

✗ 调用了当前用户没有权限执行的工具

✗ 给出了格式正确、语义却危险的控制指令

这些错误往往无法通过语言流畅度发现。

格式正确≠ 可以执行。

即使大模型输出了完全符合 JSON 格式的命令,也只能证明字段结构正确,不能证明设备当前允许执行这条命令。

工业控制具有强状态依赖。同一个操作,在正常生产、检修、清洗或异常处置状态下,风险可能完全不同。很多操作还具有顺序要求和不可逆后果,不能像修改一段文案那样简单撤回。

因此,评估工业 AI 不能只看平均准确率,还要看系统如何处理低频但高后果的错误

二、不要把降低幻觉当成安全保证

企业经常采用知识库检索、模型微调、私有化部署和低温度参数来提高稳定性。这些措施有价值,但没有一项能够单独构成工业安全机制:

常见措施

它解决的问题

它解决不了的问题

知识库检索

补充领域知识、提供出处

可能召回过期的操作规程

模型微调

提升领域表达的贴合度

不能保证推理结果符合现场工况

私有化部署

数据边界与部署合规

不会自动提高推理正确性

结构化输出

限制输出的格式与字段

只能限制格式,不能限制语义

低温度参数

降低输出随机性

不能证明答案符合现场工艺条件

要求“再检查一遍”

表面上的自我复核

模型可能在第二次检查中重复第一次的错误

工程上更可靠的思路,是

承认模型可能犯错

,然后建立

独立于模型的约束和验证机制

。真正不可容忍的,不是模型产生了一个错误候选,而是

系统没有识别这个错误,仍然把它送进了执行层

三、工业智能体需要混合架构

工业智能体不应该让大模型直接控制设备。合理的系统链路应当是:

工业智能体混合架构:四层防线

现场数据

[LLM] 模型理解与生成候选 ← 概率性,可能出错

[第一层] 约束生成 ← 白名单 + 受控注册表

[第二层] 确定性校验 ← 规则引擎 / 状态机

[第三层] 独立安全联锁 ← 与 AI 推理链路隔离

人工确认 / 仿真 / 数字孪生 / 影子模式

[第四层] 执行验证与审计 ← PLC / DCS 执行 + 留痕

任何一个条件不满足

拒绝执行 / 降级运行 / 进入预先定义的安全状态

第一层:约束生成

大模型不能自由创造控制指令,只能从系统允许的动作集合中选择。设备、参数、单位和动作类型应来自受控注册表。输出必须满足明确的数据类型、取值范围和必填字段要求。没有被列入白名单的工具和指令,大模型不能调用。

约束生成可以缩小错误空间,但仍不能证明指令安全。

第二层:确定性规则

模型生成的只是候选动作,真正的执行条件由规则引擎、状态机或控制程序判断:

确定性校验清单

· 当前设备是否处于允许操作的状态

· 操作者和智能体是否具备相应权限

· 参数是否超过工艺边界

· 调整速度是否超过允许变化率

· 前置步骤是否已经完成

· 操作顺序是否符合规程

· 指令是否与其他设备状态或安全联锁冲突

这些规则必须可测试、可版本化、可审计,不能继续依赖大模型用自然语言自行判断。

第三层:独立安全联锁

安全联锁、安全仪表系统以及关键的 PLC/DCS 控制逻辑,应保持确定性,并与大模型的推理链路隔离

大模型可以解释报警、生成处置建议,甚至在授权范围内提交操作申请,但不能绕过或修改安全联锁。高风险控制的最后防线,必须独立于 AI 是否判断正确。

第四层:执行验证与审计

工业智能体需要记录它看到了什么数据、调用了哪份规程、为什么生成该动作、经过了哪些规则、由谁批准,以及设备最终返回了什么状态。对于风险较高的动作,还应先经过仿真、数字孪生或影子模式验证。

物理系统没有真正的“回滚”。

系统设计不能只考虑执行成功,还必须提前定义超时、通信中断、状态不一致和执行失败时的安全处置方式。

四、一个格式正确但不能执行的指令

假设一个工业智能体根据报警信息,建议提高某台泵的运行频率

这条指令可能满足所有格式要求,参数也没有超过设备铭牌范围。但如果——

✗ 下游阀门尚未打开

✗ 设备正处于清洗状态

✗ 当前管路压力已经接近工艺上限

这条看似合理的指令就可能带来风险。

大模型不应拥有最终决定权。

确定性规则必须根据实时状态检查操作模式、管路条件、压力边界、权限和联锁状态。任何条件无法确认,都应拒绝执行,而不是让模型“凭经验”补全缺失信息。

这就是生成式智能与工业控制之间必须存在的边界。

五、Data+AI:先有可信的数据,再有可控的 AI

四层防线解决的是“不让错误进入执行层”,但防线的原材料是数据。很多工业 AI 项目失败,不是模型不行,而是喂给模型的数据本身不可信:点位找不到设备、单位不统一、时序有跳变、经验散落在老师傅的脑子里

Data+AI 的工程含义,是把数据当作 AI 的基础设施来建设,而不是当作报表的附属品。工业数据通常分四层:

数据层

典型内容

 AI 的作用

实时时序

IoT 点位、状态量、报警流

理解“现在发生了什么”

静态资产

台账、BIM、拓扑、铭牌参数

理解“对象是谁、在哪、什么关系”

过程经验

工单、SOP、故障案例、检修记录

理解“以前怎么处理的”

业务结果

能耗、产量、成本、KPI

定义“什么算好、什么算坏”

数据治理的四项基本功

1. 点位—设备—系统的语义映射

建立 asset_id 主标识,统一关联 IoT 点位、BIM 构件、工单与文档。前文“引用了不存在的设备位号”这类幻觉,一半根源在语义层缺失,而不是模型能力不足。

2. 单位与量纲的强制统一

压力 kPa/MPa、温度 ℃/℉、流量 m³/h/L/s——在数据入湖时完成归一,而不是指望模型“自己换算”。

3. 数据质量标签

每条时序数据带上时间戳、采集频率、缺失标记、跳变标记、传感器校验状态。AI 必须知道“这个数能不能信”,坏数据宁可标记为不可用,也不要静默填充。

4. 经验的结构化沉淀

把工单处置结果、故障原因、检修效果整理成结构化案例库。这是领域数据大模型和诊断能力的养料,也是企业真正的数据资产。

Data+AI 是双向的。

一方面用治理好的数据喂养 AI(Data for AI),另一方面用 AI 反哺数据治理(AI for Data):用异常检测清洗时序、用模型辅助点位映射、用实体识别抽取历史工单中的关键信息。数据飞轮转起来,幻觉的地基才会越来越牢。

六、混合模型策略:小模型 + 大模型 + 领域数据大模型

“接一个大模型”是演示逻辑,“配一套模型组合”才是产品逻辑。工业场景的任务差异极大——毫秒级异常检测和一段诊断报告,不该由同一个模型承担。合理的策略是三层模型栈:

 S 阶段 · 小模型 / 传统算法

异常检测、阈值判断、趋势预测、参数软测量。毫秒级响应,可边缘部署,行为确定可审计。

 D 阶段 · 领域数据大模型

在海量工业时序与设备数据上预训练的领域基础模型,擅长模式识别、健康评估、负荷预测,用数据规模换领域精度。

 L 阶段 · 通用大模型

意图理解、多源信息综合、诊断解释、报告生成、人机交互。负责“读得懂人话、说得清道理”。

任务怎么路由到模型

任务类型

由谁承担

原因

实时异常检测

小模型

要求毫秒级、确定性、可离线运行

设备健康评估 / 剩余寿命

领域数据大模型

依赖长周期时序模式,通用 LLM 不擅长

报警归并与诊断解释

大模型 + 检索

需要综合规程、案例与实时状态并生成可读结论

控制参数计算

机理模型 / 优化算法

物理守恒不容概率采样

工单起草 / 报告生成

大模型

语言组织是其强项,且有人工复核兜底

混合策略如何反哺幻觉防线

模型组合不只是分工,更是交叉验证:当大模型给出“冷机能效下降,建议提高频率”的候选动作时,系统可以同时用小模型校验时序趋势是否支持这一判断、用领域数据大模型评估该设备同类工况下的历史模式。多源结论一致,才放行到确定性规则层;结论冲突,则标记为需要人工审查。

混合模型协同链路

[大模型] 生成候选动作 + 理由链

[小模型] 时序趋势校验 ← 毫秒级,边缘侧

[领域数据大模型] 同类工况模式比对 ← 领域基础模型

结论一致→ 进入确定性规则层(四层防线)

结论冲突→ 降级为“建议 + 人工审查”,不进入执行

模型组合不改变边界原则。

无论多少个模型投票一致,设备控制的最终裁定权仍在确定性规则与安全联锁。混合策略降低幻觉进入候选的概率,四层防线保证幻觉进不了执行层——两者是叠加关系,不是替代关系。

七、工业 AI 应该从副驾驶开始

工业智能体的落地,不应从完全自动控制起步:

阶段· 只读模式

AI 负责报警解释、知识检索、检修记录整理和操作建议,不具备写入设备的权限。

阶段· 影子模式

AI 生成建议但不实际执行,与工程师决策和现场结果比对,持续积累失败样本。

阶段· 受约束执行

从低风险、可中止、边界清晰的动作开始;高风险操作保留人工审批和独立联锁。

这条路径看起来不如“AI 自主控制工厂”有冲击力,却更接近工业产品真正的交付逻辑。

八、工业智能体的壁垒不只是模型

对于工业 AI 创业公司,接入一个大模型并调用设备 API,只能完成演示。真正困难的工作,是建立现场状态模型,把工艺经验转化为机器可检查的规则,统一设备语义,积累异常测试集,并让每一次建议和执行都可以追溯。

这些工作不够炫目,却决定了产品能否进入真实生产环境。工业智能体的竞争力,最终不会只体现在模型参数和回答能力上,还会体现在三个方面:

1. 能否准确理解现场状态

设备语义统一、实时工况建模、状态依赖关系的正确处理

2. 能否把生成结果限制在安全边界内

约束生成、确定性校验、独立联锁构成的多层防线

3. 能否在无法证明安全时可靠地拒绝执行

宁可漏答,不可错答——拒绝本身就是一种工程能力

并非所有工业 AI 应用都具有同等风险:

应用类型

风险等级

安全策略

生成检修报告、查询设备资料

保留人工复核

生产优化建议

需要更严格的证据

设备控制、安全联锁

必须由确定性机制兜底

给创业者的优先级原则:

规划工业 AI 产品时,功能优先级不应按照“自动化程度有多高”排序,而应按照

“错误的代价有多大”排序

。先让 AI 看懂,再让 AI 建议;先经过影子运行,再开放受控执行。任何时候,安全联锁都不能依赖大模型保持清醒。

结语

工业智能体真正成熟的标志,不是它敢于执行多少操作,而是系统能够明确证明它不能做什么,并在无法证明安全时拒绝行动。

不是让大模型永不犯错,

而是不让未经验证的生成结果,

进入控制回路。

—— 创业观察 · 工业智能体系列

— END —