问题不是让大模型永不犯错,而是不让未经验证的生成结果进入控制回路
创业观察· 工 业 智 能 体 系 列
在许多消费级 AI 应用中,一次错误回答通常意味着重新提问、人工核对,或者放弃这次生成。它消耗的是时间,影响的主要是信息质量。
工业场景完全不同。
当 AI 连接设备、生产系统和控制接口后,它输出的可能不再是一段文字,而是调整设定值、改变设备状态、启动执行机构,甚至触发一组连续操作。此时,一个听起来十分确定的错误,可能直接变成设备停机、产品报废、环境风险或者人身事故。
工业 AI 真正的工程目标,不是消灭模型层面的所有幻觉,而是 把幻觉隔离在不会产生物理后果的边界之外 。 |
一、从信息错误到物理后果
大模型生成的是概率意义上最合适的回答。表达流畅,不代表事实正确;语气自信,也不代表操作安全。
在工业系统中,“幻觉”不只表现为编造知识,还可能表现为:
✗ 引用了不存在的设备位号 |
✗ 混淆压力、温度、流量等参数单位 |
✗ 忽略设备当前所处的运行状态 |
✗ 遗漏操作前置条件 |
✗ 把正确步骤放在错误顺序中 |
✗ 调用了当前用户没有权限执行的工具 |
✗ 给出了格式正确、语义却危险的控制指令 |
这些错误往往无法通过语言流畅度发现。
格式正确≠ 可以执行。 即使大模型输出了完全符合 JSON 格式的命令,也只能证明字段结构正确,不能证明设备当前允许执行这条命令。 |
工业控制具有强状态依赖。同一个操作,在正常生产、检修、清洗或异常处置状态下,风险可能完全不同。很多操作还具有顺序要求和不可逆后果,不能像修改一段文案那样简单撤回。
因此,评估工业 AI 不能只看平均准确率,还要看系统如何处理低频但高后果的错误。
二、不要把降低幻觉当成安全保证
企业经常采用知识库检索、模型微调、私有化部署和低温度参数来提高稳定性。这些措施有价值,但没有一项能够单独构成工业安全机制:
常见措施 | 它解决的问题 | 它解决不了的问题 |
知识库检索 | 补充领域知识、提供出处 | 可能召回过期的操作规程 |
模型微调 | 提升领域表达的贴合度 | 不能保证推理结果符合现场工况 |
私有化部署 | 数据边界与部署合规 | 不会自动提高推理正确性 |
结构化输出 | 限制输出的格式与字段 | 只能限制格式,不能限制语义 |
低温度参数 | 降低输出随机性 | 不能证明答案符合现场工艺条件 |
要求“再检查一遍” | 表面上的自我复核 | 模型可能在第二次检查中重复第一次的错误 |
工程上更可靠的思路,是 承认模型可能犯错 ,然后建立 独立于模型的约束和验证机制 。真正不可容忍的,不是模型产生了一个错误候选,而是 系统没有识别这个错误,仍然把它送进了执行层 。 |
三、工业智能体需要混合架构
工业智能体不应该让大模型直接控制设备。合理的系统链路应当是:
工业智能体混合架构:四层防线 现场数据 ↓ [LLM] 模型理解与生成候选 ← 概率性,可能出错 ↓ [第一层] 约束生成 ← 白名单 + 受控注册表 ↓ [第二层] 确定性校验 ← 规则引擎 / 状态机 ↓ [第三层] 独立安全联锁 ← 与 AI 推理链路隔离 ↓ 人工确认 / 仿真 / 数字孪生 / 影子模式 ↓ [第四层] 执行验证与审计 ← PLC / DCS 执行 + 留痕 任何一个条件不满足→ 拒绝执行 / 降级运行 / 进入预先定义的安全状态 |
第一层:约束生成
大模型不能自由创造控制指令,只能从系统允许的动作集合中选择。设备、参数、单位和动作类型应来自受控注册表。输出必须满足明确的数据类型、取值范围和必填字段要求。没有被列入白名单的工具和指令,大模型不能调用。
约束生成可以缩小错误空间,但仍不能证明指令安全。
第二层:确定性规则
模型生成的只是候选动作,真正的执行条件由规则引擎、状态机或控制程序判断:
确定性校验清单 · 当前设备是否处于允许操作的状态 · 操作者和智能体是否具备相应权限 · 参数是否超过工艺边界 · 调整速度是否超过允许变化率 · 前置步骤是否已经完成 · 操作顺序是否符合规程 · 指令是否与其他设备状态或安全联锁冲突 |
这些规则必须可测试、可版本化、可审计,不能继续依赖大模型用自然语言自行判断。
第三层:独立安全联锁
安全联锁、安全仪表系统以及关键的 PLC/DCS 控制逻辑,应保持确定性,并与大模型的推理链路隔离。
大模型可以解释报警、生成处置建议,甚至在授权范围内提交操作申请,但不能绕过或修改安全联锁。高风险控制的最后防线,必须独立于 AI 是否判断正确。
第四层:执行验证与审计
工业智能体需要记录它看到了什么数据、调用了哪份规程、为什么生成该动作、经过了哪些规则、由谁批准,以及设备最终返回了什么状态。对于风险较高的动作,还应先经过仿真、数字孪生或影子模式验证。
物理系统没有真正的“回滚”。 系统设计不能只考虑执行成功,还必须提前定义超时、通信中断、状态不一致和执行失败时的安全处置方式。 |
四、一个格式正确但不能执行的指令
假设一个工业智能体根据报警信息,建议提高某台泵的运行频率。
这条指令可能满足所有格式要求,参数也没有超过设备铭牌范围。但如果——
✗ 下游阀门尚未打开 |
✗ 设备正处于清洗状态 |
✗ 当前管路压力已经接近工艺上限 |
这条看似合理的指令就可能带来风险。
大模型不应拥有最终决定权。 确定性规则必须根据实时状态检查操作模式、管路条件、压力边界、权限和联锁状态。任何条件无法确认,都应拒绝执行,而不是让模型“凭经验”补全缺失信息。 这就是生成式智能与工业控制之间必须存在的边界。 |
五、Data+AI:先有可信的数据,再有可控的 AI
四层防线解决的是“不让错误进入执行层”,但防线的原材料是数据。很多工业 AI 项目失败,不是模型不行,而是喂给模型的数据本身不可信:点位找不到设备、单位不统一、时序有跳变、经验散落在老师傅的脑子里。
Data+AI 的工程含义,是把数据当作 AI 的基础设施来建设,而不是当作报表的附属品。工业数据通常分四层:
数据层 | 典型内容 | 对 AI 的作用 |
实时时序 | IoT 点位、状态量、报警流 | 理解“现在发生了什么” |
静态资产 | 台账、BIM、拓扑、铭牌参数 | 理解“对象是谁、在哪、什么关系” |
过程经验 | 工单、SOP、故障案例、检修记录 | 理解“以前怎么处理的” |
业务结果 | 能耗、产量、成本、KPI | 定义“什么算好、什么算坏” |
数据治理的四项基本功
1. 点位—设备—系统的语义映射 建立 asset_id 主标识,统一关联 IoT 点位、BIM 构件、工单与文档。前文“引用了不存在的设备位号”这类幻觉,一半根源在语义层缺失,而不是模型能力不足。 |
2. 单位与量纲的强制统一 压力 kPa/MPa、温度 ℃/℉、流量 m³/h/L/s——在数据入湖时完成归一,而不是指望模型“自己换算”。 |
3. 数据质量标签 每条时序数据带上时间戳、采集频率、缺失标记、跳变标记、传感器校验状态。AI 必须知道“这个数能不能信”,坏数据宁可标记为不可用,也不要静默填充。 |
4. 经验的结构化沉淀 把工单处置结果、故障原因、检修效果整理成结构化案例库。这是领域数据大模型和诊断能力的养料,也是企业真正的数据资产。 |
Data+AI 是双向的。 一方面用治理好的数据喂养 AI(Data for AI),另一方面用 AI 反哺数据治理(AI for Data):用异常检测清洗时序、用模型辅助点位映射、用实体识别抽取历史工单中的关键信息。数据飞轮转起来,幻觉的地基才会越来越牢。 |
六、混合模型策略:小模型 + 大模型 + 领域数据大模型
“接一个大模型”是演示逻辑,“配一套模型组合”才是产品逻辑。工业场景的任务差异极大——毫秒级异常检测和一段诊断报告,不该由同一个模型承担。合理的策略是三层模型栈:
第 S 阶段 · 小模型 / 传统算法 异常检测、阈值判断、趋势预测、参数软测量。毫秒级响应,可边缘部署,行为确定可审计。 |
第 D 阶段 · 领域数据大模型 在海量工业时序与设备数据上预训练的领域基础模型,擅长模式识别、健康评估、负荷预测,用数据规模换领域精度。 |
第 L 阶段 · 通用大模型 意图理解、多源信息综合、诊断解释、报告生成、人机交互。负责“读得懂人话、说得清道理”。 |
任务怎么路由到模型
任务类型 | 由谁承担 | 原因 |
实时异常检测 | 小模型 | 要求毫秒级、确定性、可离线运行 |
设备健康评估 / 剩余寿命 | 领域数据大模型 | 依赖长周期时序模式,通用 LLM 不擅长 |
报警归并与诊断解释 | 大模型 + 检索 | 需要综合规程、案例与实时状态并生成可读结论 |
控制参数计算 | 机理模型 / 优化算法 | 物理守恒不容概率采样 |
工单起草 / 报告生成 | 大模型 | 语言组织是其强项,且有人工复核兜底 |
混合策略如何反哺幻觉防线
模型组合不只是分工,更是交叉验证:当大模型给出“冷机能效下降,建议提高频率”的候选动作时,系统可以同时用小模型校验时序趋势是否支持这一判断、用领域数据大模型评估该设备同类工况下的历史模式。多源结论一致,才放行到确定性规则层;结论冲突,则标记为需要人工审查。
混合模型协同链路 [大模型] 生成候选动作 + 理由链 ↓ [小模型] 时序趋势校验 ← 毫秒级,边缘侧 [领域数据大模型] 同类工况模式比对 ← 领域基础模型 ↓ 结论一致→ 进入确定性规则层(四层防线) 结论冲突→ 降级为“建议 + 人工审查”,不进入执行 |
模型组合不改变边界原则。 无论多少个模型投票一致,设备控制的最终裁定权仍在确定性规则与安全联锁。混合策略降低幻觉进入候选的概率,四层防线保证幻觉进不了执行层——两者是叠加关系,不是替代关系。 |
七、工业 AI 应该从副驾驶开始
工业智能体的落地,不应从完全自动控制起步:
第一阶段· 只读模式 AI 负责报警解释、知识检索、检修记录整理和操作建议,不具备写入设备的权限。 |
第二阶段· 影子模式 AI 生成建议但不实际执行,与工程师决策和现场结果比对,持续积累失败样本。 |
第三阶段· 受约束执行 从低风险、可中止、边界清晰的动作开始;高风险操作保留人工审批和独立联锁。 |
这条路径看起来不如“AI 自主控制工厂”有冲击力,却更接近工业产品真正的交付逻辑。
八、工业智能体的壁垒不只是模型
对于工业 AI 创业公司,接入一个大模型并调用设备 API,只能完成演示。真正困难的工作,是建立现场状态模型,把工艺经验转化为机器可检查的规则,统一设备语义,积累异常测试集,并让每一次建议和执行都可以追溯。
这些工作不够炫目,却决定了产品能否进入真实生产环境。工业智能体的竞争力,最终不会只体现在模型参数和回答能力上,还会体现在三个方面:
1. 能否准确理解现场状态 设备语义统一、实时工况建模、状态依赖关系的正确处理 |
2. 能否把生成结果限制在安全边界内 约束生成、确定性校验、独立联锁构成的多层防线 |
3. 能否在无法证明安全时可靠地拒绝执行 宁可漏答,不可错答——拒绝本身就是一种工程能力 |
并非所有工业 AI 应用都具有同等风险:
应用类型 | 风险等级 | 安全策略 |
生成检修报告、查询设备资料 | 低 | 保留人工复核 |
生产优化建议 | 中 | 需要更严格的证据 |
设备控制、安全联锁 | 高 | 必须由确定性机制兜底 |
给创业者的优先级原则: 规划工业 AI 产品时,功能优先级不应按照“自动化程度有多高”排序,而应按照 “错误的代价有多大”排序 。先让 AI 看懂,再让 AI 建议;先经过影子运行,再开放受控执行。任何时候,安全联锁都不能依赖大模型保持清醒。 |
结语
工业智能体真正成熟的标志,不是它敢于执行多少操作,而是系统能够明确证明它不能做什么,并在无法证明安全时拒绝行动。
不是让大模型永不犯错, 而是不让未经验证的生成结果, 进入控制回路。 —— 创业观察 · 工业智能体系列 |
— END —
夜雨聆风