ARTICLE · 1054525
AI for AI:工业小模型场景的落地思路,以安全行为识别、Sop识别为例
今天和某大厂的AI咨询Leader喝茶,聊到工业AI项目的现状,他说了一句让我印象很深的话:"现在很多AI项目,本质上是一种新形式的卖人头。表面上是AI公司,实际上是低毛利的外包公司。地位还不如做传统数字化套装软件"
这句话说得很直,但并不夸张。如果你在工业AI圈子里待过,你一定见过这样的项目:一个工厂的视觉质检项目,合同金额可能200W以上,似乎看起来不小,但实际执行下来,光是数据收集与标注就需要3-5个人干3个月,模型调优还要再搭进去2个算法工程师,还要介绍非标机构的设计、组装与调试的无底洞,再加上持续的售后成本。项目利润被人力成本吃掉大半。更难受的是,这个项目的经验几乎无法复用——隔壁工厂换了一条产线,之前积累的数据和模型权重大部分都要推倒重来。这就是工业小模型赛道当前最核心的困境:场景碎片化、数据稀缺、可复制性极差。
AI小模型项目易扯皮,签约时候是客户与伙伴,交付之后是敌人;小模型的AI准确率的"薛定谔的猫"
如果你是工业AI的乙方,你一定经历过这种谈判场景:甲方要求在合同里写清楚——模型准确率不低于95%,漏检率不超过0.5%。你心里清楚,在没有拿到真实数据、没有跑过基线实验之前,这个数字是拍出来的。但如果不写,项目可能签不下来。于是双方陷入一种奇怪的博弈——乙方拍胸脯,甲方心里也知道这是拍的,但就是要你写进合同。
这就是工业小模型的"薛定谔准确率"问题:在合同签订之前,准确率既可能达标,也可能不达标,没有人真正知道答案,但甲方的采购流程要求在签约前就锁定交付边界。
这两个困境叠加在一起,导致工业AI小模型赛道出现了两种典型的做法:一种是什么都做,最终沦为卖人头;一种是只做极少数垂直场景,技术壁垒高但市场天花板明显,规模做到一定程度就遭遇增长瓶颈。后者如果恰逢赛道较大,还能面前上市,而前者往往最后累了自己,苦了团队,恼了客户。
场景分析
先找对地方,再谈效率
在讨论如何破局之前,有一个前提必须想清楚——并不是所有工业AI场景都值得用同样的方式去攻。
我们用两个维度来给工业AI场景分类:可靠性要求(出错的代价有多大)和业务复杂性(背后的机理和数据处理有多复杂)。这两个维度构成一个四象限矩阵,不同象限的场景有着截然不同的落地逻辑。
高可靠 + 高复杂的场景,典型如非常复杂的表面缺陷质检如钢板质检、又如化工反应过程控制,涉及复杂物理机理和高维非结构化数据融合,技术门槛极高,落地周期长,不是短期可以规模化复制的方向。
高可靠 + 低复杂的场景,典型如安全行为识别、SOP合规检测,普通的AI质检(如防错防漏)业务规则相对明确,替代人工岗位的ROI可以直接量化,是当前工业AI落地优先级最高的区域。
低可靠 + 低复杂的场景,如飞书、钉钉等办公协同类AI,属于个人效率提升,ROI难以直接衡量,是"锦上添花"而非"雪中送炭",往往不一是工业企业核心预算的投向。
明确了象限,接下来的核心问题是:在这些场景里,有没有哪些场景适合用"AI for AI"的自动化方式来解决?
什么样的场景,才真正适合 AI for AI?
这是本文最想回答的一个问题。AI for AI不是万能药,它能走通的场景是有边界的,需要从三个维度来判断:数据获取难度、标注难度、机理或业务复杂度、业务价值清晰度等。
场景1:视频行为识别与 SOP 合规检测
视频行为识别(安全帽检测、危险区域入侵、操作姿态识别)和SOP合规检测,我认为是当前适合AI for AI路径的场景之一。
原因首先在于数据获取极其便利、业务逻辑通俗易懂。摄像头安装成本低、不涉及设备改造、不需要对接生产设备的控制系统,客户侧的阻力非常小。历史监控录像几乎每个工厂都有存量,这意味着冷启动数据不是问题。其次,标注逻辑天然适合大模型理解。"工人头顶有没有安全帽"、"操作员是否按顺序完成了三个步骤",这类判断可以用自然语言精确描述,大模型视觉理解模块(VLM)可以直接对视频帧生成高质量的伪标签,人工复核的比例可以控制在很低水平。
但这条赛道也有一个明显的短板——业务价值不够直接。安全合规、操作规范,这类场景更多属于"避免损失"而非"创造收益",在企业内部立项时,业务部门的推动力不如质量提升或产能增加类场景强。因此,这个方向的核心竞争逻辑不是"能做到什么",而是"能做得多便宜"。笔者两年前的经验是,很多工厂的项目都不超过50W,而即使是这样对于AI来讲也许是白菜价的价格,推广起来仍然还会面临成本的压力。当硬件+软件的年均成本低到一定程度,ROI的计算就会自动转正,决策阻力消失。AI for AI平台最大的价值,是把这条赛道的交付成本打下来,让项目可以用更低的价格签约、用更少的人力交付、用更快的速度复制到下一个工厂。
场景2:离散行业的质量根因分析与非化学变化的工艺优化
离散制造(汽车零部件、电子装配、机械加工)中的质量根因分析、或者工艺优化(容如热处理、波峰焊等),以及不涉及复杂化学反应的工艺参数优化,是AI for AI的第二梯队场景。
这类场景的业务价值远高于视觉行为识别——一个工艺参数优化模型,直接影响良品率和单位产品成本,ROI非常清晰,甲方愿意付更高的预算。但代价是数据获取难度提升了一个台阶:需要从设备上接入传感器数据,可能涉及轻量级的设备改造,需要打通MES、SCADA等系统的数据接口。
尽管如此,AI for AI在这里仍然有发挥空间,核心是用大模型辅助工艺知识的结构化表达。工艺工程师懂得"这个参数组合为什么会导致那个缺陷",但这些知识往往散落在经验里、技术文档里、历史工单里。大模型可以帮助工艺工程师把这些隐性知识转化成结构化的训练标签——"在这个温度区间+这个进给速度下,出现裂纹的概率上升"——从而大幅降低小模型的标注成本。这条路需要比视觉行为识别更多的前期投入,但天花板更高,是AI for AI平台向深水区延伸的自然方向。
不适合场景1:AI 视觉质检(特别是复杂场景而非防错防漏)
很多人直觉上觉得AI视觉质检是AI for AI的天然场景,但实际上这里有一个很容易被忽视的陷阱。
表观缺陷(划痕、污点、色差)的标注看起来简单,但实际上质检标注的难度远高于行为识别标注。原因在于:质检的判断标准本身往往不是绝对的,同一个划痕,在A客户的标准里是废品,在B客户的标准里是可接受的;同一个色差,在批次早期和批次末期的判定策略不一样。这种"标准本身是模糊的"特性,让大模型的自动标注质量大打折扣——大模型可以识别"有划痕",但很难判断"这个划痕在当前客户标准下是否构成缺陷"。
更重要的是,AI视觉质检往往涉及专用工业相机和打光系统的改造,这不是一个简单的摄像头安装问题。设备改造拉长了项目周期,提高了实施门槛,AI for AI在数据获取和部署环节的优势被硬件壁垒大幅抵消。因此,AI视觉质检更适合由深度垂直的专业公司来做,而不是作为AI for AI平台的通用场景来推。
不适合其他场景:如复杂的,带十几个甚至几十个化学反应式的工艺优化场景,或者设计跨部分跨知识领域的复杂业务场景。
AI for AI 平台思路
明确了场景边界,我们来谈破局的具体路径。
工业小模型的核心矛盾是:每个场景都需要专业能力,但专业能力无法规模化复制。以往解决这个矛盾的方式是堆人力——招更多懂业务的AI工程师,但这条路的边际成本不降反升。
真正的破局点在于:把"训练一个工业小模型"这件事本身,变成另一个AI问题来解决。 这就是"AI for AI"的核心逻辑——用大模型Agent驱动小模型的训练流水线,让大模型承担原本需要AI专家手工完成的工作:需求理解、数据标注、增强策略选择、模型配置、准确率诊断。用一句话概括:大模型Agent是生产小模型的工厂,业务工程师是这个工厂的操作员。
环节一:需求定义——把自然语言变成可执行的训练规格
传统方式下,需求定义是一个漫长的拉锯过程。甲方说"我要识别危险行为",乙方问"什么叫危险行为",甲方说"就是不安全的行为"……这种对话可以来回拉扯好几轮,最终落到纸面上的需求文档也往往不够精确。
AI for AI平台的做法是:业务工程师用自然语言输入检测目标,例如"识别工人在焊接区域是否佩戴了防护面罩和焊接手套,同时判断是否有未经授权的人员进入该区域"。大模型Agent接收这段描述后,自动输出一份结构化的需求规格文档,包含检测目标列表、正负样本定义、边界条件说明,以及准确率预估所需的最低样本量建议。
这份文档交由甲方确认,双方基于同一份结构化文档来定义交付边界——这直接解决了"薛定谔准确率"中"需求模糊导致边界不清"的根本问题。SOP识别场景同理,工程师上传SOP文档,大模型自动解析出"动作-步骤"结构,既是标注的基准,也是后续合规判断的逻辑依据。
环节二:数据准备——让大模型做数据飞轮的上游
客户上传历史监控视频后,平台自动完成三件事。
第一,大模型视觉理解模块(VLM)对历史视频帧进行分析,根据已定义的需求规格自动生成伪标签,高置信度样本直接进入训练集,低置信度样本进入人工复核队列——业务工程师只需要处理模型"不确定"的帧,而不是从头标注所有数据,标注效率提升3-5倍是保守估计。
第二,大模型Agent分析当前数据集的分布缺口(如夜间光照样本太少、特定角度样本不足),主动触发两类补充动作:从互联网搜索类似场景的公开图片视频,以及基于已有样本自动执行增强策略(角度变换、光照模拟、遮挡模拟)。增强策略的选择不是人工配置的,而是由大模型根据场景特征和数据分布缺口自动推荐——这消除了一个隐性门槛,很多业务工程师不知道自己的数据集缺什么,更不知道该用哪种增强手段来补。
第三,数据进入训练集前,大模型Agent自动运行标签一致性检查、数据分布检查、异常样本检测,确保训练数据质量。
环节三:大模型+RAG/本体辅助的轻量化路径
这里需要单独说一个重要的设计分支,它针对的是可靠性要求相对不高的场景。
并非所有工业AI场景都需要训练一个专用小模型。对于一些业务规则相对固定、可靠性要求不苛刻的场景——比如设备操作规程的合规查询、生产异常的初步分类、工艺参数的区间判断——完全可以用一种更轻量的方式来实现:大模型 + RAG(检索增强生成)+ 业务本体(Ontology)的组合,跳过模型训练环节,直接实现业务逻辑的AI化。
具体来说,把工厂的SOP文档、设备手册、历史工单、质量标准等知识资产导入知识库,构建面向工业领域的业务本体(定义"设备-工序-参数-缺陷"之间的关系图谱),然后用大模型作为推理引擎,通过RAG检索相关知识来回答业务问题。这种方式的优点是部署快、维护成本极低、不需要标注数据;缺点是推理的准确性受限于知识库的质量和本体的覆盖范围,复杂推理场景下容易出现幻觉。
因此,AI for AI平台在设计上应该提供两条路径的选择:对于高可靠性要求的场景(安全合规、质检判定),走大模型驱动小模型训练的路径;对于可靠性要求适中的场景(知识查询、辅助决策、初步诊断),走大模型+RAG+本体的路径,快速交付、低成本运营。这两条路径不是互斥的,在同一个项目里可以并存——前者负责核心判断,后者负责知识支撑。
环节四:模型训练——让平台做专家,让工程师做决策
平台根据场景类型自动推荐基础模型架构:安全行为识别推荐轻量化目标检测加姿态估计分支,SOP动作合规推荐时序动作识别模型,区域闯入推荐实时目标检测加区域规则引擎。
业务工程师只需要确认几个关键决策:部署硬件型号(决定模型大小上限)、推理延迟要求(决定精度-速度权衡)、漏检和误检哪个代价更大(决定分类阈值策略)。训练过程自动执行,实时输出可解释的训练日志,包括典型错误案例展示和失败原因分析。模型也可以同时选择10几种基础模型或者训练方式,自行对比不同的训练结果,无需人工干预调整训练参数。
这里有一个认知必须澄清:平台能降低AI工程侧的门槛,但不能消除业务侧的专业要求。 以SOP识别为例,训练一个工艺操作合规模型的工程师,必须理解操作步骤背后的工艺逻辑——旋转阀门为什么要顺时针、为什么不能少于270度,这些知识不在模型里,不在平台里,它在那个懂这条产线的工艺工程师脑子里。AI for AI平台的作用是让这个懂工艺的工程师不再需要同时懂深度学习,消除的是AI工程的门槛,不是业务知识的门槛。
环节五:准确率评测
这是整个平台设计中商业价值最被低估的环节。
在正式合同签订之前,平台提供一项"准确率快速预估"服务:甲方上传100-500张真实样本,平台在48-72小时内输出一份《准确率预估报告》,包含当前样本下的基线准确率、置信区间分析、典型失败案例图集、数据补充建议清单,以及哪些边界条件建议在合同中明确排除在KPI考核范围外。
有了这份报告,合同谈判的逻辑就变了:乙方不再拍胸脯,而是说"根据你提供的样本,当前基线是89%,在补充了建议的300张夜间样本后,我们承诺在验收测试中达到93%以上"。这是一个有数据支撑的承诺,双方的信息不对称被消除,项目风险被提前暴露和管理。
环节六:部署与持续迭代——让数据飞轮转起来
模型部署到边缘盒子后,生产现场产生的新数据通过数据回流机制自动进入标注队列,由大模型Agent完成增量标注,定期触发模型微调,形成持续运转的数据飞轮。
这个机制解决了工业AI项目的一个常见痛点:模型上线后随着时间推移性能衰减,但没有人有资源持续维护。数据飞轮把这个维护成本从"需要算法工程师的手工劳动"变成了"平台自动驱动的持续迭代",项目从一次性交付变成了持续服务。
人员行为识别与SOP识别 ROI 论证
安全行为识别的 ROI 框架
一个中型工厂,焊接车间、危化品存储区、高压设备区分别配备1名安全巡视员,合计3人,每人年均人力成本(含五险一金)约15万元,合计45万元/年。AI视觉系统上线后实现24小时全覆盖,3个巡视员可缩减到1人,节省人力成本约30万元/年。系统建设成本方面,边缘计算硬件(6个点位)约15万元(一次性),软件平台年费约10万元/年,按三年摊销年均约15万元。仅人力替代一项,年净收益约15万元,三年回收硬件投资。更大的收益通常来自间接侧:安全事故率下降带来的工伤保险费率降低、重大安全事故的罚款和停产风险规避(单次事故成本往往百万级),这些通常是推动内部立项的真正动力。
SOP 识别的 ROI 框架
某装配产线,每月因操作不规范(漏装、错序)导致的返工率约2.5%,月产量10000件,返工件数250件,每件返工人工成本约80元,年返工成本约24万元。AI SOP合规检测上线后,假设将操作不规范发生率降低60%(保守假设),年节省返工成本约14.4万元。叠加新员工培训周期缩短(每年10名新员工,培训周期从3个月缩短到2个月,节省约10万元)、合规审计成本几乎归零(原来人工调录像核查约5-8万元/年),综合年收益约30万元,年软件成本约8-12万元,净收益约20万元/年,硬件投资(约10万元)一年内即可回收。
落地建议
第一,优先选择有历史事故记录的场景。这听起来反直觉,但逻辑清晰:历史事故记录意味着有真实的负样本积累,这类数据量少但标注质量极高,模型在这类数据上学到的特征更鲁棒。
第二,不要在合同阶段承诺固定准确率,改为承诺"预估报告+迭代路径"的组合。让数据说话,而不是让经验拍板。愿意接受"先跑预估、再谈KPI"流程的甲方,通常是真正想把项目做成的甲方。
第三,第一个项目的目标不是盈利,是验证数据飞轮。把第一个工厂项目当成产品验证,重点是把数据回流机制跑通、把大模型Agent的标注质量验证清楚。数据飞轮转起来之后,第二个、第三个工厂的边际成本才会出现断崖式下降。
写在最后
工业AI的竞争,表面上是模型精度的竞争,本质上是数据闭环速度的竞争。用了更大的模型,只能赢在起跑线。但如果你的平台能让业务工程师参与训练,能让每个项目自动积累数据、自动迭代模型,你建立的是一个随时间加速的飞轮,而不是一个固定的技术壁垒。
AI for AI平台的本质,是把AI专家的工程经验沉淀成平台能力,把场景复制的边际成本从线性变成递减。第十个场景的训练成本,应该远低于第一个场景,因为大模型Agent在前九个场景里已经积累了足够的"如何标注工业数据"的经验。
对于中国制造业而言,工业小模型的价值不亚于通用大模型。通用大模型改变了知识工作者的生产效率,而工业小模型改变的是产线的可控程度、制造企业的安全和质量底线。它不够炫,没有GPT的知名度,但它嵌入的是真实的生产流程,省下来的是真实可计算的成本。