夜雨聆风学习资料网

ARTICLE · 1081744

为什么你的 AI 助手,没人用第二次

为什么你的 AI 助手,没人用第二次

“

模型是租来的,底座才是你自己的。

我见过不少这样的项目:演示那天,老板和车间主任都坐在一起看,AI 对答如流,大家点头鼓掌;上线两周后,后台的提问量掉到个位数。

你不能说技术不行——演示的时候挺行的。问题出在没人给它打地基。

最近看到的一份企业 AI 智能体平台方案,把地基讲得挺细:知识引擎、本体引擎、工作流配置、智能体评测、运营看板。这些名字听着都挺技术,但它们解决的其实是四个很朴素的问题——它查得到吗?它听得懂吗?它守规矩吗?它靠谱吗?

📌 本文看点

01

知识引擎与本体引擎

02

六条排程约束

03

评测与运营看板

01

WHY IT DIES

上线那天很惊艳,两周后没人点

一个 AI 助手死掉,通常不是因为模型不行,而是死在这三个地方:

1

答不上来。问它你们厂的设备型号,它答了一堆网上抄的通用知识。它不知道你厂里的事。

2

答错了没人知道。它偶尔编一个数值,现场照做,出了事才发现。没有评测,就没有可信度。

3

建议不能落地。它给了一个看起来合理的方案,但现场根本没这个设备、没这个料、排不进这个班。它不懂约束。

「惊艳靠模型,好用靠底座。」

下面这四层底座,就是那份方案里真正值得抄的部分。

02

LAYER ONE

底座一:知识引擎,让它查得到

知识引擎干的事,是把厂里的文档变成机器能查的资产。方案里分了三种库,这个分类很讲究:

文本知识库

作业指导书、管理制度、维修记录这类纯文字的,占大头。

多模态知识库

图片、图纸、视频也能一起存、一起搜。方案里明确支持以文搜图、以图搜图、图文混合搜图——这对设备图纸、外观检验、线边照片太重要了。

记忆知识库

把对话中沉淀下来的偏好和上下文存住,让它记得你昨天问过什么、常用哪条线。

真正决定效果的其实是最枯燥的一步:文档解析与分片。同样的 PDF,切成什么粒度、表格要不要转成 HTML、要不要按问答拆分,直接决定了 AI 答得准不准。

这一步没有捷径,就是脏活累活。但我想说的是:知识治理的质量,就是 AI 助手的智力上限。模型再强,也救不了一堆切碎了的烂资料。

03

LAYER TWO

底座二:本体引擎,让它听得懂人话

「本体」这个词,估计很多人第一次听会皱眉。我用一句工厂的话解释:它就是给机器看的一本字典。

当车间主任问「A 线这个月为什么老是停」,机器得先知道:A 线是哪个工作中心、停是指哪张表里的什么字段、老是停是跟哪个基准比。这些词如果没人翻译,AI 就只能靠猜。

方案里建的对象清单,全是车间的主角

原材料、生产设备、产品物料清单、产品、生产工作中心、生产人员、客户生产订单、标准工序,以及「工人分配至工作中心关联表」这种看着不起眼、但排程时天天要用的小表。

注意,本体不是让你把数据搬一次家,而是用 ETL 把业务系统的数据映射成一套统一的语义。ERP 里叫物料编码,MES 里叫料号,本体层统一叫「物料」——AI 才不会被两套说法绕晕。

💡 有了本体,AI 才能从「会查文档」升级到「会查事实」。这两件事的差距,就是玩具和工具的距离。

04

LAYER THREE

底座三:把车间的规矩教给它

这一部分是我看到那份方案时最惊喜的地方——它的本体层里,居然把排程约束一条条写成了规则。这不是通用 AI 厂商会做的事,这是真懂制造业的人才会做的事。

六条硬约束,句句是现场

约束名称
规则含义
设备产能约束
同一设备同一时间只能执行一个生产任务
工人可操作约束
同一工人同一时间只能操作一个任务,且每天不超过 8 小时、每周不超过 40 小时、连续不超过 5 天
工作中心产能限制
每个工作中心每天总产量不能超过其产能上限
工序先后约束
前道工序未完成,后道工序不能开工
订单交付约束
所有生产任务的计划结束时间必须早于或等于订单交付日期
物料可用性约束
任务开始前,所需物料的现有库存必须大于等于需求量

做过排程的人一眼就能看出:这六条就是APS 里最硬的那几个约束条件。以前它们压在算法里,现在它们被写成了 AI 的常识。

「没有约束的 AI 给的是理论上可行,有约束的 AI 给的才是明天能排。」

这也是我觉得很多 AI 项目最该补的一课:别指望模型自己学会你们厂的规矩。规矩是你喂给它的,而且是越早喂越好。

配套的还有工作流配置:拖拽式的流程编排,把大模型、知识库、SQL、API 调用、联网搜索像积木一样拼在一起。比如问数场景,里面的链路是自然语言转 SQL、再交给大模型解读、最后用重排模型输出。这种活儿靠对话可做不稳,得靠编排。

05

LAYER FOUR

底座四:评测与运营,让它活得过三周

最后一层,也是被忽略得最彻底的一层。

先说评测

方案里的做法很实在:上传一套标准问答数据集,设一个裁判模型,让它把 AI 的回答逐条比对打分,自动算出准确率。案例里那次跑下来,671 道题平均评分 0.96,还能点开看每一道题的相似度等级和明细。

这件事为什么重要?因为智能体改一次提示词、换一次模型,效果是会变的。没有评测,你根本不知道这次改动是变好还是变坏,只能靠感觉。

671

标准测试题数

0.96

平均评分

再说运营

运营看板上有四组数字:输入 Token、输出 Token、总消耗、提问次数,还有智能体提问次数排名和 Token 消耗排名。

这些数字看着很技术,其实回答的是管理问题:哪个助手真的有人用,哪个人是在白花钱。我甚至觉得,这一页该拿给老板看——它比任何汇报都诚实。

💡 AI 不是一次交付的工程,是一个要长期养的岗位。没有评测和运营,它就是个没人管的实习生。

∞

THE END

底座的活最脏,也最值钱

这四层底座,做起来都不性感:整理文档、建对象、写规则、跑测试,没有一项能拿去做演示。但它们决定了那个演示能不能活过三周。

如果说前几篇聊的是「AI 能干什么」,那这一篇聊的是凭什么它能干成。答案不在模型参数里,在你厂里的那堆文档、那几张表、那几条规矩里。

所以,如果你想开始动手,我的建议是反常识的:别先选模型,先选数据。挑一个你手边资料最全、规矩最清楚的场景——通常是设备或质量——把知识理干净,把规则写清楚,剩下的交给工具。

模型决定它能说多好,底座决定它能不能干活。

END

我是小七,一个在车间和代码之间来回跑的技术搭档。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

相关学习资料