上篇我们聊了这个工具能干什么、怎么用——把一册图纸的 PDF 丢进去,它替你把目录和每一页图纸核一遍,哪里对不上红字标出来。那篇没往下拆的一件事是:从你点完"上传"到它吐出那份对比表,中间到底跑了什么?
一、它跑完一本图纸,分几步

① 上传文件。 把整本图纸的 PDF 丢进去。软件先把它按页渲染成高清图片,顺便判断哪一页是目录、哪一页是图纸。这一步只是"把纸变成电脑能看的图像",还没开始认字。


② 自动认出"哪里是目录、哪里是图名、哪里是图号"。 这一步大概最容易被忽略,却最要命。软件不用你手动去框,自己就能在目录页找到目录表格的位置,在每张图纸的右下角找到图名框、图号框的位置。靠两层办法配合:一层找"图号""图纸名称""序号"这些文字标签当锚点;另一层靠的是个更聪明的思路,把目录里已经认出的图号当"探针",去每一页的候选区域里找命中、跨页聚类,同一位置在不同页出现不同图号值的,就是真正的图号格。两层互相印证,所以大多数版式不用动手,少数特别怪的再拖框微调。
回头看,我在这工具上最费劲的其实不是识别,而是让程序自己搞懂"该看哪儿"。这一步在行内叫区域检测(说白了就是自动找出图上该看哪一块),干的是"先决定看哪儿",发生在认字之前——这步找歪了,后面识别再准也白搭。它恰恰不是文字识别。

③ 把图变成字。 到这,才轮到文字识别(也就 OCR,光学字符识别,简单说就是把图片里的文字的模型)。软件把上一步定位好的区域,渲染成高清图,交给云端的中文识别模型,把图上的文字检测、识别出来。这里得先拆两个误会:
一是 OCR 干的是"看图识字",它不关心这一格是图号还是图名,只负责把字读出来、标上坐标,"这是图号"这个判断是后面才做的。
二是目前的文字识别,只对定位好的"局部区域"生效,不是把整张图纸"全页解析"。这点得说清楚:工程图纸本身线条密布、信息海量,让文字识别去啃整页,既不经济也不准。这个工具现在的做法,是先把范围收窄到目录表格、图签的图名/图号框这些确定性强的局部,再把字读出来。至于"把一整张图里的每一个构件、标注、符号都认出来"这种全图纸要素识别,那是另一个量级的问题——后续要靠 YOLO(一种目标检测模型,能在图里框出"这是什么、在哪",常用于识别图中的构件和符号)这类模型才能扛,不是现在的文字识别能解决的。所以现阶段,先把"目录对不对、图签对不对"这种任务做扎实。
④ 把碎片拼成能用的结构。 识别模型吐出来的不是整齐表格,而是一堆"在某坐标、写着某段文字"的碎片。软件接着做解析的活:在目录区,把碎片聚成行、聚成列,再按"字长什么样"判断哪列是图号、哪列是图名、哪列是张数(不迷信表头写什么,看字本身长相);在图签区,把读出来的字归到"图名""图号"两个字段。这一步叫结构化解析,和上一步是两码事:识别给原料,解析才是"做成菜"。
⑤ 拿目录当权威去比对。 前面攒齐了"目录里该有什么"和"图纸上实际有什么"两份数据,这一步才开始校核。工具不假定图纸一定对,而是以目录为准:目录说有这张、叫这个名、该有 4 张,就照这个数去核。图号不对、图名不对、张数少了、或者一张图该标"(2/4)"却印成了"(3/4)",逐项列出来。多出来的无名页、或者目录压根没列但实际存在的,也单独报,不糊弄成"识别出错"。比如对广东省的标准图进行检测




⑥ 出报告。 屏幕上一张对比表:哪条通过、哪条图号不符、哪条张数少了,一目了然;结果还能导出 Excel 和 JSON,方便留档或接着处理。
把六步串成一句话:上传 → 自动定位区域 → 文字识别 → 结构化解析 → 校核比对 → 出报告。文字识别只在第三步出现——它是重要的一环,但只是流水线的一段,而且现在只用在局部。
二、AI 在工作里到底怎么落地
把视角从"这个工具"拉到"AI 怎么进工作",刚才那条流水线其实是个挺典型的样本。
第一点,落地的关键往往不是某个多炫的模型,而是把一项具体工作的规则和判断,固化成能自动跑的流程。这个工具用到的技术不少——区域检测决定看哪儿、文字识别把图变成字、结构化解析把碎片拼整齐、规则逻辑判断对不对——但没有哪一样是"黑科技",真正难的、也最有价值的是最后那句:把"图纸目录该怎么对"这件事,定义清楚、写进代码。
这恰恰是目前 AI 落地工作里最容易被忽略的一环。我之前写过一篇讲 FDE(前沿部署工程师)的文章,里面有个观点:企业 AI 缺的不是模型,而是愿意下现场、把具体业务的门道替系统定义清楚的人。无论是文字识别还是目标检测,接进真实工作流时,真正值钱的是"这一行到底什么叫对、什么叫错"那套业务规则。工具箱里能用的能力会越来越多——今天用文字识别啃局部,明天用目标检测去认整张图的构件——但"怎么判断、怎么兜底、拿不准交给谁"这套,永远得人先想明白、写下来。
第二点是另一层:AI 进工作,大多是"补一段原来只能人盯着的活",不是"替掉一个人"。这个工具把"重复、枯燥、又容易出错的核对"接住了,但"目录和图纸真不一致时怎么处理""个别识别拿不准时拍板",还是人的事。它把人从海量重复里解放出来,去做真正需要判断的那部分。
说到底,OCR、YOLO 这些,都只是工具箱里的一件件工具。真正让工作"智能化"的,是把业务里那些含糊的、靠老师傅经验的判断,一点点变成系统能跑、能核对、能积累的规则。能接住这一步的,就已经跨过了"演示—生产"那道最难的沟。
三、写在最后
上篇那个工具,内核就是上面这一条流水线:自动定位当向导,识别当眼睛,规则当脑子,人只在拿不准时拍板那一下。往后我打算把它打磨得更易用一些,让不懂技术的人也能随手用。但无论形态怎么变,思路不会变——让电脑替人把那些重复、枯燥、又容易出错的活儿干了,人留下来做真正需要判断的那部分。
这个工具基本上已经完善了,预计下周会在小程序上线,还是在规范检测的小程序中进行合并,规范在下方:
夜雨聆风