ARTICLE · 1149377
工业三维AI实战(一):工业三维遇上AI,不只是生成个模型那么简单
一个在工程圈流传很广的演示:输入一句"生成一个汽车轮毂",AI 在三十秒内给出了一个三维模型,光影漂亮、造型现代,评论区一片"建模师要失业了"。
但把同一个模型丢给工艺工程师,五分钟就得出结论:没法用。壁厚不均匀,没有拔模角,安装孔位是画上去的贴图而不是真实几何,中心孔没有键槽,模型是三十万片三角面片堆出来的"网格疙瘩",想改一个圆角半径,无从下手。
这个反差,正是本系列要解决的核心问题:消费级三维 AI 追求"看起来像",工业级三维 AI 必须"用起来真"。前者是视觉问题,后者是几何、语义、可制造性和可追溯性的综合工程问题。两者之间的距离,远比一句"AI 生成三维模型"给人的印象要大。
本系列共六篇,从数据表示、数据获取、生成重建、理解检索、工程落地到能力边界,系统讲透工业三维 AI 的技术底座与落地方法。第一篇先把地基打好——不搞懂三维数据是怎么表示、怎么交换、怎么定义质量的,后面所有的 AI 技术都是空中楼阁。
一、工业三维数据的表示方法:AI 处理的是什么"形状"
三维模型不是"一个文件",而是数学结构的工程化封装。AI 算法吃进去的表示方式,直接决定了它能学到什么、输出什么。这一层搞错,后面全部白搭。
第一层:四种基础表示
1. 边界表示(B-Rep)工业 CAD 的正统表示。一个实体由顶点(Vertex)、边(Edge)、环(Loop)、面(Face)、壳(Shell)、体(Solid)逐层构成,其中曲面用 NURBS(非均匀有理 B 样条,ISO 832 系列定义的数学基础)或解析曲面(平面、圆柱、圆锥、球面)描述,而拓扑关系明确记录"哪条边属于哪个面""哪个面围成哪个体"。
B-Rep 的工程价值在于三件事:精确(曲面是数学定义,不是逼近)、可编辑(改一个特征参数,全模型联动更新)、可制造(面、边、法向都带语义,CAM 能直接读)。工业 CAD 内核(Parasolid、ACIS、Open CASCADE)本质都是 B-Rep 内核。
代价是数据结构复杂、对 AI 不友好——图神经网络可以学,但直接喂给点云或体素网络不行。
2. 网格表示(Mesh)三角面片的集合。优点是简单、通用、GPU 友好,缺点在工业场景被放大:精度靠面片数量堆,一个圆柱面想要光滑,可能需要上万片三角面;拓扑通常是"非流形"的(一条边被超过两个面共享、有悬挂面、有自交);更致命的是没有特征语义——网格上没有"这是一个 Ø10H7 的孔"这种信息,只有一个光滑曲面的采样。
消费级 AI 生成的三维模型,绝大多数输出网格,这就是"能看不能用"的第一根源。
3. 点云(Point Cloud)无序三维点的集合,通常带法向量、强度、颜色等附加属性。它是三维扫描设备的原生输出,也是 AI 理解方向的主流输入格式。点云天生无拓扑,所以点云深度学习必须自己解决"点与点的关系"问题(后面第 4 篇细讲)。
工业点云的交换标准是 ASTM E57(三维成像数据交换格式),工程上还有 PLY、PCD、LAS 等格式。
4. 隐式表示(Implicit Representation)用一个连续函数定义形状:SDF(有符号距离函数,物体内部为负、外部为正、表面为零)、占用网络(Occupancy Network,输出每个空间点是否在体内)、神经辐射场(NeRF,用神经网络编码颜色与密度场)。
隐式表示是当代 AI 三维生成的"母体",因为神经网络天然擅长拟合连续函数。DeepSDF(2019)证明了用一个 MLP 可以编码整个形状库,DreamFusion(2022)正是在隐式场之上做优化才实现了文本生成三维。
第二层:两类新兴表示
NeRF(神经辐射场):2020 年提出,用 MLP 记录空间中每个点的密度与颜色,通过体渲染出任意视角图像。它擅长"拍出来的照片级重建",但输出是连续场,提取网格慢、精度受光度误差影响,工业上多用于场景可视化而非零件建模。 3D Gaussian Splatting(3DGS):2023 年的突破,用数百万个各向异性高斯椭球显式地表示场景,渲染速度比 NeRF 快两个数量级,且支持实时编辑。它正在快速渗透到工业场景数字化(车间、设备、现场勘测),本系列第 2 篇会详细讨论它的工程适用性。表示方法选型对比
| 表示 | 精度 | 拓扑质量 | 可编辑性 | AI 友好度 | 工业主场景 |
|---|---|---|---|---|---|
| B-Rep | 精确(数学定义) | 完整语义拓扑 | 强(参数化驱动) | 弱(结构复杂) | 设计、制造、归档 |
| 网格 | 近似(面片逼近) | 常为非流形 | 弱(改一处动全身) | 强 | 可视化、仿真前处理 |
| 点云 | 采样密度决定 | 无拓扑 | 不可直接编辑 | 强 | 扫描、检测、逆向 |
| SDF/占用 | 连续可插值 | 提取后规整 | 中 | 很强 | AI 生成中间表示 |
| NeRF/3DGS | 光度级 | 无显式拓扑 | 中(3DGS 较好) | 中 | 场景重建、现场记录 |
二、工业三维格式底座:数据怎么流动
格式不是"另存为"的小事,它决定了数据里带不带语义、能不能追溯、下游认不认。
STEP(ISO 10303):工业三维数据的宪法
STEP 是产品数据交换的国际标准族,其中与三维最相关的是三个应用协议:
- AP203(ISO 10303-203):配置受控的三维机械零件与装配设计,偏重设计归档与配置管理,早期汽车、航空的归档格式。
- AP214(ISO 10303-214):汽车机械设计过程核心数据,颜色、图层、公差表达更丰富,长期是汽车行业主流。
- AP242(ISO 10303-242):基于模型的三维受管工程,是当前最重要的演进版本,融合了 AP203 与 AP214 的能力,并引入 PMI(产品制造信息)的三维标注表达——把尺寸公差、形位公差、表面粗糙度、技术要求直接附着在三维几何上,这是"三维无纸化"的数据基础。
STEP 的最大价值是语义完整:一个 AP242 文件里不仅有几何形状,还有零件号、材料、公差、版本、审批状态。这正是 AI 理解与追溯最需要的东西。缺点是文件大、解析慢、写入实现质量参差不齐(很多软件只写了几何、丢了 PMI)。
JT(ISO 14306):轻量化之王
JT 采用"显示体素 + 精确 B-Rep"混合结构:渲染时用高度压缩的三角面片(显示数据,甚至支持多级 LOD),需要精确几何时再调用内嵌的 B-Rep 数据。这种设计让数 GB 的装配体可以在普通工作站上流畅浏览。
JT 是"下游可视化"的事实标准:整车、整机级别的装配浏览、DMU 数字样机评审、供应商协同,基本都是 JT 的主场。与 STEP 互补而非替代——STEP 负责"交换与归档",JT 负责"看"。
通用格式的工业短板
- STL:只有三角面片,无单位、无颜色、无公差、无装配结构,3D 打印可以,工程交换不够用。
- OBJ/FBX:面向视觉与动画,缺乏工程语义。
- glTF/GLB(Khronos):被称为"三维界的 JPEG",Web 端渲染性能极好,工业上常用于三维可视化发布;其扩展规范(如 EXT_mesh_features、EXT_structural_metadata)正在补齐"面/体素带语义 ID"的能力,可以与 AP242 的结构化数据挂接,值得重点关注。
- 3D PDF(ISO 32000)与内嵌 PRC 表示:面向非工程人员的交付场景,供应商交付、检验报告、用户手册用得多。
格式选型决策
| 场景 | 首选 | 理由 |
|---|---|---|
| 设计交换、长期归档 | STEP AP242 | 语义完整、可追溯、国际标准 |
| 大装配浏览、供应商协同 | JT | 轻量、LOD、渲染快 |
| Web 端展示、三维发布 | glTF/GLB | 加载快、生态好、可挂语义扩展 |
| 3D 打印 | STL/3MF | 3MF 比 STL 多单位与颜色信息 |
| 交付非工程人员 | 3D PDF | 零安装、可批注 |
| AI 训练输入 | 点云(E57/PLY)或网格采样 | 现有深度学习框架直接支持 |
三、工业级三维 AI 与消费级的五大差异
这是本篇的核心,也是整个系列的评价坐标系。后面每一篇讲技术,都会回到这五个维度来判断"能不能用"。
差异一:精度要求——μm 级与视觉级的鸿沟
消费级三维生成的评价是"看起来像不像",工业级的评价是"测量准不准"。航空发动机叶片型面公差常在 0.05mm 量级,精密配合面要求 μm 级;而 AI 生成模型的几何误差通常在毫米级,且没有度量基准——生成的"直径 10 的孔"可能实际是 10.3,因为扩散模型并不理解"毫米"。
差异二:拓扑质量——能不能继续改
工业模型的价值一半在"可修改"。设计变更时,工程师要把 Ø10 的孔改成 Ø12、把 R2 圆角改成 R3,这要求模型带参数化特征历史或至少是干净的 B-Rep。AI 输出的三角面片网格做不到——它没有"孔"这个特征,只有一堆面片。
当前 AI 生成的拓扑修复(重拓扑、四边化)可以做到"整齐",但做不到"有特征历史",这是学术界与工业界的共同难题。
差异三:可制造性约束——设计能不能造出来
AI 生成的形状不理解车间:注塑件没有拔模角会脱不了模,壁厚不均会缩水,深腔窄槽刀具伸不进去,悬空结构没有支撑没法加工。工业 CAD 里这些靠 DFM(面向制造的设计)规则检查,而生成式模型目前基本不带约束,生成后需要专门的可制造性 AI 校验(本系列第 3 篇讨论)。
差异四:数据语义——几何之外的信息
一个可用的工业三维模型 = 几何 + PMI(尺寸公差、形位公差,依据 ISO 1101、ISO 5459、ASME Y14.5)+ 材料 + 版本 + BOM 归属 + 变更状态。AI 生成的模型在语义维度上是空白,需要与结构化数据挂接才有工程价值。
差异五:可追溯性与合规——谁生成的、能不能信
工业产品出质量问题要追溯到设计源头。AI 生成物面临三重追问:训练数据是否合规(涉密模型是否被喂进公有云模型)、生成过程是否可复现(同输入不同输出怎么办)、责任如何界定(AI 生成的曲面出问题谁负责)。这决定了工业 AI 必须是"辅助生成 + 人工确认"的工作流,而不是"一键出图"。
| 维度 | 消费级三维 AI | 工业级三维 AI | 当前差距 |
|---|---|---|---|
| 精度 | 视觉相似即可 | μm~0.05mm 级 | 大(1~3 个数量级) |
| 拓扑 | 网格即可 | 参数化 B-Rep | 大 |
| 可制造性 | 不考虑 | DFM 全约束 | 大 |
| 语义 | 无 | PMI+材料+版本+BOM | 大 |
| 可追溯 | 不要求 | 全链路审计 | 中(可用流程补) |
四、工业三维 AI 技术全景图
抛开炒作,工业三维 AI 实际落地的技术分四个方向:
1. 生成(Generation):文本/图像生成三维。当前在概念设计、外观造型、快速原型可用,在工程零件上不可用。成熟度:★★★(消费级)/ ★★(工业级)。 2. 重建(Reconstruction):点云→三维、多视图照片→三维、点云→参数化 CAD。其中点云到 CAD 的智能逆向是工业界真正的刚需,也是价值最高的方向。成熟度:★★★。 3. 理解(Understanding):模型检索、分割、特征识别、几何质量检测。AI 驱动的扫描件比对检测是目前落地最扎实、ROI 最清晰的场景。成熟度:★★★★。 4. 编辑(Editing):重拓扑、智能减面、UV 展开、网格修复、变形生成。属于"改造工具",成熟度 ★★★★,落地阻力最小。一个务实的判断:2026 年的今天,工业三维 AI 的价值排序是 检测 > 检索 > 逆向 > 编辑 > 生成。先做确定性高的,再做想象力大的,这是本系列反复强调的落地次序。
五、系列导读
- 第 2 篇 三维数据获取与处理:扫描、点云预处理、配准、摄影测量与 3DGS、数据质量规范——AI 的输入决定一切。
- 第 3 篇 AI 生成与重建:生成式三维的技术脉络、工业适配难题、点云到参数化 CAD 的逆向重建、网格智能处理。
- 第 4 篇 AI 理解与检索:三维深度学习架构、模型智能检索、分割与特征识别、AI 几何质量检测。
- 第 5 篇 工程落地:数据集构建、模型微调、AI 管线架构、与 PLM/CAD 系统集成、轻量化部署与 ROI。
- 第 6 篇 边界与展望:诚实评估能力天花板、人机分工、技术趋势与行动建议。
六、附:三维数据"可被 AI 消费"六项自检
在立项做三维 AI 之前,先用这六个问题给自己的数据体检,任何一项不合格,都意味着要先补数据工程:
- 单位与坐标系清楚吗?模型单位是毫米还是英寸?坐标系原点与方向是否规范?(常见事故:单位混用导致整体缩放 25.4 倍)
- 几何有效吗?B-Rep 是否通过内核有效性检查?网格是否流形、有无自交与破面?
- 精度声明有吗?扫描数据声明了配准残差吗?逆向模型声明了与实物的偏差吗?没有精度声明的三维数据,AI 无法判断可信度。
- 语义带了吗?有没有零件号、材料、版本、PMI?纯几何体只能做形状类任务,做不了工程类任务。
- 格式对吗?交换用 STEP、浏览用 JT/glTF、训练用点云/网格采样,格式选错会丢语义(第 2 节的选型表)。
- 元数据全吗?谁生成的、什么时候、用什么设备/模型版本、经过谁确认——追溯链不全的数据不能进生产流程。
一个实用的经验法则:把三维数据当成"带质量等级的工程记录"来管理,而不是当成"图形文件"来管理。文件思维产出的是散落的 STL,记录思维产出的是可被 AI 消费、可被流程追溯的数据资产。
七、本系列的学习路径建议
- 企业决策者:精读第 1 篇(判断坐标系)与第 6 篇(判断边界),第 5 篇(判断投入);其余可略读。
- 工艺/质量工程师:重点第 2 篇(数据可信)与第 4 篇(检测落地),这是你们的主场。
- 设计/建模工程师:重点第 3 篇(逆向与工具链),理解 AI 能替你干什么脏活。
- 数字化/IT 负责人:重点第 5 篇(管线与集成),这是你们的责任田。
- 算法工程师:全部通读,尤其注意第 1 篇的五大差异与第 6 篇的五个边界——工业三维 AI 的算法创新,必须长在工程约束之上。
小结
工业三维 AI 的第一性原理只有一句话:AI 不缺想象力,缺的是工程事实。三维数据的表示方式决定了 AI 能学到什么,格式标准决定了学到的东西能不能流动,五大差异决定了落地时该往哪里投钱。
下一篇,我们从源头讲起——物理世界里的零件,是怎么一步步变成 AI 能用的三维数据的。