乐于分享
好东西不私藏

AI 3D建模基准测试,已经跑偏到离谱了!这篇文章讲透了

AI 3D建模基准测试,已经跑偏到离谱了!这篇文章讲透了

2025到2026年,AI CAD赛道突然热闹起来。

BenchCAD、CADBench、neuralCAD-Edit、Parametric CAD Bench……一堆基准测试如雨后春笋般冒出来。它们测视觉理解、测空间推理、测代码生成、测几何内核执行、测智能体与软件的交互能力,甚至开始测装配和物理约束。

这很好。但远远不够。最近看到国外一博主的深度分析,值得参考:

https://burhop.substack.com/p/what-ai-cad-benchmarks-must-learn

3D建模师

这些测试大多在做同一件事——逆向工程。给一张图、一份二维图纸、一个扫描点云,让AI重建出三维模型。然后拿"画得像不像"来打分:倒角距离、体素交并比、表面F分数、渲染相似度……

BenchCAD的报告说得很直白:系统经常能复刻出大致外形,却漏掉参数,或者用简单操作替代扫掠(Sweep)和放样(Loft)。CADBench发现,复杂度一上去,重建质量就断崖式下跌,而且不同指标下的排名还会变。Autodesk的编辑研究更扎心:自动几何指标和视觉语言模型(VLM)评分,与CAD专家的实际评价相关性很弱。

这些发现本身很有价值。但问题是——当逆向工程成为AI-CAD的唯一标尺,整个行业就会朝着"越来越会临摹"的方向狂奔,而忘了工程设计的本质是什么。

逆向工程偏见:我们测的,不是设计师真正干的活

从图像到CAD、从图纸到3D、从网格到程序——这些当然有用。legacy系统迁移、供应商数据恢复、扫描到CAD、图纸转换、修复工作流,都离不开它。

但它不是现代工程设计的正常起点。

在当代机械产品工作流中,三维CAD模型才是中央设计产物,二维图纸是从它派生出来的。基于模型的定义更进一步,把尺寸、公差、注释和其他产品需求直接放进三维数据集。NIST的综述明确指出:航空航天和国防等行业正在把3D模型作为核心产品定义载体——尽管图纸仍未完全消失。

关键区别在于:逆向工程开始时,大量决策已经做完了。 一张标注图纸已经编码了选定的形状和至少一部分产品定义。一张照片提供的工程意义更少,但目标形态是确定的。AI的任务是"从证据推断产物"。

而工程设计开始得更早,持续得更久。

它从不完整甚至矛盾的需求出发,要处理接口、载荷、材料、制造工艺、法规约束、成本目标、产品族规划。它包括方案对比、权衡分析、迭代优化、文档编制、评审和变更。一个模型几何上接近参考物,却可能是糟糕的工程解——因为它没回答"为什么这样设计"和"这样能不能造"。

所以,图像到CAD、图纸到3D的基准测试,应该只支持精确声明:

  • 从特定表示重建几何的能力如何?

  • CAD程序能否执行?

  • 重建产物是否紧凑、可编辑?

  • 面对模糊、噪声、遮挡和几何复杂度时性能如何变化?

但它们不应在没有进一步证据的情况下,声称自己测的是自主产品设计、制造就绪性、正确的设计意图,或全生命周期鲁棒性。

被忽视的宝藏:传统CAD和PMI评测的遗产

传统CAD评估从来不是"一个分数定生死"。图形速度、几何鲁棒性、可编辑性、互操作性、文档质量、下游适用性——各有各的测法。这种多样性,恰恰是今天AI-CAD基准测试最该恢复的东西。

PMI:几何之外的世界

产品制造信息(PMI, Product and Manufacturing Information)是最典型的例子。按NIST定义,PMI包括几何尺寸与公差(GD&T)、三维标注、表面纹理、 finish要求、工艺注释、材料规格、焊接符号等一切用于定义和制造产品的信息。

语义PMI是结构化数据,能被软件消费;图形PMI控制注释如何显示给人看。两者都重要,但根本不是一回事。

NIST的MBE PMI测试系统提供了完整公差的测试案例、组合案例和简化案例,附带测试定义、原生CAD模型、STEP文件,以及验证与确认结果。案例覆盖了常见和罕见的GD&T构造,有些还能装配成组件。2023年的简化案例去掉了若干不常见概念,但保留了相同几何。

它的方法尤其值得AI基准测试学习:

  • 先比较原生模型与测试规范;

  • 再比较来自其他CAD系统的等效模型;

  • 然后比较衍生的STEP、JT、3D PDF文件与原生模型。

"创作正确性"和"翻译正确性"被刻意分开了。 公开结果浏览器记录了411个观察到的PMI错误,代表2012和2015年测试版本中的98种独特错误。NIST明确警告:这些历史结果不应被假设为描述当前版本。

配套的STEP文件分析器和查看器(STEP File Analyzer and Viewer)检查基本STEP错误,报告语义PMI、图形PMI和验证属性是否符合推荐实践。这才是AI-CAD评估器该有的样子:在标准允许的地方做确定性判断,透明地说明检查内容,并且绑定到下游互操作性。

STEP AP242与JT:互操作性不是"能打开就行"

STEP AP242生态系统包含实现指南、测试套件、用例和周期性基准测试。2024年的报告目标是记录哪些AP242域模型功能在商业PLM应用中真正可用,并识别限制。早期轮次测试了PDM装配、文档引用、标识符、端到端验证属性、完整循环交换。

ProSTEP iViP和VDA的第九轮JT应用基准测试评估了CAD到JT、JT到CAD的翻译器,以及JT与STEP AP242 XML的互操作性。范围覆盖几何、语义PMI、验证属性、装配结构、运动机构。更早的CAD-JT-CAD基准测试通过往返测试,检查了几何、三角化、PMI、元数据、产品结构、装配属性。

需要记住:和二维图纸一样,STEP和JT通常是从3D派生的。 它们用于与他人共享几何信息。修改STEP文件的基准测试虽然有趣,但这是个极少见的用例——修改几乎总是在具备完整历史和参数化的三维设计系统中完成。

QIF:把数字主线延伸到质检台

质量信息框架(QIF, Quality Information Framework)把数字主线延伸到检验规划、测量资源、结果和统计分析。NIST的QIF PMI报告软件从QIF文件中提取语义PMI。2014年IMTS的端到端QIF演示把MBD连接到检验规划、执行、结果和统计。

JEITA在一个DMSC(数字计量标准联盟)研讨会上描述的基准测试更进一步:用PMI增强的MBD模型做模具设计,并将非接触测量结果反馈回带注释的三维模型。

这些PMI和互操作性项目给AI基准测试写作者提供了一个模板:

  • 从明确的产品定义规格出发;

  • 创建可复用的案例,覆盖不同语义概念;

  • 分离原生创作、中性翻译、视觉呈现和语义消费;

  • 测试往返和下游使用,而非仅仅文件创建;

  • 公布结果的局限性和版本上下文。

AI-CAD基准测试的六条红线

基于以上传统,作者给AI-CAD基准测试划了六条明确的红线:

第一,不应只是逆向工程竞赛。 图纸到3D、图像到CAD、网格到程序、扫描到CAD, deserve各自的基准家族。但它们不应占据AI-CAD的全部定义。

第二,不应把正确性简化为形状相似度。 倒角距离、体素IoU、表面F分数、渲染相似度是有用的诊断指标,但它们不是设计意图、公差标注、材料选择、装配行为、可制造性或安全性的度量。neuralCAD-Edit报告的自动指标与专家评分的弱相关性,直接证明改进指标设计仍是刚需。

第三,不应要求唯一精确的特征树。 同一个零件可能有多种专业上有效的建模方式。基准测试应测可观察的设计行为、相关特征语义和必要约束,而非奖励单一历史构造序列。在操作本身被指定的情况下,精确操作匹配可以作为诊断性子分数保留。

第四,不应在第一次成功保存后就停止。 带命名尺寸的原生模型比静态曲面更好,但可编辑性必须被** exercised**。改尺寸、抑制特征、替换组件、重配置装配——验证请求变更和应保持不变的不变量。

第五,不应隐藏智能体技术栈。 同一个基础模型在不同提示、工具、CAD API、检查循环和资源限制下表现不同。Parametric CAD Bench发表的Harness对比已经说明,结果必须标识完整配置。

第六,不应在没有制造证据的情况下暗示制造就绪性。 评分标准可以估计可制造性,但声明应与测试成比例。更强的证据来自工艺特定检查:识别的加工特征、刀具可达性、壁厚、拔模斜度、材料和机床约束、生成的工艺计划、检验可行性,或物理相关性。NIST早期关于可制造性分析的特征识别工作,以及现代FEA反馈智能体研究,都说明了从"形态"走向"工程后果"的趋势。

作者给出了一个令人印象深刻的示例:

一个智能体收到承载式安装组件的需求简报,包括包络、接口、材料和制造约束。它创建原生参数化装配;响应两个工程变更单;生成语义PMI;导出STEP AP242;通过独立CAD导入;准备验证分析;支持加工或检验工作流;生成发布包。

基准测试不仅记录最终正确性,还记录假设、失败操作、修复、人工干预、时间、成本,以及每次转换中丢失的信息。

这不是"画得像不像"的问题。这是"能不能走完工程全流程"的问题。

如果AI-CAD基准测试只问"能不能重建这个零件",开发者就会建造越来越有效的形状重建系统。这些系统有价值,但它们的分数告诉我们很少关于自主工程的信息。

如果基准测试转而问:

  • 需求如何变成产品定义?

  • 模型如何应对变更?

  • 装配是否功能正常?

  • PMI是否正确且机器可读?

  • 数据能否在STEP、JT、QIF、CAD、CAM、CAE、CMM之间存活?

  • 专家需要干预多少次?

那么这个行业才能开始测量工程效用,而非视觉可信度。

基准测试写作者应学习传统CAD、PMI、互操作性和仿真测试的特异性和下游导向。CAD专家应参与其中,因为AI基准测试正在成为事实上的规格——定义厂商追求的能力,以及客户可能允许的自主性。

最后的问题不是:"AI能重建这个零件吗?"

而是:"结果的产品定义,能否在接下来发生的一切中被信任?"

—— End ——

免费进入AI创业交流群
媒体商务合作(视频号、小红书、公众号、抖音等)