引言:如果你是一位高性能计算专家,看到这条新闻时的心情,大概跟 18 世纪的织布工人第一次见到珍妮纺纱机差不多——"这玩意儿怎么把我的活干了,还干得比我快一百倍?"
8 月 4 日,面壁智能联合 OpenBMB 开源了一个叫 ForgeStencil 的 AI 系统。它用一周时间,自动优化了 100 多个真实的工业和科学计算软件——覆盖油气勘探、核反应堆模拟、电磁仿真、医学影像等 8 大领域——全程零人类专家介入。
做个对比:一位顶尖 HPC 专家,手写优化代码、调试、验证、集成,一年能搞定的软件不超过 20 个。面壁智能自己的说法更"残忍"——这相当于每年投入 4–8 个工程师、等效研发成本 300–1000 万。而 AI 用一个星期、零人工费,干完了。
这不是又多了一个代码补全工具。这是 AI 直接冲进了工业软件最底层、最核心、最依赖"人肉手艺"的环节——Stencil 模板计算优化——然后把整个手工作坊改造成了全自动流水线。
---
一、在 AI 能写诗之前,先让它学会了写"最不性感的代码"
先解释一下 Stencil 是什么。你不需要懂,只需要知道它有多"苦"。
气象预测、地震勘探、飞机气动设计、芯片电磁仿真——这些高精尖场景,底层都跑着一种叫 Stencil(模板计算)的运算。简单说,就是在一个网格上,用每个点周围邻居的加权平均值,反复更新整个网格。听起来朴实无华,但它是整个高性能计算领域最耗算力的计算模式之一。
耗在哪里?不是算力不够,是内存带宽不够。Stencil 是"访存密集型"计算——GPU 算得再快也没用,数据来不及从显存里搬出来。这就好比你有全世界最快的搅拌机,但食材得从隔壁城市的仓库一勺一勺运过来。
过去几十年,优化 Stencil 全靠极少数 HPC 专家。他们要做的事极其繁复:分析瓶颈 → 理解软件架构 → 识别 Stencil 模式 → 设计优化方案 → 手写高性能 kernel → 验证正确性 → 集成回原软件。每一步都依赖人的判断和经验,而且换个硬件平台、换个应用场景,全得重来一遍。
粗俗点说:这是用造火箭的脑子,在干拧螺丝的活。
更尴尬的是,国产工业软件近年算法功能追得很快,但一到真正上生产线就"跑得慢"——核心瓶颈就是这个 Stencil 优化没跟上。而能搞定这个的人,全国可能掰着手指头数得过来。
---
二、两个 AI 的分工:一个写代码,一个装软件,人类只剩递源码的份
ForgeStencil 的做法很简洁:两个 AI Agent 分工协作。用户只需要把源代码交出来,后面的事完全不用管。
KernelAgent(科学家角色):专门研究怎么把 Stencil 算子写到"逼近硬件物理极限"。它不靠预置模板,而是针对具体的 Stencil 类型、数据精度、硬件架构,自主生成高性能计算核心。在跟市面上 Halide、Devito、EBISU 等知名开源框架的对比测试中,同精度下几何平均加速 2.35 倍、混合精度再加 1.95 倍,哪怕公认最难的"变系数 Stencil",也比最优基线快 1.34 倍。
AppAgent(工程师角色):前面那个 Agent 写出来了牛逼的 kernel,但真实软件不是标准的干净循环——输入输出格式千奇百怪,计算流程跟具体应用死死绑定。AppAgent 的工作就是:定位热点函数 → 建立 GPU 基线 → 把 KernelAgent 锻造好的 kernel 塞进去 → 用软件自带的测试用例验证 → 确认端到端加速有效 → 集成回去。全程自己判断、自己踩坑、自己修复。
两个 Agent 还共享知识库——KernelAgent 优化过的算子矩阵,AppAgent 可以直接调用;AppAgent 遇到的新场景,KernelAgent 可以学习复用。人类专家的经验都锁在自己脑子里,AI 的经验实时同步、集体进化。
实测数据看一眼:hypre(全球工业仿真最依赖的数值库之一)加速 3.86 倍;minisweep(核反应堆中子学计算)加速 5.78 倍;gprMax(雷达和芯片电磁仿真)加速 2.47 倍;RTM 逆时偏移(油气地震成像)加速 1.81 倍;QuantLib 债券定价加速 1.82 倍。其中约 42%直接对应真实工业生产软件场景。
换句话说,这不是实验室跑分,是石油公司、气象部门、医疗设备厂商马上就能用的生产力提升。
---
三、不是"AI 替代人",是"手工活终于该交给机器了"
ForgeStencil 最值得聊的点,不是它"比人快 100 倍"——比快这件事,AI 已经赢麻了。真正有意思的是它验证了一个新范式:从"人设计方法、机器执行",进化到了"AI 自己研究方法、自己执行、自己部署"。
以前的所有自动化工具——编译器、代码生成器、自动调优器——本质上还是人想好优化策略,写成规则,让机器照做。遇到新场景新硬件,人得重新想策略。AI 只负责执行,不负责思考。
ForgeStencil 做的是把"想策略"这一步也自动化了。KernelAgent 不是一个巨大的 if-else 规则库,它是真的在"研究"如何写出更高效的计算核心。AppAgent 也不是简单的脚本替换,它要理解真实软件的结构、找到插入点、处理兼容性问题、验证结果。
面壁智能把这条路线叫做 Forge Engineering(锻造工程)。今年 5 月他们用同样的思路搞出了 ForgeTrain——全球首个完全由 AI 编写的大模型预训练框架,训练速度比英伟达 Megatron 快 10%。现在 ForgeStencil 是第二弹。逻辑一脉相承:AI 不仅能写应用层代码,还能干系统层、底层、需要理解硬件和数学的硬活。
对 HPC 圈子来说,焦虑是真实的——"我的工作会不会被替代"是个合理问题。但换个角度,当"手写 kernel + 手工集成"这种纯体力性质的阶段被自动化之后,真正顶尖的专家的脑子反而被解放出来了——去研究新的计算范式、提出新的架构、设计 AI 还不会的优化思路。就像织布机没有消灭纺织业,它消灭的是"一个人重复摇纺车"这个环节,然后整个行业的生产力翻了不知道多少倍。
而且 ForgeStencil 已经开源了(GitHub: OpenBMB/ForgeStencil)。这意味着不是只有面壁智能一家在推这件事——全球的 HPC 研究者、工业软件开发者都可以参与进来,一起把这条"自动化生产线"建得更长、更宽、更通用。
---
结语
以前我们说"AI 替代重复性劳动",指的是客服、翻译、数据录入。现在,AI 开始替代"高智商重复性劳动"了——那些需要顶尖脑子、但干的却是手工作坊式体力活的工种。
面壁智能 CTO 曾国洋刚入选了福布斯亚洲 U30。他和他背后的团队,正在用一种近乎"自噬"的方式推进 AI 的能力边界——让 AI 去造 AI 的训练框架,让 AI 去优化 AI 的底层计算。典型的"用魔法打败魔法"。
而对我们这些写文章的人来说,唯一的好消息是:ForgeStencil 暂时还不会写公众号。
---
▼ 点赞 · 在看 · 星标,不错过每次推送
▼ 近期好文
- 迪士尼撤了 Copilot,OpenAI 却给对手写插件:AI 编程的牌局,翻了
- AI 终于"长"出皮肤:港科大触觉机械臂登上 Nature Sensors
- 蚂蚁灵波独立融资 15 亿:具身智能赛道进入"抢身位"窗口期
▼ 作者简介
kirin,关注 AI 与产业交汇的长期观察者。不定期更新,但每次都有东西。
夜雨聆风