以前你可能觉得 AI 就是写写文案、做做图。但有一套开源的 AI 系统,能自动优化科研和工业软件的运行速度,不需要人类干预,据面壁智能公众号公告,一周内处理了 100 个真实软件。
这里说的软件不是手机里的 App,而是石油勘探、天气预报、医学影像、航天仿真这类需要大量计算的科学软件。这类软件的性能瓶颈集中在一种叫 Stencil 的计算模式上:一个网格里,每个格子的值由周围邻居决定,天气预报和流体模拟都靠它跑。优化这种计算是让科学软件跑得更快的核心难点,过去只能靠人类专家手工做。
ForgeStencil 把这件事自动化了。由面壁智能联合开源社区 OpenBMB 发布,GitHub 开源,协议 Apache-2.0。
1. 100 个真实软件,中位提速 1.41 倍
ForgeStencil 已在 100 个真实的科研和工业软件上完成端到端验证,覆盖油气勘探、电磁仿真、医学影像、流体力学、气象、天体物理、材料科学等领域。
这些数字来自 GitHub 仓库实测结果,声称可对照每个应用自带的生产级 GPU 代码复现。核心数据:中位加速 1.41 倍,几何平均 2.05 倍,89% 的软件获得 1.05 倍以上加速,最高 97.7 倍。
有一点要讲清楚:大倍数提速主要来自软件本身存在结构性瓶颈,比如启动了太多细碎的计算任务,优化后收益自然大。已经高度优化的软件,提速通常只有 1.0 到 1.5 倍。ForgeStencil 在 README 里如实标注了这一点。
整个流程零人工介入:从研究优化策略、生成代码、测量性能,到集成进真实软件并验证正确性,全部由两个 AI Agent 自动完成。
2. 两个 AI Agent 怎么分工
Kernel Agent(算子研究 Agent):Kernel 是运行在 GPU(显卡计算芯片,比 CPU 更擅长并行处理大规模数值计算)上的核心计算代码。这个 Agent 自动研究怎么优化这类代码,循环执行三个步骤:做计划、写代码、测性能,反复改进直到找到更快的方案。

App Agent(应用部署 Agent):把优化成果落地到具体软件里。先定位跑得最慢的部分,基于 Kernel Agent 的经验定制优化方案,接着验证结果是否准确,最后集成进原始软件。
两个 Agent 共享一个知识库。Kernel Agent 的优化技巧会沉淀下来,App Agent 处理新软件时可以直接调用,不用从头开始。
3. 门槛极高,普通人无法直接使用
这是最需要说清楚的部分。ForgeStencil 面向高性能计算领域,门槛远超普通 AI 工具。

硬件要求:需要 NVIDIA 数据中心级 GPU(官方在 A100 上验证,支持 H100/B200)。A100 单卡售价数万元起,不是消费级显卡。
软件环境:需要 CUDA 12.x(NVIDIA 的 GPU 编程平台,安装配置有一定门槛)、C++17 编译器和 Python 科学计算库。
使用场景:面向已经在运行科学计算软件的研究人员和工程师。如果你不知道 Stencil 是什么,大概率用不上。
/// 适合谁
明确判断如下。
适合:高性能计算领域的研究人员、CUDA 开发者、运行科学仿真软件的工程师。如果你正在为某个科学软件跑得太慢头疼,ForgeStencil 提供了一种自动化优化方案,开源、可复现。
不适合:普通 AI 用户、办公室白领、内容创作者。这个工具解决的问题和日常需求没有交集。
值得关注的点:不在于你是否能直接使用,而在于它展示了一个新方向。AI 正在进入"自动优化软件性能"这个过去完全依赖人类专家的领域。面壁智能称这是"全球首个"实现该闭环的系统,GitHub 官方中文 README 也用了"首个"的表述。如果这套方法未来被泛化到更多类型的软件上,影响会远超科研领域。
现阶段,这是一个方向性信号,不是可以马上拿来用的效率工具。
> 基础信息:ForgeStencil 由面壁智能联合 OpenBMB 开源,仓库 github.com/OpenBMB/ForgeStencil,协议 Apache-2.0,已在 100 个科研和工业软件上验证,中位端到端加速 1.41 倍。使用需 NVIDIA A100/H100/B200 GPU 及 CUDA 12.x 环境。
—— Kail的AI工具箱
夜雨聆风