夜雨聆风学习资料网

ARTICLE · 1138534

AI4PDEs 98「Computer Methods in Applied Mechanics and Engineering」用于求解复杂偏微分方程的双嵌套激活自适应深度物理信息神经网络

AI4PDEs 98「Computer Methods in Applied Mechanics and Engineering」用于求解复杂偏微分方程的双嵌套激活自适应深度物理信息神经网络

AI FOR SCIENCE · 第 98 期

不只是换一个激活函数:ad-PINN 如何同时调整表示几何与残差尺度

dual-tanh 让斜率与形状可学,自适应 Huber 让损失切换阈值可学

论文档案 · PAPER PROFILE

论文原标题Adaptive deep physics-informed neural network with dual-nested activation for solving complex partial differential equations

中文标题用于求解复杂偏微分方程的双嵌套激活自适应深度物理信息神经网络


作者:Tianhao Wang、Guirong Liu、Eric Li、Xu Xu✉

第一署名单位:吉林大学数学学院(College of Mathematics, Jilin University)

发表期刊:Computer Methods in Applied Mechanics and Engineering2024 年 11 月 21 日收稿 · 2025 年 4 月 8 日修订 · 2025 年 5 月 29 日接收 · 2025 年 6 月 17 日在线发表 · 第 444 卷 · 文章编号 118125

论文 DOI:10.1016/j.cma.2025.118125

开源代码:论文未给出代码可用性说明或仓库链接;数据可用性声明本研究未使用数据。截至 2026 年 9 月 4 日,在出版社与机构正式页面未找到作者公开复现仓库。

01 当激活函数和损失函数都成为可学对象

面对激波的锐梯度、近不可压材料的强约束、复合材料界面的跳变,普通 PINN 会同时遇到两类失配:网络的非线性表示未必贴合解的形状,而大小差异悬殊的残差又可能让优化器只盯着最醒目的那一部分。

ad-PINN 的回答像是给训练添了两只联动旋钮。第一只旋钮位于 dual-tanh 激活中,调节神经元对输入的几何响应;第二只位于 Huber 损失中,决定多大的残差应该被当作二次误差精修,多大的残差应改用线性惩罚限制影响。

先给这篇文章一个清楚的坐标。普通 PINN 把时间、空间坐标送进网络,输出该点的温度、位移或速度;随后用自动微分计算控制方程、初值与边界条件的残差,并把几类残差合成训练损失。即使方程完全正确,若固定激活函数在陡峭区域表达不足,或平方损失让少数极大残差压倒其余区域,模型也可能卡在一种看似已收敛、实际局部误差很高的解。ad-PINN 没有改变这些 PDE 的物理定律,而是改了“网络怎样表示解”和“残差怎样进入优化”两处接口。

图 1|不同 β 值下的双 tanh 激活函数

曲线图的关键不是“又造了一个 tanh”,而是参数 β 不只改变原点附近的斜率,还能把整条曲线变成非对称、非单调的形状。当 β 为零时它回到标准 tanh;随着 β 变化,正负输入获得不同的通过方式。因此,这只旋钮调的是一层网络能表达什么样的局部结构。

原文式 (5) 写作 z(x)=tanh{x[tanh(βx)+1]}。内层 tanh(βx) 先判断输入落在哪侧,再把结果乘回 x;外层 tanh 把响应压在有限范围。β=0 时中括号等于 1,恰好还原普通 tanh。β 不为零时,正负半轴受到不同放大,曲线可呈非对称、局部非单调形状;因为 β 与权重一起求梯度,网络能在训练中改变这条响应曲线,而不必预先在 tanh、ReLU、Sigmoid 之间做一次性选择。

复现时有一处必须按正式公式核对:原文式 (5) 的外层输入是 x×[tanh(βx)+1],但 Methods 后面给出的 PyTorch、TensorFlow 一行示例写成 x×tanh(βx)+1;加号位置不同,函数不再相同。这里不能猜作者实际实验运行哪一种,也不能把一行示例直接当可复现实装。最稳妥的做法是先用 β=0 的极限检验实现:正确式子应回到 tanh(x),示例写法则会变成常数 tanh(1)。

02 β 管网络如何弯,δ 管误差如何称

图 2|ad-PINN 的训练流程示意图

训练回路把网络权重与偏置、dual-tanh 参数 β、Huber 阈值 δ 合并成一组可训练参数。PDE、边界和初值残差先经 Huber 规则形成损失,再反向更新所有参数。这意味着网络在学解的同时,也在重塑自己的非线性和误差标尺。

双自适应的最小表达

z(x) = tanh(x · (tanh(βx) + 1))

|r| < δ:二次惩罚  ·  |r| ≥ δ:线性惩罚

权重、偏置、β、δ 联合更新

β 改变表示几何,δ 改变大小残差进入优化的方式。它们不等于对不同 PDE 损失项设置显式权重。

Huber 的作用可以理解为一个随训练移动的放大镜。小残差落在二次区,便于继续精修;大残差进入线性区,避免少数尖峰完全支配梯度。让 δ 自己移动,意在减少为每个问题手工选切换点的负担。但这并不会自动解决 PDE、边界和数据项之间的所有权重冲突。

Huber 的数学形式也值得比“自动调阈值”多看一步。对固定残差 r,若 |r|<δ,损失为 r²/2;若 |r|≥δ,损失为 δ|r|−δ²/2。后一段对 δ 的导数是 |r|−δ,严格为正;若直接把 δ 和网络参数一起向降低同一损失的方向更新,线性区的梯度会推 δ 向下,而不是自动替大残差选一个更高阈值。δ 接近零时,只要没有额外约束或惩罚,这部分损失也趋近零,哪怕原残差尚未改善。这是从式 (6) 推出的复现风险,不是作者已经验证的训练失败。

论文确实把 δ 限定为正数,也使用支持边界约束的 L-BFGS-B;但没有给出 δ 的显式下界、约束参数化、额外正则项或训练轨迹,无法据此判断上述退化是否在实验中被阻止。更不能仅凭最终误差表推断 δ 在不同阶段如何变化。读这篇文章时,dual-tanh 的表示作用可以直接从式 (5) 和曲线讨论,Huber 阈值“自适应改善”的独立贡献却仍需要完整代码与因子消融才能确认。

数值实验采用全批量 L-BFGS-B,最多 50000 次迭代和 50000 次函数评估,并对 10 次随机初始化取平均。作者强调 β 初值不宜远大于一,δ 初值应与初始损失正相关。这说明“可训练”减轻了手调,却不等于初始化已无关紧要。

03 Burgers 方程中,调形状比单调斜率多带来了什么

Burgers 测试给出一个相对可控的起点:一维区域 x∈[−1,1]、时间 t∈[0,1],初值是 −sin(πx),两端边界保持零;作者把 γ 设为 0.01,形成逐渐变尖的内部层。网络为 7 个隐藏层、每层 20 个神经元,输入坐标 (t,x),输出 u;内部取 12,000 个配点,边界取 100 个。这样的对照不是“任意激波都能处理”,而是在同一方程与采样设置下检验不同激活和训练损失。

图 8|误差随采样点数量增加的变化

随内部采样点增加,图中 ad-PINN 的误差拟合斜率为 4.37,标准 PINN-Tanh 为 3.10,只让 tanh 斜率可学的版本为 3.50。在表格汇总中,ad-PINN 误差为 1.07×10^-4,标准 PINN 为 3.31×10^-3,PirateNets 为 6.12×10^-4。这些斜率是本文采样实验上的经验拟合,并不是离散方法那种已证明的渐近收敛阶。

图 6|四种模型求解 Burgers 系统的误差等值线

Fig. 8 的曲线只说“总体误差怎样随点数下降”,Fig. 6 才显示误差具体堆在哪里。标准 tanh 版本在内层形成时的中心附近留下一条明显亮带;ReLU 与 Sigmoid 对照更大范围偏离参考。ad-PINN 的误差图整体更暗,说明收益并非只靠改变一个总体指标,而是在最难的锐梯度位置减小了偏差。但图中颜色条量级不完全相同,不能仅凭颜色深浅跨面板算倍数,数值还要回到表格。

表 1|不同激活函数 PINN 模型的近似误差比较

Table 1 把同一组 Burgers 模型的初值、PDE 残差和总体误差并列。ad-PINN 三项分别为 3.01×10^-4、3.04×10^-4、3.17×10^-4;PINN-Tanh 对应 2.32×10^-3、2.29×10^-3、2.37×10^-3。改进不只落在某一种损失项上。它和下一张 Table 2 不是同一口径:Table 1 是同组激活函数对照,Table 2 汇集多种不同论文或架构的结果,不能把两表中的数字互相当作严格复现实验。

表 2|不同 PINN 方法求解 Burgers 系统的误差比较

Table 2 里 ad-PINN 的 1.07×10^-4 好于列出的 PirateNets 6.12×10^-4、Rowdy-PINN 9.13×10^-4 和标准 PINN 3.31×10^-3。这说明作者所选报告指标上具有竞争力;但表未统一参数量、训练时间、硬件及参考解评估细节,不能据此推出该方法在等资源条件下必定优于所有对照。本文更强的因果证据,仍是同一数值场景中的空间误差与采样点敏感性分析。

论文自己给出的一个重要对照

把交替 tanh 与 tanh(βx) 写成更深的 h-MLP,也能显著超过标准 PINN。Burgers 算例中 h-MLP 误差为 6.86×10^-4,ad-PINN 为 1.07×10^-4。这支持了“嵌套非线性有用”,也提醒我们:部分收益可能来自表达深度,需要按参数量与计算预算继续对齐。

04 从不可压约束到三维复杂几何

纯弯曲梁实验为水平、垂直位移各用一张网络,通过弹性方程和边界条件训练;每张网络 7 个隐藏层、每层 20 个神经元,取 100 个边界点和 1000 个内部点,再用 3000 个点与 COMSOL 参考解比较。泊松比 ν 接近 0.5 时,材料趋于近不可压,体积变形受限,因此这是比常规平滑场更能检验训练稳定性的测试。

图 13|泊松比接近 0.5 时的位移误差比较

在纯弯曲梁中,泊松比越接近 0.5,体积变形越受限,网络也越容易暴露类似“锁死”的近不可压难题。图中 ad-PINN 在泊松比逼近这一极限时仍将误差保持在 10^-3 以下;泊松比为 0.49 时,其误差为 5.09×10^-4,标准 PINN 为 1.12×10^-2。这里的亮点不是换了本构关系,而是相同物理残差下的表示与优化更稳定。

表 3|不同 PINN 方法求解不可压梁问题的误差比较

Table 3 把 ν=0.49 的误差放到同一页:ad-PINN 为 5.09×10^-4,标准 PINN-Tanh 为 1.12×10^-2;PirateNet 为 5.20×10^-4,已经与本文方法非常接近。合理结论是“在作者的设置下明显优于标准 tanh,并处于强基线的同一量级”,而不是宣称对所有改进 PINN 都有数量级优势。表中只给终值,缺少等参数量和等运行时间的完整核算。

表 4|ad-PINN 与 h-MLP 的误差比较

Table 4 帮助判断“新激活到底贡献了什么”。把 tanh 与 tanh(βx) 交替堆成更深的 h-MLP,Burgers 误差 6.86×10^-4、梁误差 8.84×10^-4,已经比部分普通 PINN 更好;ad-PINN 分别达到 1.07×10^-4 和 5.09×10^-4。加深非线性也能得到部分收益,但 h-MLP 的层数和参数量发生变化,不能把剩余差距精确归因于 dual-tanh,更不能分离自适应 Huber 的贡献。

双材料层合梁把难点换成界面两侧的伸缩与滑移。上层弹性模量 70 MPa,下层 200 MPa;作者用两张网络分别预测两块材料,再用界面力学条件联结。此处并非“整条界面都不能动”:水平位移允许两侧不同,垂直位移则应符合连续的粘结行为。若把水平位移也硬性设成连续,会把论文实际测试的滑移难点抹掉。

图 18|PINN 与 ad-PINN 得到的界面两侧位移场

Fig. 18 沿界面分别画上下两侧的水平位移 u 与竖直位移 v。u 的两侧曲线不重合并非求解失败,而是材料伸缩不同且允许相对滑移;v 则应保持相近的整体趋势。ad-PINN 的曲线更贴近参考解,说明它在界面附近没有简单把两个材料区混成一条光滑解。观察这张图时要先分清物理上应连续的量和允许跳变的量。

图 19|ad-PINN 与其他 PINN 随训练轮次及采样点数的收敛比较

Fig. 19 左边按训练轮数比较总损失,右边按采样点数比较误差。作者据此称 ad-PINN 在两种横轴上都有约十倍的收敛优势,采样误差拟合斜率为 1.53,PINN-Tanh 为 0.74。这里的“快”指图上达到相近误差所需轮数或点数,不是同硬件、同实现下实测的墙钟时间;右图斜率也只是该采样区间的经验拟合,不是方法普遍的理论阶数。

热传导算例把区域改成带相交孔洞的三维连接块。稳态方程要求温度满足无内热源的扩散平衡,外壁一部分固定在 100、孔面固定在 50,其余表面绝热;网络既要拟合温度,也要通过自动微分让 x、y、z 三方向的梯度满足方程和边界条件。因此仅看温度云图够不够像并不充分,导数误差更能暴露局部几何附近的失真。

图 22|方形连接块中温度场及三个梯度分量的误差

三维带交叉圆孔的连接块把温度边界、绝热边界和复杂几何放在同一算例。误差图按行比较温度本身与三个空间梯度:ad-PINN 一列的高误差区域显著小于 PINN-Tanh。该算例总共生成 50000 个点,其中 30000 个用于内部采样;温度误差对采样数的拟合斜率为 2.19,PINN-Tanh 为 0.73。

这组结果有一处具体复现障碍:文本把问题称为三维、损失中也含 T 对 x、y、z 的梯度,但网络结构却写成“输入层 2 个神经元”。三维坐标通常需要三个输入,除非作者另做了未说明的降维或编码。论文没有解释这一处,因此不能仅按文字直接重建完全相同的热传导网络;这是配置说明不一致,不代表图中的数值结果必然错误。

05 只知道部分 Navier–Stokes 结构,能否同时追回两个参数

最后一个算例不再只求场:二维圆柱绕流中,动量方程形式给定,但对流项系数 λ1 和黏性项系数 λ2 当作未知,网络要同时拟合速度、压力并把两个系数从观测中反推出来。真值设为 1 与 0.01,作者在尾流矩形区取 1500 个带标签点训练。这个任务比已知参数的正问题多一层可辨识性:如果观测覆盖不足,即使速度场看着合理,也可能得到错误的黏性参数。

图 26|参数 λ1、λ2 的误差随采样点数量的变化

圆柱绕流算例从尾流矩形区抽取 1500 个带标签点,联合动量方程反演对流与黏性系数。真值分别为 1 和 0.01,ad-PINN 给出 0.998 与 0.0101,误差为 0.2% 和 1.0%;PINN-Tanh 的对应误差为 2.3% 和 26%。图中红线说明两个参数误差都随采样数稳定下降,而黏性项的改善尤其明显。

图 29|t=5 秒与 15 秒时 PINN-Tanh 和 ad-PINN 的速度场误差

Fig. 29 把速度场误差放到 t=5 s 和 t=15 s 两个时刻。前者位于训练时间区间内,后者超出 0–14 s 的训练区间。ad-PINN 在尾流涡结构附近的误差分布更小,但这张图只是两个时刻的切片,不能推出任意时间都准确;颜色条量程应逐面板核对,不应把色深差直接当成统一的误差比。

图 30|t=5 秒与 15 秒时 PINN-Tanh 和 ad-PINN 的近似压力解

Fig. 30 的压力场更需要读懂“比较什么”。在这一反演式中,动量方程只出现压力梯度,不直接确定绝对压力;给预测压力整体加常数,速度和物理残差也可能不变。作者因此用云图观察空间结构,而不直接报告压力点对点误差。ad-PINN 的纹理与参考解较接近,但若未对齐压力零点和色标,就不能用跨面板颜色说某点绝对压力更准。

训练数据位于 0–14 s,论文还把 14–15 s 作为时间外推检查。速度与压力云图显示,ad-PINN 在较长时刻仍更接近参考场。但这只是窄的一秒外推,且未加观测噪声;它说明可以继续测,还不足以说明对长时间流动反演普遍稳健。

06 这篇论文证明了什么,又还没证明什么

定理考察的是带 L₂ 正则的可微损失,并要求初始损失低于零参数点,学习率还需由指定的线搜索规则产生。在这些条件下,作者声称梯度序列的极限点不是次优临界点或局部极小。它不能直接外推为“完整 ad-PINN 在任意初始化下都会找到全局最优解”,更不是对数值 PDE 误差的先验保证。

证据上最大的缺口是两只旋钮还没有被彻底拆开。论文有标准激活、斜率自适应、h-MLP 和多种现有模型对照,但缺少在完全相同网络与预算下的“只dual-tanh”、“只自适应 Huber”和“两者同时”因子消融。同时,β 与 δ 的训练轨迹、时间与显存代价、随机重复方差以及噪声下的稳健性仍未系统呈现。

复现状态

论文说明了 TensorFlow、L-BFGS-B、网络层数和主要采样配置,但未给出 Code availability 或仓库链接;Data availability 为“未使用数据”。截至 2026-09-04,出版社和机构正式页面也未列出作者公开复现仓库。这不否定结果,但会限制对误差表格、运行成本与随机稳定性的独立核对。

如果要把这篇论文变成自己的实验,建议先做四个最小检查。第一,用 β=0 校验激活实现是否真的退化成 tanh(x);第二,给 δ 设置明确正下界或记录其轨迹,确认损失没有因阈值趋零而虚假变小;第三,在同一网络、配点、随机种子和计算预算下分别关掉 dual-tanh 与自适应 Huber;第四,既看最终场误差,也看方程残差、梯度误差及外推区间。这样才能把“在本文五类算例有效”逐步推进为“自己的 PDE 场景也可靠”。

AI 模拟审稿

如果从方法贡献、证据边界和后续价值重新审视

① 优点用一个简洁的 dual-tanh 把斜率和整体形状同时纳入学习,再将 Huber 切换阈值与网络联合优化;结果覆盖锐梯度、近不可压、材料界面、复杂三维几何和未知参数。

② 局限理论结论依赖特定初始化、L₂正则与线搜索条件;实验没有完全分离 dual-tanh 和自适应 Huber 的贡献,也缺少统一计算预算、噪声、超参轨迹与开源复现证据。

③ 下一步启示最有价值的扩展是做等参数、等时间的因子消融,记录 β 与 δ 的动力学,再在强激波、噪声反演和更高维几何中检查这种“双自适应”是否仍能保持收益。

关注智核学术 · 看懂方法背后的问题

免责声明:本文为第三方学术解读,并包含 AI 辅助整理与 AI 模拟审稿,仅供学术交流;不构成正式同行评审、工程验证或决策依据。文中观点不代表论文作者、所属机构或期刊立场,论文事实与数据请以原文为准。

相关学习资料