蛋白质并非僵硬的雕像,而是在生理温度下于一整族构象之间不停涨落的动态分子,实验观测到的结构往往只是自由能最低的那个"基态"。可要访问基态之外的过渡态、激发态与部分解折叠的中间态,对理解蛋白质功能、别构调控乃至理性药物设计都至关重要,却长期受限于计算难题。来自相关机构的Pratik Worah、Subhash Khot与Srinivasa Varadhan提出了一个新颖的视角:把计算被条件化的不均匀Curie–Weiss自旋哈密顿量的对数配分函数(即自由能),归约为一个"不平衡的2→1范数"计算,并为此设计了多项式时间的半定规划(SDP)算法,还给出了所达成不平衡程度的下界证明。把这套框架应用到泛素(Ubiquitin)这一蛋白质上,它能从已知晶体结构出发,在自由能景观上探索不同的主链构象,识别出蛋白质中柔性的区域,同时保持其天然的二级结构。
为什么计算蛋白质的条件自由能这么难?
约束满足问题(CSP)出现在从抽象到实用的各类场景中,既包括布尔可满足性这样的纯理论问题,也包括基于CSP的蛋白质结构预测这样的实际应用。研究团队指出,这些底层CSP的解有一个共同主题:组合规律决定了大多数解都具有高熵、因而信息量低。更直白地说,对于布尔情形,如果解空间是由0和1组成的串,那么大多数可满足的CSP,其解中0和1的数量大致相等。数学上,这种"平衡"的解并无不妥;然而在实践中,这类解携带的信息并不多,人们往往隐式甚至显式地,更想要那些"不平衡"的解(如果它们存在的话)。
蛋白质恰好是这种诉求的绝佳例证。蛋白质在生理温度下于一整族主链构象之间涨落,实验观测到的结构代表的是自由能最低点:那个在低能量与构象熵之间达成最优平衡的状态。而访问天然折叠之外的构象状态——过渡态、激发态、部分解折叠的中间态——对于理解蛋白质功能、别构调控与理性药物设计是必不可少的。可现有的计算工具大多局限于预测基态结构。诸如基于序列预测结构的方法虽对基态预测有效,却没有直接提供一个面向其它构象状态的热力学框架;分子动力学配合力场(如OPLS4)原则上能采样激发态,但对带混合符号耦合的受挫自旋系统,会遭遇指数级的混合时间;TALOS+、CS-Rosetta这类NMR专用工具可从化学位移预测二面角,却同样局限于基态结构;基于Rosetta的柔性主链方法又缺乏对自由能景观的连续参数化刻画。
这里的"受挫"二字,正是难点的根源所在。NMR实验所推导出的蛋白质哈密顿量,其耦合往往是混合符号、且高秩的:有的残基对倾向于同向,有的倾向于反向,谁也无法让所有约束同时满意,系统于是陷入彼此冲突的"受挫"状态。在理论一侧,Jerrum与Sinclair虽为铁磁哈密顿量给出了全多项式时间近似方案,单秩哈密顿量也存在闭式解,但这两个前提对NMR推导出的、带混合符号且高秩耦合的蛋白质哈密顿量都不成立。换言之,蛋白质的真实情形恰好落在那些"好算"的特例之外,这才使得它的自由能计算格外棘手。
一条共同的主线把这些局限串联起来:在一般情况下,计算一个受挫自旋系统的自由能在计算上是困难的,现有方法要么绕开问题(只盯着基态),要么缺乏多项式时间的保证。研究团队的思路则是把问题重新表述成一个可以高效求解的凸优化形式:他们证明,不均匀Curie–Weiss哈密顿量的对数配分函数(自由能),在渐近意义上等价于一个受约束的"ℓ1最大化"问题——也就是耦合矩阵的不平衡2→1算子范数。这一变分刻画,把"计算被条件化的能量状态"这一物理问题,归约为一个半定规划。值得一提的是,这个不平衡ℓ1最大化问题,也独立地出现在符号约束回归、临床风险评分与投资组合优化等领域,因此其算法结果对这些方向也可能有借鉴意义。

▲ 图1:Secondary structure composition vs. ε. Left: Coarse classification (β-sheet at 5
不平衡的2→1范数与半定规划算法,如何破解困局?
这一框架的核心,是把自由能的计算转化为对不平衡2→1范数的求解。在哈密顿量这一侧,范数中"βAz的ℓ1部分"对应能量贡献;而约束"z的ℓ2范数平方不超过y"则约束了熵的代价:y越大,z允许的涨落越大,对应着越高的熵。最优自旋构型的磁化方向,由矩阵A的行符号作用于最优解来决定。换言之,引入一个熵预算参数y,就把"能量与熵的权衡"显式地写进了优化问题里,从而把计算条件化自由能状态的物理难题,转换为一个凸优化问题。不平衡的2→1范数问题,则是在ℓ2范数不超过1、并对不平衡度δ设有下界的约束下,最大化向量的ℓ1范数;由于2→1范数本身的精确计算是NP-困难的,研究团队设计了一个基于SDP的算法,通过在参数空间上扫描来求得近似解。
具体的SDP松弛使用了两个半定矩阵,目标基于在某种由V诱导的度量下行向量的对数互相干性,并以"ℓ1目标不低于ε·OPT"作为约束。算法先求解无约束的SDP松弛得到最优值OPT,再对不同的参数值求解带约束的SDP,并通过一个舍入过程从中挑选出最不平衡的解。研究团队还为此给出了两条理论结果。其一是关于不平衡程度的下界:对任意ε,算法都能算出一个不平衡解,其期望的舍入目标值至少达到ε·OPT量级,不平衡因子则由最优矩阵范数的算术-几何-调和平均比所界定。其二是关于运行时间:在对耦合矩阵的温和假设下(条目有界、最优矩阵正定),算法在多项式时间内运行,并产出一个与最优值相差不超过(1+1/n)倍的解。这两条保证合在一起,意味着这套方法既"算得动",又"算得准"。
下表把这套框架的三个核心理论结果对照列出,帮助读者把握它"既证可解、又证有界、还证高效"的逻辑骨架。

▲ 图2:Ramachandran plots at $\varepsilon = 0 . 9 \mathrm { : }$ energy-only $( y = n ,
在泛素上,这套方法看见了怎样的构象图景?
作为概念验证,研究团队把这套框架应用到一个小的调节蛋白——泛素(76个残基,PDB编号1UBQ)。从晶体结构到条件化拉氏图(Ramachandran plot)的整条流水线包含几个关键步骤:第一步,从PDB主链二面角出发,通过正向Karplus方程计算J耦合常数;第二步,据此构造自旋哈密顿量;第三步,求解带约束的SDP;第四步,通过Karplus反演恢复出被条件化的主链二面角。其中,由于Karplus方程非单射、一个J值可对应多个角度解,反演时会在多个分支中挑选最接近已知(来自PDB)基态角度的那一支;而对被"翻转"的残基对,则采用一种带混合系数α=0.9的J值调和方式来获得条件化构象。
为了定位自由能的最优点,研究团队把熵预算y从1扫到20n,并在每个网格点计算相应的目标值。所得到的自由能景观是凹的,在y*约等于592(约为7.8n,其中n=76)处取得唯一的极大值。这个最优点位于一个内部点上:如果把问题限制到y=n=76(即只看能量、忽略熵的情形),得到的自由能大约比最优值低40%,这有力地确认了熵的贡献是实质性的——单看能量会严重低估真实的自由能。换句话说,正是"能量与熵的权衡"塑造了蛋白质真实的热力学行为,而这一框架通过显式扫描熵预算,把这一权衡清晰地刻画了出来。
这个约40%的差距,本身就是一个发人深省的数字。它意味着:如果研究者像许多只关注基态的方法那样,仅仅去最小化能量、把熵的贡献抛在一边,就会系统性地误判蛋白质真实所处的热力学状态。蛋白质之所以稳定在它被观测到的那个构象上,并非单纯因为那里能量最低,而是因为那里在"低能量"与"高构象熵"之间达成了最优的折中。这一框架的可贵之处,正在于它把熵预算y作为一个可调旋钮显式地纳入优化,让"能量与熵的天平"第一次以可计算、可扫描的方式呈现在眼前,而不是被某个隐含假设悄悄固定下来。
在结构层面,1UBQ的PDB真实拉氏图展现出泛素混合的α/β折叠:包含40个β折叠残基、16个右手αR螺旋残基、5个左手α残基与13个无规卷曲残基。这一构成被用作条件化构象的基线参照。借助前述的SDP扫描与Karplus反演,研究团队得以从基态出发,系统地探索被条件化的构象景观:通过改变条件化参数ε,框架可以在自由能景观上探索不同的主链构象,识别出结构上易于变动(即柔性)的主链区域,同时保持蛋白质天然的二级结构不被破坏。这意味着,它不只是给出一个静态的最优结构,而是描绘出一族围绕基态、在不同柔性程度上展开的构象,从而把"哪里僵硬、哪里灵活"这一对功能至关重要的信息显式地呈现出来。

▲ 图3:Round-trip pipeline validation: forward Karplus → Hamiltonian → $\mathrm { S D P
这种从基态出发、沿条件化参数逐步展开的探索方式,与AI时代蛋白质研究的关切高度合拍。当下以AlphaFold为代表的结构预测工具,擅长给出一个序列对应的单一最优构象,却难以直接回答"这个蛋白质还能采样到哪些其它构象、哪些区域在功能发挥时会大幅运动"这类问题。而别构调控、酶催化中的催化环开合、信号转导中受体在活性态与非活性态之间的切换,恰恰都依赖基态之外的那些构象。该框架通过对熵预算与条件化参数的系统扫描,把"构象族"而非"单一结构"作为输出,正是朝着"序列-构象系综-功能"这一新范式迈出的一步——它让计算工具不再只盯着一张静止快照,而是去描绘蛋白质在自由能景观上真实的活动空间。
综观全文,这项工作做出了两点贡献:其一,给出了Curie–Weiss自由能作为不平衡2→1范数计算的变分刻画,并配以带可证近似保证的SDP算法;其二,提供了一条把该框架应用于探索条件化蛋白质构象的计算流水线。它的价值,不仅在于把一个原本NP-困难的物理量纳入了多项式时间近似的射程,更在于它示范了一种跨越统计物理、凸优化与结构生物学的统一视角:把受挫自旋系统的自由能、约束满足问题中对"不平衡解"的偏好、以及蛋白质对天然折叠之外构象的探索,归拢到同一套数学语言之下。
研究团队也明确强调,泛素上的结果属于概念验证性质,并在文末讨论了相应的局限。例如,从主链二面角经由Karplus方程构造哈密顿量、再经反演恢复角度的整条链路,本身依赖若干近似与分支选择;扫描参数所得的"柔性区域"也还需要与独立的实验或模拟证据相互印证。但即便如此,这一从凸优化角度切入蛋白质条件自由能的思路,已经为"如何在保证计算可行性的前提下,系统研究蛋白质基态之外的构象与柔性"这一长期难题,提供了一个新颖且理论扎实的出发点,也为AI与计算工具更深入地介入蛋白质动力学的研究,开辟了一条值得继续走下去的路径。
arXiv 链接:https://arxiv.org/abs/2606.01329论文标题:Conditioned free-energy density of proteins using unbalanced solutions to constraint satisfaction problems作者:Pratik Worah, Subhash Khot, Srinivasa Varadhan
夜雨聆风