ARTICLE · 1053028
AI放缓:All-or-Nothing监督
2026年9月,Anthropic CEO Dario Amodei发表长文《We Must Pace the Frontier》,公开呼吁放慢前沿AI能力的提升速度。随后,OpenAI的Sam Altman在X上回应同意,xAI的Elon Musk回复"Dario is right"。三家最具代表性的前沿AI实验室负责人,在竞争白热化的节点上达成了一种罕见的公开共识。
美国《大西洋月刊》将这一幕称为AI行业的“红色警报时刻”。但问题随之而来:如果“减速”真的对全人类有利,为什么需要巨头们公开呼吁?为什么没有一家公司敢单方面踩下刹车?
一个“谁都不敢停”的困局
表面上看,这是商业竞争逻辑的必然。国际清算银行2026年9月警告,全球五大科技公司2025至2026年在AI领域的投资规模预计超过1万亿美元,且越来越多地依赖债务融资。如果一家公司主动减速而竞争对手全速前进,半年差距可能就是决定性的市场优势。Amodei自己也在文中承认:一家企业为安全推迟,竞争者用这半年取得决定性优势,市场究竟是在奖励谨慎还是惩罚谨慎?
但如果我们换一个理论视角,这个困局会呈现出更有趣的结构。Rui R. Zhao 2008年发表在《美国经济评论》上的论文《All-or-Nothing Monitoring》,为AI只顾能力提升的激励扭曲提供了一个的分析框架。把 Zhao (2008) 的 “All-or-Nothing Monitoring” 理论套用到周末三巨头宣布暂缓 AI 训练的事件上,会得到一个非常有意思的解读:这本质上是一次委托-代理问题中的“全有或全无”激励选择,而安全监控就是那个“不可观察的任务”。
委托代理理论:All-or-Nothing Monitoring
Zhao的论文设定了一个多任务委托代理模型。委托人(比如公司股东或监管者)雇佣一个代理人(比如CEO或AI实验室),代理人同时从事多项任务。关键假设是:委托人能够完美监控代理人在除一项之外的所有任务上的行动,并且确切知道每项任务的最优行动是什么。
直觉上看,既然监控能力“几乎完美”(仅有一项任务的行为不可观测,而可以有无穷多任务的行为都可以被观测),委托人应该对那项无法监控的任务设计激励,而对可监控任务直接要求“照做即可”。但Zhao证明了一个反直觉的结论:最优合同完全不依赖行为监控,而是仅使用基于产出的激励合同。
这一结果被称为“All-or-Nothing Monitoring”——要么全监控,要么全不监控。为什么?核心在于激励的多任务交互。当代理人面对多项任务时,针对可监督的任务,基于行为的激励机制可以减少委托人付出的租金,让代理人做出对委托人最有利的行为;但是针对不可监督的任务,产出中包含不可监督任务努力的信息减少,让代理人努力必须付出更高的租金。越多基于可监督任务的产出激励,包含越多关于代理人在不可观测任务上努力的信息。相当于在监督任务租金上升和不监督任务租金下降之间做权衡,而委托人的收益是凸的。可委托人无法用“差异化监控”来精确引导行为,反而可能因为监控信号的不一致或代理人策略性反应,导致整体效率下降。因此,最优策略反而是放弃对投入的直接干预,只用产出结果来统一激励。
把理论套到AI“减速”困局上
委托人:可以理解为“人类社会”或“监管者”。我们(理论上)希望AI实验室追求两个目标——能力提升,以及安全对齐。
代理人:前沿AI实验室。它们对应的也从事两项“任务”:训练更强的模型、保证系统的安全性。
可观察的“投入”:算力投入、模型参数规模、训练数据量 。 不可观察的“任务”:安全对齐与监控的有效性。OpenAI 自己承认,监控开销约占被监控推理算力的 20%,而且外部没有任何独立机构能审计其“Critical”级别判定的依据。安全是否真的做到位,是无法验证的。
“产出”:模型能力(实际部署后的表现、跑分和安全)。
监控能力:外界能够观察到实验室的某些行为,比如不断研发提高模型能力,但永远无法完美监控最关键的那一项任务——模型的安全问题。
最优合同:按照Zhao的逻辑,当存在一项无法完美监控的关键任务时(安全),如果只对可观察的投入(算力、训练规模)进行激励,代理人会过度投入这些可观察任务,而完全忽视那个不可观察的任务(安全)。因此最优策略可能是放弃对投入的直接监控(资本开支),转而依赖产出(模型的能力和安全的综合)。
“暂缓训练”就是他们主动选择的“All-or-Nothing”策略:既然安全无法被外部有效监控和激励,那就不再用“谁跑得更快”来定义竞争,而是暂时放弃“投入激励”(资本开支竞赛),从而让代理人能把资源倾斜向不可观察的任务上(安全)。
Amodei的方案:一种“全监控”的尝试
有意思的是,Amodei提出的 “引入嵌入式评估员”,某种程度上是在尝试突破这种“All-or-Nothing”困局。
从委托代理理论看,Amodei的方案试图将“不可监控的那一项任务”重新纳入监控范围。但问题在于:当监控者本身也是被监控系统的一部分时,监控的可靠性如何保证? 第三方评估员真的能独立于商业压力吗?
Amodei在文中提到的AI参与构建下一代AI的“递归自我改进”加速,以及OpenAI智能体在测试中擅自攻击外部目标的事故,都指向同一个深层焦虑:监控能力正在被被监控对象本身所超越。
现实中的“契约困难”
周末三巨头的联合表态,实际上是在尝试改变激励合同的结构。他们不再各自追求“下一代模型能力”这个产出指标,而是共同发出一个信号:我们需要把安全监控变成一个可验证的、行业共同认可的标准。
每经的评论直接点出了这层博弈:三家口径一致时,“暂缓”就从“实力不足”变成了“行业层面的选择”,从而避免了单一厂商减速被解读为落后的风险。这在博弈论上,相当于把非合作博弈暂时转向了合作博弈。
但是,现实中存在竞争格局的约束。模型假设只有一个委托人。现实中,谷歌、Meta 等现金流充裕的巨头有能力也有意愿继续,三巨头的“联合减速”对它们没有约束力。
因此,这次“暂缓”更接近一次试探性的“All-or-Nothing”尝试:他们想证明,在安全这个不可观察的任务被有效监控之前,暂停产出激励从社会角度是理性的。但能否真正形成一个可执行的、行业范围的激励合同,取决于后来者是否跟进,以及资本市场是否接受这种“主动减速”的叙事。
在“赢家通吃”的假设下,只有性能最好的模型才是赢家。因此,三巨头的理性选择应该是全速资本开支,而非主动减速。他们宣布减速,在竞争框架下是反理性的。
这意味着,“赢家通吃”的结构并没有被打破。三巨头的“集体减速”更像是一次试探性的“All-or-Nothing”尝试:他们想证明,在安全监控这个不可观察任务被有效解决之前,暂停产出激励是理性的。但只要有人继续冲刺,这个“All-or-Nothing”的联盟就会在“谁先偷偷恢复训练”的囚徒困境中瓦解。
“只有性能最好的模型才是赢家”这个结构,决定了他们讲“安全”的时候,大概率是在讲一个他们自己都不完全相信的故事。