ARTICLE · 1043738
AI 安全不能建立在让 AI 变弱之上
AI 也一样,如果安全意味着牺牲能力,那么无论我们设计出了多好的安全机制,它都必须面对现实世界里的竞争。
如果安全以能力为代价,那就不是真正的安全
假设两个模型本来拥有相同的能力,但其中一个增加了安全机制。如果去掉安全机制能够获得更多知识、更大的自主权、更强的工具调用能力,或者在关键任务上取得更好的表现,那么放弃安全就获得了直接的竞争优势。
这时候问题已经不再是:大家愿不愿意负责任?因为即使绝大多数人都愿意,总会存在企业为了市场、国家为了竞争、个人为了权力,愿意承担更大的风险。而且在这个游戏里,收益由野心家获得,而风险却由整个社会承担。
于是每一个参与者单独看都可能是理性的:如果别人会造,我最好先造。只要安全是以能力损失为代价,那么这种安全天然就是脆弱的。
我们讨论的不是给 AI 加一道防火墙
这里需要区分两件不同的事情。权限控制、Sandbox、人工审批、审计和可回滚机制,解决的是系统健壮性问题:即使一个组件判断错误,也要限制错误能够造成的影响范围。这些措施和 AI 本身是否安全对齐,是两个不同的维度。一个价值可靠、能够自我纠错的 AI 仍然应该运行在健壮的系统里,就像可靠的软件仍然需要权限隔离和容错设计。
这里真正值得担心的是另一种 Safety:如果为了让模型更安全,我们必须让它少懂一些、少想一步、少拥有一些推理和自主决策能力,会发生什么?如果去掉这些限制之后,模型就能够解决更多问题、获得明显的竞争优势,那么安全本身就变成了一种能力税。这才会产生真正危险的博弈结构,竞争就会持续奖励那些愿意牺牲 Alignment 换取能力的人。
安全和能力真的天然冲突吗?
前面的推论似乎很悲观:如果安全意味着牺牲能力,那么竞争迟早会侵蚀安全。但这里隐藏着一个前提:安全一定是通过减少能力获得的吗?
上一篇讨论到,一个真正安全的超级智能应该拥有一种重要的能力:知道自己可能错。它不仅需要一个 World Model,还需要知道这个模型有多可靠;不仅需要理解任务目标,还需要意识到自己对目标的理解可能不完整;不仅需要找到一个可行方案,还需要判断哪些关键假设支撑着这个方案,以及什么新证据足以让自己改变判断。
孔子两千多年前说:“知之为知之,不知为不知,是知也”。真正的“知”,并不只是知道更多,还包括知道自己的知识边界,对一个超级智能来说,这也许不只是美德,而是一项基础能力。
而这种能力并不只对 Safety 有价值。今天的 Agent 在短任务里往往已经表现得很好,但任务时间一旦拉长,一个很常见的问题就是错误不断累积:最初接受了一个并不准确的假设,随后每一步局部推理都看起来合理,最终却沿着错误方向越走越远。
于是上一篇里看起来属于 Safety 的能力,换一个角度看,恰恰也是提高工作质量的能力:
World-model uncertainty → 避免在错误事实之上继续推理Goal uncertainty → 重新检查自己是否真正理解了任务Self-model → 理解自己的能力边界Error monitoring → 阻止局部错误不断累积Reflection / replanning → 从已经陷入的局部最优中跳出来
这时 Safety 和 Capability 的关系就开始发生变化。
更安全,也可能意味着更强
现实世界里,一个 AI 的能力并不只是“理论上能够完成什么”,更重要的是它能够多稳定地完成一件复杂的事情,以及人类敢把多大的事情交给它。一个推理能力很强,但不知道自己什么时候会犯错的 Agent,也许可以完成一个十分钟的任务,却很难被放心地独立运行十天。相反,如果它能够发现异常、暴露 uncertainty、重新检查假设,并在高风险决策前主动降低行动速度,那么它不仅犯的长程错误更少,人类也敢给它更长的自主运行时间、更高的权限和更重要的任务。
这就出现了一种值得认真考虑的可能:某些对 AI Safety 至关重要的能力,也许恰好是更高级智能继续发展的必要能力。
这里并不是说“AI 越聪明就自然越善良”,一个更好的 Self-model 同样可能被用于隐藏意图,更强的 Theory of Mind 也可能被用于操纵别人。智能本身并不会自动产生 Alignment。这只是一个必要条件,让对齐的价值观可以被可靠的执行。
只有这样,安全才可能成为稳定策略
这就重新回到了文章开头的博弈。
如果安全以能力为代价,那么 Safety 永远面对被竞争侵蚀的压力。但如果随着 AI 的发展,Self-awareness、Uncertainty、Reflection 和 Error Correction 不仅让模型更安全,也让它在复杂长程任务中表现得更好,那么博弈结构就可能逐渐发生变化,安全就不再只是需要所有参与者共同承担的一笔成本,它开始成为能力本身的一部分。
真正可靠的超级智能,也许不是一个被人类绑住手脚的强大智能,而是一个因为足够强大,所以也学会了理解和控制自身力量的智能。