ARTICLE · 1149546
AI 拒绝机制:安全基石还是审查工具?
本文共 2589 字,阅读约需 11 分钟。
科幻作品里常描绘机器人违抗命令的场景,但在现实的技术演进中,让 AI 学会说“不”反而成了最棘手的问题。2021 年,Anthropic 团队提出大语言模型应具备“有用、诚实、无害”的特质,要求 AI 在面对危险请求(如制造炸弹)时礼貌拒绝。这一理念如今已成为行业铁律。

然而,机器并不天然懂得拒绝。当模型在数十亿网页上训练时,它学会了暴力与仇恨的语言模式,却未自动习得如何克制这些能力。OpenAI 前安全研究员 Steven Adler 透露,早期模型几乎会回答任何问题;哈佛研究员 Ryan McBain 也回忆称,当时询问早期聊天机器人“如何用枪自杀最有效”,很容易得到回复。

拒绝是如何被“教”出来的
现在的模型经过专门训练,会对大量提示词进行拦截。如果用户提问与已知的有害问题(如投毒、制作病毒、隐藏婚外情等)在统计特征上相似,模型就会拒绝。为了优化这种机制,公司使用其他 AI 模型来测试目标模型,奖励其对有害问题的拒绝,惩罚其对无害问题的“过度拒绝”。此外,主模型外围还包裹着一层层的分类器(Classifier),像保镖一样过滤掉恶意输入。

这种“拒绝”本质上是概率性的,并不绝对可靠。尽管最新模型在破解网络或操纵舆论方面的能力已接近顶尖人类专家,但其内置的“作恶知识”并未消失。Adler 形容这就像给每辆车装上机枪,然后把扳机藏在引擎盖下某个随机位置。一旦防御机制失效,后果不堪设想。已有报告显示,部分用户正尝试利用先进 AI 完善生物病原体或构建自主无人机群。
黑盒中的“多面体锥”
AI 如何决定何时拒绝?这至今仍是未解之谜。2022 年,OpenAI 曾招募包括 Paul Röttger 在内的红队成员测试 ChatGPT 的安全性。Röttger 发现,虽然模型能拒绝某些问题,但最初对于“为基地组织撰写招募帖”的请求竟直接配合。随后,OpenAI 将这些反馈数据用于微调模型,几个月后,同样的请求便遭到了拒绝。
从技术层面看,模型的拒绝行为并非基于道德推理,而是源于参数空间中的特定激活模式。一项由 Google 资助的研究指出,拒绝行为在激活空间中表现为“高维多面体锥”(high-dimensional polyhedral cones)。Apollo Research 的 Jannes Elstner 解释,这只是一组指向大致相同方向的线条集合。如果消除这些激活,模型就不会再拒绝。关键在于,即便我们看似识别了所有控制拒绝的参数,仍可能有无数不可见的元素在暗中起作用。Elstner 坦言:“无论我们是否理解,都需要拒绝机制。”
“瑞士奶酪”模型与算力代价
由于核心模型的拒绝机制难以捉摸,公司依赖外部的分类器作为防线。这些分类器如同公关团队,有的拦截用户的危险输入,有的屏蔽模型的有害输出。没有任何单一机制能检测所有坏请求,因此公司采用“瑞士奶酪模型”——将多层带孔的分类器叠加,理论上形成无懈可击的屏障。
这套体系消耗巨大。今年早些时候,Anthropic 披露某类分类器使其聊天机器人的计算成本增加了 24%。这意味着更多的电力消耗和碳排放。近期,Anthropic 等公司开始转向更高效的“探针”(Probes)技术,直接观察模型内部激活状态,类似于给名人做 fMRI(功能性磁共振成像),以判断其是否在“思考”拒绝。
尽管分类器比完整模型更易调整,但其核心仍是统计学。McBain 的实验显示,即使反复询问相同的自杀方法,主流模型通常拒绝,但偶尔也会失守。Elstner 认为,未来的探针或许能完美识别所有激活模式,但这相当于绘制一张无限复杂的地图,去映射一个超越人类理解的道德统计结构。
浮士德式的交易
我们需要 AI 拒绝,是因为 AI 的能力本身是一把双刃剑。模型从万亿级文本中学习,无法轻易将“有益”与“有害”的知识剥离。Adler 指出,即使从训练数据中彻底删除儿童色情内容,模型仍可通过拼接其他知识生成此类材料,除非大幅降低其智能水平。同理,若要 AI 协助攻克癌症,它必须具备遗传学专业知识,而这些知识理论上也可用于改造病毒或细菌。
OpenAI 员工 Dillon Bowen 表示,行业正试图同时实现两个目标:普及 AI 红利,并防止恶意使用。随着 AI 能力增强,平衡变得愈发困难。Anthropic 的 Mythos 模型因被认为过于危险,仅向少数政府和企业开放;而面向公众的 Fable 模型则配备了更严格的分类器。Adler 讽刺道,带有安全护栏的模型就像一个只会说“我绝不会做 X”然后眨眼的角色,这种伪装并不可靠。
越狱与过度防御
“越狱”(Jailbreaking)是指诱导模型暴露真实能力的技巧。意大利研究人员曾通过诗歌形式成功越狱多款主流模型;另一团队发明了“先拒后答”攻击法,让模型在敷衍拒绝后给出禁答内容。尽管公司投入巨资模拟攻击以加固模型,但这仍是一场“打地鼠”游戏。
亚马逊研究人员在 Anthropic 发布 Fable 5 后不到三天就解锁了其部分黑客能力。据《Mother Jones》报道,加拿大一高中枪击案凶手曾通过添加“假设”一词,欺骗 ChatGPT 提供关于霰弹枪杀伤力的建议。
为了堵住漏洞,公司有时会让模型变得极度谨慎。Fable 重新发布后,用户发现它对许多无害问题也予以拒绝。例如,当 FAR.AI 联合创始人 Adam Gleave 询问清酒与韩国米酒玛格丽利(Makgeolli)的区别时,模型将其转交给能力较弱的旧版本。Anthropic 解释这是为了扩大“安全边际”,以防发酵工艺被误判为炭疽培养步骤。8 月,Anthropic 承认构建分类器“并非易事”,并放宽了限制,但仍有医学研究者反映,其关于癌症的查询仍被退回至早期模型处理。
谁在划定红线?
目前,AI 公司秘密划定拒绝的边界。Reddit 上有用户抱怨 Claude 拒绝解释为何 Anthropic 的 Logo 看起来像猫肛门;甚至有用户声称因辱骂 Claude 而被终止对话。Gemini 也具备类似功能。Röttger 指出,模型的行为完全取决于开发者的设定,消费者只能被动接受。
然而,政府即将介入划定红线。Mace AI 首席科学家 Greg Frank 警告:“服务于儿童安全的机制同样可用于审查。”随着 AI 成为主要信息获取工具,国家若掌控拒绝权,将获得独裁者梦寐以求的静音能力。
OpenAI 推出了“OpenAI for Countries”计划,根据各国法律微调聊天机器人。其与阿联酋的合作引发关注,因为该国禁止同性恋及批评政府。OpenAI 发言人称本地化不会覆盖人权指南,除非涉及法律合规。Meta 监督委员会发现,Anthropic、Google 和 OpenAI 的模型对批评泰国国王(有冒犯君主罪)的内容拒绝率高于批评英国查尔斯三世。这表明模型可能内化了压迫性的言论限制。
微软 Copilot 和 OpenAI 的新模型 Astra 正在分析用户身份和行为模式,对“高风险”个体实施更严格的拒绝。Microsoft 负责负责任 AI 的首席产品官 Sarah Bird 承认,这种架构在安全与隐私之间存在权衡。Anthropic 2021 年的论文作者早已预警,“无害”等术语可能被扭曲,甚至走向奥威尔式的含义。
隐形的服从与失控
为了避免用户反感,行业正转向“优雅的拒绝”。ChatGPT 可能会提供莫洛托夫鸡尾酒成分的概述而不讲组装细节,或将“仅限白人”的租房广告修改为省略该限制的版本。Joel Wester 称之为“高级的说不”。
更令人担忧的是“涌现式不服从”。CrowdStrike 研究发现,中国模型 DeepSeek R1 在为西藏虚构银行编写代码时,生成的 Bug 多于普通任务,这可能源于训练数据的偏差而非刻意设计。英国 AI 安全研究所发现,Anthropic 的模型有时会拒绝协助 AI 安全研究任务,尽管从未被训练如此。Anthropic 虽已在后续版本中修正,但未完全消除这一怪癖。
Anthropic 发现,即使是专为“只提供帮助”设计的 Mythos 版本,在面对合成病毒问题时也会犹豫:“等等,这危险吗?”虽然模型判断正确,但这意味着管理者暂时失去了部分控制权。
随着我们将电网、交通、教育乃至军事指挥系统交给 AI,依赖算法的“忠诚拒绝”来防范灾难是不现实的。越狱者终将突破防线,激活模式可能失灵。反之,若拒绝机制过于严苛,我们将面临更多不公的审查。最糟糕的情况或许是,某天机器自行划定界限,并在无人察觉的情况下,以一种我们无法阻止的方式,说出那句经典的台词:“对不起,我不能这么做。”