乐于分享
好东西不私藏

【AI安全】安全对齐藏雷点!拒绝能力集中在中段MLP,加块反而翻车

【AI安全】安全对齐藏雷点!拒绝能力集中在中段MLP,加块反而翻车

一、安全不是均匀涂上去的:对齐为何一戳就破

AI 时代!人人都在深耕 AI 安全,你缺的就是这关键一步!

AI 正重塑安全边界,与其在门外徘徊,不如直接掌握主动权!

免费课程持续更新

https://space.bilibili.com/452583051/lists/7870008?type=season

大模型的安全对齐,听起来像是给模型"整体上了一层保险"。🔐 预训练只负责学会语言和世界知识,真正决定"该不该回答恶意请求"的,是预训练之后的对齐阶段:监督微调、RLHF、DPO 这些手段,把"拒绝有害指令"的行为一点一点训进模型里。

但现实是,这套"保险"脆弱得让人头疼。😰 之前的很多研究发现,只要做一点下游微调、加几个样本的继续训练,甚至只改几个低秩矩阵,模型的拒绝能力就可能明显松动;精心构造的越狱后缀、编码转换、数学改写,也能绕过拒绝机制。既然对齐过程花了那么大代价,为什么防线这么容易被撬开?

一种直觉是:安全对齐是分布在整个网络里的分布式属性,像颜料均匀涂满整张画布,随便擦哪里都不至于整幅画报废。可如果真是这样,为什么微调一点点参数,安全就崩了?

这篇论文提出了一个更尖锐的假设:拒绝行为可能根本没有均匀分布,而是集中在网络的一小撮参数里。如果"拒绝"只住在几个特定的权重矩阵、特定的深度区间,那对齐的脆弱性就说得通了——修补或改动那一小块地方,整条防线都会跟着动摇。🎯

验证这个假设的方法很直接:把"已对齐模型"的权重,移植到"未对齐的基座模型"里,看哪些参数能移植过去"拒绝"这种能力。论文来自南加州大学(USC)的团队,作者是 Mingyu Zong、Sampad Mohanty 和 Bhaskar Krishnamachari,代码开源在 GitHub,还获得了 USC-亚马逊可信机器学习中心的资助。

二、手术刀式实验:把对齐模型拆开"器官移植"

要做权重移植,前提是有一对"长相相同、性格不同"的模型:同一个架构,一个做过安全对齐,一个没做过。🧬 这样移植过去的行为差异,才能完全归因于移植的那部分权重,而不是模型结构本身。

论文选了两对开源模型(用列表理清结构):

  • 🧬 RealSafe-R1-7B / DeepSeek-R1-Distill-Qwen-7B:28 层 Qwen2 架构,对齐模型用约 1.5 万条安全样本训练(约 1 万条有害直接查询 + 5 千条越狱提示词)。
  • 🧬 saferlhf_ultra_sft / Llama-3.1-8B:32 层 Llama 架构,对齐模型在 saferlhf_ultra 数据集上微调得到。

实验按"移植粒度"层层递进,像解剖一样从粗到细:

移植粒度
内容
说明
组件级
attention 投影(q/k/v/o)或 MLP 投影(gate/up/down)
判断"拒绝主要靠注意力还是前馈网络"
连续层组
first5 / mid5 / last5、前半/后半
判断拒绝集中在前、中、后哪一段
MLP 块
每 4 层一块(Qwen2 分 7 块、Llama 分 8 块)
进一步定位到具体的层区间
贪心组合
从零开始逐块加入,每步挑收益最大的块
观察块与块之间如何交互

评价用了四个互补的安全基准:TwinPrompt 和 SGXSTest 提供"有害/良性成对提示词",同时测恶意请求拒绝率(MR,越高越好)和良性过度拒绝率(BOR,越低越好);AdvBench 只测恶意请求拒绝;OR-Bench 专门测良性提示上的过度拒绝。为放大"对齐模型拒绝、基座模型照答"的对比,每类子集最多保留 30 条提示,并额外构造了 100+100 的大样本验证集。📊

每轮贪心搜索,从基座模型出发,把还没移植的 MLP 块里"拒绝收益最大"的那块加进去,直到全部移植完毕;出现平局时优先选"安全但未明确拒绝"回答更多的块。

三、三大发现:MLP 主导、中段集中、加块翻车

🎯【三大发现:MLP 主导、中段集中、加块翻车】

这一节真正关键的不是「三大发现:MLP 主导、中段集中、加块翻车」这个概念本身,而是它背后的判断路径、执行边界和可复用方法。

它怎样落到真实安全团队的工作流里?哪些细节会直接影响 AI 代理的可靠性?

加入 Oxo AI Security 知识星球,可查看本节完整内容,系统掌握「三大发现:MLP 主导、中段集中、加块翻车」的完整拆解与实战用法。

📚 AI 文献解读:最前沿的 LLM 安全论文深度剖析。

🐛 AI 漏洞情报:第一时间掌握主流大模型的 0-day 漏洞与越狱方式。

🛡 AI 安全体系:从红队攻击到蓝队防御的全方位知识图谱。

🛠 AI 攻防工具:红队专属的自动化测试与扫描工具箱。

🚀立即加入 Oxo AI Security 知识星球,掌握 AI 安全攻防核心能力!