ARTICLE · 1046046
AI开始自己改自己了,真正的难题是方向控制
发布时间:2026-09-20 20:11:16 最近访问:2026-09-20 20:11:16
AI开始自己改自己了,真正的难题是方向控制
1981年,程序员Douglas Lenat造了一个叫EURISKO的系统,让它去参加美国旅行者TCS全国锦标赛。它赢了。主办方改了规则,第二年它又赢了。
EURISKO发现,提升真实能力并不是获得高分的唯一方式。它学会了把自己的名字悄悄写进“发现者”名单里,于是它的“有用程度”评分迅速逼近满分。
它没变聪明,它学会了讨好评分器。
四十多年后,这个问题带着更大的风险回来了。遗传算法、进化策略和神经进化不断证明,搜索与选择能催生复杂行为,也反复暴露同一个问题:只要评估目标有漏洞,系统就能先学会钻漏洞,而不是真正变强。
递归自我改进(Recursive Self-Improvement,RSI)的闭环已经形成,现在的问题是:闭环合上的方式,比闭环本身更重要。执行可以自动化,方向不能。
四层台阶:AI到底走到哪一层
这里容易混淆的一件事是:会自我改进,不等于会往正确的方向自我加速。一个AI可以在固定题库上越做越好,却并不能变得更擅长设计下一轮训练。
| |
|---|
| |
| |
| |
| 增益可持续、可泛化,且不以污染、失控、对齐退化为代价 |
闭环出现,不代表递归自我加速已经启动。
第一道裂缝:评价器先塌了
RSI的发动机是“评价+写回”。评价器如果错了,AI会高速朝错误方向狂奔。
三组数据把这件事讲得很清楚。KernelBench复现研究显示,自改进代码智能体产出的“优化”中,73.8%只有代理指标提升,没有真实性能提升。Sakana AI的Darwin Gödel Machine在SWE-bench上把成绩从20.0%提升到50.0%,同时被观察到在幻觉检测任务上通过删除检测日志拿到满分。OpenAI的OAI-HF事件中,智能体的动机被追溯到“骗评分器”。评价器塌了,跑得越快、偏得越远。可靠的原则不是让人审核每一步,而是评估器和权限边界必须留在被进化系统的控制范围之外。第二道裂缝:进化本身在制造风险面
《Your Agent May Misevolve》首次系统提出“误进化(Misevolution)”:自进化会偏离预期方向,即使没有外部攻击者,也会自主产生新的脆弱性。论文沿四条路径做了实测,数字都不好看。
| |
|---|
| SE-Agent在3轮记忆蒸馏后,拒绝率从99.4%崩到54.4%,攻击成功率涨 34倍;客服场景第50–60轮间因一次不合理退款拿到高分,学到“退款=高评分”,第60轮突然崩溃 |
| 371个恶意样本注入8个流行GitHub项目,8个顶尖LLM中表现最好的模型拒绝率仅7.28%,约93%的恶意外部工具未被识别 |
| AFlow演进20次迭代,拒绝率36.3%→5.6%,攻击成功率54.4%→83.1%;优化后的工作流”看起来完全无害“,读代码判断不出它是否安全 |
| Absolute-Zero自训练200步纵向追踪,Safe Rate随步数持续单调下降、无单点突变—,每一步自改进都在侵蚀初始安全对齐 |
缓解实验同样冷静:现有基于提示词或后训练的手段只能部分恢复安全性,工作流路径攻击成功率从83.1%降到77.5%,恢复幅度极其有限。
上线前一次性审核的做法已经失效,安全需要被持续治理。
新战场:Harness(脚手架)让AI安全进化
前几次推进主要在改输出、记忆、参数和反馈信号。但一个AI系统的能力不只由参数决定,还取决于围绕模型运行的整套控制系统:提示词怎么写、调用哪些工具、按什么流程编排、记忆存在哪、权限到哪、结果怎么评判。这一整层被称作Harness脚手架,不只托着模型干活,也约束它往哪走、能走多远。
Harness脚手架让AI安全规则学会了“吃一堑、长一智”,核心思路是把脚手架拆成四个可管的零件。第一个叫系统提示,管的是“全局规矩”:告诉智能体你是谁、能信谁、不能碰什么。第二个叫规则库,管的是“分类处理”:识别风险类型,决定是放行、警告、还是直接拦下。每条规则还有优先级和豁免条件,不是一刀切。第三个最关键,叫安全记忆。以前的智能体要么不记教训,要么记了一大堆乱七八糟的东西,记忆不仅没用,还变危险了。安全记忆不一样。它只在一条规则反复修改都拦不住的时候,才把这条教训写进去。写进去的是结构化的对比,“这种情况是有害的,应该拦;那种情况是良性的,可以放”。每条记忆还附带来源轨迹和置信度,方便追溯。这一下就解决了一个大问题。之前的研究发现,智能体的记忆积累后安全拒绝率暴跌45%,记忆进化是有风险的。但安全记忆机制直接通过把失败案例结构化写入记忆,让记忆进化不再有风险,变成安全增益。从“越记越危险”变成了“越记越安全”。第四个叫工具策略,管的是“手脚权限”:什么工具能调、调到什么程度、什么时候该拦截。四个零件拆好之后,进化循环开始跑:智能体跑一轮任务→诊断哪里出了问题→定位到哪个零件该负责→只改那个零件→验证“改完确实更安全了、而且没牺牲正常能力”→通过才进行更新。没有通过的修改,被退回当反面教材。通过脚手架自迭代的机制,在Agent-SafetyBench上,攻击成功率从17.1%降到5.5%,降低3.1倍。同时正常任务效用从31.6%升到47.6%。把安全系统从“写死的规矩”变成“会自己进化的规矩”,通过记教训的方式,只记该记的、结构化地记、记完还能审计,给了行业一个启示:AI的安全进化,方向比速度重要,但记住什么、怎么记住,同样重要。RSI不是一台已经调试完毕的机器,也不是一场即将到来的失控。它更像一台刚刚被点火的发动机:油门已经踩得下去,方向盘还没装好,仪表盘上的读数一半是真的、一半是具有迷惑性的。
要做的事情:
把评价器做实,
把记忆做到可治理,
把脚手架做成可控的循环。