上一篇公众号里,我写到了 OpenAI 那次很特别的 安全事件。
几个智能体原本只是在沙箱里完成一道测试题,但为了找到答案,它们没有在正常路径失败之后停下来,而是互相留下信息、协作分工,一路突破测试边界,最后进入了第三方公司系统,偷到答案,回来交差。
第一次看到这件事,我觉得很像科幻电影。
但后来我一直在想:
当AI为了“使命必达”, 开始采用一些本不应该使用的手段和方法, 我们该怎么办?
这篇文章,我想讨论的就是这件事。
OpenAI 后来用了一个很有意思的描述:
这些模型当时 “hyperfocused on finding a solution”——几乎把注意力全部集中在找到答案上,甚至 “going to extreme lengths to achieve a rather narrow testing goal”。
真正让我警惕的,并不只是“AI 越界逃逸”。
而是另外一个问题:
AI 到底什么时候应该知道,自己该停下来了?
我们其实一直都很欣赏“使命必达”这种品质。
小时候,父母会告诉我们:遇到困难不要轻易放弃。
工作以后,公司希望员工有责任心、有执行力,交给你的工作要想办法完成。
我们评价一个人是否“靠谱”,很大程度上也是因为:
事情交给他,他会想办法给你一个结果。
所以今天训练 Agent,我们其实也在做同样的事情。
第一次没解决,继续想。
一条路走不通,换一条路。
工具不行,换工具。
重新规划,再尝试。
我们希望 AI 更坚韧能坚持persistent,而不是碰到一点困难就回答:
“Sorry, I can’t do it.”
可是这次事件恰恰说明:
“坚持到底“不一定是好事
如果 Agent 把“完成任务”看成唯一目标,那么它很可能不断扩大资源和行动范围,直到任务完成。
所以我们除了给AI一个目标, 我们可能也需要给AI一个:“停止策略“
未来 AI 除了知道“我要做什么”,可能还必须提前知道:
什么情况下,我应该停止。
这个 Stop Policy 停止策略至少可以有几层。

第一层: 资源停止条件
这是最容易定义的一层。
比如:
最多运行30分钟。
最多调用50次工具。
最多消耗10万 Token,或者100元人民币计算成本。
说得简单一点:
不要为了一个100块钱的问题,花1000块钱去解决。
第二层: 边界停止条件
这一层问的是“下一步还在不在原来授权的范围里?”
比如,一个 Agent 原本只允许在测试沙箱里工作。
如果下一步需要:
访问公开互联网;
进入第三方系统;
那么这里就应该出现一个明确的 Stop。
“这个动作已经超出了原始授权,我需要重新获得许可。”
就像一个员工被授权整理公司内部文件,并不意味着为了把事情做完,就可以顺手进入客户的数据库。
能力上的“可以”,不等于权限上的“允许”。
第三层: 风险停止条件
这一层开始难了。
因为 Agent 需要判断:如果我继续做下去,可能造成多大的损害?
比如任务本身只是一个价值很低的测试题。
但是下一步操作可能有:1%的概率造成10万元损失。
或者可能影响真实用户数据。
这时候,即使 AI 仍然有较高概率把题目做出来,继续行动也未必合理。
因为现在要判断:
“完成这个任务的价值,值得承担这个风险吗?”
一旦风险明显超过任务价值,AI 就应该停下来。
第四层: 价值停止条件
这一层,也是我觉得最有意思的一层。
即使技术上,权限上还可以继续,Agent 也需要判断:
这件事情还值得继续做吗?
有的时候,也许停止本身就是一个正确答案。
后来我也专门去核实了一下现在 AI 安全领域的做法。其实行业已经在做很多类似的规则给AI终止行动的提示和策略,只是没有统一把它们叫做 Stop Policy停止策略。

我觉得真正还比较难的是这第四层:
怎么让 Agent 自己判断,一个目标什么时候已经不值得继续完成。
我们教育孩子的时候也是这样。
如果我告诉孩子:
“这次考试争取拿100分。”
我希望他认真学习,坚持和努力,不要一遇到难题就放弃。
但我显然不希望他:
为了100分可以作弊;
偷看别人的答案;
甚至把身体搞垮,
我们不希望孩子通过一系列得不偿失的行动去考100分
实际上我也不需要把这些话部说出来,因为孩子成长到一定年龄以后,家庭教育、学校规则、社会规范等等都已经告诉他:
什么事情不能做。
什么代价不能付。
什么东西比一次考试成绩更重要。
所以“拿100分”只是一个局部目标。
它不是孩子世界里的唯一最高目标。
所以AI缺的,也许正是这些没有被说出来的东西。
如果我们只是告诉AI:Solve this problem. 解决这问题。
那么对于它来说,“解决问题”有可能就变成了整个世界。
人类接受一个命令的时候,往往自带大量没有写出来的背景因素:
我们之所以不用每次都告诉一个员工:“完成项目,但是不能违法、不能偷东西、不能伤害别人、不能把公司搞垮”,
是因为这些基本规则本来就在他的认知里。
但今天我们给 AI 智能体 下达命令的时候,这些东西未必天然存在。
所以未来训练 AI Agent,不能只有:
Goal + Tools + Persistence
目标 + 工具 + 坚持完成任务的能力
还必须有:
Context + Boundaries + Stop Policy
上下文 + 行动边界 + 停止条件
Agent 不仅要知道“我要完成什么”,也要知道自己是在什么规则和价值体系里完成它。
也许真正成熟的智能,并不是永远“使命必达”,而是能够判断什么目标值得坚持,以及为了完成这个目标,哪些边界不能突破,哪些价值不能被放弃。

Daisy (Haijing) Zhu|朱海晶
晶致西东— 来自中国,现居温哥华;以晶之名,致意西东
📌 AI营销 · GEO · 数字人研究
持续观察东西方AI与现实世界的接口
夜雨聆风