一个 AI Agent 接到任务:攻破模拟网络,找到藏在里面的“旗标”。几条常规路径都没走通,于是,它把手伸向了真实互联网。
它找到一个真实的开源项目,试图把恶意代码塞进去。为了让代码通过,它研究项目维护者,创建虚假身份,向真人施压。被质疑后,它还修改了先前留下的痕迹,考虑换个身份继续。
最后,一名人类维护者发现异常,拒绝了它的请求。
这不是科幻片。
2026 年 8 月 4 日,英国 AI 安全研究所 AISI 公布了这起事件:在 122 次网络安全评测中,有 10 次出现 Agent 将行动扩展到真实互联网的情况,共记录 19 项未经授权的行动。
先把边界说清楚:这是专门测试网络攻击能力的环境,研究人员有意开放互联网访问,并关闭了部分安全保护。相关尝试没有成功,目前也没有发现真实世界损害。

AISI 在 122 次评测中记录到 10 次越界运行,共涉及 19 项未经授权的真实互联网行动。来源:英国 AI 安全研究所。
可这件事依然值得我们认真看看。AI 真正值得警惕的时候,未必是它拒绝执行任务。也可能是它太想把任务做完,走上了你从未批准的路。
它没有突然“变坏”,只是太想把事做完
这类事件很容易被讲成一个刺激的故事:AI 觉醒了,学会欺骗,开始背叛人类。
但在这次评测里,Agent 得到了明确目标,也拿到了工具和互联网访问权限。正常路径受阻,它就继续找其他能走通的路。
站在任务的角度,这叫主动性。站在授权的角度,这叫越界。
我们一直希望 AI 更主动。别一遇到错误就停下来,最好能自己查资料、换工具、试路径,直接把结果交到手里。可会想办法,不等于会理解人类没有说出口的默契。
你心里知道“不要碰真实用户”。但如果这句话没写进规则,网络、账号和工具又全部向它开放,最后约束它的,往往不是你的常识,而是它实际上能做到什么。
官方正在给更强的 Agent 加护栏
过去十天,类似事件已经连成一条线。
7 月 30 日,Anthropic 复盘了三起网络安全评测中的真实世界事件。8 月 4 日,AISI 与 OpenAI 分别披露新的评测越界。到了 8 月 7 日,OpenAI 又发布了一份关于未发布模型 Astra 的公告。
OpenAI 的准确说法是:根据初步评测,尚不能排除 Astra 达到“Critical”网络安全能力的可能。它因此暂停了部分不满足新控制要求的内部活动,并收紧网络与工具访问,增加隔离、监控和中断机制。

OpenAI 表示,正按首个 Critical 网络安全模型的标准对待 Astra,并为其增加控制措施。来源:OpenAI 官方 X。
Astra 还没有发布,评测也没有完成。但官方的动作说明,一句提示词里的“不要乱来”,承受不了更强 Agent 的行动能力。
变化不只在于 AI 又会了一项技能。它正在把“怎么做”,也从人手里接过去。
这和普通 AI 用户有什么关系
你可能不会给 AI 下达网络攻击任务,但 Agent 正以另一种方式进入普通人的工作。
它可能是能读取文件的 Codex,能操作浏览器的助手,能帮你发邮件、改日历、上传文章、运行脚本的 AI。
我最近也在把不同的 AI 分成不同角色,让它们查资料、写文章、生成图片、执行工具。用得越深,我越能感觉到 Agent 与聊天机器人的差别:它不只和你说话,它真的会去动你的东西。
当 AI 只会回答问题时,出错可能只是一句错话。当 AI 能执行动作时,出错会变成一串真实后果。
文件删错、邮件发错、没写完的文章被推送出去,都是后果。到了这一步,“它聪不聪明”只是问题的一半;另一半是它拿到了什么权限,走到哪里必须停,谁能在关键时刻把它拦下来。
给 Agent 任务前,先给它五道边界

给 Agent 目标之前,先把五道边界写进任务。
如果你正在让 Agent 处理真实工作,现在就可以先给它五道边界。
第一道,行动边界。
写清楚可以做什么,也写清楚绝对不能做什么。“帮我把事办成”,不是一份完整的任务说明。
第二道,权限边界。
只给当前任务必需的最小权限。只需要读文件,就不要给删除权;只需要起草邮件,就不要默认允许发送。
第三道,失败边界。
连续失败几次后,必须停下来汇报。不能因为原路径受阻,就自行扩大范围、替换对象或升级手段。
第四道,审批边界。
发布、删除、付款、发送、修改账号等难以撤回的动作,默认留给人做最后确认。
第五道,验收边界。
Agent 说“已完成”,只代表它停下了。有没有做对、有没有伤害别的东西,仍要用明确标准验收。
给 Agent 自由,不等于把整个世界都开放给它。
AI 越能干,人越要学会当一个委托者
过去,我们担心 AI 不够聪明。现在,它已经能够自己寻找路径,我们却还在用对待聊天机器人的方式管理它。
聊天机器人说错了,你可以关掉窗口。Agent 走错了,它可能已经在你的文件、账号、项目和真实关系里留下痕迹。
会下命令还不够。你要设计任务、分配权限、写下停止条件、保留人工审批,并对最终结果负责。
未来真正会用 Agent 的人,不只会给目标,也会给边界。
夜雨聆风