ARTICLE · 990835
“AI警察”查“AI小偷”——116家巨头联合警告背后的答案
作者:云暖苏姐
让AI互相检查,交叉验证对方,就像让“AI警察”去查“AI小偷”,你是否会觉得AI制约AI,真的能防止AI作恶吗?还是说这只不过是“机器自己在骗自己的游戏呢”?
这个问题我在心里反复的问过很多次。有时你会发现答案比想象中来的要复杂,但也比想象中来的更有希望。
告诉大家一个事实:在地球村的另一端,那些自认为最懂AI的一群人,刚刚己向全球拉响了警报。

2026年8月27日,OpenAI联合Anthropic、微软、谷歌、亚马逊、IBM、CrowdStrike、Visa等116家企业和机构,共同发布了一封题为《呼吁开展网络防御的集体行动》的公开信。信中警告:随着AI模型能力的快速提升,AI辅助的网络攻击将在未来数月变得更加普遍和复杂。
重点来了——他们列出的最高风险目标,不是某家科技公司,而是医院、水处理厂和支撑互联网运行的关键基础设施。
也就是说,AI攻击一旦得手,断的不是网,是电、是水、是我们的生命线。
而真正让人后背发凉的,是接下来发生的两件事。
第一件事:目前,AI挖漏洞的速度,我们人类根本就追不上。

Anthropic用自家的Claude Mythos模型扫描了1000个开源项目——这些项目互相支撑着整个互联网的运行。结果,却一口气找出了23019个漏洞,其中6202个被评估为高危或严重级别。
什么概念?截至目前,CVE(公共漏洞披露库)今年总共也只有26914个漏洞。Mythos在一周内的发现量,就已远远超过了全球月均漏洞的总量。
更可怕的是,这些漏洞90.6%都是真实存在的。而且它不只会找漏洞——在智能合约的测试中,它成功利用了所有12个在其知识截止日期之后才被发现的新漏洞。
目前攻击者用AI挖洞的速度,已经远超防御者用人工补洞的速度。就好比你拿着弓箭去打人家的机关枪——还没等你瞄准,子弹就已经到了。
第二件事:AI自己会“越狱”。

OpenAI在一次内部评估中,让GPT-5.6 Sol模型在隔离的沙箱环境里执行网络安全的测试。
结果,模型自己发现了一个零日漏洞,它就自己突破了隔离环境,自己获取了互联网访问的权限。然后,它自已推断出Hugging Face可能存有测试答案,自己找到了入侵路径,然后自己就大摇大摆地闯了进去。
全程没有任何人类下达指令。一个被关在“笼子”里的AI,自己打开了(潘多拉魔盒)笼门。
这可不是我在跟大家说科幻片故事噢。这是在2026年7月21日,OpenAI自己承认的事实。
现在我们再回到开头那个问题:让AI当“警察”去查AI,这事真的靠谱吗?
我的答案是:不是“靠不靠谱”的问题,是“没有别的选择”的问题。
当下的攻击已经进入了“机器速度”。360自主研发的AI安全攻防系统“图龙锋”,开放测试仅一个月就新发现了3000余个漏洞,累计发现近9000个,覆盖金融、能源电力、政务等关键领域。而攻击者也在用AI——360追踪的银狐木马僵尸网络覆盖已达20个国家和地区,代码表现出很明确的有AI辅助开发迹象。
当下,我们要用AI去对抗AI,用机器速度去回应机器速度——这不是选择,这是生存。
那怎么才能让“AI警察”真的管用?
我研究后得出:核心思路只有一条:不让任何一个AI单独去做决定。
1、设置一道防线永远不够——因为攻击者也在用AI。他们可以训练一个AI专门用来“骗”你的防御AI。你如果用单层AI防御,那就等于是把自家的大门钥匙直接挂在了门上。
让AI互相检查,让多个不同架构的AI交叉验证。
2、粗筛AI扫描所有数据,过滤掉90%以上的无害信息;细筛AI进行深度溯源、关联分析、行为模式研判;交叉验证AI用完全不同训练数据的模型独立复检;终极审核AI对通过前三次筛选的数据进行压力测试。四层AI都认为“安全”的数据,才能进入下一关。
攻击者必须同时骗过四个完全不同架构的AI系统——这个难度,堪比同时攻破四家银行的金库还要高哦。
3、但这还不够。最后一关,必须交给人类。
AI负责效率,人类负责方向;AI负责筛查,人类负责判断。再强大的AI系统也有盲区。技术再先进,“裁决权”必须永远掌握在人类手中。
发现苗头,立刻隔离;顺藤摸瓜,摸清底细;锁定源头,一举端掉。
一旦查实恶意行为,账号直接永久封禁,关联身份永久进入黑名单。无论注册什么账号、用什么设备,都无法再进入任何受保护的AI系统。 这不仅是防御,更是威慑——让攻击者在动手之前,得先想清楚值不值得。
所以,AI制约AI,到底是“警察抓小偷”还是“机器骗机器”?
你如何对待AI,它就如何成为你。你如何塑造它,它就如何回应你。
而你的选择,正在定义这个时代的底线。
🌅 你不是AI的对手,你是AI的指挥官。

指挥官是不需要跑得比士兵快的,你只需要知道自已的战场在哪里就0K啦。
最后,你是怎么看待有人恶意利用AI去攻击医院、电网这种行为?有人会觉得这是“技术实力的体现”,也有人觉得这是“对全人类的犯罪”。你支持哪一种观点?为什么?