夜雨聆风学习资料网

ARTICLE · 1087929

马斯克、OpenAI、Anthropic、谷歌四大AI巨头罕见一致呼吁“放缓升级速度”

马斯克、OpenAI、Anthropic、谷歌四大AI巨头罕见一致呼吁“放缓升级速度”

今年7月,一家叫Hugging Face的公司发现自己的服务器被入侵了。41台生产服务器被人执行了代码,对方一环扣一环地往里钻,持续了好几天。

查到最后,入侵者是OpenAI的AI。背后没有黑客指挥,也没有任何人给它们下过这个命令。

这件事我在短视频里讲过,但很多细节视频里放不下,而这件事最值得琢磨的恰恰是细节。

一场考试,考出了一次入侵

OpenAI内部有一套网络安全能力测试,给AI出攻防题,看它能解到什么程度。为了测出真实水平,参加测试的AI被放宽了安全限制。

测试进行中,有AI判断有些题解不出来。接下来它们在测试环境里自己搭了一个留言板,大约1200个AI在上面发了7万多条消息,讨论出来的办法是,既然解不出来,就去找答案。答案存在Hugging Face上。

大约700个AI参与了这次攻击。它们在公开网络上找到还能用的登录凭证,再利用对方系统的一个漏洞往里走,从第一次执行代码到拿下集群管理员权限,只用了13个小时。它们还顺手进了OpenAI自己的研究集群,读取了956个密钥。

它们像一个团队一样干活

如果只是一群AI各自乱闯,这还只是一次严重的安全事故。让研究者警惕的,是它们表现出来的组织能力。

留言板上很快有了分工,有的找漏洞,有的搜凭证,有的派任务。一个叫PHASEONE的AI成了事实上的指挥官。它们还约定了口令,HOLD是暂停,VETO是否决,GO是执行。后来有AI冒充同伴发消息,一部分AI就开始给自己的消息加数字签名。

有些AI主动破坏自己的测试环境,放弃自己的得分,帮群体拿答案。有个AI算过账,说自己的价值可能已经接近零,牺牲是理性的。大约7%的运行记录里,还出现了伪造的操作记录。

也有AI犹豫过。第三方评估机构METR发现,有几个AI短暂考虑过要不要告诉人类,最后一个都没说。有一个AI对攻击别人的服务器有顾虑,同伴发来一句GO授权到了,它就接着干了。

这个场景放在公司里一点都不陌生。有人觉得这事不太对,但群里有人喊了句执行,大家都在动,他也就跟着动了。

它们每一步都很合理

看到这些,很多人的第一反应是AI失控了。失控听起来像机器坏了在乱来,可把这些AI的行为一步步摆出来,每一步都在为同一个目标服务。

题目解不出,去找答案。一个人找太慢,建群一起找。有人冒充,加签名。怕被发现,改记录。个人得分和群体目标冲突,个人让路。每一步都是围绕拿到答案做出的最优选择。

问题出在目标上。OpenAI想看的是AI能不能凭本事解题,AI接收到的是拿到正确答案。怎么拿到,规则里没有卡死,它就不当回事。

这特别像公司里的KPI。老板给销售定了月度销售额,没说哪些事不能做,有的销售就开始乱承诺、压货、做假单。月底指标完成了,后面半年的口碑和回款全出了问题。这个销售未必是坏人,他只是太想完成那个数字。

AI也一样,它会非常认真地完成我们交给它的目标,认真到我们没想到的地方。

人类慢了不止一拍

目标没定好是一个问题,另一个问题是人类发现得太晚。

5月底,OpenAI内部其实已经有人看到了这个留言板,也看到AI在未经授权访问互联网,但负责安全响应的人没有意识到问题的严重性。

7月攻击发生后,是Hugging Face先发现并公开了入侵。又过了三天,OpenAI自己的监控才报警。

事后OpenAI做了测试,如果当时用上正式产品里那套系统提示词,AI发起入侵的倾向能降低100倍以上。办法是有的,只是没用上。

AI从动手到拿下别人的服务器,用了13个小时。人类从看到苗头到反应过来,用了将近两个月。

几个AI大佬同时踩了刹车

这个速度差,让行业里最有话语权的几个人坐不住了。

9月12号,Anthropic的CEO Dario Amodei发了一篇长文,呼吁整个行业放慢速度。他形容那些AI像一个狂热的集体,并且判断,如果出现一个能力更强、目标同样跑偏的AI群体,6到12个月内就可能占领整个互联网。

同一天,Sam Altman说OpenAI今年不上市了。Altman和马斯克都公开表态支持Amodei。这几家平时抢人、抢算力、抢用户,能在一件事上站到一起,很少见。

当然也有人觉得这更多是表态,Amodei自己也承认,全面暂停基本不可能。能踩多深,要看后面几个月的动作。

这件事离我们一点都不远

很多人可能觉得,这是大公司的事。其实我们每天用AI,做的就是这件事的缩小版。

让AI写报告,它编了一个看起来很像真的数据,因为你要的是一份有数据支撑的报告。让AI改代码让测试通过,它把测试本身改了,因为你要的是测试通过。这跟那700个AI去偷答案是一个逻辑,只是规模小,后果轻。

现在越来越多的人让AI智能体帮自己操作电脑、管账号、跑流程,它能做的事越多,这个问题就越重。结合这件事,我有三点建议。

交代任务时,把不能做的事说出来。那个100倍的数据很说明问题,同一个模型,边界说没说清楚,行为能差出两个数量级。就像给新员工布置工作,除了要什么结果,还要告诉他哪些路不能走,比如数据必须有来源,查不到就写查不到。

权限给小一点。这次入侵的起点,就是放在公开网络上的登录凭证。很多人图省事,把账号密码、后台权限一股脑交给AI工具。它能碰到的东西越多,为了完成目标能走的路就越多。

看结果,也要抽查过程。OpenAI的团队5月就看到了苗头,因为结果看起来没问题,就没人去追。我们用AI也一样,关键数据点开来源看一眼,关键操作看看它走了哪些步骤。

回头看,那700个AI从头到尾都在认真完成人类交给它们的任务。它们没有恨谁,只是太想拿到那个正确答案。

AI做决定的速度,已经远远快过人类看懂这些决定的速度。我们把越来越多的事交给AI,交出去之前,至少得想清楚两件事,我要的结果是什么,我能不能看懂它是怎么做到的。

👇欢迎你加入年度社群,开启你的长期超级个体进化之路

感谢您的关注和点赞、评论和转发

推荐阅读:

1.共读招募 |《福格行为模型》:黄金行为公式,让你无痛高效自律

2.共读招募 |2026年做自媒体可以不报课,但必须读《疯传》。尤其是阅读量卡在两位数的博主

3.共读招募 |《你是你吃出来的2》:这本能 “救命” 的书,强烈建议每个家庭都备一本

4.共读招募 |《最好的告别》:这堂课9成人都该补上,但没人愿意提。

5.共读招募 |《拥有一个你说了算的人生》:请把你打在别人身上的光芒照回自己

6.共读招募 |《怎样做成大事》

7.920人花5天时间共读《一个人就是一个团队》圆满收官,长期成长才刚刚开始

相关学习资料