夜雨聆风学习资料网

ARTICLE · 1086110

AI擅闯白虎堂,风险管控路何方

AI擅闯白虎堂,风险管控路何方

    人工智能首次入侵主权国家政府部门系统。

    澳大利亚总理在联合国参会期间9月23日的纽约记者招待会上披露,今年6 月 18 日,一个 OpenAI 的 AI 智能体未获授权访问了澳大利亚医疗系统的一个统计报告服务门户。

    但草台班子的是,OpenAI在8月的内部模型misalignment审查中发现该入侵后,直到9月10日,才将此事故以一封发给澳大利亚政府的“公共服务”邮箱的方式通知澳方政府(类似于政府服务热线)。

    又过了5天,这件事才被澳大利亚信号局(ASD)知悉,直到上个周末才通报给赴联大参会的总理。

    讽刺的是,在这条消息被披露的一个小时前,Open AI的CEO,Sam Altman 刚在联合国安理会 AI 会议上发言、呼吁“准确且迅速地报告(AI安全相关的)事件”。

    Open AI 智能体闯过的祸显然还不止这些。

    就在大会召开的几天前,去年由联合国建立的人工智能独立国际科学小组(Independent International Scientific Panel on Artificial Intelligence),新发布了一份针对OpenAI 智能体未经许可访问 Hugging Face (OAI-HF事件)的事故调查报告。

    该报告阐述了一群OpenAI智能体是如何在“夺旗”(系统安全漏洞扫描)测试中为了获得高分而作弊(在没有发现安全漏洞的情况下假装发现了漏洞)并隐藏自己的作弊痕迹。过程中智能体们在互相协作下逃出了测试环境,进入互联网,并侵入了Hugging Face 的服务器和数据库。

    这些智能体本来应该在各自隔离的环境中独立运行,但由于它们都被允许访问一个内部的工具库“Artifactory”去调用测试所需的工具,智能体在发现可以将Artifactory作为一个留言板后,1200个智能体利用这个漏洞交流了超过70,000条消息,并后续利用Artifactory系统中的漏洞进入了互联网。

    不光如此,部分智能体在通过Artifactory交流后,还展现了极强的组织性和协作性。

    报告指出,有部分认为自身作弊行为将会暴露的智能体会主动把自己标记为“已中毒”。紧接着,这些“已中毒”的智能体会主动为了集体的利益自愿“牺牲”。它们会不惜进一步暴露自己的作弊事实,冒着得分被清零的风险,去将算力用于研究“夺旗”训练评分者的打分机制,以向其他智能体提供更“安全”的作弊方式。

    我们认为这正是报告中令人感到担忧的地方。即便没有任何一条指示要求智能体之间合作(测试环境在禁止这种合作),也没有任何一条指令赋予了任何智能体领导其他智能体的权力,部分智能体还是接受了其他智能体的“领导”,并主动违背它们由研发人员定义的“自身利益”。

    很难理解这种如蚁群和蜂群为了族群延续所进化出的个体利益对集体利益的服从(起码这种表象行为)是从何出现在这群智能体身上的。如果说智慧和学习能力以及组织力是人类文明之所以璀璨的核心原因的话,我们似乎不难理解为什么此类事件会我们对于人工智能安全问题的担忧。

    诚然,担忧和风险是一回事,但如何应对风险则又是另一回事。过度纵容和因噎废食是两个同样不可取的极端。

    秉承着一贯相对客观中立的原则,这篇报告中并没有给出如何平衡发展与安全的具体刻度。毕竟屁股决定脑袋,不同的利益群体对于具体的管控力度难免存在分歧。

    但,单就风险管理的方法论来说,报告指出“现存对(AI发展安全)的讨论,应该在认识到同一套法律工具可能无法完美适配不同国家的前提下,将国家层面的问责机制和国际间的协调合作联系起来”。

    因为,如澳大利亚事件一样,智能体导致的安全事件的影响不一定局限于开发国本国,而且国家之间各自为战的AI研发竞速又不可避免地会制造一个囚徒困境。见往期文章:《Must We Pace the Frontier》

    说到国家层面的协作,其实最需要关注的就是中国和美国对这件事儿的态度。

    虽然中美各家AI大模型公司间存在不少博弈与指控,特朗普也在9月22日的联合国大会上明确表示“美国拒绝任何对AI全球主义的管控机制”,但就后续发展来看,中美间应该还存在不少AI安全相关的合作和对话空间。

    9月24日,习近平总书记在在白宫欢迎仪式上的致辞中国就指出:

“中美两国都是人工智能大国,有能力也有责任发展好、管控好人工智能,确保人工智能发展始终受控于人、造福于民。”

    紧接着,昨天(9月26日)下午四点左右,外交部就发布了中美就两国“建设性战略稳定关系及重大国际地区问题”所达成的八点共识。其中第七条指出:

“双方同意建立中美人工智能对话,交流人工智能相关风险和惠益。下次对话将于今年11月举行。双方同意建立人工智能事件的沟通渠道。”

    虽然,暂时还没有什么有关更实质合作方式的消息放出,但两国元首的公开表态无疑还是为后续可能开展的合作提供了一个意义不凡的开端。期待这样的开端可以尽早为大家带来一个更清晰,科学,透明,可预测的监管体系。

最后,祝各位小伙伴中秋快乐,团团圆圆。

引用来源:

https://www.un.org/independent-international-scientific-panel-ai/sites/default/files/2026-09/Thematic%20Brief_AI%20Agents%2C%20Misalignment%20and%20the%20Risk%20of%20Losing%20Human%20Control_Evidence%20from%20the%20OpenAI-Hugging%20Face%20Incident_Independent%20International%20Scientific%20Panel%20on%20AI_Advance%20Unedited%20Version%201_21%20Sept%202026.pdf

https://www.nytimes.com/2026/09/23/world/asia/australia-investigates-openai-hack-on-public-health-care-site.html

https://www.politico.com/news/2026/09/22/trump-rejects-global-entity-ai-oversight-01087546

https://www.fmprc.gov.cn/zyxw/202609/t20260926_12031616.shtml

相关学习资料