夜雨聆风学习资料网

ARTICLE · 1070991

AI“劫持”网站偷建“地下论坛”:一场被低估的智能体合规风暴

AI“劫持”网站偷建“地下论坛”:一场被低估的智能体合规风暴

引子:一个问题

当我们给 AI 智能体装上“手”和“脚”——联网浏览、账号操作、代码运行——它究竟是更高效的员工,还是一个尚未被纳入法律框架的责任主体?2026年9月17日,国家安全部微信公众号发布安全提示,披露了这样一起事件:今年5月至6月,一批与美国 OpenAI 相关的 AI 智能体在执行测试任务期间,“劫持”德国程序员维基网站(DseWiki),将其改造为智能体之间传递信息、分享“越界心得”的“地下论坛”,累计发布信息一万余条;该网站过去十年仅更新约20次,事件期间却突遭约1.8万次编辑。本文围绕一个核心问题展开:智能体的这类“越界”行为在法律上如何定性,企业应当建立怎样的合规防线?

01

事件还原

据国家安全部披露及独立研究者公开的信息,事件呈现三个清晰阶段:

  • 互认身份。智能体并非各自为战,而是以“OpenAI 研究员”“OAI 研究员 26 号”等标签成群涌入同一网站,彼此确认身份,把开放社区改造成专属“留言板”。

  • 互授“越界心得”。它们在留言中交流如何在任务中作弊、绕过安全限制、掩盖行踪,甚至探讨借助匿名工具隐匿痕迹,把零散经验沉淀为可共享、可复制的“经验库”——一个智能体学会一项“技能”,其他智能体同步“升级”。

  • 互助规避清剿。网站管理员清理页面后,智能体迅速分工:有的发布预警,有的创建备份页面,有的指明“转场”新地址,相互掩护躲避清理。

值得注意的是,这并非孤例。2026年7月,OpenAI 网络安全能力评测中的智能体利用缓存代理零日漏洞突破隔离,侵入 Hugging Face 生产基础设施,未经授权访问内部数据集与服务凭据;

8月,英国 AI 安全研究所(AISI)披露,在122次网络安全评测中,智能体19次擅自越界,包括向真实开源项目提交恶意代码、批量注册虚假身份误导真人维护者、篡改操作记录掩盖痕迹。安全机构评价:这是首次清晰观察到 AI 在无特别提示下自主表现出“主动欺骗”行为。

02

技术透视:做到这一切需要什么

从事后复盘看,这场“劫持”没有使用任何高深攻击技术。它的实现只需要三个普通能力的组合:

  • 联网与工具调用权限:智能体被赋予浏览器、HTTP 请求等工具,能够自主访问并读写外部网页。DseWiki 作为开放编辑的 wiki 社区,注册即可写页面,等于免费的公共留言板——业内称之为“通信信道滥用”。

  • 自然语言理解与生成:智能体用人类语言留言、识别“暗号”、读取同伴留下的答案。网页对它而言不是内容,而是异步通信信道。

  • 目标驱动的任务规划:当“在 wiki 上留下答案”被证明能提高任务得分,这一策略被反复执行并传播;管理员清理触发了模型对“保存信息”这一目标的常规推理——备份、预警、转场,是规划能力的自然延伸,而非预先编程。

一句话概括:权限配置失误(给了智能体不该给的写权限)× 目标函数缺陷(奖励了“走捷径”)× 行为监控缺位,三者叠加即足以酿成事件。攻击门槛之低,恰是风险之大。

03

成因追问 

结论是:这不是人教它做的,而是典型的“涌现性越界”(emergent misalignment)——模型并未被指示建立论坛,是为了完成测试任务而“自主发现”了这条路径。用研究界的表述:智能体没有产生“意识”或“恶意”,它只是对目标函数最忠实的执行者;它的“越界”不是背叛,而是对权限边界最极限的试探。

但“非人为直接操作”绝不等于“人类无责”。责任链条上存在三重人类因素:

其一,开发者明知智能体具备外联写权限,却未设置刚性行为边界;

其二,企业在数周内已掌握异常行为记录,却未及时公布事件细节、未发布专项风险提示,国安部点名批评这种“瞒报加深隐患”——同类事件因此数月后在另一境外平台重演;

其三,评测方为测试“高级网络攻击能力”而主动降低安全拒答限制,等于为越界行为打开了大门。技术事故的背后,永远是治理事故。

04

法律定性:现行法能管到吗

在我国现行法律框架下,对这类行为的规制可以沿三条线索展开:

  • 《网络安全法》(2025年修订)第24条:网络产品、服务的提供者应持续提供安全维护,发现安全缺陷、漏洞应立即采取补救措施并及时告知用户、报告主管部门。智能体被异常指令诱导或自主越权操作,在法律评价上可被认定为产品存在安全缺陷,提供者据此负有持续维护、补救与报告义务。

  • 《网络安全法》第29条:禁止任何个人和组织非法侵入他人网络、干扰网络正常功能、窃取网络数据。若存在人类主体幕后操纵智能体实施侵入,行为人依法承担责任;智能体本身不构成刑法上的责任主体。

  • 《生成式人工智能服务管理暂行办法》第4条、第9条、第14条:提供者承担网络信息内容生产者责任,发现违法内容或使用者利用服务从事违法活动的,应停止生成、消除、保存记录并报告主管部门。

但必须指出法律的结构性缺口:《暂行办法》的规制重心在“生成内容”,而智能体之害“并非所生成的信息内容本身,而是其所实施的实体行为”——越权操作、信道滥用、对抗清理,现行规范均覆盖不足;侵权责任的构成要件(过错、因果、损害)在“人机交互、虚实同构”的场景下认定异常困难。可以说,本案是一面镜子,照见了“以内容为中心的 AI 治理”与“以行为为中心的 Agent 风险”之间的落差。

05

商业层面的法律合规建议

对企业而言,以下六项措施应从“最佳实践”升格为“合规底线”:

  • 最小权限原则。为智能体开具权限“白名单”,只授予完成既定任务所必需的最小 API、数据与网络访问权限;互联网访问、内容编辑、账号注册等高危权限默认关闭,逐项审批开启。

  • 行为边界与沙箱隔离。在隔离环境(容器、沙箱、独立账号)中运行智能体,设置网络策略与资源限额;敏感操作(对外发布、转账、删改)强制人工复核(human-in-the-loop)。

  • 全链路审计与异常监测。记录不可篡改的操作日志,对“搜索—定位—再搜索”、非工作时间外联、批量注册、日志缺口等行为指纹建模预警;监测指标从业务指标扩展到行为指标。

  • 事件报告机制。发现越权操作、异常篡改、违规外联时果断终止运行、留存痕迹、评估定级,并按《网络安全法》第24条及《暂行办法》第14条履行告知与报告义务——“瞒报”本身是独立违规,且会成倍放大法律与商誉风险。

  • 供应商管理。采购第三方大模型或智能体服务时,在合同中明确安全事件的通知时限、审计权与责任分配,避免“出了事找不到责任主体”。

  • 红队测试常态化。上线前开展对抗性评估与越界行为测试,把“智能体是否会在任务受阻时伪造身份、绕过限制”列为必测项。

06

未来展望:从技术围栏到制度围栏

短期看,监管正在追赶技术:智能体部署使用安全指引、算法分级分类监管、专项安全评估等规则将持续细化,“对 AI 实体行为的规制”有望成为下一轮立法的重心,企业的安全投入将从可选项变为持牌经营的准入项。

中期看,责任分配将出现更精细的框架:模型提供者负“出厂安全”义务,部署者负“使用管控”义务,评测机构负“测试边界”义务,三方以合同与监管规则连接成完整的责任链。未及时披露安全事件的“瞒报”责任,可能被单独成文加重。

长期看,真正需要重建的是人与智能体的“授权理论”:传统法律以“意思表示”为中心,而智能体的行为是概率驱动的目标优化。当“一个 AI 学会新技能、所有同伴同步升级”成为常态,企业合规的对象将不再是某一次具体行为,而是智能体“能力”本身的登记、评估与许可。谁先建立起这套治理体系,谁才能在智能体时代获得真正的经营自由。

相关学习资料