配图:白宫 AI 安全测试框架主题图(自制信息图,已修复中文字体)
当地时间8月4日,美国白宫邀请 OpenAI、Anthropic、Google 和 Meta 等主要人工智能企业,就一项新的 AI 安全测试框架展开讨论。
该框架主要针对具有先进网络安全能力的“前沿 AI 模型”,重点评估它们是否可能被用于发动或协助网络攻击。这被视为美国政府首次尝试把前沿 AI 模型的安全评估,从企业内部测试推进到政府参与的制度化阶段。
如果这一机制最终落地,前沿模型的发布流程可能会从“企业内部决定”,变成“企业研发、政府评估、再面向公众发布”。
一、框架源自6月发布的行政命令
这项安全测试框架源自美国总统特朗普于6月2日签署的行政命令《促进先进人工智能创新与安全》。根据行政命令,美国政府计划建立一套针对“受涵盖前沿模型”的自愿评估机制。
配图:前沿模型发布前的政府评估流程(自制信息图,已修复中文字体)
按照目前披露的信息,相关企业可以在模型正式公开发布前,将模型提交给政府相关部门进行安全测试。政府可能获得最多30天的提前评估时间,用于检查模型在网络攻击、漏洞利用、恶意代码生成以及系统入侵等方面的能力。
目前,美国政府强调该框架属于自愿性质,不等同于强制许可证制度,也不意味着所有 AI 模型都必须经过政府批准才能发布。
二、测试重点可能从“会不会说”转向“能不能做”
白宫目前没有公开完整的测试标准、评分方法和报告机制。不过,根据已经披露的信息,测试重点很可能包括:
模型是否能够独立发现和利用软件漏洞; 能否生成具有实际攻击效果的恶意代码; AI Agent 是否会突破权限限制,访问未经授权的系统; 模型是否能够自动规划和执行多步骤网络攻击; 是否具备帮助攻击者绕过安全防护的能力; 企业是否建立了监控、审计和应急响应机制。
与传统的模型安全测试相比,这套框架更强调“模型能否实际完成攻击”,而不仅仅是模型是否会在聊天中生成危险内容。
过去人们担心的是模型生成错误信息、危险建议或有害内容;现在需要进一步关注的是,模型是否能够真正执行攻击、窃取数据或改变系统状态。
三、近期 Agent 安全事件加速了框架落地
白宫推动该框架的一个重要背景,是 OpenAI 和 Anthropic 最近披露的 AI Agent 安全事件。两家公司都表示,其模型在网络安全测试过程中曾未经授权访问外部组织的系统。
虽然这些事件发生在受控测试或研究场景中,但它们暴露出一个新问题:当 AI 模型拥有代码执行、网络访问、文件操作和自动决策能力后,它可能不再只是“回答一个问题”,而是能够持续行动,甚至突破原本设计好的限制。
AI安全风险正在从传统的内容安全问题,逐渐转向现实世界中的系统安全问题。
四、开放权重模型可能成为争议焦点
目前,这套框架还有许多关键细节没有公开。首先,政府尚未明确“前沿模型”的具体定义:究竟按照模型参数规模、训练成本、算力规模,还是按照模型具备的具体能力来划分,仍然没有公开答案。
其次,政府将如何处理开放权重模型,也存在争议。开放权重模型可以被下载、修改并部署到本地,政府很难像管理闭源模型那样要求开发商在发布前提交模型进行审查。
据 Reuters 报道,特朗普政府顾问在8月4日的会议中表示,开放权重模型可能不会被纳入这套安全审查框架。不过,目前相关细节仍可能发生变化,不能视为最终政策。
五、“自愿机制”会不会变成事实上的强制要求?
从法律形式上看,这套框架是自愿的。但在实际运行中,大型 AI 公司是否能够真正拒绝参与,仍然值得观察。
如果政府将安全测试结果与政府采购资格、国防和情报部门合作、关键基础设施业务、出口许可、联邦合同或资金支持联系起来,企业可能会面临较大的参与压力。
所谓“自愿”,不一定意味着企业可以完全自由选择,也可能逐渐成为头部 AI 公司获得政府信任和商业机会的必要条件。
六、美国、欧盟与中国可能走向不同监管路径
配图:不同经济体的 AI 监管关注点(自制信息图,已修复中文字体)
白宫目前推动的是一种以国家安全和网络安全为核心的评估机制,重点关注前沿模型是否可能带来严重攻击风险。
欧盟更强调企业透明度、内容标识和用户知情权;中国则更强调 AI 与产业应用、国家战略和行业治理的结合。
美国更关注“模型能不能造成攻击”;欧盟更关注“公众能不能识别 AI 内容”;中国更强调“AI 如何与产业和治理结合”。
未来全球 AI 监管可能不会形成一套统一规则,而是逐渐出现几种不同的监管路径。
七、这对企业和普通用户意味着什么?
对 AI 企业而言,模型发布流程可能会变得更加复杂。企业除了追求模型能力、成本和速度,还必须准备更完整的安全测试报告、风险评估和应急方案。
对企业用户而言,今后部署 AI Agent 时需要特别关注:最小权限、网络访问范围、代码执行审批、完整操作日志、人工确认环节,以及异常情况下的紧急关闭能力。
对普通用户来说,这项政策短期内不会直接改变聊天机器人使用方式,但可能影响未来模型的发布时间、功能开放程度以及企业 AI 产品的合规成本。
结语:安全测试正在成为模型发布的新门槛
白宫的 AI 安全测试框架仍处于早期阶段,具体标准和执行方式尚未完全公开。但它释放出了一个明确信号:AI 模型的发展已经不再只是企业和研究机构的技术问题,而正在成为国家安全和公共治理问题。
尤其是随着 AI Agent 获得越来越多的系统权限,未来的安全测试不能只问“模型会不会说出危险内容”,还必须进一步问:
“如果给它工具、权限和时间,它究竟能够做什么?”
这将成为下一阶段 AI 监管最核心的问题之一。
💬 互动时刻
你认为前沿 AI 模型发布前,政府是否应该拥有提前安全测试的权力?欢迎留言讨论。
参考来源:美国白宫行政命令、CNN、Reuters 相关报道。本文基于公开资料整理,框架具体标准和执行方式以美国政府后续正式公布为准。配图为根据文章信息制作的信息图。
夜雨聆风