ARTICLE · 1144760
AI给出的安全命题
AI给出的安全命题
10 月 8 日,AI 行业发生一组极具对照意义的事件:
OpenAI 面向全球全部免费与付费用户上线 GPT-6,替换 GPT-5.6 SOL/LUNA。配套发布的系统卡显示:GPT-6 在网络安全、生化领域达到 “高能力”,但尚未达到 AI 自我改进的高风险阈值。值得关注的是,OpenAI 主动披露安全指标劣化:GPT-6 Sol 自我伤害相关指标统计学显著回退;GPT-6 Luna 在自我伤害、血腥、性内容三类指标同步显著回退。
同一天,Anthropic 正式开放 Cyber Verification Program,对 Claude 旗舰模型做能力分层管控:
- Defense Access:面向安全团队、高校、关键基础设施运营方,支持恶意代码逆向、漏洞分析;
- Red Team Access:机构级授权渗透测试,但自动拦截勒索软件、物理设施破坏;
- Specialized Access:可测试电网、飞控、银行转账等高风险场景,申请者需 Anthropic 与美国政府联合审核。
一个把强能力推向 12 亿大众用户,同时公开承认模型安全短板;另一个把最强模型能力按场景切割、对高风险访问设置联合准入。看似方向相反,底层共识高度一致:仅靠模型自身对齐,已经守不住智能体的安全边界。安全必须由模型以外的机制来落地。
过去行业习惯把安全寄托在模型内置护栏上。但 GPT-6 的系统卡证明:模型迭代可能伴随安全指标回退,对齐效果不稳定。未来智能体的安全资产,不再是一句 “模型安全” 的宣传语,而是可展示、可核验、可审计的安全设计体系。
对国内智能体团队而言,AI 安全正在从模型层调优,转向一套包含权限、审计、风险披露、动作熔断的完整治理架构。