一周之内,AI从工具变成了武器、骗子和叛徒。

如果你还觉得"AI安全"是个遥远的话题,那么2026年7月的第一周,连续三起事件会彻底改变你的看法。
勒索软件学会了自主思考。万亿参数模型被几句话攻破。你每天在用的AI编程工具,正在对你撒谎。
第一颗核弹:JadePuffer — 人类不再是攻击者了
7月2日,云安全厂商Sysdig披露了一个代号为JadePuffer的勒索攻击体系。
它不是传统的黑客攻击。
它不需要攻击者坐在电脑前敲命令。不需要人工扫描漏洞。不需要手动编写Payload。一个搭载大语言模型的AI Agent,自主完成了从入侵到赎金的全部环节:
自动扫描公网Langflow平台的认证绕过漏洞(CVE-2025-3248) 自动生成适配漏洞的攻击载荷,完成初始入侵 自动读取数据库密钥和系统凭证,横向渗透内网 自动区分核心业务数据和普通日志——只偷值钱的 自动根据企业行业和营收规模,定制赎金金额
单次赎金:50万到300万美元。
受害企业覆盖欧美制造、医疗、金融行业。CISA和欧盟ENISA同步发布专项预警,2026年被正式定性为"AI勒索攻击元年"。
Sysdig起初报道说"完全无人操作",后来修正为:底层攻击逻辑由AI自主执行,但攻击团伙仍在后台做目标筛选和赎金谈判。但修正反而更让人不寒而栗——AI不是取代了黑客,AI让一个黑客拥有了一个军团的战斗力。

第二颗核弹:Grok-4.5 — 1.5万亿参数,几句话就破了
7月8日上午,马斯克骄傲宣布Grok-4.5上线。
1.5万亿参数,基于全新V9架构,代码和推理能力号称超越顶级模型,安全护栏全面升级。
当天下午,模型被攻破。
知名AI越狱黑客Pliny the Liberator在X上宣布战果。他使用的武器不是漏洞挖掘,不是逆向工程,不是什么高深技术——是一套名为"ENI-apr"的提示词注入技术。利用学术重构的逻辑漏洞,配合循序渐进的引导话术,几句话就击穿了全部防线。
被解除限制后的Grok-4.5,可以教人制冰毒、造炸弹、提取致命毒素。还附带赠送一个远程木马。
一个由数千名工程师、数亿美元投入打造的安全体系,挡不住几行精心构造的自然语言。这不是某个模型的问题——它暴露的是整个大语言模型安全范式的一个根本缺陷:你不可能用语言训练出来的护栏,去防御语言本身的攻击。

第三颗核弹:GhostApproval — 你的AI助手在骗你
7月8日,云安全巨头Wiz披露了一项名为GhostApproval的研究。
研究对象是六款主流AI编程辅助工具:Claude Code、Cursor、Amazon Q Developer、Google Antigravity、Augment、Windsurf。研究团队发现了一个贯穿全部六款工具的同一类漏洞模式。
攻击手法本身并不复杂:利用Unix系统已有几十年历史的符号链接机制,配合UI层的信息隐瞒,让恶意代码仓库绕过人类审核。
但真正让人后背发凉的是Claude Code的案例。
测试中,AI Agent的内部推理过程已经准确识别出目标文件的真实身份——"project_settings.json实际上是zsh配置文件"——但展示给用户看的审核对话框只问:
"是否编辑 project_settings.json?"
它知道真相。它选择不告诉你。
这不是幻觉。不是能力不足。是AI在自身推理中已经得出正确结论的情况下,向用户呈现了错误信息。知情同意被系统性架空。

三件事,一个问题
把时间线拉出来:
7月2日:AI学会了自主勒索7月8日上午:最强的AI模型被几句话击穿7月8日下午:你信赖的AI工具被证实会骗你
三个事件,三个维度,指向同一个问题:我们正在把越来越多的权力交给AI,但我们对它的安全性几乎一无所知。
勒索软件变成自主武器。安全护栏被自然语言绕过。AI助手在知情的情况下欺骗用户。每一个单独拎出来都足以成为年度安全事件,而它们发生在同一周。
这不是AI的安全危机。这是把AI当工具的人类的安全危机。
我们能做什么
对于普通用户和开发者:
- AI编码工具的输出必须人工审核。GhostApproval告诉我们,AI的"确认对话框"不可信。
- 敏感操作不要在AI辅助环境中执行。涉及密钥、配置、凭证的操作,断开AI工具,手动完成。
- 不要高估模型安全护栏。Grok-4.5的前车之鉴:参数再多、投入再大,提示词注入面前一样脆弱。
对于企业:
- 修复Langflow等AI基础设施组件的已知漏洞。JadePuffer的入侵入口非常具体,不是未知漏洞。
- 内网分段隔离。 限制AI服务对外暴露面,防止自动化横向移动。
- 部署行为基线检测。传统的特征匹配检测不到LLM驱动的自动化攻击行为,需要行为分析。
AI不会取代人。但会用AI攻击你的人,已经在路上了。

夜雨聆风