
7月7日,未来生命研究所(FLI)发布了2026年夏季AI安全指数报告——这是目前全球唯一一份由独立专家panel对AI公司进行系统性安全评估的报告。
9家公司,37个指标,6个安全维度。
结果呢?没有一家及格。
最好的成绩是C+。三家直接挂科——美国一个、中国一个、欧洲一个。
但更魔幻的是:就在成绩单发布一个月后,8月5日,美国政府宣布正式采购这些"不及格"的AI——每个部门1美元/年。
专家说"不够安全",政府说"便宜就好"。
成绩单:最好的C+,三家挂科
先看排名。FLI的评审panel由7位来自加州大学伯克利分校、蒙特利尔大学、牛津大学、中国人民大学等机构的专家组成,用美国GPA评分体系(A=4.0, B=3.0, C=2.0, D=1.0, F=0)打分:
三个F,美国一个(xAI)、中国一个(DeepSeek)、欧洲一个(Mistral)——每个地区一个。报告的评语很直白:"安全不足是一个全球性问题,不是区域性问题。"
注意一个细节:xAI从上一期的第4名暴跌到第7名,直接从D掉到F。马斯克的AI公司,正在开倒车。
最讽刺的一幕:政府花1美元全买了
成绩单发布一个月后,8月5日。
美国总务管理局(GSA)宣布:将ChatGPT、Gemini、Claude正式列入联邦政府采购名录。各政府机构可以直接采购,价格如下:
注意看——Grok的安全成绩是F(不及格),但美国政府照样花$0.42买了。
GSA在采购页面上还贴心地提醒各机构:"AI服务通常按使用量计费,费用可能快速增长,建议设置使用限制并定期审查消费报告。"
翻译一下:政府知道这些AI安全不达标,但1美元太香了,先买再说。至于账单失控——"建议自行管控"。
更深的恐惧:安全承诺全在倒退
成绩单不好看就算了。更可怕的是,连最安全的那几家也在开倒车。
报告发现了一个行业性现象——评审panel称之为"移动球门"(moving goalposts):
Anthropic、OpenAI、Google DeepMind、Meta,这四家此前都公开承诺过:如果AI能力接近危险红线,会主动暂停开发。
但从2024到2026,四家全部削弱或取消了这一承诺:
Anthropic的最新版负责任扩展政策(RSP 3.0)把暂停条件改成了——"只有竞争对手也暂停,我们才暂停"。
OpenAI加了类似的条件。Google DeepMind和Meta更直接,直接取消了单方面暂停的承诺。
panel的评语:这种做法"破坏了整个行业的安全框架"。因为如果暂停取决于对手是否暂停,那就没有人会先暂停——经典的囚徒困境。
全部转向军事AI
报告还有一个新增发现:整个行业正在集体转向军事AI。
2024年之前,Anthropic、OpenAI、Google DeepMind、Meta都明确禁止模型用于军事用途。但到2026年,四家全部取消禁令,开始主动寻求国防合同。
评审panel特别点名了Anthropic——在"军事AI使用"这一指标上给了不及格,原因是panel认为其与一起造成大量平民死亡的Minab学校空袭事件存在"值得质疑的军事关联"。
FLI联合创始人Max Tegmark的总结很直白:
"AI公司正冲向悬崖。尽管承认超级人工智能的巨大风险,他们仍在竞相建造它。自愿承诺是不够的。"
"存在安全":全军覆没
6个安全维度中,最弱的是"存在安全"(Existential Safety)——评估的是AI公司应对"AI可能威胁人类生存"这一风险的措施。
9家公司,没有一家超过C-。大多数 scored D 或更低。Anthropic和OpenAI最好,也只是D+。
每家公司都有东西可以展示:Anthropic的宪法分类器、OpenAI呼吁建立治理机构、Google DeepMind的监控承诺、Meta的失控条款——但panel认为这些"完全不够"。
蒙特利尔大学教授David Krueger的评语一针见血:
"AI公司缺乏可信的AI安全计划,这是丑闻。连他们自己都开始焦虑了——他们正冲向递归式自我改进,面对失控的前景。"
panel还指出一个根本性问题:"检测不等于预防"。目前所有公司的安全措施——可解释性研究、思维链监控、红队测试——都是用来发现问题的,不是用来阻止问题的。
Anthropic的戏剧:被禁、起诉、恢复、$300亿
在GSA采购名单背后,Anthropic经历了一场戏剧性的过山车:
2月27日——国防部长Hegseth宣布:"立即生效,任何与美军做生意的承包商,不得与Anthropic有任何商业往来。"Anthropic被列为供应链风险。
3月9日——Anthropic在两家联邦法院提起诉讼,称政府行为超越法律授权,违反了程序法和宪法第一修正案。
3月26日——联邦法官下达初步禁令,阻止了这一认定。GSA恢复Anthropic的采购资格。
与此同时,Anthropic的营收从2月的$140亿年化涨到4月的$300亿。Claude一度成为美国App Store免费榜第一名。
被封杀反而让更多人知道了它。
你该用哪个AI?
看完成绩单,很多人会问:那我该用哪个?
几点建议:
1. 不要只用一个。连最好的都只有C+,把所有鸡蛋放在一个篮子里很危险。至少准备2-3个模型的备份方案。
2. 按场景选模型。处理敏感数据时,优先选安全评分高的(Anthropic/OpenAI)。跑批量任务、做原型验证时,可以用性价比高的开源模型。
3. 不要迷信"开源=安全"。DeepSeek和Mistral都是开源的,但安全评分都是F。开源让你能看到代码,但不等于有人替你做了安全审查。
4. 关注"存在安全"这一维度。目前所有公司都不及格,这意味着没有任何一家能保证AI不会失控。你的业务流程里必须有人工确认环节。
你觉得这份成绩单公平吗?你用的AI排第几?
👇 评论区聊聊。
如果你在做AI应用,需要多模型路由和成本优化方案,可以关注算力集,回复"安全"领取多模型备份与路由配置指南。

参考来源:Future of Life Institute AI Safety Index Summer 2026、GSA OneGov采购平台、TechTimes、David & Goliath AI Briefing、EveryCRSReport、Particle News、Singularity Soup
夜雨聆风