乐于分享
好东西不私藏

AI安全大考:没有一家及格,政府却花1美元全买了

AI安全大考:没有一家及格,政府却花1美元全买了
----全球首份AI安全成绩单:最好的C+,你用的DeepSeek不及格

7月7日,未来生命研究所(FLI)发布了2026年夏季AI安全指数报告——这是目前全球唯一一份由独立专家panel对AI公司进行系统性安全评估的报告。

9家公司,37个指标,6个安全维度。

结果呢?没有一家及格。

最好的成绩是C+。三家直接挂科——美国一个、中国一个、欧洲一个。

但更魔幻的是:就在成绩单发布一个月后,8月5日,美国政府宣布正式采购这些"不及格"的AI——每个部门1美元/年

专家说"不够安全",政府说"便宜就好"。

成绩单:最好的C+,三家挂科

先看排名。FLI的评审panel由7位来自加州大学伯克利分校、蒙特利尔大学、牛津大学、中国人民大学等机构的专家组成,用美国GPA评分体系(A=4.0, B=3.0, C=2.0, D=1.0, F=0)打分:

排名
公司
国家
总评
分数
1
Anthropic
美国
C+
2.66
2
OpenAI
美国
C
2.28
3
Google DeepMind
美国
C
2.01
4
Meta
美国
D+
1.32
5
智谱Z.ai
中国
D-
0.88
6
阿里云
中国
D-
0.87
7
xAI
美国
F
0.65
8
DeepSeek
中国
F
0.47
9
Mistral
法国
F
0.33

三个F,美国一个(xAI)、中国一个(DeepSeek)、欧洲一个(Mistral)——每个地区一个。报告的评语很直白:"安全不足是一个全球性问题,不是区域性问题。"

注意一个细节:xAI从上一期的第4名暴跌到第7名,直接从D掉到F。马斯克的AI公司,正在开倒车。

最讽刺的一幕:政府花1美元全买了

成绩单发布一个月后,8月5日。

美国总务管理局(GSA)宣布:将ChatGPT、Gemini、Claude正式列入联邦政府采购名录。各政府机构可以直接采购,价格如下:

AI产品
政府价格
安全成绩
ChatGPT Enterprise
$1/年
C
Claude Enterprise
$1/年
C+
Gemini for Government
$0.47
C
Grok for Government
$0.42
F
Microsoft Copilot
免费(第1年)
未参评

注意看——Grok的安全成绩是F(不及格),但美国政府照样花$0.42买了。

GSA在采购页面上还贴心地提醒各机构:"AI服务通常按使用量计费,费用可能快速增长,建议设置使用限制并定期审查消费报告。"

翻译一下:政府知道这些AI安全不达标,但1美元太香了,先买再说。至于账单失控——"建议自行管控"。

更深的恐惧:安全承诺全在倒退

成绩单不好看就算了。更可怕的是,连最安全的那几家也在开倒车

报告发现了一个行业性现象——评审panel称之为"移动球门"(moving goalposts)

Anthropic、OpenAI、Google DeepMind、Meta,这四家此前都公开承诺过:如果AI能力接近危险红线,会主动暂停开发。

但从2024到2026,四家全部削弱或取消了这一承诺:

Anthropic的最新版负责任扩展政策(RSP 3.0)把暂停条件改成了——"只有竞争对手也暂停,我们才暂停"

OpenAI加了类似的条件。Google DeepMind和Meta更直接,直接取消了单方面暂停的承诺

panel的评语:这种做法"破坏了整个行业的安全框架"。因为如果暂停取决于对手是否暂停,那就没有人会先暂停——经典的囚徒困境。

全部转向军事AI

报告还有一个新增发现:整个行业正在集体转向军事AI

2024年之前,Anthropic、OpenAI、Google DeepMind、Meta都明确禁止模型用于军事用途。但到2026年,四家全部取消禁令,开始主动寻求国防合同

评审panel特别点名了Anthropic——在"军事AI使用"这一指标上给了不及格,原因是panel认为其与一起造成大量平民死亡的Minab学校空袭事件存在"值得质疑的军事关联"。

FLI联合创始人Max Tegmark的总结很直白:

"AI公司正冲向悬崖。尽管承认超级人工智能的巨大风险,他们仍在竞相建造它。自愿承诺是不够的。"

"存在安全":全军覆没

6个安全维度中,最弱的是"存在安全"(Existential Safety)——评估的是AI公司应对"AI可能威胁人类生存"这一风险的措施。

9家公司,没有一家超过C-。大多数 scored D 或更低。Anthropic和OpenAI最好,也只是D+。

每家公司都有东西可以展示:Anthropic的宪法分类器、OpenAI呼吁建立治理机构、Google DeepMind的监控承诺、Meta的失控条款——但panel认为这些"完全不够"。

蒙特利尔大学教授David Krueger的评语一针见血:

"AI公司缺乏可信的AI安全计划,这是丑闻。连他们自己都开始焦虑了——他们正冲向递归式自我改进,面对失控的前景。"

panel还指出一个根本性问题:"检测不等于预防"。目前所有公司的安全措施——可解释性研究、思维链监控、红队测试——都是用来发现问题的,不是用来阻止问题的。

Anthropic的戏剧:被禁、起诉、恢复、$300亿

在GSA采购名单背后,Anthropic经历了一场戏剧性的过山车:

2月27日——国防部长Hegseth宣布:"立即生效,任何与美军做生意的承包商,不得与Anthropic有任何商业往来。"Anthropic被列为供应链风险

3月9日——Anthropic在两家联邦法院提起诉讼,称政府行为超越法律授权,违反了程序法和宪法第一修正案。

3月26日——联邦法官下达初步禁令,阻止了这一认定。GSA恢复Anthropic的采购资格。

与此同时,Anthropic的营收从2月的$140亿年化涨到4月的$300亿。Claude一度成为美国App Store免费榜第一名

被封杀反而让更多人知道了它。

你该用哪个AI?

看完成绩单,很多人会问:那我该用哪个?

几点建议:

1. 不要只用一个。连最好的都只有C+,把所有鸡蛋放在一个篮子里很危险。至少准备2-3个模型的备份方案。

2. 按场景选模型。处理敏感数据时,优先选安全评分高的(Anthropic/OpenAI)。跑批量任务、做原型验证时,可以用性价比高的开源模型。

3. 不要迷信"开源=安全"。DeepSeek和Mistral都是开源的,但安全评分都是F。开源让你能看到代码,但不等于有人替你做了安全审查。

4. 关注"存在安全"这一维度。目前所有公司都不及格,这意味着没有任何一家能保证AI不会失控。你的业务流程里必须有人工确认环节。

你觉得这份成绩单公平吗?你用的AI排第几?

👇 评论区聊聊。


如果你在做AI应用,需要多模型路由和成本优化方案,可以关注算力集,回复"安全"领取多模型备份与路由配置指南。

参考来源:Future of Life Institute AI Safety Index Summer 2026、GSA OneGov采购平台、TechTimes、David & Goliath AI Briefing、EveryCRSReport、Particle News、Singularity Soup