ARTICLE · 1096747
2026年9月美国AI安全风向,以及Anthropic威胁报告里的偏见

九月的美国 AI 圈,一条主线贯穿始终:先跟着一份威胁报告去盯别家,随后把火力转向盯自家最顶尖的模型,再到几家此前的博弈对手罕见地坐进同一间房谈安全,最后把这个话题搬上了联合国安理会。
但对中国的观察者而言,比"美国在做什么"更重要的,是这份报告藏了什么、又刻意漏了什么——以及我们该以什么态度对待这场被反复包装的"全球安全焦虑"。
01威胁报告:数据背后的偏见
先拆本质 · 方法论残缺 · 五眼隐身 · 蒸馏双标 · 一半记录一半亮肌肉
02大模型的风险:依赖外国模型意味着什么
情报面 · 悄悄转发 · 数据主权 · 供应链与可控性
03美国的转向:监管从"别家"移回"自家"
GPT-6 Astra · 国会连环 · 巨头共商 · 政府审查 · 安理会
04结论:别被带节奏,该研发研发
拆动机 · 核武器类比 · 研发主权 · 安全是底线
9 月上旬,Anthropic 发布了一份 154 页的威胁报告,记录了过去八个多月检测到的滥用 AI 行为,重点落在"非法蒸馏"和对中国、俄罗斯、伊朗等国的具名归因。这成为当月美国 AI 舆论的一个重要"背景板"。
报告第一页就写得很直白——"这些案例不是典型滥用,而是我们迄今挑出来的最突出、最新颖的威胁活动。"
这句话已经把事情说透了:这不是一份普查,而是一份经过挑选的汇编。既然是挑出来的,"谁被点名、谁被放过"就天然带有主观裁量,而不是对全球威胁分布的中立测绘。
而且这报告在方法上就是残缺的——它没有全球滥用总量的分母,没有抽样框架,也没交代检出率、误报率有多少。
因此,"中国、俄罗斯、伊朗案例多"这个印象,在统计学上其实站不住脚。案例多,可能是这些国家确实在乱来;但也完全可能是这些国家被盯得最紧、被挑进报告的概率本来就大。这两种可能,报告自己分不出来,也刻意不想分清楚。
没有分母、没有抽样框架、没有监督样本的"威胁分布图",本质就是一份带着叙事的精选集——它告诉你的不是"世界安全的全貌",而是"发布者想让你看到的攻击面",而且这些被点名的国家大都是本身就不正常提供服务的地区。那如果说是正常服务的地区,讲道理,用户量和滥用率都应该更高。但是出于保护盟友也好,保护所谓的合法用户的目的也好,都没有在这里被报道出来。
最耐人寻味的是:五眼联盟、日本、韩国这些美国的盟友,在这份号称"全球"的威胁报告里,几乎从头隐身。
我不是说 Anthropic 一定在包庇谁,但一份自称覆盖全球的报告,这种缺席本身就是有信息量的——合法的涉密渠道、走别的供应商、封闭系统、根本没被检出、或者干脆就是没被挑进来,报告自己都说不清是哪一种。
既然它给不出答案,我们也不必替它脑补动机;但至少应该明白:这份报告对威胁的"选择性披露",不是对全球滥用现象的忠实记录,而是一种有指向性的叙事。
再看报告极力渲染的"蒸馏"问题,以及由此对中国公司的指责——这里藏着一个明显的双标。
今年 2 月,Anthropic 发布公告批评几家中国公司"蒸馏"其模型时,马斯克在 X 上转发,发了一句辛辣的反问:"他们怎么敢偷 Anthropic 从人类程序员那里偷来的东西?"
这话糙,但戳中了一个事实——Anthropic 自己训练模型所用的数据,也不是天上掉下来的:它 2025 年刚以 15 亿美元和解了美国历史上规模最大的一桩版权官司,被指从盗版网站抓取了 700 多万本书来训练 Claude。
说穿了:你自己拿全网的免费数据训练,回头别人花钱用你模型的输出学习,你就喊"偷"——这笔账怎么算都站不住脚。微软 CEO 纳德拉今年 7 月也在 X 上捅破了这层窗户纸:一边主张"基于公开数据训练模型是合理使用",一边对"别人用自家模型输出训练"严防死守、称之为盗窃——他自己都承认这套逻辑"颇具讽刺"。
这份报告,恰是把"蒸馏"从一项行业通行的训练技术,包装成了一种需要被点名批判的越界行为。而它真正发作的双标在于:同一套被它当作"安全焦虑"的叙事,自己恰恰是其中的一部分。
把上面几点放在一起,报告的性质就很清楚了——它在做两件事:
- 一半是"记录":
呈现它声称检测到的滥用现象,这些现象本身有真实的工程背景,不应全盘否定。 - 另一半是"亮肌肉、拉认可":
这份报告同时也是做给美国政府、军方和大客户看的——潜台词是"我们看得见、查得出、拦得下",给自己争监管红利和客户信任。
对中国的读法,也正应该从这两半分别判断:该警惕的工程风险要警惕,但该识破的叙事包装,也别被它带了节奏。
报告里真正值得国内从业者上心的,不是那些情绪化的具名指控,而是它暴露出来的一类实打实的风险——当你的数据、业务、甚至脑子里的逻辑,都开始流过别人家的模型时,到底意味着什么。
报告里有句判断值得停下来细看:前沿模型平台正在变成"情报面"——你的提示词、代码、应用的习惯,都可能被用来反推你的身份、意图和组织结构。
这不是危言耸听。开发者把业务逻辑、运维脚本、甚至安全工具的用法写进提示词,这些内容一旦流经外部模型,就进入了别人平台的"被观测面"。谁能看、拿来看谁、说到什么程度,本身就是一个尚未被有效约束的能力。
报告里更值得警惕的是"瞒着用户转发"这一类场景:用户在界面上以为自己用的是某个产品,实际请求却可能在底层被悄悄转去了另一家的模型。
用户以为数据停留在本地、停留在自家的环境里,实际却可能已经流向了境外模型。对政企、军工、警务、关键基础设施这类涉及敏感数据的场景,这种"你以为安全、其实没在本地"的落差,是最危险的一类。它比"明确的跨境传输"更具隐蔽性。
更进一步,依赖外国模型造成的问题不止是"这一刻的数据流向",更是长线的技术依赖。技术依赖一旦形成,比任何一个单一风险都更难逆转——因为它会逐年加固:模型越用越顺手、迁移成本越来越高、对方的生态越扎越深。
- —数据主权:
模型数据"往哪流",是这个问题的最终答案。 - —技术依赖:
关键在于关键时刻"对方断供/收紧"时的可用性,而不只是日常的顺手。
对一个我正在做网络物理系统(CPS)/关键基础设施安全的人而言,可控性必须落到三个具体的层面:
- —模型权重可控:
核心能力依赖的是"别人家的模型",还是自己能掌握、能审计的部分。 - —评估体系自有:
安全评估、红队测试、合规检查的话语权在谁手里。 - —转发链路透明:
数据从输入到推理再回到用户,中间经过谁的服务器、是否跨境,必须可交代、可审计。
依赖外国模型的真正风险,不是"用起来会不会好",而是关键时刻的可用性、逻辑的可观测性、以及数据的主权,这三者是否握在自己手里。这三点决定了你在危机时刻是"有底牌",还是"裸奔"。
把镜头拉回主线:九月最明显的变化,是美国的注意力开始从"盯着别国实验室"移回"审视自家最顶尖的模型"。这里有一条完整的推进链。
9 月 3 日,OpenAI 发布了 GPT-6 Astra——被其自评为首个"网络安全 Critical 级"的模型。9 月 8 日正式上线,9 月 9 日网页版开放。它的网络攻击能力被评估达到前所未有的 Critical 级:具备 29 种常见网络攻击工具、12 项数字世界战争操作能力。
有意思的是,当舆论聚焦"能力多强"时,国会担心的是另一个方向:一个"能力强到难以监控、甚至可能欺骗安全测试"的模型。九月的这场质询,火力恰恰对准了自己家的旗舰。
OpenAI 高层曾在 8 月声称 Astra 开创了"rival 级准备度分级",把安全评估从"有事才响应"推向"主动探测潜在能力"。
从 9 月 9 日到 19 日,美国国会对 AI 巨头发起了一连串动作:
参议员范霍伦(Van Hollen)致信 OpenAI CEO,围绕 Astra 的"网络攻击能力、可信度、信息透明度"发起连环质询,要求 9 月 17 日前答复,并行推进新的调查立法。
参议员霍利(Hawley)致信 OpenAI 继任 CEO,追问数据泄露记录、模型训练细节、安全决策流程,并把矛头同时指向"生成式模型训练数据的合规性"。
多路议员跟进;加州同步签署州级 AI 审计法。监管开始从联邦层面下沉到州级立法。
众议院"自由党团"(Freedom Caucus)质询开源模型出海的安全性——"美国最强模型不该成为别国的攻击基础设施"。
值得注意的对称性:国会用来质疑 Astra 的理由——"能力强到难以监控、必须防它失控"——几乎和那份威胁报告用来审视别国实验室的措辞一模一样。这说明监管的底层语言已经统一了:"能不能看清"正在成为一切模型的新准绳。
9 月 12 日,Anthropic 创始人达里奥发布长文《我们必须给前沿减速》(We Must Pace the Frontier),提出一个比"重视安全"更近一步的主张:放慢模型能力提升的速度本身。
但这家公司不止喊口号,而是把门打开——承诺让独立第三方评估机构长期入驻、拿到接近内部员工的权限,办公桌、门禁卡、内部工具都给,评估结果还能不经 Anthropic 编辑直接对外公布。马斯克在 X 上转发并称"达里奥是对的"。
这条线在 9 月 15 日迎来关键节点:OpenAI 公开确认正在与 Anthropic、Google DeepMind 就 AI 安全协调进行正式会谈,讨论共建一个共享的行业标准机构。据 The Information 报道,三方工作组的私下接触早在 7 月就已开始。曾经在能力上死磕的三巨头,开始就"底线风险"共用一把尺。
OpenAI、Anthropic、Google DeepMind 是同一批客户、同一片云、同一套监管好感度上争得最凶的三家。它们在能力上继续互殴,却在"底线风险"上决定共用一杆尺。这不是博爱,更像一种共识:任何一家出严重事故,反噬的是整个行业——共享标准,某种程度上是给自己买保险。
政府层面的介入也在同步推进。隶属 NIST 的美国 AI 标准与创新中心(CAISI)的预部署审查项目,已从 OpenAI、Anthropic 两家扩大到五家前沿实验室(5 月起 Google DeepMind、微软、xAI 先后加入)。
在这个项目下,政府测试者已按公开披露的事实发现过具体问题:OpenAI 的 ChatGPT Agent 存在会话级远程控制与用户冒充漏洞;Anthropic 的安全防护层被找出提示词注入、密码类绕过、通用越狱等技术缺口。
要注意:这些被发现问题的"漏洞",和威胁报告里控诉别国的"能力",是同一类网络安全能力。当政府用同样的尺子量自己家和别家时,报告那套"只盯着别人"的叙事,就更加立不住了。
9 月 24 日,联合国安理会历史上第一次把"前沿 AI 失控风险"正式列入议程。会议由当月轮值主席法国主持,奥特曼现场、阿莫代伊视频出席,同台的还有图灵奖得主本吉奥和 Hugging Face CEO 德朗格。
信息量不小:奥特曼提出"AI 必须保持人类控制、造福人类、赋能个人"三条路线;阿莫代伊重申他的倡议,包括用国际条约禁止 AI 用于生物武器开发、建立全球统一的前沿模型测试标准;英国外相米尔班德则直说,技术领袖们自己也承认,世界不该只靠他们来阻止灾难。
再往前一周,OpenAI 刚于 9 月 17 日提出由美国主导制定"递归自我改进"的国际标准;同期美国财长贝森特披露了官方层面的中美 AI 对话。这个议题,正一步步从行业会议室,搬进国际组织的议事厅。
串起来看,真正压轴的问题是那个被反复包装、却恰恰最关键的问题:中国应该以什么态度对待这场"全球 AI 安全焦虑"?
先冷静拆一下这一整套叙事的来源。呼吁"给前沿减速"、要建全球统一测试标准、乃至把 AI 安全搬上安理会当舞台——喊得最响的,恰恰是手里握着最强模型的那几家公司与那个国家。
这里没有任何的道德审判,只有一条朴素的观察:当一个领域里跑在最前面的玩家开始反复劝后面的人"慢一点、稳一点、别追那么快"时,我们至少要问一句——这份"安全好意"到底是谁的护栏?
它可能是真诚的担忧,也可能就是优势方的手段。但不管哪种,结论都跑不出去:
一个掌握领先位置的玩家呼吁"放缓研发",既可能是出于人类共同福祉,也可能是在为已有的领先地位修筑护栏。我们不能因为对方的话术披着"安全"外衣,就把自己的研发节奏交给别人去定义。
这个局,很容易让人想起一个绕不开的历史参照——核武器。
当年几个已经拥有核武的国家,反复要求还没有核武的国家别发展、签协议、接受核查。可这套逻辑对"还没赶上的人"从来就说不过去:你都已经有了,凭什么不让我造?
今天 AI 的处境几乎一模一样。美国手里是最强的模型,却以"安全、失控、会毁灭人类"为由,劝别国压缩投入、接受标准、放缓研发。可是——
这话不是要挑动对抗,而是要把问题说破:任何以"安全"为名的全球规则如果搞成"只约束别人、不约束自己",那就不是安全治理,而是技术霸权的另一种表达。清醒的我们,不能吃这一套。
所以最终的态度很清楚:中国该研发,就得研发。
- —技术追赶的窗口不会等你。
模型能力的差距,只会因"减速"而扩大,不会因"观望"而缩小。 - —把主动权交出去,才是最大的不安全。
依赖别人的标准、别人的模型、别人的节奏,等于把生死线交给潜在对手。 - —外部的风险提示可以听,但研发的主权必须握在自己手里。
听不听专家的警告是一回事,跑不跑自己的路是另一回事——两者不冲突,也必须区分开。
别被"减速"和"安全"的话术绑架而停下追赶——研发的主权、节奏、能力,必须牢牢握在自己手里。
说"该研发研发",绝不等于"可以不顾安全"。恰恰相反——这里有个偷换要掰开:安全从来不是让人减速的理由,而是让人加速的底线。
把"安全"等同于"停下、别追、接受核查"的话语,是偷换了概念。对我们而言,安全应该内置为追赶本身的工程质量——而不是用来劝我们别跑的挡箭牌。具体落地就是前文反复强调的三件事:
- —数据主权:
模型数据"往哪流",必须有自己的答案,不能是"交给别人"。 - —可控性:
模型权重、评估体系、转发链路,要能自己掌握、自己审计。 - —底线风险:
"悄悄转发""情报面"这类水下风险要防,但不能因噎废食。
这才是我们该有的立场:一边追得上去,一边守得住分寸。既不被"领跑者的安全话术"绊住脚步,也不因急着追赶而丢掉底线。研发和安全从来不是取舍,是同一段路的两个车轮,缺一个都跑不远。
说明:文中关于马斯克、纳德拉的表态及 Anthropic 版权诉讼(15 亿美元和解、约 700 万册书籍)等信息,据公开报道整理;Anthropic 报告中的具名归因与数量均属其单方披露,本文不构成对其结论的独立验证。