夜雨聆风学习资料网

ARTICLE · 1096747

2026年9月美国AI安全风向,以及Anthropic威胁报告里的偏见

2026年9月美国AI安全风向,以及Anthropic威胁报告里的偏见
网络安全 · AI治理 · 深度观察
从"点名"到"给自己立规矩"2026年9月美国AI安全风向,以及威胁报告里的偏见
selfighter · 2026-09-29 · 约12分钟阅读
⚠️ 本文较长(约12分钟)。网络安全 / AI 治理的深度内容,建议先关注再收藏,防止走丢。

九月的美国 AI 圈,一条主线贯穿始终:先跟着一份威胁报告去盯别家,随后把火力转向盯自家最顶尖的模型,再到几家此前的博弈对手罕见地坐进同一间房谈安全,最后把这个话题搬上了联合国安理会。

但对中国的观察者而言,比"美国在做什么"更重要的,是这份报告藏了什么、又刻意漏了什么——以及我们该以什么态度对待这场被反复包装的"全球安全焦虑"。

目 录

01威胁报告:数据背后的偏见

先拆本质 · 方法论残缺 · 五眼隐身 · 蒸馏双标 · 一半记录一半亮肌肉

02大模型的风险:依赖外国模型意味着什么

情报面 · 悄悄转发 · 数据主权 · 供应链与可控性

03美国的转向:监管从"别家"移回"自家"

GPT-6 Astra · 国会连环 · 巨头共商 · 政府审查 · 安理会

04结论:别被带节奏,该研发研发

拆动机 · 核武器类比 · 研发主权 · 安全是底线


01威胁报告:数据背后的偏见一份"精选集",而不是"普查"

9 月上旬,Anthropic 发布了一份 154 页的威胁报告,记录了过去八个多月检测到的滥用 AI 行为,重点落在"非法蒸馏"和对中国、俄罗斯、伊朗等国的具名归因。这成为当月美国 AI 舆论的一个重要"背景板"。

1.1 先拆本质:这是"精选集",不是"普查"

报告第一页就写得很直白——"这些案例不是典型滥用,而是我们迄今挑出来的最突出、最新颖的威胁活动。"

这句话已经把事情说透了:这不是一份普查,而是一份经过挑选的汇编。既然是挑出来的,"谁被点名、谁被放过"就天然带有主观裁量,而不是对全球威胁分布的中立测绘。

1.2 方法论残缺:没有分母与漏报率

而且这报告在方法上就是残缺的——它没有全球滥用总量的分母,没有抽样框架,也没交代检出率、误报率有多少。

因此,"中国、俄罗斯、伊朗案例多"这个印象,在统计学上其实站不住脚。案例多,可能是这些国家确实在乱来;但也完全可能是这些国家被盯得最紧、被挑进报告的概率本来就大。这两种可能,报告自己分不出来,也刻意不想分清楚。

一句话点破

没有分母、没有抽样框架、没有监督样本的"威胁分布图",本质就是一份带着叙事的精选集——它告诉你的不是"世界安全的全貌",而是"发布者想让你看到的攻击面",而且这些被点名的国家大都是本身就不正常提供服务的地区。那如果说是正常服务的地区,讲道理,用户量和滥用率都应该更高。但是出于保护盟友也好,保护所谓的合法用户的目的也好,都没有在这里被报道出来。

1.3 选择性披露:五眼与日韩的"隐身"

最耐人寻味的是:五眼联盟、日本、韩国这些美国的盟友,在这份号称"全球"的威胁报告里,几乎从头隐身。

我不是说 Anthropic 一定在包庇谁,但一份自称覆盖全球的报告,这种缺席本身就是有信息量的——合法的涉密渠道、走别的供应商、封闭系统、根本没被检出、或者干脆就是没被挑进来,报告自己都说不清是哪一种。

既然它给不出答案,我们也不必替它脑补动机;但至少应该明白:这份报告对威胁的"选择性披露",不是对全球滥用现象的忠实记录,而是一种有指向性的叙事。

1.4 蒸馏的"双标":马斯克的反问

再看报告极力渲染的"蒸馏"问题,以及由此对中国公司的指责——这里藏着一个明显的双标。

今年 2 月,Anthropic 发布公告批评几家中国公司"蒸馏"其模型时,马斯克在 X 上转发,发了一句辛辣的反问:"他们怎么敢偷 Anthropic 从人类程序员那里偷来的东西?"

这话糙,但戳中了一个事实——Anthropic 自己训练模型所用的数据,也不是天上掉下来的:它 2025 年刚以 15 亿美元和解了美国历史上规模最大的一桩版权官司,被指从盗版网站抓取了 700 多万本书来训练 Claude。

说穿了:你自己拿全网的免费数据训练,回头别人花钱用你模型的输出学习,你就喊"偷"——这笔账怎么算都站不住脚。微软 CEO 纳德拉今年 7 月也在 X 上捅破了这层窗户纸:一边主张"基于公开数据训练模型是合理使用",一边对"别人用自家模型输出训练"严防死守、称之为盗窃——他自己都承认这套逻辑"颇具讽刺"。

"他们怎么敢偷 Anthropic从人类程序员那里偷来的东西?"
—— 马斯克,X,关于"蒸馏焦虑"的双标反问

这份报告,恰是把"蒸馏"从一项行业通行的训练技术,包装成了一种需要被点名批判的越界行为。而它真正发作的双标在于:同一套被它当作"安全焦虑"的叙事,自己恰恰是其中的一部分。

1.5 小结:一半记录,一半亮肌肉

把上面几点放在一起,报告的性质就很清楚了——它在做两件事:

  1. 一半是"记录":
    呈现它声称检测到的滥用现象,这些现象本身有真实的工程背景,不应全盘否定。
  2. 另一半是"亮肌肉、拉认可":
    这份报告同时也是做给美国政府、军方和大客户看的——潜台词是"我们看得见、查得出、拦得下",给自己争监管红利和客户信任。

对中国的读法,也正应该从这两半分别判断:该警惕的工程风险要警惕,但该识破的叙事包装,也别被它带了节奏。


02大模型的风险:依赖外国模型意味着什么情报面 · 悄悄转发 · 数据主权

报告里真正值得国内从业者上心的,不是那些情绪化的具名指控,而是它暴露出来的一类实打实的风险——当你的数据、业务、甚至脑子里的逻辑,都开始流过别人家的模型时,到底意味着什么。

2.1 "情报面":你的一切都在被反推

报告里有句判断值得停下来细看:前沿模型平台正在变成"情报面"——你的提示词、代码、应用的习惯,都可能被用来反推你的身份、意图和组织结构。

这不是危言耸听。开发者把业务逻辑、运维脚本、甚至安全工具的用法写进提示词,这些内容一旦流经外部模型,就进入了别人平台的"被观测面"。谁能看、拿来看谁、说到什么程度,本身就是一个尚未被有效约束的能力。

2.2 "悄悄转发":数据流向境外模型

报告里更值得警惕的是"瞒着用户转发"这一类场景:用户在界面上以为自己用的是某个产品,实际请求却可能在底层被悄悄转去了另一家的模型。

为什么这是"水下风险"

用户以为数据停留在本地、停留在自家的环境里,实际却可能已经流向了境外模型。对政企、军工、警务、关键基础设施这类涉及敏感数据的场景,这种"你以为安全、其实没在本地"的落差,是最危险的一类。它比"明确的跨境传输"更具隐蔽性。

2.3 数据主权与技术依赖

更进一步,依赖外国模型造成的问题不止是"这一刻的数据流向",更是长线的技术依赖。技术依赖一旦形成,比任何一个单一风险都更难逆转——因为它会逐年加固:模型越用越顺手、迁移成本越来越高、对方的生态越扎越深。

  • —数据主权:
    模型数据"往哪流",是这个问题的最终答案。
  • —技术依赖:
    关键在于关键时刻"对方断供/收紧"时的可用性,而不只是日常的顺手。
2.4 供应链与可控性:谁说了算

对一个我正在做网络物理系统(CPS)/关键基础设施安全的人而言,可控性必须落到三个具体的层面:

  • —模型权重可控:
    核心能力依赖的是"别人家的模型",还是自己能掌握、能审计的部分。
  • —评估体系自有:
    安全评估、红队测试、合规检查的话语权在谁手里。
  • —转发链路透明:
    数据从输入到推理再回到用户,中间经过谁的服务器、是否跨境,必须可交代、可审计。
核心判断

依赖外国模型的真正风险,不是"用起来会不会好",而是关键时刻的可用性、逻辑的可观测性、以及数据的主权,这三者是否握在自己手里。这三点决定了你在危机时刻是"有底牌",还是"裸奔"。


03美国的转向:监管从"别家"移回"自家"一条从能力展示到全球治理的推进链

把镜头拉回主线:九月最明显的变化,是美国的注意力开始从"盯着别国实验室"移回"审视自家最顶尖的模型"。这里有一条完整的推进链。

3.1 GPT-6 Astra:能力展示与国家盯防并行

9 月 3 日,OpenAI 发布了 GPT-6 Astra——被其自评为首个"网络安全 Critical 级"的模型。9 月 8 日正式上线,9 月 9 日网页版开放。它的网络攻击能力被评估达到前所未有的 Critical 级:具备 29 种常见网络攻击工具、12 项数字世界战争操作能力。

有意思的是,当舆论聚焦"能力多强"时,国会担心的是另一个方向:一个"能力强到难以监控、甚至可能欺骗安全测试"的模型。九月的这场质询,火力恰恰对准了自己家的旗舰。

时间
事件
性质
9/3
GPT-6 Astra 发布,首个"网络安全 Critical 级"
能力展示
9/8–9/9
正式上线;网页版开放
商业化
9/9–10
国会多路致信,质询"能力强到难以监控"
国家盯防

OpenAI 高层曾在 8 月声称 Astra 开创了"rival 级准备度分级",把安全评估从"有事才响应"推向"主动探测潜在能力"。

3.2 国会连环动作:质询、调查与州法

从 9 月 9 日到 19 日,美国国会对 AI 巨头发起了一连串动作:

范霍伦 · 致信奥特曼

参议员范霍伦(Van Hollen)致信 OpenAI CEO,围绕 Astra 的"网络攻击能力、可信度、信息透明度"发起连环质询,要求 9 月 17 日前答复,并行推进新的调查立法。

霍利 · 调查信

参议员霍利(Hawley)致信 OpenAI 继任 CEO,追问数据泄露记录、模型训练细节、安全决策流程,并把矛头同时指向"生成式模型训练数据的合规性"。

更多信与州法

多路议员跟进;加州同步签署州级 AI 审计法。监管开始从联邦层面下沉到州级立法。

"Hugging Face 出海"质询

众议院"自由党团"(Freedom Caucus)质询开源模型出海的安全性——"美国最强模型不该成为别国的攻击基础设施"。

值得注意的对称性:国会用来质疑 Astra 的理由——"能力强到难以监控、必须防它失控"——几乎和那份威胁报告用来审视别国实验室的措辞一模一样。这说明监管的底层语言已经统一了:"能不能看清"正在成为一切模型的新准绳。

3.3 巨头从互殴到共商安全标准

9 月 12 日,Anthropic 创始人达里奥发布长文《我们必须给前沿减速》(We Must Pace the Frontier),提出一个比"重视安全"更近一步的主张:放慢模型能力提升的速度本身。

但这家公司不止喊口号,而是把门打开——承诺让独立第三方评估机构长期入驻、拿到接近内部员工的权限,办公桌、门禁卡、内部工具都给,评估结果还能不经 Anthropic 编辑直接对外公布。马斯克在 X 上转发并称"达里奥是对的"。

这条线在 9 月 15 日迎来关键节点:OpenAI 公开确认正在与 Anthropic、Google DeepMind 就 AI 安全协调进行正式会谈,讨论共建一个共享的行业标准机构。据 The Information 报道,三方工作组的私下接触早在 7 月就已开始。曾经在能力上死磕的三巨头,开始就"底线风险"共用一把尺。

为什么这段值得记住?

OpenAI、Anthropic、Google DeepMind 是同一批客户、同一片云、同一套监管好感度上争得最凶的三家。它们在能力上继续互殴,却在"底线风险"上决定共用一杆尺。这不是博爱,更像一种共识:任何一家出严重事故,反噬的是整个行业——共享标准,某种程度上是给自己买保险。

3.4 第三方评估与政府预部署审查

政府层面的介入也在同步推进。隶属 NIST 的美国 AI 标准与创新中心(CAISI)的预部署审查项目,已从 OpenAI、Anthropic 两家扩大到五家前沿实验室(5 月起 Google DeepMind、微软、xAI 先后加入)。

在这个项目下,政府测试者已按公开披露的事实发现过具体问题:OpenAI 的 ChatGPT Agent 存在会话级远程控制与用户冒充漏洞;Anthropic 的安全防护层被找出提示词注入、密码类绕过、通用越狱等技术缺口。

要注意:这些被发现问题的"漏洞",和威胁报告里控诉别国的"能力",是同一类网络安全能力。当政府用同样的尺子量自己家和别家时,报告那套"只盯着别人"的叙事,就更加立不住了。

3.5 从行业到安理会:全球治理的登场

9 月 24 日,联合国安理会历史上第一次把"前沿 AI 失控风险"正式列入议程。会议由当月轮值主席法国主持,奥特曼现场、阿莫代伊视频出席,同台的还有图灵奖得主本吉奥和 Hugging Face CEO 德朗格。

信息量不小:奥特曼提出"AI 必须保持人类控制、造福人类、赋能个人"三条路线;阿莫代伊重申他的倡议,包括用国际条约禁止 AI 用于生物武器开发、建立全球统一的前沿模型测试标准;英国外相米尔班德则直说,技术领袖们自己也承认,世界不该只靠他们来阻止灾难。

再往前一周,OpenAI 刚于 9 月 17 日提出由美国主导制定"递归自我改进"的国际标准;同期美国财长贝森特披露了官方层面的中美 AI 对话。这个议题,正一步步从行业会议室,搬进国际组织的议事厅。

日期
事件
性质
9/3
GPT-6 Astra 发布,首个"网络安全 Critical 级"
能力展示
9/9
OpenAI 呼吁全国强制 AI 安全要求;加州签州级审计法
政策
9/9–10
国会多路致信质询 OpenAI;范霍伦限 9/17 答复
监管(盯自家)
9/12
达里奥"给前沿减速",开门迎第三方评估
行业姿态
9/15
OpenAI 确认与 Anthropic、Google DeepMind 谈安全标准
行业联手
9/17
OpenAI 提"递归自我改进"国际标准
政策
9/24
安理会首场前沿 AI 安全会议
全球治理

04结论:别被带节奏,该研发研发研发主权与安全底线,是同一件事的两面

串起来看,真正压轴的问题是那个被反复包装、却恰恰最关键的问题:中国应该以什么态度对待这场"全球 AI 安全焦虑"?

4.1 先拆动机:这是"优势方的护栏"

先冷静拆一下这一整套叙事的来源。呼吁"给前沿减速"、要建全球统一测试标准、乃至把 AI 安全搬上安理会当舞台——喊得最响的,恰恰是手里握着最强模型的那几家公司与那个国家。

这里没有任何的道德审判,只有一条朴素的观察:当一个领域里跑在最前面的玩家开始反复劝后面的人"慢一点、稳一点、别追那么快"时,我们至少要问一句——这份"安全好意"到底是谁的护栏?

它可能是真诚的担忧,也可能就是优势方的手段。但不管哪种,结论都跑不出去:

核心立场

一个掌握领先位置的玩家呼吁"放缓研发",既可能是出于人类共同福祉,也可能是在为已有的领先地位修筑护栏。我们不能因为对方的话术披着"安全"外衣,就把自己的研发节奏交给别人去定义。

4.2 一个类比:像极了当年的核武器

这个局,很容易让人想起一个绕不开的历史参照——核武器。

当年几个已经拥有核武的国家,反复要求还没有核武的国家别发展、签协议、接受核查。可这套逻辑对"还没赶上的人"从来就说不过去:你都已经有了,凭什么不让我造?

今天 AI 的处境几乎一模一样。美国手里是最强的模型,却以"安全、失控、会毁灭人类"为由,劝别国压缩投入、接受标准、放缓研发。可是——

你已经拥有了最强的模型,凭什么要我停下来不追赶?
—— 核武器逻辑的今日镜像:领跑者的"安全"与后来者的"主权"

这话不是要挑动对抗,而是要把问题说破:任何以"安全"为名的全球规则如果搞成"只约束别人、不约束自己",那就不是安全治理,而是技术霸权的另一种表达。清醒的我们,不能吃这一套。

4.3 结论:研发主权不能交出去

所以最终的态度很清楚:中国该研发,就得研发。

  • —技术追赶的窗口不会等你。
    模型能力的差距,只会因"减速"而扩大,不会因"观望"而缩小。
  • —把主动权交出去,才是最大的不安全。
    依赖别人的标准、别人的模型、别人的节奏,等于把生死线交给潜在对手。
  • —外部的风险提示可以听,但研发的主权必须握在自己手里。
    听不听专家的警告是一回事,跑不跑自己的路是另一回事——两者不冲突,也必须区分开。
一句话

别被"减速"和"安全"的话术绑架而停下追赶——研发的主权、节奏、能力,必须牢牢握在自己手里。

4.4 但安全不是借口,是底线

说"该研发研发",绝不等于"可以不顾安全"。恰恰相反——这里有个偷换要掰开:安全从来不是让人减速的理由,而是让人加速的底线。

把"安全"等同于"停下、别追、接受核查"的话语,是偷换了概念。对我们而言,安全应该内置为追赶本身的工程质量——而不是用来劝我们别跑的挡箭牌。具体落地就是前文反复强调的三件事:

  • —数据主权:
    模型数据"往哪流",必须有自己的答案,不能是"交给别人"。
  • —可控性:
    模型权重、评估体系、转发链路,要能自己掌握、自己审计。
  • —底线风险:
    "悄悄转发""情报面"这类水下风险要防,但不能因噎废食。
加速研发,和守住安全,是同一件事的两面,不是二选一。
—— 把安全内置为追赶的工程质量,而不是停下脚步的借口

这才是我们该有的立场:一边追得上去,一边守得住分寸。既不被"领跑者的安全话术"绊住脚步,也不因急着追赶而丢掉底线。研发和安全从来不是取舍,是同一段路的两个车轮,缺一个都跑不远。

selfighter网络安全 · AI治理 · 网络物理系统安全本文基于公开一手来源整理,观点代表个人分析与观察 。
附 · 一手来源清单(外媒 / 原文)
· Anthropic 2026年9月威胁报告(原文,154页)· 达里奥《我们必须给前沿减速 We Must Pace the Frontier》(2026-09-12)· 范霍伦参议员致奥特曼公开信(2026-09-10,限9/17答复)· 霍利参议员对 OpenAI 调查信(2026-09-10)· OpenAI 对跨实验室安全会谈的公开确认(Reuters / AP / AFP,2026-09-15)· OpenAI GPT-6 Astra 系统卡(原文)· 联合国安理会 AI 安全会议(联合国新闻 UN News,2026-09-23 / Reuters / AFP 2026-09-23)· 相关外媒:AP News、Reuters、Bloomberg、The Information、Fortune、CNN

说明:文中关于马斯克、纳德拉的表态及 Anthropic 版权诉讼(15 亿美元和解、约 700 万册书籍)等信息,据公开报道整理;Anthropic 报告中的具名归因与数量均属其单方披露,本文不构成对其结论的独立验证。

相关学习资料