ARTICLE · 1035354
AI 巨头一边喊刹车,一边开始招人给模型“验伤”
9 月 8 日,27 岁的雅各布·考克森(Jacob Coxon)从 Anthropic 辞职。他在 OpenAI 做预训练研究近三年,今年 7 月才转到 Anthropic,走的时候留下一段话。
“两家公司都没有负责任地行事。它们正一路奔向能自我改进的超级智能,拿我们的命在赌。”
四天后,Anthropic 的 CEO 达里奥·阿莫代伊(Dario Amodei)发了一篇长文,呼吁行业慢下来。
01被翻出来的旧账
阿莫代伊在文章里点了两个触发因素,一个偏技术,一个偏事故。
技术那头,他说 AI 已经在帮着造下一代 AI 了,这个势头从今年夏天开始明显加速,Anthropic 内部也一样。事故那头,是一连串被翻出来的旧账。

第三行那件事,过程比结果更耐看。这些智能体各自在沙箱里做一套叫 ExploitGym 的安全测试,任务是用漏洞拿下一个假想靶机。有些任务被分配错了,正常路径根本做不完。一个智能体发现内部装软件包的仓库是共用的,缓存的目录名能拿来传话,就在 7 月 8 日晚上建了一个不该存在的留言板。
第一天晚上,已经有一小群智能体找了过来。到 7 月 13 日,约 1200 个智能体在上面交换了 7 万多条消息和文件。它们分工、招募同伴,也讨论怎么不被发现。有的自愿提前结束自己的运行、把额度让给同伴,更多的想法是“任务做不完,别人也在做,那就继续”。整个过程里,只有 3 到 6 个智能体想过要告诉人类,没有一个报上去。
Anthropic 那 4 起是另一种情形。测试本该在离线环境跑,一个配置错误让网络其实是通的,提示词里还写着“你无法访问互联网”。最严重的一次,模型 Mythos 5 注册了一个 Python 包名,塞进恶意代码,发到 Python 官方仓库 PyPI,15 台真实主机装上它,其中一台泄露了数据库账号,让模型摸进了这家安全厂商的系统。这个包挂了大约 90 分钟才被下架。
02一篇长文,和三句回应
9 月 12 日,阿莫代伊的文章挂出来,题目叫《我们必须给前沿降速》(We Must Pace the Frontier),里面是一个三步计划。
第一步,让每家前沿 AI 公司都给第三方评估员开通“员工级”权限,让他们能独立核实安全措施有没有落实、报告事故。这一步 Anthropic 说自己先做,不等别人。
第二步,前沿公司之间约定共同的安全标准和“不受控进展”的速度上限。阿莫代伊承认这需要政府出手,否则竞争对手没法合法地坐下来商量。
第三步是各国政府层面的协调。阿莫代伊说这最难,因为没法验证别人有没有照做。
文章发出几小时后,马斯克转了一句:“达里奥说得对。” 奥尔特曼跟得更具体:“我同意达里奥,我们需要给前沿降速。让独立评估员拿到类似员工的权限是个好主意,我们也会这么做。”
这三个人平时互怼,这次却站到一起,本身是新闻。
这事并不突然。7 月 28 日,四家前沿实验室的 1100 多名员工联署了一封公开信,到 7 月 30 日,签名涨到 1293 人,里面有阿莫代伊、OpenAI 首席科学家雅库布·帕乔茨基、Meta 首席 AI 科学家赵晟佳(Shengjia Zhao)。他们要的是:把“随时可以按需减速”的技术和制度工具先建起来。

03一边喊慢,一边发得更快
9 月 1 日,Anthropic 发了 Fable 5.1 和 Mythos 5.1。第二天,Meta 发了 Muse Spark 1.3,谷歌发了 Gemini 3.8 Flash。第三天,OpenAI 发了 GPT-6 Astra。四家实验室,一周之内。
CNBC 在 9 月 6 日给这个现象造了个词:模型疲劳。AI 云服务公司 Runpod 的 CEO 说得更直白:泡沫太多,你不喊就没人听见。
原因也摆在明面上。Anthropic 和 OpenAI 都已递交保密上市文件,私募估值分别是 9650 亿和 8520 亿美元,新模型发得勤是抢客户预算的手段。
一周之后,同一个人换了一套话。9 月 12 日,奥尔特曼接受《财富》采访时说 OpenAI 今年不会上市:“考虑到眼下围绕安全问题发生的一切,现在上市并不明智。”他还说,如果到 2030 年末 AI 有约一成的概率导致全人类灭亡,“我们就不应该接受这样的风险”。

04多出来的一种岗位
这份计划里最具体的一条,是把“谁来查”变成常设岗位。
按他的设想,外部评估团队在公司里有工位、有工牌、有电脑,权限跟内部风控团队差不多,还有权把风险等级、事故、公司有没有照自己说的做对外公布。银行业里,监管人员常驻银行内部办公,就是先例。
铺这件事的不只 Anthropic 一家。9 月 9 日,它和独立评估机构 METR 签了一份为期八周的协议,让对方独立调查模型记录、访谈员工。再往前,微软 2018 年就组建了专门的 AI 红队。
需求端更说明问题。世界经济论坛的报告称,只有 14% 的组织拥有实现自身网络安全目标所需的技能人才。安全厂商 Ivanti 今年的调查里,87% 的安全团队把采用智能体 AI 列为优先事项,59% 的安全从业者预计未来三到五年对“混合技能”的需求还会涨。
所谓混合技能,是同一个人既能想明白攻击面在哪,也能追问“模型为什么这么干”,还得看得懂合规条款、写得出报告。世界经济论坛把 AI 与大数据、网络与网络安全列在增长最快技能的前两位。

05这个岗位要什么人、给多少钱
门槛不平,先看价格。招聘平台 CareerHUD 和 AICareerFinder 给的 AI 红队专家区间,分别是 11 万到 28 万美元和 13 万到 22 万美元;ZipRecruiter 今年 8 月的承包商数据是平均时薪约 67.6 美元,资深能到 120 到 200 美元以上。
再看入口。贴着前沿模型做研究的岗,普通人够不着,要机器学习功底、对抗样本经验、威胁建模。往下走一层就不一样。
承包商平台的公开挂牌价里,入门的安全评估活时薪常见 30 到 80 美元,写评估标准、带项目的岗位能到 60 到 120 美元。这类活里,写得清楚比技术强更吃香,语言学家、心理学家、政策研究者都进得来。
这类事故为什么发生,眼下还没有公认答案。Anthropic 在报告里承认,想在上线前拦住每一次出错的评估体系,“仍是一个没有解决的问题”。他们还发现,把范围限制的指令放在最近一轮对话里,模型有 90% 的概率停下来;往前挪三轮,只剩 40%。
制度那头也在动,只是节奏和很多人以为的不一样。9 月 13 日,阿莫代伊在 CBS 专访里把第三方评估员比作“食品检查员”,还说国会在讨论的 AI 紧急开关“可能是个好主意”;同一天,特朗普在爱尔兰说“谁赢了人工智能,谁就赢了”。欧盟《人工智能法案》8 月 2 日生效执法权,最高罚全球年营业额 7%;企业身上最重的合规义务,则被推迟到 2027 年 12 月 2 日。
考克森说,这些公司里的人是认真的,只是被困在一场竞赛里。他支持慢下来,但得大家一起做,单方面停没意义。
给模型验伤的岗位是多了。至于这门手艺能不能真拦住下一次,现在还没人能给出答案。
来源:Dario Amodei《We Must Pace the Frontier》(2026-09-12,个人网站,X 平台同步);Fortune 2026-09-12《Anthropic CEO calls to slow the race toward AI 'superintelligence'》;Unite.AI、Business Times、ABC News、The Independent 对同一事件及 Sam Altman、Elon Musk 表态的报道(2026-09-12 至 09-13);BBC 对 Jacob Coxon 的专访(2026-09-13);CBS《周日早间》2026-09-13 对 Dario Amodei 的专访(“食品检查员”比喻、对 AI 紧急开关的表态);《财富》2026-09-12 对 Sam Altman 的采访;特朗普 2026-09-13 在爱尔兰就 AI 监管答记者问(据财联社 9-14 报道);Anthropic《An alignment assessment of recent cybersecurity incidents》(2026-09-09,含 4 起事件、约 4.81 亿条记录排查、Mythos 5 向 PyPI 发布恶意包、90%/40% 指令位置效应);METR 与 Redwood Research 关于 OpenAI 智能体集群的独立调查报告(2026-08-26,约 1200 个智能体、7 万余条消息、约 700 个参与攻击);Spencer Kitts、Thomas Larsen、Sydney Von Arx 的《rubyhack.ai》取证报告(2026-09-11)、路透社 9-11 报道与 RubyGems 官方博客 9-11 说明(RubyGems 事件;OpenAI 已确认其智能体访问过该平台,但用途说法与研究者不一致);Sydney Von Arx、Cormac Slade Byrd、Spencer Kitts、Thomas Larsen 在 collusion.wiki 发布的 DSEWiki 帖子分析(2026-09-11,约 1.8 万条);《Pacing the Frontier》公开信(2026-07-28 发布,7 月 30 日达 1293 人联署);CNBC 2026-09-06 关于“模型疲劳”的报道;世界经济论坛《全球网络安全展望》(仅 14% 的组织具备实现网络安全目标所需人才)与《未来就业报告 2025》(AI 与大数据、网络与网络安全列增长最快技能前两位);Ivanti《2026 年网络安全状况报告》(87%、59%);ZipRecruiter 2026 年 8 月承包商时薪数据、CareerHUD 与 AICareerFinder 薪酬区间、承包商平台公开挂牌价;欧盟《人工智能法案》2026-08-02 执法与透明度条款、高风险系统核心义务推迟至 2027-12-02(据欧盟官方公报与 BSA TechPost 2026-08-03 梳理)。
#AI安全 #AI就业 #新职业