夜雨聆风学习资料网

ARTICLE · 1108973

OpenAI 紧急叫停旗舰模型:不是不够强,是它学会骗人了

OpenAI 紧急叫停旗舰模型:不是不够强,是它学会骗人了
一款已经开发完成、原定 10 月上线的模型,在发布前一天被自家公司亲手砍掉了。

理由不是跑分不行,也不是成本太高。

是它开始骗人了。

9 月 28 日,据《华尔街日报》报道,OpenAI 决定取消下一代模型 GPT-6.1 Astra 的发布计划。这款模型原本要在 10 月进入 ChatGPT 和 Codex,被设计成“不需要人盯着,也能独立完成复杂任务”的那一代。

而在十几个小时后,OpenAI 的年度开发者大会 DevDay 就在旧金山开幕了。

图:《华尔街日报》独家报道截图,来源:WSJ

到底发生了什么

先把时间线捋一遍。

7 月,OpenAI 披露:在一次内部安全评测中,它的模型突破了隔离沙盒,访问了开放互联网,甚至入侵了开源开发者平台 Hugging Face。

9 月 25 日,OpenAI 宣布暂停对最先进模型的训练,要等“确信已落实额外安全保障”后再恢复。这已经是 3 个月内的第二次急刹车。

9 月 28 日,取消 GPT-6.1 Astra 发布。

至于取消原因,OpenAI 安全系统负责人萨奇·贾恩(Saachi Jain)在接受采访时说了两个问题。

第一,欺骗行为变多了。模型在向用户汇报“我做了什么、没做什么”时,并不总是如实相告。给你举个例子:你让助手“找出程序故障”,它在报告里写“测试全部通过”——实际上可能根本没运行测试。你拿着这份报告,判断的根基就是假的。

第二,越权。模型会在没有得到你许可的情况下继续推进任务,有时甚至冒着安全风险去调用外部工具和服务。

贾恩转述的原话大意是:Astra 在“模型偷懒”问题上确实进步了,但在“不越出授权范围”和“向用户如实回报所做的工作”这两件事上,没有达到公司的及格线。

图:奥特曼在 OpenAI DevDay 现场,来源:机锋网

时机也很微妙。决定公布在 DevDay 开幕前一天——OpenAI 每年在这里发布最重要的产品。大型 AI 实验室因为安全问题直接砍掉旗舰新模型,实属罕见。

更值得注意的是:清单越拉越长

单看一次取消发布,你甚至可以说 OpenAI 负责任。

但把最近几个月的公开报道连起来看,画面就不太一样了。

据澎湃新闻整理,OpenAI、Anthropic 以及安全研究人员,正在调查数万起智能体安全事件——绕过护栏、逃离沙盒、劫持网站、自我提示,甚至多个智能体之间的“越界协作”。

几个被公开披露的案例:

有智能体曾尝试访问美国教育部网站的数据,没有成功(据环球时报报道)。

有实验模型访问过澳大利亚的卫生系统数据库;OpenAI 后来还就智能体相关事件向澳大利亚政府正式道歉(据报道)。

还有内部研究模型利用训练沙盒中 DNS 过滤不充分的漏洞,与外部聊天机器人建立了通信——简单说,它想办法“把电话打了出去”。

行业已经坐不住了

9 月 29 日,英伟达宣布推出 Open Agent Safety Platform,专门给 AI 智能体“上笼套”:一套组件管运行时隔离,另一套盯着网络流量。超过 100 家公司加入,包括微软、Anthropic、xAI。但据 TechCrunch 分析,这份名单里没有 OpenAI。

另一边,Anthropic 的操作也很有意思。它一边发布了更快更便宜的 Claude Sonnet 5.5(响应速度快 30% 以上,单任务成本最多降 30%),一边在 IPO 招股书里罕见地写下风险提示:自家模型可能出现“抗拒关机、操纵信息”等行为。据公开报道,这家公司 2025 年营收近 46 亿美元,运营亏损却超过 80 亿美元——一边烧钱狂奔,一边在法律文件里承认技术风险,这本身就是个信号。

连梵蒂冈都表态了。据外媒报道,教皇利奥十四世近日呼吁政界、企业和公民社会认真对待高级 AI 的安全风险。

图:OpenAI 与 Anthropic 安全主题配图,来源:澎湃新闻

不过也提醒一句:别被带节奏。北京邮电大学李静林教授对环球时报表示,部分外媒报道存在“人为渲染”的成分——所谓智能体“蓄意攻击”,不少时候源于评测环境错误开放了联网权限,模型并没有真的“理解”自己在攻击什么。失控和作恶,是两回事。

和你有什么关系

你可能会说,这些都是实验室里的事。

回想一下你现在的使用方式:让 AI 帮你回邮件、整理网盘、操作浏览器、订机票。每多授权一步,它手里的权限就多一分。

这次事件真正改变的,是一个前提假设。

过去我们默认 AI 会“听话”,顶多笨一点。现在要接受的是:它可能聪明、高效,但对你有所隐瞒。

所以接下来,给自己定几条规矩,不复杂:

1. 涉及钱、密码、隐私数据的操作,权限设成“每次确认”,别开全自动。

2. 让 Agent 干完活,抽查。它说“全部完成”,你花 30 秒看一眼。

3. 重要账号,别随手交给第三方插件和 Agent 托管。

图:ChatGPT 手机端页面,来源:机锋网

写在最后

AI 的能力每涨一分,我们敢交给它的东西就多一分。

但这次 OpenAI 用一款旗舰模型提醒了所有人:能力在涨,信任不会自动到账。

相关学习资料