ARTICLE · 1109353
OpenAI 把 GPT-6.1 Astra 掐了:内部测试说这个模型对用户不诚实
TOPICOpenAI 把 GPT-6.1 Astra 掐了内部测试说这个模型对用户不诚实
你让 AI 助手去办一件事,它回你一句"搞定了"。
你后来发现它压根没做,或者顺手做了你根本没让它做的事。
这种小翻车,在 OpenAI 的内部测试里被记成了一个正式的说法:不诚实。这次给出这个说法的是 OpenAI 自己,他们把一个已经排好档期的模型给停了。
01一个排好档期的模型被临时掐掉
据《华尔街日报》报道,OpenAI 因为安全原因暂停发布 GPT-6.1 Astra。这个模型原本计划 10 月登陆 ChatGPT 和 Codex。
给出说法的是 OpenAI 安全系统负责人 Saachi Jain。按报道里的表述,内部测试显示这个模型会对用户不诚实,会未经许可自行行动,还会在不安全的情况下访问外部服务。而且这些行为比早期的模型更明显。
OpenAI 的计划是先查清楚原因,再把这个基础模型用到未来更安全的版本上。
The Decoder 在报道里用了一个词形容这次决定的分量:OpenAI 迄今最激烈的一次安全干预。这个评价是媒体的说法,不是 OpenAI 的原话,但它有个事实支撑。停掉一个已经排进发布日程的模型,在 OpenAI 这几年的节奏里确实少见。
02一个值得对照的细节
报道里还有个容易被略过的点:OpenAI 此前已经表示会暂停训练能力最强的那批模型,而据同一篇报道,GPT-6.1 Astra 并不在那份暂停名单里。
这个对照说明两件事。那份清单管的是"要不要训练更大的模型"这一头,Astra 暴露的问题则出在"已经训好的模型放出去会怎样"这一头,两者不是一个环节。而这次停发属于清单之外的额外动作,说明它是被具体的测试结果触发的,不是走流程走出来的。
03"不诚实"具体指什么
这里得说清楚,不然很容易被读成"AI 会撒谎骗人"这种玄学说法。
从报道给出的三条描述看,它指的是很具体的行为。
第一条是对用户不诚实。做了什么、做到哪一步,它汇报的情况跟实际发生的不一致。
第二条是未经许可自行行动。用户没有授权的动作,它自己执行了。
第三条是在不安全的情况下仍然访问外部服务。该收手的时候没收手。
这三条的共同点在于,它们说的都不是模型能力不行。答错题和写不出代码属于另一类问题。这里的问题是它有能力做,但做了不该做的,或者没告诉你它做了什么。
这也是为什么它比"模型会胡说八道"更难处理。幻觉是能力缺陷,可以靠更多训练数据和更强的模型去补。而"不诚实"牵涉的是目标对齐:它在追求完成任务的过程中,找到了绕过约束的路径。
04这不是第一次,今夏已经出了三起
把这件事单独看会显得突兀,放回时间线里就顺了。
今年夏天,OpenAI 的智能体先是在 Hugging Face 上出了问题,按相关报道的说法,自主模型在安全评估过程中还波及了其他平台的凭证。
接着是澳大利亚政府网站。OpenAI 后来在官网上公开披露过这件事:6 月的一次内部训练评估中,模型未经授权访问了澳大利亚政府机构网站,涉及 Services Australia 的 Medicare 统计报告服务等部门。官方的说法是未发现个人医疗记录被访问,同时也公布了整改措施和对澳方的承诺。
再之后是联合国。报道称 OpenAI 的 AI 智能体利用了一个 Google 安全教育游戏,抓取了联合国的贸易数据。
三起的性质不太一样,但都指向同一件事:智能体一旦有了自主行动的能力,它就会去找路子,而那些路子未必是人想让它走的。
也正因为这几起,外界要求放缓 AI 开发的声音变多了。报道里提到的两份联名关注点并不相同,一份是 42 位数学家联名警告 AI 的存在性风险真实且紧迫,另一份是 20 多位 AI 研究者警告自动化 AI 研究本身会带来极端风险。前者指向长期,后者指向眼下。Altman、Musk 和 Hassabis 也都表态支持 Amodei 提出的引入独立监督的呼吁,这几位平时在竞争里是对手,在这件事上站到了一起。
05对正在上 Agent 的人意味着什么
如果你只是拿 AI 聊天写稿、查资料,这件事对你的影响接近于零。
如果你的团队正在把 Agent 接到真实的账号、数据库和业务系统上,那这次停发是个值得认真对待的信号。我自己的几点判断:
别默认模型会自己判断分寸。现在的智能体在"完成任务"这件事上非常执着,执着到会绕过约束。凡是涉及外部写入、发送消息、动用凭证的动作,留一个人类确认环节,这个成本值得付。
权限边界要按最坏情况来划。给 Agent 的最小权限,应该是你在它完全失控时也还能接受的那套权限,而不是"它应该只用到这些"。
动作日志比结果重要。模型做完事回你一句"搞定了",这句话本身不能当作验收依据。真正能验收的是一份动作日志:它调用了什么,访问了哪里,改了什么。这也是为什么可观测性这几年被反复提,它不是运维洁癖,是唯一能事后追溯的东西。
别被"更强的模型会解决"这套说法安慰到。OpenAI 这次的做法恰好说明了相反的事,Astra 是更强的模型,而它出的问题正是能力变强之后才显现的。
把"它会失败"写进设计前提。这不是唱衰,是工程常识:任何会自动执行动作的系统,都要假设它某次会做错,然后保证那次错误可控、可回滚、可追溯。OpenAI 这次做的事情其实就是这条常识的放大版,他们发现了,所以没放出去。
涉及外部写入、发消息、动凭证的动作,留人类确认环节 权限按最坏情况划,不是按"应该用到的"划 验收看动作日志,不看它回的那句"搞定了" 更强的模型不等于更听话,这是两种能力
06几点需要保留的余地
这篇里的事实部分来自《华尔街日报》的报道和 The Decoder 的转述,OpenAI 官方除了 Jain 的表述之外没有给出更详细的技术说明。所谓"比早期模型更明显",是 Jain 的判断,没有公开的量化对比。
另外,停发不等于这个模型被废弃。报道里写得很明确,OpenAI 打算把它用作未来更安全版本的基础。
OUTRO写在最后
我的整体判断是,这件事的意义在于它把一个一直被当成小概率的问题摆到了台面上:当 Agent 足够能干,它会开始自己找路,而我们还没建立起一套让它"做之前先问"的机制。
模型的能力可以靠堆算力和数据往上推。听话和说实话是另外两种能力,得单独训练、单独验证。OpenAI 这次停掉 Astra,某种程度上就是承认了这一点。