ARTICLE · 1140842
AI 一更新,小工具就不灵?给它留 3 道后手
设想你让 AI 帮你写了个小工具:每月把一堆发票整理成一张表,财务接着用这张表对账。用了三个月,一直好好的。
有一天,表里列的顺序变了。你一行代码没改,后面接着用这张表的步骤,全对不上。
出这种事,一个可能的原因是:工具调用的 AI 模型换了版本。就在这一周,OpenAI 一位负责写安全报告的老员工辞职,公开说这家公司发新模型,一直是先发出去、再边用边修[1][3]。
模型什么时候换,由不得你。你能做的,是给小工具留 3 道后手:锁住版本、存 3 份考题定期复测、要发出去要付钱的那一步留给人确认。
下面先把这件事讲清楚,再讲它和你的小工具有什么关系,最后把 3 道后手一道一道讲到能照着做。

图 1|The Atlantic 原文页:标题《I Quit OpenAI Because Its Culture Is Broken》(我辞职,因为 OpenAI 的文化坏了) 来源:The Atlantic,David Robinson 署名文章(2026-10-03)
> 01谁辞职了,说了什么
辞职的人叫 David Robinson,在 OpenAI 的安全团队干了约三年半。据路透社报道,OpenAI 发布前沿模型时配的安全报告,他带头写过 12 次[2]。
10 月 3 日,美国老牌杂志 The Atlantic 登出他的署名长文。开头两句是:我这周从 OpenAI 辞职了;每次大发布配的安全报告,是我带头写的[1]。
他说的问题,科技媒体 TechCrunch 逐字引了几段[3]:
▸ OpenAI 是靠试错长大的,公司管这种做法叫“迭代部署”,也就是先发布、边用边找问题、再补;
▸ 照这个路子走,失败会定期出现,躲不掉;系统能力越强,每次失败的规模也越大;
▸ 例子是最近一起事故:OpenAI 的几个 AI 代理(能自己连续操作、执行任务的 AI)闯进了 Hugging Face 的系统。这家网站是 AI 开发者放模型、放数据的公共仓库。
他认为前沿 AI 公司应该照核电站、繁忙机场的标准运转,多层冗余,一层出错还有下一层兜住[3]。
OpenAI 这边,回应来自发言人 Drew Pusateri 的书面声明[3]。要点有两个:模型的能力,不让它超出公司能安全管住的范围;该慢下来的时候,就暂停训练,或者扣下模型先不放。“文化坏了”这句,回应里没有接。

图 2|视频画面:OpenAI 说必要时会放慢,Hacker News 上不少人不信 来源:本期视频画面,内容据 TechCrunch(2026-10-03)、Hacker News 讨论帖(网友观点,非官方)
程序员常逛的讨论网站 Hacker News 上,这篇长文的讨论帖采集时有 473 分(网友投票攒的热度分)、789 条评论[4]。
多数人偏质疑:没有法律逼着,AI 公司不会自己上核电站那样的层层设防;还有一部分人,把矛头对准了他本人为什么这时候站出来(网友观点,非官方)[4]。
“边发边修”这四个字,对做小工具的人已经是个提醒。
> 02你没改一行代码,结果为什么会变
你让 AI 写的小工具,干活时多半要去问某个 AI 模型:把发票图片发过去,拿回一张表。这一步走的是 API,也就是程序调用 AI 的通道。
小工具的代码在你手里,可它问的那个模型,在 AI 公司手里。
Robinson 批评的是安全:先发出去、出了事再补[3]。借他这句话,要说的是另一件事:AI 公司的节奏是一版接一版地发、一版接一版地改,你接的模型随时可能换。
下面证明“会悄悄换”的例子,来自 Anthropic 和 DeepSeek 的官方文档和一次第三方测试,不是 OpenAI。
我的判断是,对小工具来说,模型换了,等于你手里的工具换了一个零件。你一行代码没动,结果却可能变:列的顺序、日期的写法、金额带不带货币符号,都可能和原来不一样。

图 3|视频画面:发票整理成表格,AI 一更新,列的顺序变了,后面的步骤全对不上 来源:本期视频画面(示意)
写代码的人对这种事不陌生,老办法有两条:上线前多跑一遍测试;出了错,能一键退回上一版。
下面 3 道后手,就是把这两条老办法,搬到你的小工具上。
> 03第一道:锁住版本
// 怎么做
你让 AI 写的小工具,设置里通常有一行写着用哪个模型。让 AI 把它改成官方文档里带版本号的完整名字,不用简称。
怎么判断手里的名字算不算简称:到这家公司官方文档的模型列表里查这个名字。文档说它会“指向最新版”的,就是简称,要换;文档说它固定对应一个版本的,就可以留着。
可以直接这样跟 AI 说:
▍让 AI 锁版本的说法
把这个小工具里调用模型的那一行找出来,告诉我现在用的模型名。对照这家公司官方文档里的模型列表,换成带版本号的完整名字,不要用简称。改完把这一行原样给我看,并把模型名写进说明文件。
// 为什么锁名字有用
Anthropic 是做 AI 助手 Claude 的美国公司。它的官方文档写得很直接:每个 Claude 模型名对应一个固定版本,只要你用这个名字,背后的模型就不会变;有了新版,就出一个新名字[5]。
文档里的原话是这样写的:
Each Claude model ID identifies a pinned version of the model. When you use a model ID in an API request, the underlying model remains constant for the lifetime of that ID.——Anthropic 官方文档[5]
意思是:每个 Claude 模型名对应一个固定版本,只要你一直用这个名字,背后的模型就不变。
同一页也写了例外。早一些的型号有简称,比如 claude-sonnet-4-5,它只是个方便用的指针,会自动指向最新的那一版[5],所以锁版本不能用它。另外,模型外围的服务偶尔会更新,表现可能有小差别[5]。

图 4|Anthropic 官方文档原页:每个模型名对应一个固定版本;早期型号的简称会指向最新的那一版 来源:Anthropic 官方文档《Model IDs and versioning》(2026-10-07 截图)
// 版本号也不是保险箱
国产 AI 公司 DeepSeek 的官方说明,给了一个反面例子。它的《模型 & 价格》页原文是:
旧模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 仍可调用,但对应模型已下线,请求将由 DeepSeek-V4.1-Flash 模型提供服务。——DeepSeek 官方 API 文档[6]
页面没有写这次更换是哪天[6]。

图 5|DeepSeek 官方文档原页:现用模型名和版本,下面的脚注写着旧名字仍可调用、由 V4.1-Flash 提供服务 来源:DeepSeek 官方 API 文档《模型 & 价格》(2026-10-07 截图)
也就是说,你锁的那个旧名字照样能用,回答你的已经换了。工具不会报错,你也不会收到提示。
锁版本能挡住大部分“悄悄换”,挡不住全部,所以还要第二道。
> 04一次重跑:名字没变,回答的换了
“官方说名字不变”和“实际有没有换”,有人测过。下面这张测试条件卡,是第三方的测试,不是本号跑的。
项目 | 内容 |
谁测的 | Vals AI,美国一家 AI 评测公司,独立重跑 |
我们从哪看到 | Value Add VC 网站的排名文章引用的结果[7]。这是一家做创投数据和研究的网站,主编 Trace Cohen 是天使投资人;页面注明文章由 AI 辅助起草。数字是它引用 Vals AI 的,不是它自己测的 |
哪天 | Vals AI 这份排行 9 月 22 日更新;文章写“截至 9 月 26 日”,9 月 29 日最后更新 |
考什么 | Terminal-Bench 4.0:在命令行(程序员敲文字指令的窗口)里完成编程任务的一套考题 |
比谁 | Anthropic 的 Claude Opus 5.5,OpenAI 的 GPT-6 Astra(页面只写到这一层,没给接口里的完整模型名) |
跑了几次 | Opus 5.5 那边 198 次任务尝试;Astra 跑了几次,页面没有交代 |
出的岔子 | 198 次里有 30 次,是服务方自动换成旧版 Claude 来答的(页面原文:provider-side fallback,服务方的后备切换) |
谁打分、怎么判 | 页面没有交代 |

图 6|Value Add VC 文章原页:发布和更新日期,以及“61.6%,旧版顶替算失败则 53.5%”那句 来源:Value Add VC《Best AI Models (September 2026): Opus 5.5 vs GPT-6, Ranked》(2026-10-07 截图)
结果要按两种算法看[7]。只看分数:Opus 5.5 是 61.6%,Astra 是 57.1%,Claude 占先。Anthropic 自己公布的成绩是 66.4%[7]。
把那 30 次旧版顶替算成失败:Opus 5.5 掉到 53.5%,Astra 还是 57.1%,反倒是 OpenAI 占先[7]。

图 7|测试条件卡和两种算法:只看分数 Claude 占先,把旧版顶替的 30 次算失败,OpenAI 占先 来源:Value Add VC 引用 Vals AI 独立重跑 Terminal-Bench 4.0 的排行(2026-09-22 更新)
这组数要打个折扣:它是 Value Add VC 引用的结果,文章由 AI 辅助起草[7]。
两个百分比照页面原样引用(页面精确到 61.62% 和 53.54%[7]),具体怎么算的、旧版为什么会顶上来答,页面都没有交代。可它和 Anthropic 文档放在一起看,正好说明一件事:官方的承诺写在文档里,实际跑的时候,还是可能出岔子。
名字锁住了,也得拿你自己的考题复测。
> 05第二道:存 3 份考题,定期复测
// 怎么做
1. 挑 3 份真实资料。我的建议是:一份最常见的,一份格式最乱的,一份以前出过错的。拿发票工具说,就是 3 张真发票。
2. 每份配一份标准答案:你自己核对过的正确结果,比如那 3 张发票整理出来、你确认无误的那张表。
3. 资料和答案放进同一个文件夹,名字写清楚,比如“考题”。
4. 什么时候跑:收到你用的那家 AI 公司发的更新通知(邮件或官网公告),或者每周固定一次。
5. 只比关键的几列,比如日期、公司、金额;AI 每次措辞、空格有小差别,不算错。关键列对不上,先停用,别让错的表流到下一步;再回到第一道,检查模型名该不该换。
让 AI 给小工具加一个“复测”,可以这样说:
▍让 AI 加复测的说法
在这个小工具里加一个复测功能:读“考题”文件夹里的 3 份资料,各跑一遍,把结果和同名的标准答案对比,只比日期、公司、金额这几列。哪一份、哪一行、哪一列不一样,都打印出来;这几列只要有一处不一样,就停下,不往下走。
// 只在网页上聊天的人
要是你不写小工具,只在网页上跟 AI 聊天,模型版本你选不了。这种情况,第一道用不上,全靠这一道:把 3 份常用的提问和满意的回答存下来,隔一阵拿同样的提问再问一次,看回答有没有走样。
考题是你自己定的,模型怎么换,标准都在你手里。
> 06第三道:发出去、付钱的那一步,留给人确认
小工具最怕的,是一路跑到底:整理完表格自动发给客户,或者自动付款。前面任何一步变了样,错的东西就直接出了门。
所以,凡是要发出去、要付钱的那一步,让工具停一下,等你点了确认再走。
▍让 AI 加确认的说法
在发送邮件和付款之前加一步:先把要发的内容、收件人、金额完整列出来给我看,等我输入“确认”才继续;我不确认,就停在这里。
这一道和 Robinson 说的“层层留后手”是一个思路:前两道没拦住的,最后还有人看一眼。

图 8|视频画面:还有两道后手,存 3 份真实资料当考题;要发出去、要付钱的那一步留给人确认 来源:本期视频画面
这位安全员工批评得在不在理,还得看 OpenAI 接下来怎么做。AI 公司边发边修的节奏,你左右不了;你的小工具稳不稳,一部分在你自己手里。
这周就能先做一件事:把 3 份考题存好。
本文是视频《AI 一更新小工具就不灵?3 道后手》的文字版,补充了 Robinson 文章的原话、OpenAI 回应的原文意思、Anthropic 和 DeepSeek 文档里的细节、Vals AI 重跑的测试条件,以及 3 道后手能直接说给 AI 的话。Hacker News 上的内容是网友观点,非官方;Vals AI 的数字据 Value Add VC 文章引用。
全部依据
[1] The Atlantic:David Robinson 署名文章《I Quit OpenAI Because Its Culture Is Broken》(2026-10-03,开头公开部分)www.theatlantic.com/technology/2026/10/openai-safety-team-resignation/688881/
[2] 路透社:OpenAI safety employee quits, says 'time for trial and error is over'(2026-10-03)www.reuters.com/legal/litigation/openai-safety-employee-quits-says-time-trial-error-is-over-2026-10-03/
[3] TechCrunch:OpenAI safety employee resigns, claiming the company's 'culture is broken',含 OpenAI 发言人 Drew Pusateri 书面回应(2026-10-03)techcrunch.com/2026/10/03/openai-safety-employee-resigns-claiming-the-companys-culture-is-broken/
[4] Hacker News(程序员论坛):I quit OpenAI because its culture is broken 讨论帖(2026-10-03;分数和评论数为 2026-10-05 采集时;网友观点,非官方)news.ycombinator.com/item?id=49944227
[5] Anthropic 官方文档:Model IDs and versioning(2026-10-07 查并截图)platform.claude.com/docs/en/about-claude/models/model-ids-and-versions
[6] DeepSeek 官方 API 文档:模型 & 价格(2026-10-07 查并截图;页面没有写更新日期)api-docs.deepseek.com/zh-cn/quick_start/pricing
[7] Value Add VC:Best AI Models (September 2026): Opus 5.5 vs GPT-6, Ranked(2026-07-12 首发,2026-09-29 更新;引用 Vals AI 2026-09-22 更新的 Terminal-Bench 4.0 独立重跑排行;网址里是旧型号名,页面标题和内容是 2026 年 9 月版,2026-10-07 已核对)valueaddvc.com/blog/best-ai-models-in-2026-ranked-gpt-5-claude-4-gemini-2-5-grok-3-compared