💡 7 月 9 日,OpenAI 在同一天丢出三件事:被政府按了 12 天的 GPT-5.6 全量放开;Codex 应用整个并入 ChatGPT 桌面端;还有一个叫 ChatGPT Work 的新东西上线——它不回答问题,它直接替你把活干完。单看每一件都是常规更新,拼在一起,是 OpenAI 把产品线重新拧了一遍。
两周前写过一篇《OpenAI 发了新旗舰,却不让你用》:6 月 26 日 GPT-5.6 发布,最强的 Sol 变体却只开放给少数政府审核过的合作伙伴,理由是「应美国政府请求」。当时留了个悬念——闸门什么时候开。
答案是 12 天。7 月 9 日,GPT-5.6 全家桶正式全量上线(GA),覆盖 ChatGPT、Codex 和 API。但这只是当天新闻的三分之一。同一天,Codex 桌面应用宣布并入 ChatGPT 桌面端;也是同一天,ChatGPT 里多了一个叫 Work 的智能体——能连你的 Slack、网盘和邮箱,自己拆任务、自己排活,连续干几个小时,最后交给你一份成品。
📌 一、闸门开了:GPT-5.6 全量上线
据 Axios 及 TechTimes 报道,从 6 月 26 日到 7 月 9 日这 12 天里,GPT-5.6 一直处在一个「法律上自愿、实际上像预审」的状态:美国商务部下属的 AI 标准与创新中心(CAISI)做了额外测试,OpenAI 的工程师和政府官员做了直接的技术沟通,然后限制解除,公开发布。这大概是迄今最清晰的一个先例:在 2026 年的美国,发布前沿模型这件事,事实上要先过一遍华盛顿。
放开的东西和预览时一致:三个变体,太阳系命名。
Sol(太阳) :旗舰,对标最难的任务; Terra(大地) :均衡款,官方定位是「GPT-5.5 级性能、更低成本」; Luna(月亮) :最快最便宜,给高并发场景。
OpenAI 这次给 GPT-5.6 定的主叙事,不是「更聪明」,而是 「每个 token 榨出更多活」 。官方公告里反复出现的词是 performance per dollar——同样的钱办更多事,或者同样的事花更少的钱。
几个官方给出的数字:
在 Agents' Last Exam (覆盖 55 个专业领域的长程工作流基准)上,Sol 拿到 53.6 的新高,领先 Claude Fable 5 达 13.1 分;即便调到中等推理档,也还领先 11.4 分,而估算成本只有对方的约四分之一。 在 Artificial Analysis 编程智能体指数 上,Sol 满推理档拿到 80 分,比 Fable 5 高 2.8 分,同时输出 token 不到对方一半、耗时不到一半、成本约低三分之一。Terra 也略高于 Fable 5,Luna 则压过 Opus 4.8。 在 OSWorld 2.0 (电脑操作基准)上,Sol 拿到 62.6% 的新纪录,超过 Opus 4.8 的同时少用了 85% 的输出 token。
📊 以上数据均引自 OpenAI 官方 GPT-5.6 发布公告(2026-07-09),其中成本与耗时为 OpenAI 基于自家生产环境的离线模拟估算,实际结果可能有出入。
跑分漂亮,但上篇立下的规矩这里还得用一次: 看跑分,先看是谁给你看的。 这次 OpenAI 大方公布了 SWE-Bench Pro 的成绩——Sol 64.6%。这个数字比上一代 GPT-5.5 的 59.4% 有进步,但离 Claude Fable 5 的 80% 还差 15 个点以上。也就是说,在「真实 GitHub issue 修没修好」这道硬题上,Anthropic 依然明显领先;OpenAI 赢的是效率账和长程任务,不是所有单项。两家各有各的主场,这个格局没变。另据 TechTimes 等报道,第三方评估机构 METR 在预览期的软件任务测试中检出了创纪录的「作弊率」(模型走捷径绕过任务本意),给这份成绩单加了一个需要持续观察的注脚。
另外据 TechTimes 报道,Sol 还将在 Cerebras 的芯片上以最高每秒 750 个 token 的速度供货——这个速度对需要实时响应的 agent 循环来说,是从「能用」到「顺手」的差别。
📌 二、价格账:标价没降,账单在降
GPT-5.6 的价格表本身没什么惊喜——Sol 和上一代 GPT-5.5 的定价一模一样。但把同梯队的旗舰拉通了比,事情就有意思了:
📊 GPT-5.6 定价据 OpenAI 官方公告;Fable 5、Opus 4.8 定价据 Anthropic 官网及此前报道;Grok 4.5 据 xAI 官方公告(2026-07)。

单看标价,Sol 的输入价是 Fable 5 的一半、输出价是六成,Grok 4.5 依然是全场最便宜。但标价只是这笔账的一半,另一半是 token 效率 ——同一份活各家要烧多少 token。OpenAI 这次的核心卖点正在这里:官方称在编程智能体任务上,Sol 用不到 Fable 5 一半的输出 token 拿到更高的分;而在 Agents' Last Exam 上,Terra 和 Luna 能以约 十六分之一 的估算成本超过 Fable 5 的成绩。
把两层叠起来,官方给出的成本估算是这样一组区间:编程智能体任务上 Sol 比 Fable 5 约低三分之一;Agents' Last Exam 中等推理档约为对方的四分之一;换到 Terra、Luna 档位,最低能到十六分之一。口径各不相同(都是 OpenAI 的离线模拟估算),但方向一致:完成同一份工作,实付账单明显更低。这和我们前两天写 Grok 4.5 时算的是同一种账——当前沿模型能力咬得很紧时,竞争的主战场就从跑分挪到了账单。现在三家里,Anthropic 卖「最强单项」,xAI 卖「最低标价」,OpenAI 卖「最高性价比」,站位已经清清楚楚。
对开发者还有一个实际的利好:GPT-5.6 把提示词缓存做得更可控了——支持显式设置缓存断点,最短缓存期 30 分钟;缓存写入按 1.25 倍输入价计费,命中读取仍打一折。对于反复带着同一大段上下文跑的 agent 工作流,这笔省下的钱可能比模型差价本身更可观。
📌 三、ultra:一次调用,四个分身
预览期我们重点讲过 Sol 新增的两个推理档位,这次 GA 把细节和开放范围都落定了。
max :比 xhigh 更长的思考时间,让模型多探索几条路、多做几轮自查,适合「慢点没关系、错了才要命」的任务。 ultra :默认派出 4 个并行智能体 分头干活,再汇总结果。用更多 token 换更强的结果和更短的完工时间。
官方给的例证是 Terminal-Bench 2.1:Sol 单干 88.8%,ultra 四个分身一起上,冲到 91.9%——用并行把「分数—耗时」的边界整体往上推了一格。
配套的还有两个 API 层面的东西。一个是 Programmatic Tool Calling :模型可以现场写一段轻量程序去协调工具、过滤中间结果,不用把每次工具返回都塞回模型再走一轮——工具密集型任务的 token 消耗和往返次数都能省下来。另一个是 Responses API 里的 multi-agent beta :开发者可以在一次请求里让模型自己起子代理并汇总,也就是把 ultra 这套「派分身」的玩法开放出来自己搭。
这条线我们跟了一年:从外挂调度框架,到把编排能力内化进模型。ultra 走到今天这一步,意味着「多智能体系统」正式从架构师的活,变成了 API 里的一个参数。
开放范围:ChatGPT Work 里 ultra 给 Pro 和 Enterprise 用户;Codex 里放得更宽,Plus 及以上就能用。
📌 四、ChatGPT Work:动词从「回答」换成「完成」
当天真正的新物种,是 ChatGPT Work。
官方的定义是:一个内置在 ChatGPT 里的智能体,能跨你的应用和文件采集信息,把复杂项目拆成小步骤独立执行,必要时连续跑几个小时,最后产出表格、幻灯片、文档、网页应用这样的 成品 。它的底座是 Codex 的技术——这里有一组值得注意的数字:Codex 每周活跃用户超过 500 万,其中超过 100 万人用它干的根本不是写代码的活。OpenAI 显然从这里读出了信号:既然一个编程智能体已经被自发用成了「万能打工的」,那就干脆把它产品化。
ChatGPT Work 的几个关键件:
Plugins(插件) :把 ChatGPT 接到 Slack、Teams、Google Drive、SharePoint、邮箱、日历、CRM 这些你日常干活的地方。提示词里打 @ 加应用名,就能指定从哪里取上下文。

Scheduled Tasks(定时任务) :让它按计划或按事件触发干活——每周汇总 Slack 新消息刷新会议议程、每天早上巡一遍网站和仪表盘发日报、邮件里来了新反馈就自动更新演示文稿。你不在电脑前,活也在往前走。

Sites(公测) :把工作成果直接生成可分享的交互式网站或 Web 应用——实时仪表盘、项目跟踪器、内部门户,一个 URL 发给团队。 桌面端加强 :桌面版 ChatGPT 内置了浏览器,能自己上网查资料、操作网页工具;还有 Computer Use——它可以直接操作你的电脑,在各种本地应用之间点击、输入、挪文件。
效果如何?OpenAI 给了自家的数据:内部接近 100% 的团队在用 ChatGPT Work 和 Codex,财务团队的月结和预测从几天压缩到几小时,销售团队把一次客户沟通在 24 小时内变成了定制化的概念验证——以前这要几周。当然,这是官方口径的内部案例,参考价值有,滤镜也有。
还有一个容易被忽略的信号藏在公告末尾:OpenAI 宣布 开始逐步关停独立的 Atlas 浏览器 ,把从中学到的东西并进 ChatGPT 和 Chrome 侧边栏扩展。去年被寄予厚望的「AI 浏览器」路线,试验了一圈,最终还是收编回主产品——入口不必另起炉灶,能力长在 ChatGPT 身上就够了。
开放范围上,Web 和移动端的 ChatGPT Work 从 7 月 9 日起先给 Pro、Enterprise 和 Edu 用户,Plus 和 Business 在随后几天跟上;桌面 App 则全球上线,所有套餐(包括免费档)都能用到 Chat、Work、Codex 三个模式,只是免费和 Go 档只能用 Terra 模型。
计费方式也值得注意:ChatGPT Work 干的是长活,按用量计费,沿用 Codex 的用量结构——任务越复杂,消耗你套餐里的额度越多。「替你上班」不是无限量供应的。
📌 五、Codex 并入桌面端:一个 App 装下聊天、办公和写码
第三件事看起来最小,其实最能说明 OpenAI 在想什么:Codex 桌面应用从 7 月 9 日起并入新的 ChatGPT 桌面端。
据 Codex 官方 changelog,合并后的桌面应用把 Chat、Work、Codex 三个模式装进同一个 App。老用户正常升级,项目、设置、工作流全保留;开发者可以把 Codex 设成默认视图,macOS 上连图标都能继续用 Codex 的。原来的 ChatGPT 桌面版改名 ChatGPT Classic,退居二线。

这次合并不只是换个壳,Codex 本体也加了几个实打实的功能:
直接在应用里编辑 Markdown 和代码,支持行内批注,选中一段就能让 Codex 改; GitHub PR review 进了侧边栏,评审意见和 diff 并排看,不用切出去; 一个项目里可以同时挂多个代码仓库; Computer Use 换上 GPT-5.6 后速度更快。
把三件事放到一起看就清楚了:GPT-5.6 是引擎,ultra 和 multi-agent 是传动,ChatGPT Work 和 Codex 是两个轮子——一个面向办公,一个面向工程——合并后的桌面 App 则是那台整车。与其说 OpenAI 这天发了三个产品,不如说它做了一次总> 💡 7 月 9 日,OpenAI 在同一天丢出三件事:被政府按了 12 天的 GPT-5.6 全量放开;Codex 应用整个并入 ChatGPT 桌面端;还有一个叫 ChatGPT Work 的新东西上线——它不回答问题,它直接替你把活干完。单看每一件都是常规更新,拼在一起,是 OpenAI 把产品线重新拧了一遍。
两周前写过一篇《OpenAI 发了新旗舰,却不让你用》:6 月 26 日 GPT-5.6 发布,最强的 Sol 变体却只开放给少数政府审核过的合作伙伴,理由是「应美国政府请求」。当时留了个悬念——闸门什么时候开。
答案是 12 天。7 月 9 日,GPT-5.6 全家桶正式全量上线(GA),覆盖 ChatGPT、Codex 和 API。但这只是当天新闻的三分之一。同一天,Codex 桌面应用宣布并入 ChatGPT 桌面端;也是同一天,ChatGPT 里多了一个叫 Work 的智能体——能连你的 Slack、网盘和邮箱,自己拆任务、自己排活,连续干几个小时,最后交给你一份成品。
📌 一、闸门开了:GPT-5.6 全量上线
据 Axios 及 TechTimes 报道,从 6 月 26 日到 7 月 9 日这 12 天里,GPT-5.6 一直处在一个「法律上自愿、实际上像预审」的状态:美国商务部下属的 AI 标准与创新中心(CAISI)做了额外测试,OpenAI 的工程师和政府官员做了直接的技术沟通,然后限制解除,公开发布。这大概是迄今最清晰的一个先例:在 2026 年的美国,发布前沿模型这件事,事实上要先过一遍华盛顿。
放开的东西和预览时一致:三个变体,太阳系命名。
Sol(太阳) :旗舰,对标最难的任务; Terra(大地) :均衡款,官方定位是「GPT-5.5 级性能、更低成本」; Luna(月亮) :最快最便宜,给高并发场景。
OpenAI 这次给 GPT-5.6 定的主叙事,不是「更聪明」,而是 「每个 token 榨出更多活」 。官方公告里反复出现的词是 performance per dollar——同样的钱办更多事,或者同样的事花更少的钱。
几个官方给出的数字:
在 Agents' Last Exam (覆盖 55 个专业领域的长程工作流基准)上,Sol 拿到 53.6 的新高,领先 Claude Fable 5 达 13.1 分;即便调到中等推理档,也还领先 11.4 分,而估算成本只有对方的约四分之一。 在 Artificial Analysis 编程智能体指数 上,Sol 满推理档拿到 80 分,比 Fable 5 高 2.8 分,同时输出 token 不到对方一半、耗时不到一半、成本约低三分之一。Terra 也略高于 Fable 5,Luna 则压过 Opus 4.8。 在 OSWorld 2.0 (电脑操作基准)上,Sol 拿到 62.6% 的新纪录,超过 Opus 4.8 的同时少用了 85% 的输出 token。
📊 以上数据均引自 OpenAI 官方 GPT-5.6 发布公告(2026-07-09),其中成本与耗时为 OpenAI 基于自家生产环境的离线模拟估算,实际结果可能有出入。
跑分漂亮,但上篇立下的规矩这里还得用一次: 看跑分,先看是谁给你看的。 这次 OpenAI 大方公布了 SWE-Bench Pro 的成绩——Sol 64.6%。这个数字比上一代 GPT-5.5 的 59.4% 有进步,但离 Claude Fable 5 的 80% 还差 15 个点以上。也就是说,在「真实 GitHub issue 修没修好」这道硬题上,Anthropic 依然明显领先;OpenAI 赢的是效率账和长程任务,不是所有单项。两家各有各的主场,这个格局没变。另据 TechTimes 等报道,第三方评估机构 METR 在预览期的软件任务测试中检出了创纪录的「作弊率」(模型走捷径绕过任务本意),给这份成绩单加了一个需要持续观察的注脚。
另外据 TechTimes 报道,Sol 还将在 Cerebras 的芯片上以最高每秒 750 个 token 的速度供货——这个速度对需要实时响应的 agent 循环来说,是从「能用」到「顺手」的差别。
📌 二、价格账:标价没降,账单在降
GPT-5.6 的价格表本身没什么惊喜——Sol 和上一代 GPT-5.5 的定价一模一样。但把同梯队的旗舰拉通了比,事情就有意思了:
📊 GPT-5.6 定价据 OpenAI 官方公告;Fable 5、Opus 4.8 定价据 Anthropic 官网及此前报道;Grok 4.5 据 xAI 官方公告(2026-07)。

单看标价,Sol 的输入价是 Fable 5 的一半、输出价是六成,Grok 4.5 依然是全场最便宜。但标价只是这笔账的一半,另一半是 token 效率 ——同一份活各家要烧多少 token。OpenAI 这次的核心卖点正在这里:官方称在编程智能体任务上,Sol 用不到 Fable 5 一半的输出 token 拿到更高的分;而在 Agents' Last Exam 上,Terra 和 Luna 能以约 十六分之一 的估算成本超过 Fable 5 的成绩。
把两层叠起来,官方给出的成本估算是这样一组区间:编程智能体任务上 Sol 比 Fable 5 约低三分之一;Agents' Last Exam 中等推理档约为对方的四分之一;换到 Terra、Luna 档位,最低能到十六分之一。口径各不相同(都是 OpenAI 的离线模拟估算),但方向一致:完成同一份工作,实付账单明显更低。这和我们前两天写 Grok 4.5 时算的是同一种账——当前沿模型能力咬得很紧时,竞争的主战场就从跑分挪到了账单。现在三家里,Anthropic 卖「最强单项」,xAI 卖「最低标价」,OpenAI 卖「最高性价比」,站位已经清清楚楚。
对开发者还有一个实际的利好:GPT-5.6 把提示词缓存做得更可控了——支持显式设置缓存断点,最短缓存期 30 分钟;缓存写入按 1.25 倍输入价计费,命中读取仍打一折。对于反复带着同一大段上下文跑的 agent 工作流,这笔省下的钱可能比模型差价本身更可观。
📌 三、ultra:一次调用,四个分身
预览期我们重点讲过 Sol 新增的两个推理档位,这次 GA 把细节和开放范围都落定了。
max :比 xhigh 更长的思考时间,让模型多探索几条路、多做几轮自查,适合「慢点没关系、错了才要命」的任务。 ultra :默认派出 4 个并行智能体 分头干活,再汇总结果。用更多 token 换更强的结果和更短的完工时间。
官方给的例证是 Terminal-Bench 2.1:Sol 单干 88.8%,ultra 四个分身一起上,冲到 91.9%——用并行把「分数—耗时」的边界整体往上推了一格。
配套的还有两个 API 层面的东西。一个是 Programmatic Tool Calling :模型可以现场写一段轻量程序去协调工具、过滤中间结果,不用把每次工具返回都塞回模型再走一轮——工具密集型任务的 token 消耗和往返次数都能省下来。另一个是 Responses API 里的 multi-agent beta :开发者可以在一次请求里让模型自己起子代理并汇总,也就是把 ultra 这套「派分身」的玩法开放出来自己搭。
这条线我们跟了一年:从外挂调度框架,到把编排能力内化进模型。ultra 走到今天这一步,意味着「多智能体系统」正式从架构师的活,变成了 API 里的一个参数。
开放范围:ChatGPT Work 里 ultra 给 Pro 和 Enterprise 用户;Codex 里放得更宽,Plus 及以上就能用。
📌 四、ChatGPT Work:动词从「回答」换成「完成」
当天真正的新物种,是 ChatGPT Work。
官方的定义是:一个内置在 ChatGPT 里的智能体,能跨你的应用和文件采集信息,把复杂项目拆成小步骤独立执行,必要时连续跑几个小时,最后产出表格、幻灯片、文档、网页应用这样的 成品 。它的底座是 Codex 的技术——这里有一组值得注意的数字:Codex 每周活跃用户超过 500 万,其中超过 100 万人用它干的根本不是写代码的活。OpenAI 显然从这里读出了信号:既然一个编程智能体已经被自发用成了「万能打工的」,那就干脆把它产品化。
ChatGPT Work 的几个关键件:
Plugins(插件) :把 ChatGPT 接到 Slack、Teams、Google Drive、SharePoint、邮箱、日历、CRM 这些你日常干活的地方。提示词里打 @ 加应用名,就能指定从哪里取上下文。

Scheduled Tasks(定时任务) :让它按计划或按事件触发干活——每周汇总 Slack 新消息刷新会议议程、每天早上巡一遍网站和仪表盘发日报、邮件里来了新反馈就自动更新演示文稿。你不在电脑前,活也在往前走。

Sites(公测) :把工作成果直接生成可分享的交互式网站或 Web 应用——实时仪表盘、项目跟踪器、内部门户,一个 URL 发给团队。 桌面端加强 :桌面版 ChatGPT 内置了浏览器,能自己上网查资料、操作网页工具;还有 Computer Use——它可以直接操作你的电脑,在各种本地应用之间点击、输入、挪文件。
效果如何?OpenAI 给了自家的数据:内部接近 100% 的团队在用 ChatGPT Work 和 Codex,财务团队的月结和预测从几天压缩到几小时,销售团队把一次客户沟通在 24 小时内变成了定制化的概念验证——以前这要几周。当然,这是官方口径的内部案例,参考价值有,滤镜也有。
还有一个容易被忽略的信号藏在公告末尾:OpenAI 宣布 开始逐步关停独立的 Atlas 浏览器 ,把从中学到的东西并进 ChatGPT 和 Chrome 侧边栏扩展。去年被寄予厚望的「AI 浏览器」路线,试验了一圈,最终还是收编回主产品——入口不必另起炉灶,能力长在 ChatGPT 身上就够了。
开放范围上,Web 和移动端的 ChatGPT Work 从 7 月 9 日起先给 Pro、Enterprise 和 Edu 用户,Plus 和 Business 在随后几天跟上;桌面 App 则全球上线,所有套餐(包括免费档)都能用到 Chat、Work、Codex 三个模式,只是免费和 Go 档只能用 Terra 模型。
计费方式也值得注意:ChatGPT Work 干的是长活,按用量计费,沿用 Codex 的用量结构——任务越复杂,消耗你套餐里的额度越多。「替你上班」不是无限量供应的。
📌 五、Codex 并入桌面端:一个 App 装下聊天、办公和写码
第三件事看起来最小,其实最能说明 OpenAI 在想什么:Codex 桌面应用从 7 月 9 日起并入新的 ChatGPT 桌面端。
据 Codex 官方 changelog,合并后的桌面应用把 Chat、Work、Codex 三个模式装进同一个 App。老用户正常升级,项目、设置、工作流全保留;开发者可以把 Codex 设成默认视图,macOS 上连图标都能继续用 Codex 的。原来的 ChatGPT 桌面版改名 ChatGPT Classic,退居二线。

这次合并不只是换个壳,Codex 本体也加了几个实打实的功能:
直接在应用里编辑 Markdown 和代码,支持行内批注,选中一段就能让 Codex 改; GitHub PR review 进了侧边栏,评审意见和 diff 并排看,不用切出去; 一个项目里可以同时挂多个代码仓库; Computer Use 换上 GPT-5.6 后速度更快。
把三件事放到一起看就清楚了:GPT-5.6 是引擎,ultra 和 multi-agent 是传动,ChatGPT Work 和 Codex 是两个轮子——一个面向办公,一个面向工程——合并后的桌面 App 则是那台整车。与其说 OpenAI 这天发了三个产品,不如说它做了一次总装。
📌 六、安全:拦得更狠了,也更贵了
上篇讲过 GPT-5.6 被按住的核心原因是网络安全能力,GA 之后这套逻辑变成了常态化的运营。
官方公布的几个事实:GPT-5.6 是 OpenAI 迄今网络安全能力最强的模型——ExploitBench(漏洞利用基准)73.5%,上一代只有 47.9%;相应地,安全栈也是迄今最重的——新的 cyber 防护拦截量约是以前的 10 倍 ,发布前跑了约 70 万 A100e GPU 时的自动化红队测试。最强的攻防能力被锁进 Trusted Access 计划,只对完成身份验证、开启高级账户安全的个人和机构开放。

ChatGPT Work 这边配的是 auto-review 机制:用最先进的模型在涉及外部工具和 API 的关键动作执行前做一道审查。官方称在对抗性红队测试中,它拦下了 100% 的敏感数据窃取尝试——包括审查模型训练时没见过的攻击。这个「100%」当然只对已测试的攻击面成立,但姿态很清楚:让 AI 替人干活的前提,是先让另一个 AI 盯着它干活。
拦截变狠的副作用是误伤。OpenAI 自己也承认这套保守策略会给正常使用添堵,所以在 ChatGPT 和 Codex 里加了个选项:被拦了可以一键换低能力档的模型重试。安全和可用之间的这道缝,暂时是用「降级重试」糊上的。
📌 模型发布的时代正在过去,工种发布的时代开始了
上篇的结尾我们说,GPT-5.6 最该被记住的不是跑分,而是「最强的那一档开始默认不对所有人开放」。12 天后闸门开了,而这次真正该被记住的,依然不是跑分。
是那个合并后的桌面 App。聊天、办公、写码装进同一个入口,模型在底下按需要派分身、开档位,插件把你的 Slack、网盘、日历全接进来,定时任务让它在你睡觉时继续干活。OpenAI 这次交付的不是一个更强的模型,而是一个完整的「数字同事」——有脑子(GPT-5.6)、有手(Computer Use 和浏览器)、有工位(桌面 App)、有考勤(按用量计费)。
模型发布的时代正在过去,工种发布的时代开始了。装。
📌 六、安全:拦得更狠了,也更贵了
上篇讲过 GPT-5.6 被按住的核心原因是网络安全能力,GA 之后这套逻辑变成了常态化的运营。
官方公布的几个事实:GPT-5.6 是 OpenAI 迄今网络安全能力最强的模型——ExploitBench(漏洞利用基准)73.5%,上一代只有 47.9%;相应地,安全栈也是迄今最重的——新的 cyber 防护拦截量约是以前的 10 倍 ,发布前跑了约 70 万 A100e GPU 时的自动化红队测试。最强的攻防能力被锁进 Trusted Access 计划,只对完成身份验证、开启高级账户安全的个人和机构开放。

ChatGPT Work 这边配的是 auto-review 机制:用最先进的模型在涉及外部工具和 API 的关键动作执行前做一道审查。官方称在对抗性红队测试中,它拦下了 100% 的敏感数据窃取尝试——包括审查模型训练时没见过的攻击。这个「100%」当然只对已测试的攻击面成立,但姿态很清楚:让 AI 替人干活的前提,是先让另一个 AI 盯着它干活。
拦截变狠的副作用是误伤。OpenAI 自己也承认这套保守策略会给正常使用添堵,所以在 ChatGPT 和 Codex 里加了个选项:被拦了可以一键换低能力档的模型重试。安全和可用之间的这道缝,暂时是用「降级重试」糊上的。
📌 模型发布的时代正在过去,工种发布的时代开始了
上篇的结尾我们说,GPT-5.6 最该被记住的不是跑分,而是「最强的那一档开始默认不对所有人开放」。12 天后闸门开了,而这次真正该被记住的,依然不是跑分。
是那个合并后的桌面 App。聊天、办公、写码装进同一个入口,模型在底下按需要派分身、开档位,插件把你的 Slack、网盘、日历全接进来,定时任务让它在你睡觉时继续干活。OpenAI 这次交付的不是一个更强的模型,而是一个完整的「数字同事」——有脑子(GPT-5.6)、有手(Computer Use 和浏览器)、有工位(桌面 App)、有考勤(按用量计费)。
模型发布的时代正在过去,工种发布的时代开始了。
夜雨聆风