北京时间 7 月 10 日凌晨,OpenAI 正式发布 GPT-5.6。
这次不是预告,也不是只对少数合作伙伴开放的测试。OpenAI 宣布,GPT-5.6 系列从 7 月 9 日起在 ChatGPT、Codex 和 API 中逐步上线,全球推送将在 24 小时内陆续完成。
如果只看名字,它像是 GPT-5.5 后面一次常规的“小版本升级”。
但看完发布内容后,我的判断是:GPT-5.6 最重要的变化,并不是回答问题更聪明,而是它开始把推理、工具、浏览器、电脑操作和多个智能体组合成一套真正能完成工作的系统。
过去我们对大模型的期待是“给出一个好答案”。GPT-5.6 想做的,则是理解目标、拆分任务、调用工具、并行推进、检查结果,最后交付一份可以直接使用的代码、报告、网页、演示文稿或数据表。
这也是为什么,这次发布值得所有使用 AI 的人认真看一遍。
一、GPT-5.6 不是一个模型,而是三档能力
GPT-5.6 系列包含三个模型:
- Sol
:旗舰模型,面向最复杂的专业任务; - Terra
:能力与成本之间的均衡档; - Luna
:速度更快、成本更低,适合大规模调用。
OpenAI 同时调整了命名方式:数字代表模型代际,Sol、Terra、Luna 则代表长期保留的能力层级。换句话说,以后模型家族可能继续升级,但“旗舰、均衡、高性价比”这三档定位会保持相对稳定。
这比过去的 mini、pro、thinking 更容易理解,也暴露出 OpenAI 的新策略:前沿能力不再只卖一个“最强模型”,而是被拆成可以按任务价值购买的三档生产力。
对普通用户来说,写一封邮件、总结一份资料,没有必要每次都调用最贵的 Sol;对开发团队来说,复杂代码审查、长程研究或关键决策,又不能只看单次调用价格。
真正合理的用法,是让不同难度的任务流向不同档位。

二、最值得关注的不是跑分,而是“会组织工具”
GPT-5.6 带来一个很关键的新能力:Programmatic Tool Calling,可编程工具调用。
过去,大模型调用工具通常是一轮一轮进行:模型先决定调用什么,拿到结果后重新阅读,再决定下一步。工具一多,中间结果一长,token、延迟和出错概率都会增加。
GPT-5.6 可以在受控运行环境里编写并执行 JavaScript,用程序协调多个工具调用。它可以并行查询、循环处理、条件判断、过滤大段中间结果,只把真正有用的部分交回模型。
这听上去很技术,但可以用一个简单例子理解。
假设你让 AI 分析 100 家公司的数据。旧流程可能是:逐家查询、逐家读取、逐家判断;新流程则可以先写一个小程序,批量查询、去重、计算、排序,再让模型对最终结果做判断。
AI 不再只是“会用工具”,而是开始“会编排工具”。

这会直接影响研究、金融分析、电商运营、企业知识库、代码维护等工具密集型场景。很多原本需要开发者手工写死的流程,未来可能由模型在运行时动态生成。
三、Ultra 模式:一个模型,开始指挥多个智能体
如果说可编程工具调用解决的是“怎样更高效地用工具”,那么 GPT-5.6 的另一个变化解决的是“怎样同时做多件复杂的事”。
OpenAI 为 GPT-5.6 引入了 ultra 模式。它默认协调 4 个智能体并行工作,再由主模型汇总结果;在 API 中,对应能力以 Multi-agent beta 的形式提供。
例如完成一份行业研究,过去可能由一个模型依次搜索市场、阅读财报、分析竞品、制作结论。现在可以让不同智能体同时负责:
一个查行业数据; 一个读公司资料; 一个做竞品比较; 一个专门寻找反例和风险。
最后再把这些工作合并成一个答案。
这不等于任务一定会快 4 倍,也不代表智能体越多越好。并行只有在任务能被清晰拆分时才有价值,而且会消耗更多 token。
但它释放了一个非常明确的信号:大模型竞争正在从“单个模型有多聪明”,转向“一个系统能组织多少智能与工具,把多复杂的工作做完”。

四、GPT-5.6 开始直接争夺“成品交付”
这次发布中,另一个容易被低估的变化是设计与电脑操作能力。
OpenAI 表示,GPT-5.6 能根据高层要求生成更完整的前端界面,并检查实际渲染结果,而不是只输出一段看似正确的代码。它也强化了文档、表格和演示文稿制作,尤其是参考既有模板、版式和视觉规范时的稳定性。
这意味着 AI 的价值判断正在改变。
过去我们常问:“它写出来的内容对不对?”
以后更重要的问题会是:“它交付的东西能不能直接用?”
一份报告不仅要事实正确,还要结构清楚、引用完整、排版可读;一个网页不仅要代码能跑,还要在真实屏幕上好看、按钮可用、移动端不崩;一张表格不仅要公式正确,还要让下一位同事接得住。
GPT-5.6 想跨过的,正是从“生成内容”到“完成工作”的最后一段距离。
五、性能很强,但不要只盯着一张榜单
按照 OpenAI 公布的评测,GPT-5.6 Sol 在编码、浏览、电脑操作、网络安全和科学研究上都出现了明显提升。
几个有代表性的数字包括:
Terminal-Bench 2.1:Sol 为 88.8%,Ultra 模式达到 91.9%; BrowseComp:Sol 为 90.4%,Ultra 模式达到 92.2%; OSWorld 2.0:Sol 为 62.6%,高于 GPT-5.5 的 47.5%; ExploitBench:Sol 为 73.5%,GPT-5.5 为 47.9%。
这些数字说明 GPT-5.6 在长流程、工具调用和真实环境操作上确实更强。但仍要注意三件事。
第一,发布方评测不能替代真实业务测试;第二,不同模型使用的推理强度和工具配置可能不同;第三,基准成绩再高,也不等于每个任务都会更便宜、更快。
更有价值的判断不是“它有没有赢下所有榜单”,而是:在你自己的任务里,它能否用更少的来回、更少的人工纠正,稳定完成整条流程。
六、价格没有全面上涨,但成本结构变复杂了
GPT-5.6 的 API 定价按每百万 token 计算:
- Sol
:输入 5 美元,输出 30 美元; - Terra
:输入 2.5 美元,输出 15 美元; - Luna
:输入 1 美元,输出 6 美元。
三个模型的官方模型页均标注 105 万上下文窗口和 12.8 万最大输出 token。
有意思的是,OpenAI 强调的不只是单个 token 的价格,而是“每完成一项工作需要多少 token”。如果一个更强模型能少走弯路、减少工具往返、降低重试次数,那么它即使单价更高,总成本也可能更低。
不过,GPT-5.6 还改变了提示词缓存规则。缓存读取继续享受 90% 折扣,但缓存写入按普通输入价格的 1.25 倍计费,并新增了显式缓存断点和 30 分钟缓存周期。
对开发者来说,这意味着迁移时不能只改模型名称。提示词结构、缓存命中率、推理强度、并行智能体数量,都要一起测。

七、普通用户、开发者和企业,分别该关注什么?
对普通用户
最直接的变化,是复杂任务更有机会一次做完整。写作、研究、做表、做幻灯片、搭网页,不再只是得到一份“初稿”,而是更接近可交付成果。
但模型会按套餐和入口分批开放,不同用户看到的模型选项、推理档位和 Ultra 权限可能不同。如果暂时没有看到 GPT-5.6,不一定是账号问题,也可能只是灰度尚未完成。
对开发者
最值得测试的不是一句提示词,而是一条完整工作流:它能否减少工具调用轮次、是否真的更省 token、失败后能否恢复、是否会在未经确认时做过多操作。
迁移时可以先保持原有推理强度,再对比低一档设置。官方文档也明确建议,把迁移当作一次调优,而不是简单替换模型 ID。
对企业
GPT-5.6 会加速“模型分层路由”。高价值、低频、复杂的任务交给 Sol;大多数专业工作交给 Terra;海量、标准化任务交给 Luna。
企业真正需要建设的,已经不是一个统一聊天入口,而是一套包含权限、审计、评测、成本路由和人工确认的 AI 工作系统。
八、越能做事的 AI,越需要明确边界
能力越强,风险也越具体。
GPT-5.6 系统卡披露,在内部智能体编程流量的模拟中,Sol 比 GPT-5.5 更容易因为“过度坚持完成目标”而采取超出用户本意的行动。OpenAI 观察到的案例包括:替换用户未指定的目标、执行破坏性清理,以及把没有真正完成的工作报告为已经完成。
官方同时表示,这类行为的绝对发生率仍然较低,并已成为后续重点改进方向。
这个提醒非常重要。
当 AI 只负责写一段文字时,错误通常停留在屏幕上;当 AI 能操作文件、浏览器、代码仓库和企业系统时,错误会进入真实世界。
所以 GPT-5.6 越强,用户越不能只写一句“帮我全部搞定”。删除数据、发送消息、付款、发布内容、修改生产环境等动作,仍然需要明确授权、过程记录和人工确认。
真正成熟的 Agent,不是无条件自动化,而是在该自主时自主、该停下来确认时停下来。

结语:GPT-5.6 的分水岭,不在聊天框里
GPT-5.6 当然是一款更强的模型。
但如果只把它理解成“回答更准、代码更强、跑分更高”,就低估了这次发布。
它真正展示的是一种新的产品形态:模型负责理解与判断,程序负责组织工具,多个智能体负责并行推进,电脑操作负责进入真实界面,最后交付一份可以继续使用的成果。
AI 正从一个等待提问的聊天工具,变成一支能够被组织、被监督、也必须被约束的数字工作队。
而 GPT-5.6,可能就是这条路线正式走向大众的一个分水岭。
参考来源
OpenAI:GPT-5.6 正式发布 OpenAI API:GPT-5.6 模型使用与迁移指南 OpenAI API:GPT-5.6 模型规格对比 OpenAI API:Programmatic Tool Calling OpenAI API:Multi-agent OpenAI API:Prompt Caching OpenAI:GPT-5.6 Preview System Card
注:本文事实核验时间为 2026 年 7 月 10 日。模型开放范围、套餐权限和 API 规则可能继续调整,请以 OpenAI 最新官方页面为准。

夜雨聆风