乐于分享
好东西不私藏

GPT-5.6全面上线,Codex App的时代结束了.

GPT-5.6全面上线,Codex App的时代结束了.

凌晨两点,Skill改到第三版,眼皮都开始打架了。

习惯性刷一眼手机,卧槽,GPT-5.6上线了。

这次OpenAI一口气发了三个模型,旗舰叫Sol,均衡款叫Terra,主打性价比的叫Luna,太阳、大地、月亮,凑成一家三口。

这次Codex直接消失,Codex独立App直接跟ChatGPT合体了,往后不再有单独的Codex应用,老版聊天界面被压缩成了一个小入口。

桌面端左上角现在能直接切换工作Work、Codex、定时任务、站点这几个模式。

先说模型定位。

Sol定位是啃最难的长链路任务,价格每百万token输入5美元、输出30美元,走高端路线。

Terra是均衡款,官方说是拿到了GPT-5.5的水准,价格直接减半,输入2.5美元、输出15美元,日常办公基本都接得住。

Luna最便宜,输入1美元、输出6美元,主打走量。但长上下文是硬伤,Luna在长文本任务上的分数比Sol低了一大截,用它聊长文得留个心眼。

在覆盖55个领域长期专业工作流的Agents' Last Exam中,Sol拿了53.6分,比Claude Fable 5高13.1分,就算开中等推理档也能高出11.4分,成本只要对方四分之一。

编程这块优势更明显,Artificial Analysis编程智能体指数上,Sol拿了80分创最新纪录,比Fable 5高2.8分,输出token和耗时都少了一半多。

我翻到官方发布页最后的评测大表,有几个数字挺打脸的。

SWE-Bench Pro上,Sol只有64.6%,Claude Fable 5是80%,这不是几分的差距,直接是断层。

专业知识工作评测GDPval-AA上,Sol是1747.8 Elo,Claude Fable 5是1759.6 Elo,也是小比分落后。

不过在网络安全效果上,GPT-5.6 Sol在衡量从接触漏洞代码到任意代码执行进展的ExploitBench上,它输出token预算得分为73.5%。

意味着只需要极低的成本,就可以达到几乎跟Claude Fable 5相同的网络安全效果。

更值得一提的是,GPT-5.6 这次带来一个新玩法:Ultra模式。

它可以同时跑4个agent并行处理,适合特别复杂的任务。

如果是大型的任务,需要开到极高,或者你的token实在烧不完的时候,偶尔再把推理等级开到Ultra,是Token利用率最高的解法。

我是Pro套餐,这一波5小时额度大概消耗了20%左右,周额度掉了2到3个点,比我预想的省不少。

这次主要是靠插件目录打通了Slack、Notion、微软365、谷歌云盘这些日常工具,输入@加应用名就能调上下文。

再说说这次新增的Sites功能,非开发者做完东西没法上线,这个大问题算是被正面解决了。

看完客户资料和Slack聊天记录,做完东西说一句:用Sites部署一下,它会自动更新一份战略客户方案,自动帮你挂到线上,给你一个能分享的域名。

我拿它顺手测了个PPT,数据表格类的内容处理得确实强。

但审美这块,说实话看着能用,GPT-5.6生成的PPT依然很丑:

做PPT大家就可以完全不用考虑GPT-5.6了。

整体判断上,如果你要的是那种稳定、便宜、跑得快的日常执行活,GPT-5.6这波性价比是实打实的。但要说它能替代人在审美和创意上的判断,我觉得还早。

最后我把套餐权限,按官方最新说法给大家理清楚。

工作模式和Codex里,免费和Go用户能用Terra,Plus往上可以在Sol、Terra、Luna之间随便切换推理力度。

聊天那边,Plus往上都能用Sol,Pro和企业版另外多个Sol Pro选项。

ChatGPT Work这个新功能今天先对Pro、企业版、教育版开放,Plus和Business用户还要再等几天。

max模式对所有能用上GPT-5.6的Work和Codex用户开放,ultra这块,Work里是Pro和企业版专属,Codex里Plus往上就能用。

如果你想知道这个新工具怎么落到团队的日常工作里,欢迎来找我聊聊。

我们,下次再见。