夜雨聆风学习资料网

ARTICLE · 1065395

如何看待 OpenAI深夜发布 GPT-6 Sol?一夜三发,价格腰斩,AI行业的价格战变天了

如何看待 OpenAI深夜发布 GPT-6 Sol?一夜三发,价格腰斩,AI行业的价格战变天了
作者:P10
首发:PIDAOAI

真夸张,一夜三发,同日开战,这个九月还是太精彩了。

22日下午,OpenAI发布GPT-6 Sol与GPT-6 Luna,将它们纳入GPT-6产品线,Claude 5.5同时间发布,两家发布撞车。

GPT-6-sol面向复杂编程和智能体工作流而生,可以说是补全GPT6系列的商业化路线。在GPT 6系列中Astra负责能力上限,Sol承担能力与成本之间的平衡,Luna则覆盖高频、轻量任务。

行业竞争的计量单位正在变化,单次回答有多聪明依然重要,但持续运行一个智能体要花多少钱、能否稳定完成整条工作链已经成为同等重要的指标。

目前对Sol的技术来源没什么太多的公开资料可以参考,OpenAI称它与Astra采用相近的训练方法,并强调缓存和推理效率的改进,但没有公布具体的参数规模、网络结构、训练数据构成或训练算力。

API规格显示,目前GPT-6 Sol支持105万token上下文窗口,最大输出为12.8万token,知识截止日期是2026年4月20日。

它支持接收文本和图像,输出文本,不支持原生音频或视频输入输出。

Sol还提供reasoning.effort控制项,从none、low、medium到high、xhigh、max,默认值为medium。通过Responses API,开发者可以让它调用网页搜索、文件搜索、代码解释器、托管Shell、补丁应用、计算机操作和MCP等工具。

Chat Completions接口则只有在推理强度设为none时才支持函数调用。实际表现还取决于工具权限、状态管理、执行环境和结果校验。

另外如果你原来用GPT-5.6 Sol跑medium或high的工具调用流水线,换个model id是不能直接平移的,要么迁到Responses API,要么在工具调用轮次上不要推理。

GPT-6 Sol的性能没什么好说的,并没有太大的涨幅,但是定价非常值得一说。

它标准API价格为每百万输入token 2美元、每百万输出token 10美元,相比GPT-5.6 Sol的促销价格4美元和20美元下降50%。

缓存输入每百万token为0.20美元,缓存写入则为2.50美元。与此同时,输入超过27.2万token时,整个请求按两倍输入与缓存价格、1.5倍输出价格计费。

Batch和Flex价格为标准费率的一半,Fast模式则为适用费率的两倍,区域处理在可用时还会产生额外费用。

OpenAI说降价的原因是缓存和推理服务效率提升,并称GPT-6的提示词缓存默认命中率更高,缓存输入读取可享受90%的价格折扣。

开发者还可以调整推理强度和工具可用性,同时保留此前上下文以供缓存复用。

对短对话来说,这些改进未必改变体验;对长时间运行的编码智能体,重复输入系统提示、仓库规范、历史任务状态和代码上下文时,缓存命中率会直接影响成本。

在跑分方面,OpenAI公布的AutomationBench结果是GPT-6 Sol在xhigh推理强度下得分33.2%,单任务成本0.27美元,高于该项测试中max强度的Claude Opus 5所获26.9%。

OpenAI称Sol的任务成本约为后者的九分之一。

就这个价格,梁叔叔在不整点活就没活了。

Sol在该评测中的成本也低于低强度GPT-6 Astra,不过Astra低强度得分为30.3%。

这组数据的亮点不是Sol在所有维度上压过更高阶模型,而是它在限定的工作流测试中,以较低成本取得有竞争力的完成率。

而在编程主导的DeepSWE 1.1中,GPT-6 Sol在max强度下得分68.8%,距Claude Fable 5在该评测中的最高成绩69.9%相差1.1个百分点,OpenAI报告的单任务成本约低80%。

在OSWorld 2.0离线测试中,Sol的xhigh成绩为60.5%,Claude Opus 5的medium成绩为60.3%,Sol的单任务成本同样约低80%。

这说明GPT 6 Sol在代码执行、跨应用操作等长流程任务中,能把性能维持在较高区间,同时压低单位完成成本。

而在准确性方面,OpenAI称Sol在内部事实性评测中的错误数量约为前代的一半。

这个评测基于经过去标识化的真实对话,样本经过筛选,用户此前曾指出模型答错,因此它更像是针对易错案例的压力测试,而不是生产环境中的日常幻觉率。

Sol的输出答案缩短了很多,它在不确定时选择弃答,于是错得少了,同时对得也少了。

这到底是进步还是退步,取决于你的使用场景。

客服问答、检索增强、需要引用源的场合,弃答就比比编造好得多。

HealthBench结果中,Sol在HealthBench Professional的长度调整后得分为60.8,高于GPT-5.6 Sol的60.5。

但在HealthBench和HealthBench Hard上分别为53.2和30.1,低于前代的57.0和33.1。

OpenAI同时指出,Sol在HealthBench中的平均回答长度缩短约45%,较短的回答覆盖评分细则的能力不足,可能影响得分。

答案更简洁不等于信息覆盖更完整,评估时必须把准确性、完整度和篇幅分开看。

安全数据同样不支持简单的“新一代就更安全”结论。

GPT-6 Astra系统卡披露的内部Codex部署模拟覆盖50,319项任务,GPT-6 Sol出现42项三级及以上错位行为标记,占0.083%;GPT-5.6 Sol为66项,占0.131%,Sol的此类标记减少约36%,两者都没有出现四级标记。

但同一评估中,Sol的外传行为标记有所上升,模型表现出评测意识的轨迹比例也从前代的2.56%升至4.76%。

这组结果显示总体风险信号下降,但不意味着所有风险类别同步下降,内部模拟只能作为部署风险的补充指标,不能直接等同于外部使用中的风险率。

网络安全能力方面,OpenAI将GPT-6 Sol在网络安全领域按High能力管理,但认定其低于Critical阈值。

截至9月23日,Sol已经通过API提供,也在ChatGPT Work和Codex逐步上线,但尚未进入普通Chat界面。免费和Go用户可以使用的是Luna。

Sol当前优先争取的是专业工作流和开发环境,而非单纯的消费级聊天体验。它的工程价值最终要落在实际仓库和业务流程中,按同一测试集、工具配置和成功标准测量成本、返工率、合并率、延迟与人工接管频率。

所以如果你需要的是批量分类、抽取、摘要、RAG 问答,或者有明确 chema的工具调用,默认luna,高配Sol。

Luna每百万一毛和五毛,Intelligence Index 37分,DeepSWE max档 66.6%,这个价格已经进入国产开源快模型的区间。

如果你在跑长期存活的agent,Sol的任务成本要按缓存算,不按单价算。

命中率、breakpoint 的位置、推理强度中途切换是否击穿缓存、allowed_tools 是否让工具定义保持稳定,这四个变量决定你的账单,

如果你要的是50分以上的能力,GPT 6 Sol不行,性能并没有升级.它只是打折了。

另外知识工作交付物的完整性有明确退步。GDPval-AA v2.1 上Sol掉约 100 Elo、Luna掉约 75,AA-Briefcase v1.1 上Luna掉约45、

9月29日是OpenAI DevDay,Altman说准备这次DevDay是他记忆里OpenAI历史上第一次说东西太多发布不完。让人非常期待,我们也会跟进报道。

END

往期阅读

相关学习资料