ARTICLE · 1062112
【AI前沿】刚谈 AI 减速,两家却同日上新:Opus 5.5 与 GPT‑6 Sol 到底在争什么?
刚谈 AI 减速,两家却同日上新:Opus 5.5 与 GPT‑6 Sol 到底在争什么?
2026 年 9 月 23 日|AI 资讯与独立判断
9 月 12 日,Anthropic CEO Dario Amodei 呼吁给前沿 AI 的能力进步“配速”;OpenAI CEO Sam Altman 随后表示支持让外部评估者深入公司核查安全实践。十天后的 9 月 22 日(美国时间),Anthropic 发布 Claude Opus 5.5,OpenAI 也发布 GPT‑6 Sol 和 GPT‑6 Luna。网上的第一反应很直接:说好的慢下来呢?
这组发布恰好值得认真看。两家都没有把“更聪明”当成唯一卖点:Anthropic 要把接近顶级模型的能力做得更便宜、更稳;OpenAI 要把 GPT‑6 家族的能力压进大规模可用的成本区间。所谓“放慢”,如果不是公关语言,就必须在这种商业压力最大的时刻接受检验。

图:Claude Opus 5.5 官方发布视频节选。
先把“三个新模型”放在正确位置
Opus 5.5 是 Anthropic 新 5.5 家族的首款模型。Anthropic 说,它在多数工作上达到 Claude Fable 5.1 的水平;与 Opus 5 相比,典型任务的运行成本下降约 40%,输出速度提高超过 30%。API 标价为每百万输入 token 4 美元、输出 token 20 美元,分别比 Opus 5 低 20%;缓存读取降至 0.20 美元。这里的“运行成本降 40%”来自价格与任务 token 用量共同变化,不能误读成每一种 token 都降了 40%。Anthropic 官方说明

图:官方演示的另一段画面。动态素材分段处理,便于手机阅读。
OpenAI 一次发布的是两个档位。**Sol 是面向复杂日常工作的主力,Luna 是便宜到适合大规模调用的轻量档;GPT‑6 Astra 仍是官方定位中的最高能力档。**Sol API 标价每百万输入 / 输出 token 为 2 / 10 美元,Luna 为 0.10 / 0.50 美元。相对 GPT‑5.6 系列的促销价格,OpenAI 宣称新款约降价 50%。Sol 与 Luna 均可通过 API 使用,并开始面向符合条件的 ChatGPT Work 与 Codex 用户逐步开放;免费和 Go 用户可在桌面应用尝试 Luna。OpenAI 发布说明OpenAI 开发者文档

图:GPT‑6 Sol 与 Luna 官方发布视频节选。
只看 API 标价,Sol 的输入和输出价格均为 Opus 5.5 的一半,Luna 又比 Sol 低一个数量级。但实际账单还受推理档位、缓存命中、工具调用次数和重试率影响。价格表只告诉你“单价”,不告诉你“一件事做完要花多少”。
Opus 5.5:能力天花板,更像成熟的工作搭档
Anthropic 给出的强项是代理编程、计算机操作和知识工作。其报告的 Terminal‑Bench 4.0 成绩为 66.4%,FrontierCode 54.4%;在 GDPval‑AA 知识工作评估中取得 1846 Elo。一个早期测试客户用它在一天内迁移了约 68 万行代码;另一个测试把约 20 万行代码的审计与修复从 Opus 5 的 20 多小时缩至 3 小时以内。这些客户案例有参考价值,但不能等同于所有团队都能复现的平均表现。Anthropic 官方数据与案例

图:独立评测机构 Artificial Analysis 的模型智能指数及任务成本分布。横轴是每项任务成本,不是 API token 标价。
独立评测给出的方向基本一致,但更有层次。Artificial Analysis 在统一评估中给 Opus 5.5 的最高推理档打出 58 分,是其当时测试过的最高分;在专业知识工作测试 AA‑Briefcase 中取得 1822 Elo,尤其在分析质量与成品呈现上领先。需要补一条重要限定:这一评测启用了 Anthropic 默认的安全回退机制,所以测到的是实际服务配置,不是每一次请求都由 Opus 5.5 单独完成。Artificial Analysis 评测

图:Opus 5.5 在知识工作类任务中的位置。
网上最直观的试用还包括 3D 场景。Anthropic 的 Alex Albert 展示了用 Opus 5.5 驱动 Blender 构建 1906 年旧金山市场街场景的过程。它证明模型更擅长将描述转成空间场景、组织工具操作;但一个漂亮演示仍需检查史实准确度、模型结构、材质质量和可复用性,不能直接当成稳定的影视资产管线。

图:Alex Albert 公开展示的 Blender 场景构建视频节选。
GPT‑6 Sol 与 Luna:省钱很真,能力提升不能照单全收
OpenAI 公布的 Sol 在 AutomationBench、DeepSWE、OSWorld 等任务上进步明显。例如在其选定的 DeepSWE 设置下,Sol 最高推理档为 68.8%,Luna 为 66.6%;Sol 在 OSWorld 2.0 离线部分奖励评分为 60.5%。官方还表示 Sol 在其内部事实性评测中,比前代少犯约一半错误,并改进了表达方式:回答更直接、少术语、少无用细节。OpenAI 发布数据
但发布图表有一个容易忽略的细节:OpenAI 比较的是旧版 Claude Opus 5 或 Fable 5.1,Anthropic 表格中的 OpenAI 对照则是旧版 GPT‑5.6 Sol。两家官方发布材料都不是“昨天两款新模型同场考试”的答案。

图:Artificial Analysis 对 GPT‑6 Sol / Luna 的成本与能力评估。
Artificial Analysis 的结论尤其值得产品团队看:GPT‑6 Sol 最高档的智能指数单任务成本约 1.06 美元,约为 GPT‑5.6 Sol 的一半;Luna 约 0.07 美元。Sol 的编码代理指数从前代 55 升至 57,Luna 却从 43 降至 41。也就是说,“更便宜”比“全面更强”更有把握。Artificial Analysis 独立报告

图:Sol 的编码代理表现小幅提高;Luna 则有回落。
另一个很微妙的变化是“少胡说”。独立评测中,Sol 的幻觉率显著下降,但它回答的问题也变少:尝试作答比例由前代的 99% 降到 83%,准确率反而从 59% 降到 54%。这可以是审慎,也可能让用户遇到更多“我不确定”。对于研究、客服或医学信息产品,不能只用一个“幻觉率下降”就下结论,必须同时看拒答率与有效完成率。Artificial Analysis 数据说明

图:更低的幻觉率与更高的放弃作答比例,需要放在一起读。
网上试用:真实体验比榜单多一层矛盾
开发者 Simon Willison 第一时间把三款新模型放进自己的日常工作。他认为 Luna 的价格极具竞争力,也把 Sol 和 Opus 5.5 分别设为自己在 Codex 与 Claude Code 中的默认模型。但他记录了一个反例:让 Opus 5.5 在最高推理档画一只骑自行车的鹈鹕,它两次在长时间推理后都没交付结果,触及输出上限;每次花了约 2.56 美元和近 20 分钟。这个测试不是综合排名,却提醒我们:更高推理档不保证更好,失控的思考成本也属于产品体验。Simon Willison 的实测记录

图:知识工作评测中的变化,显示答案短不等于交付完整。
产品负责人 Claire Vo 则做了盲测:邮件、PRD、前端原型、后端、长任务、SVG 与视频编辑一起比。她的判断是:Astra 最令她惊喜;Opus 5.5 在长任务和 B 2 B 前端上更稳;Sol 在清晰写作、可读 PRD 与价格方面有吸引力。她也发现同一轮测试里,人类审美与模型裁判的偏好并不一致。这比单张排行榜更贴近产品团队的实际选择:能交付、好修改、可维护,比“第一眼惊艳”更重要。Claire Vo 的盲测记录
也有网友根据几张截图直接判断“Sol 比前代更差,只是便宜”。这种情绪能理解,但结论太快。独立评测确实看到知识工作项目交付退步,同时也测到编码代理、自动化和事实性指标的改善;同一个模型换推理档位、工具与评分方式,结果会变。把某一项回退写成“全线退步”,和把官方宣传写成“全线胜利”一样,都不可靠。
早期接入方 Lovable 的内部评估说,Sol 在从零构建应用的测试中,比 GPT‑5.6 Sol 高 6%—12%,其“遵循简报”和设计基础能力进步更明显;同时它也报告 Opus 5.5 在现有代码库里可以用更少步骤完成工作。这些是产品方自己的工作流数据,样本、评分准则与竞争关系都需要纳入判断,不能把它们搬成通用排行榜。Lovable 的 Opus 5.5 测试说明
“放慢研发”与继续发布,真矛盾在哪里?
Dario 原文并非要求立刻停训或停止发布。他说的“配速”,核心是让能力增长不要跑在对齐、审计、监控和第三方评估前面;首先提出让外部评估者获得持续、接近员工级别的访问权。Altman 公开支持这一点,也强调配速不等于停下。Dario 原文美联社对双方表态的核对
Anthropic 在 Opus 5.5 的发布文中主动回应了这个疑问:它说当前模型的风险大致仍可用现有测试和防护体系管理;这次发布前请了 METR 与 Frontier Design 外部评估。对于将来能自动推进 AI 研究的更强系统,它不认为现有措施一定够用。Anthropic 安全说明
这解释了“为什么还能发”,却没有替行业完成证明。外部评估的覆盖范围是什么?第三方能公开哪些不利结果?一次发布后发生事故,是否有清晰的停用与复盘机制?这些比“发了新模型是否打脸”更接近要害。我的判断是,商业竞争的速度目前没有慢下来;真正可验证的进步,应该是安全证据的透明度与约束力变强。
给设计师、产品经理和开发者的实际选法
如果是长流程研究、复杂代码迁移、需要反复核对的专业交付,先试 Opus 5.5。它的成本高于 Sol,但独立评测和早期客户案例都说明,它在困难任务和成品质量上更值得一次测试。先用默认或中等推理档,别把“max”当成自动增益。
如果是持续迭代的产品开发、日常编程、PRD 改写和多轮原型,Sol 很有竞争力。你要测的不是单次回答,而是从简报到可上线交付的总轮数、人工返工时间和遗漏项。把“完成标准”写入提示与验收清单,尤其能防止简短回答漏掉重要要求。
如果是大量重复的分类、提取、数据库问答和低风险自动化,Luna 的价格很诱人。但它在部分编码和知识工作评测中退步,别因为便宜就把需要完整判断的任务全丢给它。更好的做法是用 Luna 分流,再把不确定或高价值任务升级给 Sol 或 Opus。

图:同一评测套件中的多维指标。决定选型的不是一个总分,而是你的任务落在哪一列。
这轮发布最有意思的地方,不是“谁赢了”,而是两个方向同时成立:顶级模型继续抬高复杂工作的上限,便宜模型则让原本算不过账的产品流程开始可行。安全讨论也因此不能只盯着训练速度;当更便宜的代理被嵌进更多真实系统,部署规模、权限边界和可追责性,同样会决定下一次风险从哪里出现。
数据说明:截至 2026 年 9 月 23 日。官方成绩、独立基准和个人试用的测试条件不同;文中分别标注,未将其混作同一排行榜。动态图片均为公开演示的短节选。
更多 AI 前沿技术与设计灵感,欢迎关注「设计小站」公众号(ID:sjxz00),一起探索科技与设计的融合创新。
- END -