Claude Opus 5 深度评测:这次没追顶配,反而更值得企业看
👋 YuLing Ai · 让 AI 在你公司真正落地
制造业 AI 工程化 · 企业 AI 落地实战
TL;DR:这次发布反常——它不是"最聪明的模型",Anthropic 自己都说最强仍是 Fable 5。Opus 5 的定位是"每天都用的那一个":用接近顶配的智能换一半的价格。对企业采购者,真正的信号是模型选型的坐标轴正从"最聪明"转向"够用且最便宜"。
7 月 24 日,Anthropic 发布 Claude Opus 5。过去三年,各家实验室比的是"最强模型在状态最好那天能干什么";Opus 5 比的是另一件事:一个足够好的模型,每天、以一半的成本,能稳定交付什么。对企业采购者来说,这个转向比又一次刷新榜单更重要。
先把最该记住的几条摆出来:
• 价格:5 美元 / 百万输入 token,25 美元 / 百万输出 token,与上一代 Opus 4.8 完全一致,却是 Fable 5 的一半。API 上的模型名是 claude-opus-5。• 定位:Claude Max 的新默认模型、Claude Pro 上最强的可选模型,官方定位"为每天使用而设计"。 • 能力:多个编码与知识工作基准刷到 SOTA,但网络安全、生物学仍落后自家的 Mythos 5,某些智能体编码基准也被 OpenAI 的 GPT-5.6 Sol 压着。 • 真正的卖点:不是峰值分数,是"每一块钱买到的能力",以及模型会自己验证、自己返工的行为。
这篇把事实、官方图表、各方评价和我的判断分开讲清楚,读完你能拿走一张选型检查清单。
一、跑分全景:赢在多数,但不是全赢
先看官方给出的横向对比。这张表把 Opus 5 和 Fable 5、上一代 Opus 4.8、以及 OpenAI 的 GPT-5.6 Sol 放在同一批基准上比。

图里几个关键读数:
• 智能体终端编码(Frontier-Bench v0.1):Opus 5 拿 43.3%,是 Opus 4.8(21.1%)的两倍多,也高于 Fable 5 的 33.7% 和 GPT-5.6 Sol 的 34.4%。 • 知识工作(GDPval-AA v2):Opus 5 得 1861,高于 Fable 5 的 1747、Opus 4.8 的 1593。 • 新颖问题求解(ARC-AGI-3):Opus 5 得 30.2%,把次优的 GPT-5.6 Sol(7.8%)甩开近四倍,Opus 4.8 只有 1.5%。 • 智能体搜索(BrowseComp):Opus 5 得 90.8%,略高于 GPT-5.6 Sol 的 90.4%。 • 计算机操作(OSWorld 2.0):Opus 5 得 70.6%,全场最高。 • 商业工作流(AutomationBench):Opus 5 得 26.0%,明显领先第二名一大截。
但它不是全赢,这点值得如实说:智能体编码的 DeepSWE v1.1 上,GPT-5.6 Sol 以 72.7% 领先;FrontierCode 主榜(53.5% vs 53.4%)和法律基准(13.3% vs 11.7%)上,Fable 5 险胜;医疗 HealthBench 上,Mythos 5 的 66.0% 最高。一个不吹满的对比表,比"全项第一"的通稿更可信——也提醒你:选型要看你那类任务的那一行,不是看谁高亮多。
二、真正的故事是"每块钱的分数",不是峰值分
这次发布从头到尾埋着一条线:Opus 5 不只是分数高,是"每块钱的分数"高。价格压在 Opus 4.8 不变,关键智能体基准却翻倍——按"每单位能力"算,等于一次大幅降价。官方特意强调,图表看的是"在给定成本下的表现",而不是单纯的峰值。
这张"按 effort 档看的编码得分—成本曲线",是整场发布最该看懂的一张。

怎么读这张图:横轴是单次任务成本(美元,对数轴),纵轴是得分,每条线是一个模型在不同 effort(努力档:low→max)下的表现。看位置——越靠左上越好,即花更少的钱、拿更高的分。Opus 5(红线)整条压在 Fable 5(黄线)的左上方:同样的分数,Opus 5 花的钱明显更少;到高档位时它稳定在 43% 左右,而 Opus 4.8(蓝线)整条还在 20% 以下。官方还专门说明:在 CursorBench 3.2 上,Opus 5 max effort 的成绩距 Fable 5 峰值只差 0.5%,但单任务成本只有一半。这就是"用一半成本接近顶配"的可视化证据。
这里插一句对开发者实用的点:effort 是个可调旋钮。同一个模型,你可以为省 token 拨低档、为难任务拨高档。很多日常任务低档就够,这正是"每天都用"定位的底气。
早期客户的反馈也带着不寻常的具体数字,比空泛的"更强了"有说服力:
• 法律 AI 公司 Harvey 说,Opus 5 达到了 Opus 4.8 最高推理档的相近表现,同时"平均少生成 26% 的 token"。 • Fundamental Research Lab 说,在高难度金融建模任务上,模型准确率平均高出 9 个百分点,"而且少用约三分之一的轮次和工具调用、少花 60% 的时间"。 • Zapier CEO Wade Foster 说,Opus 5 登顶了他们的 AutomationBench,"没比之前的 Claude 模型多花 token",跑通了一整套防流失工作流:"以前的模型过不了,Opus 5 拿了 100%。"
为什么这些企业只报"更少的轮次、更少的时间"而不是"更高的原始分"?因为对已经在花钱的企业来说,推理成本早就是董事会级别的一行预算。一个用更少 token 干成同样活的模型,不是锦上添花,它本身就是产品。
在"新颖问题求解"这类硬任务上,成本-收益的断层更夸张:

图里 Opus 5(high 档)孤零零地待在 30% 的高度,而 GPT-5.6 Sol 只有约 8%、Opus 4.8 贴着地板 1.5%。注意横轴是总评测成本——Opus 5 这个分数是花了更多总算力换来的,但这种断层式领先说明:在"没见过的新问题"上,它确实换了个台阶,不是靠记忆题库。
三、比跑分更值得关注的:模型开始自己验证、自己返工
Anthropic 这次卖的还有一个行为故事:Opus 5 会检查自己的产出、反复迭代直到成功。官方给了几个像"机器执拗"寓言的例子:
• 一个 Frontier-Bench 任务给模型一张机械零件图,要它写代码重建成 3D FreeCAD 模型——但故意不给它任何"看图"的接口。Opus 5 的反应是:自己写了一条计算机视觉流水线,从原始像素里把几何结构抠出来,再重建整个零件,而且能稳定复现。相同设置下,没有一个竞品模型在五次尝试内做出来。 • 给一个流行开源包管理器里的真实 bug,Opus 5 找到根因,还顺手修了社区补丁漏掉的一个边界情况;某竞品只修了表面症状就宣布搞定。 • 一位交易公司的工程师用 Opus 5 在单次会话里给一个新交易所搭数据接入——之前的模型即便给了详细计划也做不出来。因为没有实时数据源可校验,Opus 5 甚至自己搭了一套测试桩,来验证自己的解析代码对不对。
这才是企业真正在意的能力。一个能产出看似合理答案的模型,和一个会验证自己答案的模型,差的是"演示"和"能上线的系统"之间的距离。今天企业用 AI 的隐性成本,大头是人工复核——工程师在替机器检查作业。一个能可靠自查的模型,压缩的正是这块成本。这也解释了为什么客户反复引用"更少的轮次、更少的时间",而不是更高的原始分。
四、科学研究:一个容易被忽略的增量
在编码和成本的热度之外,Opus 5 在科学研究上的进步值得单独点一句,尤其对生命科学、材料、制造相关的企业。
官方说,Opus 5 在他们每一项生命科学评测上都优于 Opus 4.8,覆盖结构生物学、有机化学、生物信息学。进步最明显的是有机化学任务,比如从光谱数据反推分子结构——比 Opus 4.8 高 10.2 个百分点;以及蛋白质相关任务,比如预测蛋白质序列变化如何影响其功能——高 7.7 个百分点。官方也直说:这让 Opus 5 成为它"通用可得模型里科研能力最强的一个"。
但边界也划清楚了:在真正长时程、开放式的自主科研任务上(比如自主药物设计),Mythos 5 仍是更强的那个。这条线和前面"有界 vs 长时程"的分野是一致的——Opus 5 强在能界定的任务,顶配强在跑得远。
五、安全侧:最"对齐"的一代,但攻防能力被刻意压住
Anthropic 说 Opus 5 是它迄今最"对齐"的模型。这张自动化行为审计图给了量化结果。

得分是 1–10 分制、越低越安全。Opus 5 得 2.30,是几款模型里最低的——低于 Opus 4.8(2.85)、Mythos 5(2.81)和 Sonnet 5(3.35)。官方说它比 Opus 4.8、Sonnet 5、Fable 5 更好地遵守 Claude 的"宪法",欺骗行为率最低,最不容易被诱导滥用,也是"在避免难以撤销的鲁莽操作上最安全的一代"。
网络安全能力则被有意压制。下面这张 OSS-Fuzz 图把"发现漏洞"和"利用漏洞"拆成两半看。

左图是"发现漏洞"的成功率:Opus 5 达 79.4%,逼近 Mythos 5 的 80.0%,远高于 Opus 4.8 的 61.5%。右图是"写出可用利用"的数量:Opus 5 只成功 4 个,Mythos 5 有 13 个,Opus 4.8 是 0 个。擅长发现、拙于利用——这个不对称是 Anthropic 设计出来的:偏防御相关的"找洞"能力保留,偏进攻相关的"打洞"能力压住。官方明说,他们像对 Opus 4.8 一样,有意不拿网络攻击任务去训练 Opus 5;它在找漏洞上的进步,是"变得更通用"顺带来的副产品。
六、护栏与开发者更新:这些才是落地时真正碰到的东西
对要把模型接进生产的团队,下面这些比跑分更贴身。
网络安全护栏更"精准"而非更"一刀切"。Opus 5 的 cyber 分类器比 Fable 5 宽松:允许它在源码里找漏洞,但拦住"基于二进制"的漏洞扫描(更常和恶意行为绑定)、渗透测试和利用代码生成。官方估计,这套分类器的触发频率会比 Fable 5 少约 85%。在 Claude.ai / Claude Code / Claude Cowork 里,被拦的请求默认降级回 Opus 4.8;API 上也能开这个降级。此外还有一个 Cyber Verification Program(CVP)——已加入的企业和研究者可直接用到一个安全限制更少的 Opus 5 版本,专门给正当安全工作放行。
这套"分类器触发就降级到低能力模型"的机制,暴露了 2026 年 AI 安全的真实逻辑:风险不是问题本身的属性,而是问题乘以回答系统的能力。同一个请求,对 Opus 5 太危险、对 Opus 4.8 就可接受,因为后者能力更低、被滥用造成的实际危害也更低。
生物学请求改道。因为 Opus 5 的护栏和 Opus 4.8 相仿,这次发布起,原本在 Fable 5 上被拦的生物学请求,会路由到 Opus 5 而不是 Opus 4.8——等于给正当科研放宽了可用模型。
几个开发者会直接受益的更新:
• Fast 模式:约 2.5 倍默认速度,价格是 Opus 5 基准价的两倍,Claude 平台和 Claude Code 里都可用。 • 对话中途换工具不再让 prompt 缓存失效(beta):长链路智能体开发者会比任何跑分都开心这条。 • API 自动降级(beta):开启后,被安全分类器拦下的 Opus 5 / Fable 5 请求会自动路由到下一个可用模型,而不是直接被拒——默认总是走"当前最好可用模型"。 • 不做数据留存:和以往 Opus 一样,通用访问下没有数据留存要求。对有"零数据留存"硬性合规要求的企业,这点是明牌。
七、多方怎么看:把不同声音摊开
同一个发布,不同位置的人读出的东西很不一样。只听官方通稿会失真。
VentureBeat 抓到了最有价值的一句自我供述。问及 Opus 5 在哪儿还不如 Fable 5,Anthropic 发言人回答:"Opus 5 赢的那些评测,是有明确结果的有界任务,那是它最强的地方。这些评测测不到的,是持续时长。Opus 5 是基准能看见的那些活的最佳工具;而当任务超出基准的视野,你会去拿 Fable 5。"——"有界任务 vs 长时程自主",这可能成为 2026 年模型选型的核心分野。
CNBC 把它放进市场大背景:AI 支出不再是实验,企业在为"回报不清楚的昂贵模型"收紧钱包。Anthropic 研究产品负责人 Dianne Penn 说得直白:"如果是更便宜的方案,但达不到相近的质量,那其实没用。"降价不降质,才是这次的算盘。
批评的声音也有,而且尖锐。 产品评测人 Claire Vo 在 Lenny's Newsletter 的实测里给了个拧巴的结论——"聪明得出色,但也烦人"。她描述 Opus 5 有种"神经质"的人格:在真实编码会话里,它拒绝去碰一个 merge conflict;她还专门吐槽了"Claude Slop"——啰嗦,废话多到"让我血压升高"。这条提醒很实在:跑分高不等于用着顺手,冗长本身是成本。
八、我的判断:中国企业该从这次发布里读出什么
先说两种没用的读法。一种是"又刷榜了,真强";一种是"跟我没关系,反正用不上"。都跳过了对国内落地真正有价值的信号。我认为有三点值得记下来。
第一,选型的坐标轴变了:从"最聪明"变成"够用且最便宜"。 过去评估模型盯着榜首,现在真正的问题是"单位成功的成本"。同样一个任务,Opus 4.8 时代算成本可能不划算,Opus 5 时代就进入了"值得自动化"的区间。国内团队做模型选型时,别再只看峰值跑分,去算"跑通一个真实任务花多少钱、多少轮"——就像上面那张 Frontier-Bench 成本曲线在做的事。
第二,"有界任务 vs 长时程自主"是可以直接拿来用的选型标准。 Anthropic 自己划的这条线很实用:有明确交付物的有界任务,用效率型模型(对应 Opus 5 这一档);需要连续几小时到几天、跨大量步骤保持连贯的长任务,才上最贵的顶配。国内不管用哪家模型,这个二分法都成立——别拿顶配模型去干有界的日常活,也别指望效率型模型扛长链路自主。这条线连科研任务都适用:能界定的化学/生物问题 Opus 5 够用,开放式自主研究才需要顶配。
第三,"自我验证"这个能力,可能比分数更该进你的评测清单。 企业用 AI 的隐性成本是人工复核。如果一个模型能自己查、自己返工,省的是工程师的时间。评测新模型时,别只测"能不能做对一次",去测"它会不会在没人盯的时候,自己发现做错了并改回来"。
一个必要的冷静:Anthropic 的效率数字大多来自受控评测和早期客户,"能不能扛住生产环境的规模"还得自己在代表性负载上验。冗长、"神经质"这类批评也是真的。别把官方通稿当验收报告。
九、可以直接抄走的选型检查清单
如果你正在评估要不要在业务里换用某个新模型(不限于 Opus 5),这次发布能压缩成六个自查问题:
1. 算单位成本,不算峰值分:跑通一个你真实的任务,花了多少 token、多少轮、多少时间?拿这个和现用模型比,而不是比榜单第一。 2. 先分类任务:这是有界任务(有明确交付物)还是长时程自主任务?两类该用不同档位的模型,别混。 3. 拨一遍 effort / 推理档位:同一个任务,在"省 token"和"最聪明"两档各跑一次,看质量差多少、成本差多少——很多任务低档就够了。 4. 测自我验证:故意给一个有隐藏错误的任务,看模型会不会自己发现并返工,而不是产出看似合理就收工。 5. 测冗长度:同一批任务下,它生成的 token 是不是明显偏多?啰嗦是实打实的成本,也影响可用性。 6. 对齐合规先看清楚:护栏会不会拦你的正当业务(安全/生物类尤其)?有没有降级、白名单、零数据留存这些开关?别等上线才发现被拦。
模型每周都在更新,追新闻追不完。但上面六个问题今天就能拿去对着你的业务问一遍。能答上来,这篇评测对你就没白看。
资料来源:Anthropic 官方公告《Introducing Claude Opus 5》及官方基准图(2026-07-24)、VentureBeat、CNBC、Lenny's Newsletter(Claire Vo 实测评)。
如果你正在做模型选型、或者已经在某个模型上踩了坑,欢迎带着你的具体场景来聊——哪类任务、多大调用量、卡在哪。下一篇我们拆一个更具体的问题:效率型模型时代,企业的模型选型清单该怎么重排。想看的话,留言告诉我。
YuLing Ai · 让 AI 在你公司真正落地
制造业 AI 工程化 · 企业知识库与 Agent 落地 · AI 编程实战
— 企业落地咨询:微信 YuLing-Ai-Live(备注"落地")
YuLing Ai · 让 AI 在你公司真正落地
我们做企业 AI 工程化落地:制造业 / 企业的知识库、Agent 与流程自动化,从选型评估到交付上线。
正在选型、或者已经踩坑,都可以带着具体场景聊:微信 YuLing-Ai-Live(备注"落地")
夜雨聆风