乐于分享
好东西不私藏

一文看懂主流 AI 基准测试!MMLU、SWE-Bench、Terminal-Bench 等指标,哪个更重要?

一文看懂主流 AI 基准测试!MMLU、SWE-Bench、Terminal-Bench 等指标,哪个更重要?
这几天 GPT 5.6 发布,Luna、Terra、Sol 三款模型,每个模型4-6个思考深度,叠加 Fast 模式,光选择就高达30种...用起来越来越迷糊...甚至有的模型公司随便拿一个排第一的评测出来混淆视听,代表着自己很厉害..就像只要分类足够细,每个人都可以是区域最帅...
以 OpenAI 官网公布的 5.6 基准测评为例,公布了高达30+ 种不同评测的评分,实属眼花缭乱。看完反正就是表达,便宜的没我好,好的没我便宜,但是我很想知道,作为一个用户,我到底该关注哪些具体评测、哪些评测比较权威,对于我选择一个模型最有参考价值...
最有价值的综合指标 
现阶段使用过程中,我们主要是通过 agent 来完成各项任务,核心关注 Agents’ Last Exam 、 GDPval 、Artificial Analysis Intelligence Index 三项指标,而如果对话比较多,则关注 LM Arena 和 Chatbot Arena 两项指标。
Agents’ Last Exam 和 GDPval ,主要观测 AI、agent 能否完成真实的工作、长程任务完成度等。比如给到模型任务说明、参考文件和tools,让他交付对应的产物,再由规则、程序检查,从而得到的综合得分,这个和我们目前使用各种 agent 的效果最为直接相关
LM Arena 和 Chatbot Arena 主要是盲测,即给一个用户2个匿名的模型,让用户盲选出自己最喜欢的答案,形成的得分和排名。也就是真实用户感受哪个模型给我的结果更好,偏向真实体验,但真实的体验并不一定是最好的,比如那句“真理往往掌握在少数人手中”....
而 Artificial Analysis Intelligence Index 则主要是相当于把各项主流评测,放在一起汇总(不同权重)给出的得分,相当于告诉大家“那么多评测你不用看了,直接看我这个就好了”,其中agent 任务 34%,编程24%,科学推理24%,通用18%。好处是大而全,缺点也比较明显,可能对于有专业、垂类需求的用户而言,容易选不到最好的,比如编程、长程任务等..

Coding Agent 相关指标
如今我们很多人在 VibeCoding,写代码是 AI的核心应用场景之一。衡量一个模型好不好,我们主要看 Terminal-Bench、DeepSWE 、IFEval、IFBench 、SWE-bench Verified 这几个核心指标。
SWE-bench Verified、DeepSWE、Terminal-Bench 三个,主要是给模型代码库、Github Issue 或者终端环境,模型修改代码、执行命令,最终查看测试任务的通过情况,是对程序员、Coding Agent 以及我们日常 VibeCoding 最重要的指标
IFEval 和 IFBench 主要是看大模型是否严格听从指令,比如是否能按照格式要求输出JSON,让他写3段文字会不会写出来5段等等。这个对于我们日常程序化输出,上下游数据传递比较重要,因为格式错误就会导致系统崩溃,或者无法处理等。

工作相关 指标
我们日常使用过程中,还需要重点关注多模态理解、看懂大文件,是否有幻觉、是否会胡编乱造,能不能操纵电脑和进行网页调研。这里我们主要需要关注的是 MMMU-Pro、OCRBench v2、Video-MME 、LongBench v2、RULER 、SimpleQA、AA-Omniscience 、OSWorld、AutomationBench 、BrowseComp、GAIA 这些评测。
MMMU-Pro、OCRBench v2、Video-MME 这三个从字面就能看出来,主要是看大模型对图表、视频、文档图片、手写内容的理解是否准确。比如这次GPT 5.6 对多模态的理解提升,就直接带动了 CAD相关的建模能力。
我们平时通过 agent 做调研、填表、操纵电脑比较多的话,就需要关注 BrowseComp、GAIA 、OSWorld、AutomationBench 这四个指标。前面2个主要是看搜索网页、查看多个信息来源,调用工具查找到答案的能力,一般和深度研究、行业调研、资料搜索直接相关。后边2个主要是看能否帮你操纵浏览器、填写表格、更改流程等
另外 LongBench 系列的测评,对于大模型上下文理解、长对话记忆、多文档综合、代码库理解直接相关,对于日常需要处理大量文本、代码库的小伙伴,可以重点看一下。

其他重要 指标
还有几个指标也重要,但现在的模型基本拉开的差距并没有非常明显,对大多数人日常使用感受上,比较不明显(主要是指的头部模型差距感受不明显,不是不重要😂)
MMLU 、 MMLU-Pro 这俩的综合知识笔试题,主要用来评测大模型的知识覆盖、推理、聪明程度等,涵盖历史、法律、医学、数学、计算机等学科综合知识。
对于科研人员,GPQA Diamond、Humanity’s Last Exam、HealthBench 、GPQA、HLE、FrontierMath 、GeneBench 这些都属于前沿科学的评测了,比如高难度数学、医学等。
还有就是网络安全方面,主要是 ExploitBench、ExploitGym 、SEC-Bench Pro 这些指标,也是近期因为 Mythos ,企业越来越关注的指标,主要是漏洞发现和利用相关,和普通用户关系不大。SEC-Bench Pro 是看模型的漏洞挖掘能力,ExploitGym 看能不能把漏洞利用起来。

关于如何看和挑选模型
随着模型种类,思考深度分类越来越多,我们到底该如何选择,如何平衡成本和效果。
还是以下面的 GPT 5.6 发布的测试基准为例,横坐标轴代表成本,纵轴代表得分,我们只要遵循一个原则,即纵轴高度一样的情况下,选择最靠近原点的模型&对应思考深度,性价比会更高一些。这里纵轴的高度意味着在这个高度(得分)下,可以胜任你当前的任务
比如我们要做一个网页检索和调研,可能测试分数50分就可以胜任,在这个分数下,5.6 Sol + Low 思考深度实现成本最低,其次是5.6 Luna xhigh 和 5.6 Terra High。而如果这个任务你用Gemini 3.5 flash 或者 Opus 4.8 成本都会更贵。
那如果我们在成本一致的情况下,可以看到5.6 Sol Xhigh 在测试中,花费同样的钱,能取得更好的结果,甚至比 Terra Max 还有性价比。因此不是模型降一档位就一定便宜...
综上,随着模型种类、思考深度、测评分类越来越多,希望大家通过这个文章可以轻松、方便的找到适合自己的模型,用起来不迷糊!