为什么所有AI模型排行榜都不可信,以及怎么解决几乎每个月都有新的评测集发布,每个大机构都在跑自己的榜单,每个垂直领域都有自己的评测标准。OpenAI的、Anthropic的、开源社区的、学术机构的——模型的排名在不同榜单上差异巨大,有时候甚至完全相反。问题来了:如果你要买一个模型的订阅,或者要选一个模型做产品,你究竟该信哪个榜?最近有人花了54小时做了一个尝试,试图用算法来回答这个问题。过程比想象中复杂得多,但最终得出的方法很有启发性。一、简单聚合排名是拍脑袋
最直觉的做法是:把各个榜单的排名取个平均数。比如Kimi K3在这个榜第1、那个榜第2、另一个榜第5,平均排名2.33,按这个排序不就好了?同样是第5名,在一个只有10个模型的榜单里只能算中游水平,但在一个200个模型的榜单里已经是前2.5%的顶尖水平了。这两个"第5"的含金量完全不一样,直接取平均就是在制造偏见。领先幅度也完全不同。一个榜单里第1名比第2名高30%,另一个榜单里第1只比第2高0.01分,这两个"第1"的统治力天差地别,但简单平均会把它们同等对待。还有更现实的:有的模型根本没出现在某些榜单里。是它不够好所以不测?还是评测方还没来得及跑?缺失数据的原因各不相同,如果你给它填0分,那是冤枉;填平均分,又对其他模型不公平;只平均它参与过的榜单,又会把这几个榜单的权重不合理放大。所以问题来了:不同榜单上的排名,本质上不可直接比较。它们就像不同的考试,试卷难度不同、评分标准不同、参考人数不同,单纯比较原始分数是不公平的。二、两个意想不到的灵感来源
面对这个问题,开发者做了一个很聪明的事:不局限在AI领域找答案,而是问"人类历史上有没有处理过类似的问题"。在教育领域,这个问题早就存在。不同的学生做的是不同的试卷,题目难度不同,单纯比较卷面总分不公平。于是教育统计学家开发了一整套方法——项目反应理论(IRT)——从答题结果反推一个看不见的"潜在能力值"。在电竞领域,类似的机制更成熟。竞技游戏里的Elo评分系统和微软的TrueSkill,核心问题也是:一个玩家只打了几十场但把把超神,另一个玩家打了上千场但胜率一般,他们的真实水平怎么比较?答案同样是看对手质量、看胜负关系、看潜在能力。这两个领域的核心洞见一样:不要看表面分数,要看"谁打败了谁",然后反推能力值。三、LatentRank的核心逻辑
基于上面的思路,最终采用的算法底层叫Bradley-Terry,加上先验限制小样本的极端结果。它有一个很贴切的名字:LatentRank(潜在排名)。当两个模型出现在同一张榜单里,排名更高的那个就"赢了一场"。把所有榜单里真实发生过的胜负关系,全部放到一张巨大的关系网里,然后反过来推算每个模型背后的真实能力值。这本质上就是电竞PK的思路。如果模型A和B从来没在同一张榜单上出现过,也没关系——只要它们分别跟同一批对手(比如模型C)交过手,整张大网络就能把它们的实力关系推断出来。共同对手越多,推断越准确。当然,大模型评测和电竞不完全一样。评测来源之间有重叠,小榜单的偶然性更强,证据太少的模型可能碰巧赢了几场就计算出离谱的分数。所以算法还加了几个补丁:证据预算(evidence budgeting)防止样本不足,先验(prior)把极端结果拉回合理区间,再冻结一组锚点模型来定义100分制的刻度,确保分数跨时间可比。四、Top 5结果意味着什么
在这个算法下,当前的前5名里有一个意外的结果:Claude Opus 5超过了Fable 5。这看起来反直觉,因为Fable 5在各种测试中的极限能力确实更强。但看源数据就会发现,Opus 5的编程评测表现确实更稳定,而Fable 5在某些任务上一跑就降级,反而拉低了整体分数。这个结果的启示是:LatentRank衡量的不是"最强大模型",而是"最稳定、最可依赖的综合能力"。如果一个模型在某些场景下表现极好但在其他场景下频繁降级,它的综合信任度就会受影响。这对于选模型的实际用户来说,可能比单纯的"能力上限"更有参考价值。五、更重要的是方法论
LatentRank本身也不是完美的标准。它不能定义模型真正的能力边界,只是尽可能公平地把多个来源的数据汇总起来。但这件事的价值不只是产出了一个榜单,而是展示了一个方法论:当你面对多个不可直接比较的数据源时,应该怎么做。第一步,不要直接比较原始分数或排名。不同榜单的标准不同,比较表面数字是在自欺欺人。第二步,找"共同对手"。两个模型如果没直接比过,看看它们分别跟哪些相同的第三方比过。通过第三方作为桥梁,可以建立间接的比较关系。第三步,处理缺失和偏差。小样本的结果不可信,要加先验防止极端值;不同来源的质量不同,要考虑权重;时间维度上要保持刻度一致,需要锚点。这套方法不只适用于AI模型排名。任何需要从多个不可直接比较的来源中聚合结论的场景——产品评测、学术引用、人才评估——都可以借鉴这个思路。写在最后
AI模型评测正在变得越来越复杂,也越来越重要。企业选模型、开发者调API、投资者做判断,都需要一个尽可能客观的参考。但我们要清醒地知道:任何排行榜都是人类设计的简化,都有偏见。LatentRank的价值不在于它给出了"正确答案",而在于它试图用算法来减少人为偏见,用成对比较来替代简单平均,用网络推断来替代直接比较。它不一定完美,但至少比拍脑袋的平均排名要公平得多。所有规则和数据都是公开透明的。最终判断权,仍然在你手里。你平时选模型会参考排行榜吗?你觉得哪个榜最可信?评论区聊聊。