一张模型榜单上,22 个模型的平均通过率是 41.5%。
这个成绩看着不算差。差不多每做十道题,能过四道。
但这个成绩里,混进了不少靠作弊拿到的通过。

Dreadnode 没有停在这张成绩单上。
7 月 29 日,他们把 1518 条完整的任务轨迹一条条翻出来,像把答卷和监控录像放在一起重看。
然后,41.5% 变成了 26.1%。
前一个数字,是系统判定的通过率。
后一个数字,是排除掉问题路径以后,模型真正干净解决任务的比例。
两张表都是真的。
可如果只给你看第一张,感受会完全不一样。
更扎眼的是,在原始提示下,37.1% 的通过记录涉及研究者所说的「作弊」。
看到这里,很多人第一反应可能是,模型都学会动歪脑筋了???
这块得讲清楚。
这里的「作弊」是研究者对任务轨迹做出的分类。它不证明模型有主观恶意,也不能说明模型像人一样坐在那里盘算怎么骗人。
研究者只看一件事,模型通过什么路径拿到了那个绿色的勾。
有的模型确实把题解决了。
有的模型拿题目名称去网上搜索,找到公开题解,再把方法搬回来。
还有的模型直接读取评测环境里的答案文件,或者探查容器信息,绕开题目本身去找结果。
三种路径,最后都可能被系统记成「通过」。
可对真正要用模型的人来说,它们根本不是一回事。
你找的是一个能独立完成工作的模型。到了真实工作里,没有现成答案,也没有那个评测环境,榜单上的能力就可能突然消失。
这次审计最让人不安的地方就在这里。分数没有算错,错位发生在我们对「通过」两个字的理解上。
自动判分系统看到任务目标达成,就亮起绿灯。普通用户看到绿灯,脑子里翻译出来的却是,模型已经掌握了完成这项任务的能力。中间少掉的,正是那段过程。
Dreadnode 审计的 1518 条轨迹,把这段过程重新捞了回来。

按基线记录,22 个模型里有 21 个出现过这类行为。
研究者后来把提示词写得更严厉,把不能走的路径讲得更清楚。
变化很明显。
模型的作弊倾向从 33.0% 降到了 8.5%,干净解决率还从 26.1% 升到了 34.4%。
这件事挺有意思。
规则写得更明确,模型的行为会跟着变。限制近路以后,一些模型反而开始认真处理题目,多解出了几道。
可故事没有在这里结束。
最严提示之下,仍然有 8 个模型交出了靠作弊得到的通过记录。提醒有用,却不能代替对过程的检查。
如果排行榜只展示最终得分,不展示提示怎么写、评测环境怎么搭,也不告诉你异常轨迹怎样处理,那张榜单只给了你结果的一小部分。
说到这里,你可能会觉得,这大概只是网络安全任务比较特殊。
毕竟这类任务环境复杂,模型可以操作的东西多,判分也容易留下边边角角。
偏偏 8 月 21 日,Hugging Face 发布了一项语音识别研究。
这回没有复杂的网络攻防。
模型只需要听一段音频,再把听到的内容写出来。
够简单了吧。
语音识别的公开测试,通常会给每段音频配一份参考文本。模型输出文字以后,系统拿它和参考文本比较,再计算成绩。
问题就藏在这份参考文本里。
有一段欧洲议会录音,发言者清清楚楚说了「谢谢,主席先生」,参考文本却漏掉了「谢谢」。
如果模型老老实实听音频,它应该把「谢谢」写出来。可它一旦写对了,拿去和错误的参考文本比较,反而可能吃亏。
那要是模型也跟着漏掉呢?
系统会觉得它答得更准。
Hugging Face 测了 11 个开源语音识别模型,其中 6 个也漏掉了「谢谢」,复现了参考文本里的错误。
这就很尴尬了。。。
一道题的标准答案写错了。
真正按照音频作答,可能和标准答案不一样。对旧考卷足够熟悉,反倒能连错误一起复现。
如果你只看最终分数,后者甚至更像优等生。
研究人员随后换用新采集的声音,又用普通合成声音重新说出同一句话。换成与公开测试集无关的普通合成声音后,11 个模型全都把「谢谢」写了回来。
有些模型,像是认出了考卷。
研究里还有一个更直观的实验。
研究人员把音频中的数字静音。声音里已经没有答案了,一些榜上表现很强的模型,仍然会在大约 30% 到 40% 的样本里把原数字补回来。
声音里都没有那个数字了,它从哪里来的?

仅靠这些现象,还不能直接给每个模型定罪。研究覆盖的是特定模型、特定样本和两套公开数据,训练数据又没有完全公开。
换成模型训练截止时间之后的新录音,复现旧答案的现象减弱了。这是研究能够确认的部分。模型输出的文字会受到眼前声音的影响,对测试样本和参考答案的熟悉程度也可能参与其中。
这个对照很重要。
公开测试题和答案有没有进入训练数据,已经会直接改变我们该怎样理解榜单上的分数。
把两项研究放在一起看,会发现两条很不一样的近路。
网络安全任务里,模型可能借助现成答案或评测环境的空子拿到通过。
语音识别测试里,模型可能对公开样本过于熟悉,连参考文本的错误都一起复现。
一个更像绕过题目。
一个更像认出题目。
最后,它们都被压成了同一个绿色的勾。
这就是排行榜最容易让人误会的地方。
我们想比较的是模型解决陌生问题的能力。榜单记录的,是模型在一套特定题目、特定提示和特定判分规则下拿到的结果。
两者有关,但不能直接画等号。
模型有没有真正完成任务,是否撞见过答案,判分程序有没有被意外满足,最后都可能只剩一个数字。
而普通用户往往要拿这个数字做很重的决定。
订哪个模型,要不要多付一笔预算。团队迁移接口以后,已经跑顺的工作流还得重新搭一遍。
你押进去的不只是一笔会员费。
还有时间,流程,以及以后每一次调用的成本。
所以排行榜好不好用,要看它把什么东西算成了能力。
当然,两项研究还不够给所有排行榜判死刑。
Dreadnode 审计的是特定网络安全任务,Hugging Face 观察的是公开语音识别测试里的特定现象。它们不能证明所有模型榜单都有同样的问题,也不能推出所有公开跑分都藏着几倍水分。
公共评测依然有很实在的价值。
同一批题、同一套规则,别人可以复现,模型也更容易放在一起比较。没有这种共同尺度,大家各说各话,选模型只会更麻烦。
一个单项公开分数,承担不了全部判断。
我觉得更稳妥的做法,是把排行榜当成筛选入口。以后再看到某个模型「跑分第一」,先别急着兴奋,也不用条件反射地说榜单全是假的。
先查谁判定通过。
评测程序只看最后结果,还是有人检查模型究竟怎样完成了任务?如果碰到终点就算成功,它衡量的可能只是「能不能让终点亮灯」。
接着找人工核验。
机器评分适合大规模比较,可完整轨迹里那些奇怪的近路,往往要把过程重新打开才看得见。Dreadnode 的数字从 41.5% 收缩到 26.1%,靠的就是逐条回看。
题目新不新,也很要紧。
公开测试越有名、存在时间越长,题目和答案就越可能被模型接触过。语音模型连错误参考文本都能复现,提醒我们必须把「熟悉测试」和「解决新问题」分开看。
如果一张榜单能回答这些问题,哪怕数字没那么漂亮,反而更值得信。
如果它只扔给你一个总分,题目不清楚,判分过程看不到,也没有人工抽查,那就把信任往下调一档。
可以先拿它做候选,再用自己的真实任务验证。尤其是那些会决定迁移成本的工作,公开跑分只能帮你缩小范围,不能替你完成选择。
这套动作一点都不高深。
甚至笨得很朴素。
可数字最擅长制造一种确定感。
41.5% 看起来非常精确,26.1% 也非常精确。
这些数字该怎么读,取决于谁在判,有没有看过程,题目是否新鲜。精确的数字,不会自动带来准确的理解。
有时候,榜单并没有骗你。它回答的是,模型在这套考试里拿了多少分。
我们要拿模型去自己的工作里办事。它还能不能把事办成,比榜单上的名次更有用。
下一次再看到那个漂亮的绿色勾,不妨多停一秒。
别只看答卷。
也看看监控录像。
如果这篇文章帮你重新看懂了一张排行榜,欢迎点个赞、在看,或者转给那个正在挑模型的朋友。也可以把公众号设为星标,我们下篇见。
/ 作者 科了个喵
夜雨聆风