夜雨聆风学习资料网

ARTICLE · 1128501

给AI工作能力打分,排序对了还不够

给AI工作能力打分,排序对了还不够

现 · PRISM

一份AI写出的工作报告,被评为这组候选里最好的一份。接下来能否直接交付?这个问题,名次回答不了。最好的那份也可能还缺关键证据,整组报告也可能早已全部达到要求。

10月5日arXiv新论文公告中的预印本《Right Order, Wrong Scale》,检查了六个模型家族的33种裁判配置,测试集包含4,501条评分。以无需修改即可使用为门槛,各配置给出的回答合格比例从3.0%到97.9%,相关职业从业者的参考值则是61.1%。其中32种配置几乎覆盖全测试集,一种只覆盖22.3%;这些配置也不是独立重复。[1][3]

这组数字让裁判承担的责任变得具体:一套评测究竟在选优、估算可用比例,还是决定把某份成果交出去?三种用途,需要各自的证据。只凭排序表现,就宣布AI能完成多少工作,结论走得太远。

排在前面,离合格还差多远

用一个假设把差别展开。针对同一项延期通知任务,AI写了四个版本。裁判甲按百分制给出30、45、75、90分;裁判乙给出50、75、90、98分。两位裁判完全同意哪份更好。假定70分及以上算合格,甲放行两份,乙放行三份。这里的分数只为说明机制,与论文实验数据无关。

如果用户只要从四份里挑出一份,再由自己修改,两位裁判都能完成这个选择。若要估计无需修改即可交付的比例,两者却把同一批成果描述成了不同水平。它们可以拥有完全相同的排序成绩,同时支持彼此冲突的生产安排。

我们很容易把“分得出高下”理解成“知道有多好”。原因是名次不需要说明起点在哪里,也不需要交代差一分意味着什么;一旦画出合格线,这些被省略的东西就进入了结论。

一个评测若要据此建议减少复核人手,校验裁判时便应拿实际放行决定来对照。否则,被验证的是挑选能力,被使用的却是验收权限。风险出在这个跨越上。

机制示意·AI生成图像。两位裁判对同一任务的四个回答给出相同排序,分数位置不同,跨过同一合格线的数量也不同。仅为假设示意,不对应论文实验数据。

把平均分调准,门槛仍然可能错位

最直觉的补救,是先找一批人工评分,看看AI平均偏严还是偏松,再把分数往回调。这能修正一种误差,却还没有保证合格率。

继续用假设说明:两批各四份成果,一批是40、40、100、100分,另一批全部70分。平均分都是70。如果70分及以上算合格,前者通过一半,后者全部通过。平均数保留了总量,却丢掉分数怎样分布在门槛两边的信息。

这也解释了为什么“预测平均能得多少分”和“预测有多大机会过线”需要分开训练、检验。一个系统给出70分,可能在表达很多不确定结果的平均值;把这个平均值当成每一份成果的实际质量,再统一放行,就把不确定性抹掉了。

论文的校准实验同样发现,修正均值仍会错算通过比例;直接校准合格概率能几乎消除总体偏差,但不读取回答的常数基线也能做到。[1]

概率校准有一个更明确的含义。Guo等人在2017年的研究中,将它定义为预测置信度与实际正确频率相符。[2] 借用到验收问题,就是把那些被估计有相近通过机会的成果放在一起,观察其中实际有多少通过。这与给每份成果贴上一张确定合格证,有明显距离。

总体数字漂亮,未必识别得出哪份可用

常数基线为何重要?设想一个完全不读稿的系统,听说类似样本有六成可用,就给每份稿件都报60%的通过概率。如果下一批恰好仍有六成可用,它估计的总数十分准确;可是,任何两份稿件在它眼里都一样。它帮不了编辑优先检查哪一份,也选不出可以直接交付的那一份。

因此,总体合格率准确与逐份判断有用,可以同时成立,也可以彼此分离。一个只负责统计的工具,不必承担完整的逐件验收任务;一个被用来自动放行的工具,则需要知道它错放了谁,以及这些错误会造成什么后果。

这里也有支持AI裁判的有力理由:估计总体时,并不需要先把每份成果都判断正确。2023年的Prediction-Powered Inference研究提出,利用一部分带标签数据校正机器预测,在满足相应抽样等条件时,可以对总体均值等指标给出有效的统计区间;预测提供的信息越好,区间有机会越窄。[4]

所以合理的比较对象,应当包括同样人工预算下的抽样统计。若读了大量回答的模型,最终只复述人工样本已告诉我们的平均比例,它新增的价值就需要解释;若它能在新任务上稳定缩小不确定范围,或更准确地找出问题成果,使用它就有了具体理由。计算便宜,尚不足以证明测量更划算。

人工评分,也需要说明凭什么可信

这项审计复用既有调查资料,没有新采人类评分;每个回答只有一位自报相关职业经验的从业者评分。范围是美国职业的英语文本任务,样本未按就业人数加权。[1]

这让一个反对意见必须被认真保留:从业者也会误判。同一份延期通知,有人看重信息是否完整,有人更在意语气与客户关系;在缺少上下文时,意见分歧未必来自谁不专业。模型与某位从业者不一致,不能就此定性为模型弄错。

但这个反问也没有自动替模型取得验收资格。假如一项指标声称测量“有相应经验的人愿不愿意接受”,这些人的判断就是所要估计的对象。若改成“是否符合公司交付标准”,就应引入那套标准及独立核查;若关心实际工作结果,就需要追踪交付后的效果。换了目标,证据也应随之改变。

我的判断是,职业经验值得成为参照,不能被包装成无争议的真值;模型的整齐分数同样没有天然的客观性。更有说服力的验证,应让多位合适的评审重复判断,说明分歧发生在哪,再把可核实的错误与合理的偏好差异分开。

如果新的独立样本显示,模型在明确标准下比这批单人评分更可靠,就该修正对模型的评价。反过来,仅仅把模型调到更像现有评分,也还没有证明交付风险已经下降。

从回答合格到工作改变,中间还有几步

即便我们拥有了一把很可靠的尺子,测出了某批文字回答的合格率,它与岗位去留之间仍隔着任务组合。用一个假设场景看:一项工作每天要写十封常规通知,偶尔还得处理一次会改变客户关系的复杂投诉。常规通知全部做对,也无法按题目数量直接推算这项工作已经完成了多少。

任务出现得多不多、占用多少时间、出错能否补救,都影响实际分工。再把不同职业汇总时,还要说明统计代表哪些人、哪些工作。否则,一个便于取得的题目平均数,就会不知不觉被读成整个劳动市场的平均数。

这种区别会改变我们关注的进步。对于只需要起草备选方案的工具,排序能力提高已经可能带来收益;对于希望无人复核即可交付的系统,门槛附近的误判与严重漏检更值得看。我们可以承认一项能力的价值,同时要求它只承担被证据支持的任务。

让人更愿意相信某个AI工作合格率的下一步,是把合格标准、评审对象和实际用途说清楚,再看新样本上的结论是否仍站得住。若一份报告只给出一个百分比,却没有交代谁在评分、分数如何过线、样本代表什么,那么它首先提供的是一个待验证的判断。

主要来源

[1] Right Order, Wrong Scale原始论文(v1)

[2] On Calibration of Modern Neural Networks(ICML 2017)

[3] arXiv cs.AI 2026年10月5日新论文公告

[4] Prediction-Powered Inference原始论文

[5] Right Order, Wrong Scale提交记录

[6] arXiv Availability of submissions公告日程

本文为AI辅助撰写,机制示意图由AI生成。

相关学习资料