上周我干了件蠢事:同一份认知能力测评,我做了两遍。第一遍上午十点,第二遍凌晨一点。
不是闲的。我就想验证一个最近被说烂了的招聘趋势——AI面试正在把求职者逼到半夜。如果半夜面试真成常态,那测出来的到底是能力,还是困意?
结果很诚实:凌晨那版,我的反应时平均慢了 18%,工作记忆那组题正确率掉了差不多 12 个百分点。样本量就我一个,不能当研究,但当体感证据够了——深夜做题,大脑不是同一块大脑。
深夜对着屏幕作答的求职者,可能正在用疲惫的大脑替自己打分
1. 数据不会撒谎:招聘正在入侵凌晨
WIRED 在 8 月 10 日发了篇文章,标题就叫《凌晨 1 点面试的兴起》。里面有两组数字让我这做测评的人坐直了:
- 语音 AI 招聘平台 Ribbon 的数据显示,24% 的 AI 面试发生在晚上 10 点到凌晨 2 点;制造业客户更是高达 35%。
- 另一家平台 Greenhouse 的语音 Agent 面试里,15%–20% 的候选人主动把面试安排在夜间。
企业当然会说这是“灵活性”。父母等孩子睡了才有空,轮班工人只有深夜能喘口气,时薪岗位的人不敢在上班时间接面试——这些理由我都懂。
但问题也在这儿:当面试变成 24 小时自助服务,谁负责保证测量条件是等价的?
测评心理学第一课:信效度的前提是“标准化施测”。同样的题、同样的限时、同样的环境,分数才能互相比。把其中任何一个变量交给候选人自选,常模就失效了。
2. 你测的不是能力,是“当下状态”
睡眠研究里有个结论很直白:24 到 48 小时的完全睡眠剥夺,会同时损害工作记忆任务的准确性和反应时;清醒时间越长,准确性掉得越狠。前额叶皮层对睡眠缺失特别敏感,而这块区域恰好负责计划、抑制控制、复杂决策——也就是大多数 AI 面试和认知测评在考的东西。
还有更扎心的:Monash 大学的研究发现,睡眠剥夺 27 小时后,除了再认记忆,几乎所有认知指标都显著下降。更复杂的是昼夜节律——清晨型的人和夜晚型的人,在同样缺觉的情况下表现不一样。换句话说,你不仅是在“晚上测”,你还在测人家的生物钟类型。
岗位 JD 上写的是“逻辑思维”“学习能力”“抗压能力”,没写“必须是晨型人”。可一旦允许深夜作答,昼夜类型就变成了一个隐藏考点——而且它和岗位胜任力基本无关。
屏幕蓝光和疲惫感,正在悄悄改写分数
3. 这不是随机误差,是系统性偏差
有人说:晚上状态差,那是候选人自己选的,怪谁?
这说法的问题在于,它把“选择权”和“公平性”混为一谈。是的,候选人可以选时间,但不是所有人都有真正的选择空间。白天要带孩子、上班、照顾老人的人,往往只能在深夜作答。灵活性越被吹捧,弱势群体越可能被钉在最难发挥的时段。
Ribbon 的数据已经证实了这一点:制造业客户深夜面试占比 35%。制造业是什么地方?轮班、产线、体力活最多。最需要这份工作的那些人,恰恰最可能在凌晨 1 点面对 AI 面试官。
这在测评术语里叫“测量误差变成了系统性偏差”。本来随机分布的噪声,现在集中打在某一群人身上。放到法律框架下,这就是差别影响(disparate impact)。
4. AI 面试本身没错,错的是“不设防”
我得替 AI 面试说句话。2026 年那个涉及 7 万多申请的田野实验(Jabarian & Henkel)显示,由 AI 语音 Agent 面试的候选人,offer 率比人类面试组高 12%,入职率和一个月留存率都高 18%。四个月后,正向效应还在。
所以问题不是 AI 能不能面试。问题是企业把“24 小时可访问”当成“24 小时都等价”,把异步的便利直接等同于测评条件的恒定。
Greenhouse 的另一组数据更耐人寻味:70% 的美国候选人在面试前没被明确告知 AI 会评估他们;38% 的人因为 AI 面试直接退出流程。透明度和信任都没解决,谈什么公平?
技术本身是中性的。但技术落地的每一个细节——是否记录作答时间、是否允许重测、是否告知评分逻辑——都在决定它向善还是向偏。
5. 给企业的一点实操建议
如果你已经在用或准备用 AI 面试,别只问“效率高不高”,先问自己几个问题:
- 记录时间戳:把作答时间作为数据字段存下来,分析深夜时段的分数分布是否系统性偏低。
- 把时段当协变量:同等能力的人,晚上 11 点的分和上午 10 点的分,不能简单放一起比。
- 给异常时段复测机会:如果某候选人在凌晨完成且分数踩线,允许其在合理时段重测一次,不是作弊,是纠偏。
- 充分告知:提前说明 AI 参与评估、人类会复核、视频保存多久。信任比效率值钱。
- 别把初筛分数当终审:AI 面试适合收集结构化信息,最终录用决策必须有人类参与。
真正专业的测评,不是把题塞给更多人做,而是确保每个人在 comparable 的条件下被看见。否则你筛掉的不是不优秀的人,只是那天晚上刚好很困的人。
最后我想说,凌晨 1 点的 AI 面试不会消失。它确实给了很多人便利。但如果我们一边高谈“人才测评科学化”,一边对施测条件的失控视而不见,那这项技术不过是给旧偏见装了个新接口。
测人之前,先把测量的底线守好。
老王|人才测评行业观察|Day 32
夜雨聆风