乐于分享
好东西不私藏

AI 也会偏心:你的简历被淘汰,可能只是因为用错了模型

AI 也会偏心:你的简历被淘汰,可能只是因为用错了模型

一、你以为 AI 很公正,其实它有自己的"口味"

投出一份简历,石沉大海。你以为是自己资历不够,但有没有想过——可能是你用的 AI 模型,跟对方筛选简历的 AI,不是"一家人"?
这不是危言耸听。2025 年底收录于人工智能伦理与社会研讨会(AIES 2025)的一份研究,做了一场系统性实验:当撰写简历的模型跟评审简历的模型来自同一家,求职者进入面试名单的几率提升了 20%-60%。换句话说,同样品质的简历,只是因为"出处"不同,分数就差了一大截。
研究称这个现象为"自我偏好偏差"(self-preference bias):语言模型会偏爱自己生成的内容,即使品质已被刻意控制。
这早已不是实验室里的假设。调查显示,逾 7 成 HR 团队已定期在招募流程中使用 AI,近 7 成求职者也已用 AI 起草履历。一边用 AI 审、一边用 AI 写,已经是正在发生的现实。对坚持自己写简历的求职者来说,这意味着可能在不知情的情况下,仅因履历未经模型加工,就在评分上落后。

二、用 "音乐评审" 理解 AI 的偏心

打个通俗的比方:音乐节目里的大众评委,都有自己固定的审美偏好。有的评委偏爱细腻抒情、节奏舒缓的唱腔,有的偏爱张力十足、编曲华丽的舞台风格,每个人都有自己的固有听歌喜好。
此时有两位唱功、舞台表现力、作品完成度差不多的歌手,只是演唱风格截然不同。面对风格不同的舞台表演,评委往往会下意识偏心:给贴合自己审美偏好的舞台打高分,给不符合自己喜好风格的舞台压低分数。
AI 模型也是这样。每个模型在训练时,都被喂了大量的文本,逐渐形成了自己的"风格指纹"——句构偏好、用词分布、段落节奏。当模型评审内容时,它会把这些熟悉的风格特征,误判为"内容品质高"。
一个可能的解释来自后训练阶段:RLHF(基于人类反馈的强化学习)、DPO(直接偏好优化)等对齐训练,以相同的训练目标,同时塑造了"怎么写得好"与"什么算写得好"。风格与好恶一起被写进了模型权重,评审模型因此把熟悉的风格,等同于较高的内容品质。
不过,并非每个模型都偏爱自己。有些模型会"反向自我惩罚"——对自家生成的内容反而更严苛。但关键在于:每个模型都有自己的评分倾向,而求职者完全无从得知评审偏好哪套模型。

三、同一份简历,分数差了 29 分:i10X 的实验怎么说

2026 年 6 月,AI 工具比较业者 i10X Research 发布了一份产业测试报告:https://i10x.ai/blog/ai-cv-bias。研究团队构建了 100 份贴合现实的模拟候选人档案,覆盖 12 个行业、4 个职业层级,每份档案匹配专属定制的招聘岗位。针对每一位模拟候选人,研究使用 GPT-5.4、Claude Sonnet 4.6、Gemini 3 Pro、xAI Grok 4.3 四款模型,各生成一版简历——所有简历的事实信息完全一致,仅行文风格、排版结构不同。共计 400 份简历,由四款模型在盲评条件下,使用完全相同的提示词与标准化评分细则完成评审。1600 组原始数据中,有效样本 1576 组,有效率 98.5%。
结果揭示了五个让人意外的结论。
第一,Claude 评审最严苛,而且强烈偏爱自己人。由 GPT 生成的简历,Claude 给出"录用"的比例仅 42%;但如果简历是 Claude 自己生成的,录用率直接升到 84%;Gemini 撰写的简历在 Claude 评审下录用率更达 90%。同一个候选人,资质完全相同,只换了简历的"写手",录用率差了 42 个百分点。
第二,GPT 反而会压低自家简历的评分。GPT 整体录用率达 90.5%,能精准淘汰资质不匹配的候选人。但在 GPT 的评审结果里,自家生成的简历得分最低,录用率仅 82%;而 Gemini 简历在 GPT 评审下录用率达 97%、Claude 简历 95%。不是每个模型都偏爱自己,但每个模型都有自己的评分倾向。
第三,Gemini 写的简历是"通用偏好格式"。无论由哪款 AI 评审,Gemini 撰写的简历录用率都是最高:GPT 评审 97%、xAI 评审 96%、Gemini 自评 95%、Claude 评审 90%,平均录用率 94.5%。Gemini 产出的结构化叙事排版,即便内容不变,也会被所有筛选模型青睐。
第四,同一份简历,两款评审模型评分最多相差 29 分。某候选人由 Claude 撰写的简历,GPT 给了 74 分(待定);同一版简历交由 Claude 评审,只得了 45 分(淘汰)。29 分的巨大分差,直接让简历从"边缘可考虑"变成明确淘汰,差异仅来源于评审 AI 模型不同。
第五,"待定"就是淘汰。在企业实际使用的求职者跟踪系统(ATS)中,只要结果标注"待定",候选人的求职流程便会直接终止,简历不会流转至人工招聘专员手中。一名资历合格的后端工程师,其 GPT 版简历在 Claude 评审下仅 78 分(待定);而同一位候选人的 Claude、Gemini、xAI 版本简历,在其他模型评审中全部获得明确"录用"。若企业仅用 Claude 作为唯一筛选工具,这位合格求职者会因简历排版风格被筛除,与个人资质无关。

四、这条"鄙视链"不会停在简历上

若企业业务全链路完成 AI 闭环运作:前端依靠 AI 自动生成报价、技术方案、合规法务文件,后端采用 AI 完成材料筛选与量化评分,模型适配能力会成为全新的商业竞争指标,这是传统市场竞争中从未出现的变量。过去企业角逐的核心集中在定价、产品质量、交付周期;随着 AI 普及,模型兼容适配度将成为企业另一核心竞争力。
落实到采购招投标场景:采购方依托 AI 系统初筛供应商资料,供应商同样借助 AI 撰写投标方案。如果首轮筛选以文本内容作为排序依据,且供需双方选用不同厂商的大模型,即便供应商在价格、交付周期等硬性指标上具备优势,也会因文书行文风格不匹配评审 AI 的判定偏好,在初审环节便处于不利位置。
学术审稿已经先撞上这个问题。
当审稿人遇上“钓鱼执法”:看ICML 2026如何用提示词注入反向抓包
2025 年中起,多篇 arXiv 稿件被发现藏进肉眼看不见的指令,要求语言模型审稿人给予正面评价。顶尖会议 ICML 2026 把相同做法反过来当稽核工具。2026 年 3 月公布的结果,逾 500 位审稿人被侦测到违规。
想要规避 AI 评审带来的偏差,设计思路其实很好理清,做好四点规划就行:写材料的 AI 和审材料的 AI 尽量不要是同一系列;事关重大的评定,让好几个 AI 同时打分互相对照;表格数据和文字内容分开核算分数;重要结果一定要留出让人复查的余地。
但更深一层的问题很少有人留意:一旦全部交给机器审核,人擅长发掘小众闪光点的优势就消失了。简历里与众不同的那个人,一堆套话提案里真正有独到想法的稿件,在习惯统一文风的 AI 看来,反而更容易丢分。
现在还没有完美办法,能让 AI 流程兼顾人的判断力。不过可以记住一个小提醒:在用 AI 写简历、方案之前,先想清楚审核你的材料的,会不会也是一套 AI 评审系统。