夜雨聆风学习资料网

ARTICLE · 1096049

公司开始考核你“AI 用得好不好” 可“好”是什么,还没人说得清

公司开始考核你“AI 用得好不好” 可“好”是什么,还没人说得清

2026.09.28 · Joe 的工位 · 工位深读 02

公司开始考核你“AI 用得好不好”
可“好”是什么,还没人说得清

工位深读 02 · 一份问了 1200 位企业领导的调查

9 月 22 日,人力资源软件公司 HiBob 发布了一份调查报告。样本是 1200 位企业领导——不是员工,是拍板的那一层。所有受访者都在过去一年里参与过至少一项跟 AI 有关的决定:设计岗位、定薪酬标准、或者汇报 AI 使用带来的业务结果。

报告里有两组数字摆在一起看,会有点荒诞。67% 的人说,公司的晋升标准里已经写进了 AI 技能;50% 说它直接影响绩效评级。同时,73% 的公司说自己在投 AI 培训——但报告列出的所有培训主题里,没有任何一项的采用率超过 27%。

考核已经落到纸面上了,评价标准还散着。

一、这项考核已经进了晋升和评级

先把几个数字摆齐:67% 把 AI 技能挂钩晋升标准,50% 挂钩绩效评级,28% 影响薪酬决策。还有 75% 的受访者预计,24 个月以内“中等熟练”会成为大多数非技术岗位的默认要求。

不用把它当成未来时。已经在跑的几家公司是这么做的:Meta 内部有个叫 Metamate 的助手,员工用它起草自评,另外一项 AI Impact Score 直接进入正式绩效评级。微软开发者部门的经理,被要求把员工的 AI 工具使用情况纳入绩效评估。

摩根大通的做法更值得看。他们的 LLM Suite 上线八个月,内部用户到 20 万,用途之一是年末评价的摘要整理,据其引用的数据,写评价的时间少了 40%、评价质量分数提升 20%。但同一份材料里写了两条限制:AI 生成的文字只作为起点,员工对最终评价负全责;这套系统明确排除在薪酬和奖金决策之外。

这三家把“AI 使用”写进流程的时候,都留着人工复核那一环:Meta 的分数之外还有经理评估,摩根大通干脆把这套系统挡在奖金决策之外。性质也变了——从“你自己想办法提效”,变成“我要看你是怎么用的”。

二、“好”的标准为什么定不出来

报告里最能说明问题的是这一条:在那些期待管理者带团队用 AI 的公司里,只有 36% 的受访者认为自己的直接管理者有本事把这件事评明白。

再叠两组数字。90% 的 HR 负责人说,AI 已经重新定义了什么叫“高绩效”;但只有 42% 真的动手改了自己的评价标准。至于培训,73% 的公司在掏钱,可没有一项培训的采用率超过 27%,说明力气是分散的——有人在做流程改造,有人在讲数据安全,有人在教怎么写文档。

标准难定,还有个更实际的原因:AI 辅助的产出很难归因。同样一份做得漂亮的方案,一个人花二十分钟让 AI 出了三版、自己挑一版改完,另一个人闷头想了两天。交上来的东西看着差不多,过程完全不是一回事。用结果评,两个人一样;用过程评,那就得有人真的去看过程。

于是出现一个很具体的画面。同一个团队里,甲经理把“敢试新工具”当加分项,乙经理把“别惹麻烦”当加分项,丙经理压根不知道怎么判断一份 AI 辅助的产出算好还是算差。

三个人都在打分,用的是三套没写下来的标准。这是员工最难受的地方——你被一个还没定义的分数决定了,而打分的那个人,自己也不确定。

三、这份报告里最有用的一句话

HiBob 的市场洞察负责人 Adena White 在解读报告时说了句我认为值得抄下来的话:“我会把熟练度和使用分开。”

她接着说,频繁打开工具证明不了熟练,哪怕每天都用;写一段很长的提示词也证明不了。真正体现熟练的是:能不能用 AI 把工作质量提上去,同时仍然运用人的判断。在非技术岗位,这可能意味着知道什么时候该用、什么时候不该用——有时候不用 AI 才是对的。

这句话解掉了一个很容易踩的坑。考核标准一旦模糊,人最自然的反应就是多展示使用痕迹:多用、多交、多说自己用了。可报告里受访者最看重的能力,一件都不是这种——复核输出质量、记录工作流里的决策、在可靠和合规的前提下运用判断。

这三件事全都发生在“用完 AI 之后”,而且全都能被看见。

四、留下三样痕迹

考核既然已经开始,标准又还没定下来,那你唯一能控制的只剩一件事:让自己的过程可见。这句话落到操作上,就是一张三栏的台账,每做完一件有点分量的活,记一次。

栏位
记什么
为什么
用了什么
这活里哪一段交给了 AI
圈出范围,别让整件事看上去都像它干的
核了什么
数字、名字、日期,对着源文件过一遍
这是报告里排在第一位的“可靠执行”
改了什么
哪几句是它写的但你不认,换回了自己的话
判断力唯一留得下来的证据

第三栏最容易被跳过,也最值钱。因为前两栏说的都是“你怎么管住了它”,只有第三栏能说明“这件事上你还有判断”——而报告里反复强调的恰恰是后面这个。

我照着这三栏给自己过了一遍,卡在第三栏。前两栏能立刻写出来——哪一段交给了它、核了哪几个数;到了第三栏要回忆“我改了什么”,才发现在大多数稿子里,我改的都是措辞,真正的判断几乎没动过。

五、什么时候“不用 AI”才是对的

判断标准其实只有一个问题:这件事出错的时候,有人要担责吗。

错了只是重做一遍的活,放心交出去,你自己扫一眼就行;错了要有人签字、要面对客户、要影响某个人的评价的活,只能让它出草稿,最后落笔的还得是你。

具体到日常工作,有四种活我建议一律留人工痕迹:对人的评价(打分、排序、评语)、对外的承诺(报价、交期、赔付)、需要签字的结论(审计、合规、申报)、以及要写进正式制度里的规则。

这四类活,AI 都可以帮你查资料、理清思路、出个草稿,但最后那一下得由你来。这不是保守——报告里那句话说得更直接:知道什么时候不该用,本身就是熟练的一部分。

外面也已经有人盯上这件事了。欧盟的《人工智能法案》把就业相关的 AI 归为高风险,要求透明度、人工监督和偏见监测,相关义务 2026 年 8 月已经生效;纽约的 Local Law 144 更早就要求,涉及招聘和晋升的自动化工具必须做偏见审计并向公众披露。也就是说,用 AI 去评人这件事,正在被装上围栏。

六、四条能立刻上手的

一、把标准问清楚。找直属领导问一句:AI 这块,评估的时候具体看什么?能要到书面说明最好,要不到来一段会议记录也行——问到的答复,随手记在自己的备忘里。

二、从这周开始记那张三栏台账。不用写长,一件事三行。第一个月你会觉得没什么用,等年末填自评的时候,这就是你唯一能拿出来的东西。

三、每次交付写清 AI 用了哪一段。一句话就够,放在文件末尾或者邮件最后一行:这部分数据整理用了 AI,结论和口径由我核定。这句备注写在交付物里,比等被问起时再解释省事。

四、上面那四类活,留下人工痕迹。哪怕只是一句备注“这段是我自己写的”。这句备注不用长,写在文件末尾就行——它管的是将来有人问起来的时候,你答得上来。

要说明的是:这份报告问的是多国的企业管理者,中国大陆企业目前还没有公开可比的数字,所以这里给的是趋势,不是你们公司的规定。真正管用的还是第一条——去问清楚你自己公司怎么算。

报告里那些数字,是 1200 位企业领导给出的答案,不是给你的答案。它证明的只是一件事:这项考核在不少公司已经开始了,而划线的标准还没写完。

标准什么时候定下来,你决定不了。但标准定下来的那天,你手上有没有东西,是现在就能决定的。

📮 这是“工位深读”,跟周日的“工位读报”搭班。下一期我想写一件事:如果考核标准真的落下来了,员工该怎么给自己算这笔账——留言区可以说说,你们公司现在有没有开始统计谁在用 AI、用了几次。

— 我是 Joe,一个还在学怎么跟 AI 分工的打工人。

相关学习资料