生成式AI会修复绩效评估,还是让它更糟?
*(原标题: Gen AI Could Fix Performance Reviews—or Make Them Even Worse)*
📌 **本文适合谁读?**
- ✅ 企业中层管理者(重点看角度4:中层管理者视角)
- ✅ 创业者/CEO(重点看角度2、3:中国视角 + 中国企业视角)
- ✅ 商业分析师(重点看角度1、2:全球视角 + 中国视角)
- ✅ 对商业趋势感兴趣的职场人(全文适读)
花旗、摩根大通、波士顿咨询等巨头正快速部署生成式AI(Gen AI)来优化绩效评估流程:花旗的Performance Assist跨部门拉取数据起草评估,摩根大通的LLM Suite支持年终评语撰写,BCG的内部AI工具将撰写时间缩短40%。然而,这些系统目前主要用来更快地产出更精良的传统叙述式评语,而非从根本上变革评估机制。文章警示,Gen AI若只追求效率而忽视评估质量,可能放大偏见、削弱反馈真实性,甚至让管理者更依赖AI而丧失判断力。核心技术悖论在于:Gen AI擅长生成“听起来专业”的文本,却无法理解绩效背后的复杂语境与情感细节,从而可能使绩效评估从“对人的评判”退化到“对AI生成文本的评判”。文章呼吁企业应重新设计评估系统,而非简单用AI加速旧流程。
角度1:🌍 全球视角
全球商业正经历一场“AI加速主义”与“制度惯性”的激烈碰撞。绩效评估作为人力资源管理中最具仪式感的环节,其核心矛盾在于:它既要服务于人才发展的长期目标,又要满足薪酬分配、晋升决策等短期需求。Gen AI的介入,表面上解决了管理者“写不出、写不好、写不快”的痛点,实则将这一矛盾推向了新的高度。
从全球技术趋势看,Gen AI在绩效评估中的应用呈现明显的“效率优先”路径。花旗、摩根大通等金融机构选择从“数据整合+文本生成”切入,这符合金融行业对流程标准化和文档质量的极致追求。BCG的案例则显示,专业服务公司更看重时间节省——40%的撰写时间缩减意味着顾问可以将更多精力投入客户服务。然而,这种“用AI加速旧流程”的策略,本质上是在强化工业时代“年度评估”的范式,而非向更敏捷、更持续的反馈机制转型。
主要经济体的应对策略出现分化。美国企业倾向于技术先行、制度跟进,通过内部AI工具快速试错,同时依靠法律和合规部门防范偏见风险。欧盟则在《人工智能法案》框架下,将绩效评估AI列为“高风险应用”,要求企业进行合规评估和人工监督,这可能导致欧洲企业在部署速度上落后,但可能催生更负责任的AI评估系统。亚洲市场,尤其是日本和韩国,更关注AI如何与“年功序列”或“终身雇佣”等文化传统融合,而非简单替代。
跨国企业的最佳实践案例揭示了三个关键启示。第一,数据整合是基础也是陷阱:花旗的Performance Assist能跨部门拉取数据,但若数据本身存在偏见(如某部门长期评分偏高),AI只会放大而非纠正。第二,文本生成能力不等于评估质量:BCG的AI工具能快速生成流畅评语,但管理者反馈,AI生成的“专业术语”反而让员工感到疏离,缺乏人性化温度。第三,AI需要“人工校验环”:最成功的案例往往要求管理者在AI生成初稿后,必须手动修改至少30%的内容,以确保评估的个性化和准确性。
对全球产业链和价值链的影响更为深远。在知识密集型行业(咨询、金融、科技),“AI写评估”正在改变人才流动模式:员工更容易通过AI生成的标准化评语获得“好看”的履历,但雇主也更容易识别出“AI味”过重的推荐信,形成新的信息不对称。在制造和物流等蓝领领域,Gen AI与物联网数据的结合,可能催生“实时绩效评分”系统,彻底改变计件工资和晋升机制。这种趋势可能加剧全球人才市场的马太效应:能驾驭AI评估系统的员工获得更多资源,而缺乏数字素养的群体则被边缘化。
角度2:🇨🇳 中国视角
中国企业对Gen AI在绩效评估中的应用,正处于“技术热情”与“管理谨慎”的微妙平衡期。一方面,中国互联网和金融科技巨头在AI能力上并不落后于美国同行;另一方面,中国特有的企业文化、政策环境和劳动力结构,决定了Gen AI的本土化应用必须走差异化路径。
中国市场面临的核心挑战在于“评估文化”的独特性。中国企业的绩效评估往往高度依赖“人情关系”和“领导意志”,甚至存在“轮流坐庄”的潜规则。Gen AI如果直接介入,可能面临两种极端结果:要么因为无法处理非正式关系而失效,要么因为忠实记录数据而打破原有平衡,引发管理冲突。因此,中国企业在部署Gen AI时,更倾向于“辅助决策”而非“替代决策”,例如用AI生成初稿后由管理者手动调整,保留最终解释权。
与政府战略的关联体现在“十四五”规划中“数字中国”和“人工智能”两大方向。政策鼓励企业利用AI提升管理效率,但同时强调“科技向善”和“算法治理”。这意味着中国企业在应用Gen AI进行绩效评估时,必须同时考虑《数据安全法》《个人信息保护法》的合规要求,以及“算法推荐管理规定”对自动化决策的约束。例如,AI评估系统不能仅依赖历史数据,还需要引入人工复核机制,避免算法歧视。
对本土企业的具体影响呈现行业分化。互联网企业(如阿里、腾讯)对AI评估的接受度最高,但主要用在“基层员工”而非“高管层”,因为高管评估仍依赖董事会和人力委员会的人工判断。制造业企业(如华为、海尔)则更关注AI与“精益管理”的结合,例如通过分析生产数据生成客观绩效指标,减少主观评分。中小企业面临两难:既希望通过AI降低管理成本,又担心系统部署和数据安全成本过高,最终可能选择SaaS模式的轻量级方案。
中国市场的特殊机遇在于“弯道超车”。由于中国企业在传统绩效评估系统上的投入相对较少,反而没有“历史包袱”,可以直接采用更先进的AI原生评估框架。例如,字节跳动内部已经尝试用AI分析员工工作日志、项目协作数据,生成实时反馈而非年度评语。这种“从零开始”的可能性,让中国企业在Gen AI评估领域有机会跳过西方企业“用AI加速旧流程”的阶段,直接进入“重新设计评估系统”的2.0时代。
风险提示方面,中国企业需要警惕“技术万能论”。Gen AI无法解决绩效评估中最核心的问题:如何定义“好绩效”?在中国企业,绩效往往与“加班时长”“吃苦耐劳”等非量化因素挂钩,AI如果只分析客观数据,可能得出“准时下班但效率高”的员工绩效不如“天天加班但产出低”的员工,这与管理者期望相悖。因此,中国企业在部署Gen AI时,必须同步进行“绩效定义”的重新梳理,否则AI只会放大管理层的认知混乱。
角度3:🏢 中国企业视角
针对中国互联网巨头和出海企业的具体战略建议,需要区分两类企业:一类是“AI原生型”(如字节、阿里云),另一类是“全球运营型”(如SHEIN、TikTok、大疆)。前者更关注如何用AI优化内部管理,后者则面临跨文化绩效评估的复杂挑战。
对互联网企业(腾讯、阿里、字节)的启示是:不要只把Gen AI当作“写作工具”,而要看作“评估系统重构”的契机。字节跳动已在使用AI分析OKR(目标与关键结果)完成度、项目协作频率、代码提交质量等数据,生成动态绩效画像。这种“数据驱动+AI分析”的模式,远比传统叙述式评语更有价值。建议腾讯和阿里跟进:第一,将AI评估与OKR或KPI系统深度打通,实现“目标-过程-结果”的全链路追踪;第二,引入“360度反馈AI化”,用NLP分析同事、下属、客户的匿名反馈,提炼关键主题而非简单汇总;第三,建立“评估质量监控模型”,定期检测AI生成的评语是否存在偏见或模板化。
对出海企业(SHEIN、TikTok、大疆)的战略建议必须考虑跨文化因素。这些企业在全球拥有大量外籍员工,绩效评估需要兼顾不同文化对“直接反馈”的接受度。例如,在东南亚和拉美市场,员工可能更偏好“鼓励性”评语,而在德国和日本市场,员工需要“具体且可量化”的改进建议。Gen AI的优势在于可以“一键切换”评估风格:针对不同文化背景的员工生成适配的反馈语言。但风险在于,AI可能因为训练数据不足而产生文化误解,例如将“直接批评”视为“职业化”,或将“委婉表达”视为“回避问题”。建议出海企业:第一,为不同市场建立独立的AI评估模型,训练数据必须包含当地真实绩效案例;第二,设置“文化审核员”岗位,由熟悉当地文化的HR专家对AI生成评语进行抽查;第三,在评估系统中加入“反馈偏好问卷”,让员工选择自己更接受的反馈风格。
实操建议方面,中国企业可以分三步走。第一步(3个月内):试点“AI辅助撰写”,选择1-2个部门,用AI生成初稿后由管理者手动修改,记录效率提升和问题反馈。第二步(6个月内):引入“数据整合层”,将HR系统、项目管理工具、协作软件的数据打通,让AI能基于多维度数据生成评估。第三步(12个月内):尝试“评估系统重构”,从年度评估转向季度或月度“AI驱动反馈”,让绩效管理从“事后评判”变为“实时指导”。
风险提示必须前置。第一,数据隐私风险:中国《个人信息保护法》要求员工同意才能收集绩效数据,企业必须在部署前完成合规审查。第二,算法偏见风险:AI可能因为训练数据中“男性员工评分偏高”而延续性别歧视,建议引入“公平性审计”机制。第三,管理者依赖风险:AI生成的评语可能让管理者产生“这就是正确答案”的错觉,从而放弃独立判断,建议强制要求管理者在AI评语基础上添加至少200字的人工观察。
角度4:👔 中层管理者视角
对部门经理和业务主管而言,Gen AI在绩效评估中的应用是一把双刃剑:它可能帮你节省时间,也可能让你失去对团队的真实感知。作为夹在高层战略和基层执行之间的“夹心层”,中层管理者需要掌握三个核心能力:如何用AI提升效率而不丧失判断力,如何让AI生成的评语不流于形式,以及如何在AI介入后保持与员工的信任关系。
实操建议第一条:把AI当作“初稿生成器”而非“终稿机器”。很多管理者收到AI生成的评语后,简单修改几个字就提交,这在短期内节省时间,但长期会损害评估质量。正确的做法是:第一,用AI生成初稿后,先对照你对该员工的日常观察,找出AI遗漏的关键细节;第二,针对AI评语中“听起来很专业但缺乏针对性”的句子,替换成具体的项目案例;第三,在评语末尾加入“你的建议”,这部分必须由你亲自写,因为AI无法理解你对该员工职业发展的真实期待。
团队管理方面,Gen AI的介入可能改变你与员工的沟通方式。过去,绩效评估是“管理者说,员工听”的单向过程;现在,员工可能提前用AI生成了“自我评估”,甚至用AI分析了你往年写的评语。这种“信息对称”反而创造了更好的对话基础。建议管理者:第一,在评估面谈前,让员工先用AI生成“自我评估初稿”,然后对比AI对你的评语和员工的自我认知,找到认知差距进行讨论;第二,利用AI分析团队整体绩效数据,识别出“高潜低能”或“低潜高能”的异常员工,进行针对性辅导;第三,建立“反馈日志”,用AI记录每次1对1沟通的关键点,为下次评估积累素材。
个人职业发展方面,中层管理者必须警惕“AI替代风险”。当AI能生成比人工更流畅的评语时,管理者“写评语”的能力不再稀缺,稀缺的是“读懂团队”的能力。这意味着你需要从“文档撰写者”转型为“人才解读师”。建议提升的技能包括:第一,数据素养——学会解读AI生成的绩效数据仪表盘,识别异常模式和趋势;第二,情境判断力——在AI给出“该员工表现优异”的结论时,能判断这是真实贡献还是系统偏差;第三,同理心沟通——在AI生成“专业但冰冷”的评语后,能用人类语言重新包装,让员工感受到真诚。
值得跟进的5条具体action items:
1. 本周内:试用一款AI绩效评估工具(如花旗的Performance Assist类似产品),生成一份你下属的评估初稿,然后手动修改,记录修改比例和原因。
2. 两周内:与你的直接下属进行1次“AI评估体验对话”,询问他们对AI生成评语的感受,以及他们是否愿意接受AI介入绩效管理。
3. 一个月内:在你的团队中试点“AI辅助反馈”机制,要求每位管理者在每次1对1后用AI记录3个关键反馈点,积累数据用于季度评估。
4. 三个月内:参加至少1次“AI时代绩效管理”培训,重点学习如何识别AI偏见、如何将AI数据与人工判断结合。
5. 半年内:推动你的部门或团队制定“AI评估使用规范”,明确哪些环节必须人工介入、哪些数据可以使用、哪些场景需要员工知情同意。
原文链接: [Gen AI Could Fix Performance Reviews—or Make Them Even Worse](https://hbr.org/2026/05/gen-ai-could-fix-performance-reviews-or-make-them-even-worse)
夜雨聆风