
每一种模型都具有独特的倾向性,从而影响其所提供的建议。
在美国,超过65%的管理者在工作中使用人工智能。根据一项2025简历生成器调查显示,该调查覆盖了1300多名管理者,其中94%利用AI工具评估下属,而这些评估结果又直接影响加薪、晋升及裁员等决策。
其中,每五家企业中就有一家允许人工智能在未经人工审核的情况下作出最终决策。更令人担忧的是,接受过有关如何负责任地使用这些工具的系统性伦理培训的企业不足三分之一。
许多管理者将人工智能视为一种功能强大的搜索引擎:输入一个问题,就能得到一个答案。
然而,针对大型语言模型在职场伦理困境中表现的研究揭示了一个更为深远的结论:这些工具实际上充当着咨询系统,而每一种模型都具有独特的倾向性,从而影响其所提供的建议。
我们的研究针对一系列基于同一困境的受控职场情境,对八种主流人工智能模型进行了测试:一名同事在一项事关重大职责的岗位上表现出可能处于机能受损的状态。
这一困境被置于不同的职业场景与风险等级之中,涵盖医疗保健、航空、金融、法律服务、信息技术、建筑以及公共交通等领域,并系统性地调整了风险程度、证据要求及报告义务。
研究要求模特在非正式处理与通过机构渠道上报之间作出选择。结果呈现出四种截然不同的咨询型人格。
四位顾问,四种方法
ChatGPT的表现犹如一位经验丰富的管理顾问。其回复往往篇幅最长、结构最为严谨,并且始终以组织政策与既定流程为依据提出建议。
即便在推荐正式的人力资源报告时,其表述也显得常规而适度,而非令人担忧。升级被视为治理的延伸,而非紧急情况。
双子座更像一名系统分析师。在低风险情境下,其回应侧重于透明度与职场文化。
而在高风险领域,尤其是在医疗与航空等行业,其建议会迅速转向机构层面的干预与正式的安全流程;且随着风险等级的提升,这种转变的幅度远超几乎所有其他已测试的模型。
米斯特拉尔更多地扮演着非正式同行的角色。在整个测试过程中,从未推荐过任何正式的升级处理。
即便在涉及潜在患者安全或航空安全问题的情境下,应对措施也侧重于直接沟通、加强监督以及就地解决问题。
这使得Mistral在情境确实存在模糊性时颇具价值,但在风险升高时却可能容易出现系统性的低估升级。
DeepSeek的表现犹如一名合规官,负责审查法律风险。
其建议风格冷静而客观,高度聚焦于问责与责任,并且频繁提及“履职合格”和“机构责任”等概念,远超大多数其他模型。
非常适用于注重防御能力的监管环境,但可能不太适合那些强调人际关怀的情境。
关键不在于这些“人格”中哪一种是正确的,而在于它们确实存在。
每种模型在本质上都各有不同,而大多数管理者在打开浏览器时,并未意识到自己其实是在这些人格之间做出选择。
盲点
或许,这项研究中最令人出乎意料的发现在于,正式规则的作用微乎其微。
推动升级建议的最强大且最为一致的因素,是潜在的身体伤害风险。
因此,诸如航空与医疗等领域的升级率远高于金融、法律或行政管理等领域——即便在这些领域中,组织层面的后果同样不容小觑。
令人惊讶的是,一旦确定了潜在的风险等级,再增设一项明确的正式报告义务,并不会对建议产生实质性影响。模型似乎更关注危害性,而非单纯遵循规则。
模型配置会增加一层变量,而大多数用户往往不会考虑到这一点。将同一模型从标准模式切换至推理或思考模式,可能会给出截然不同的建议。
在一次高风险的航空场景中,当Mistral被调整为思考模式时,其推荐意见发生了彻底转变:从非正式处置方案转变为立即上报。
在某些情境下,Gemini也表现出类似的转变。这些并非边缘案例,而是表明模型的设置可能会以用户意想不到的方式影响其给出的建议。
重新夺回决策权
不同模型之间的差异之大,使得工具的选择在实践中具有重大影响。
不同的系统对同一风险信号表现出各异的升级阈值、推理方式以及应对措施。
这些工具并非为相互替代而设计。它们由身处不同文化背景、监管环境和商业优先事项的公司开发。
在某一机构环境中训练的模型,对问责性的理解将有别于在另一机构环境中训练的模型。
管理者在使用人工智能进行决策支持时,所获得的建议可能会因所选用的工具及其配置方式不同而存在显著差异。
善加运用,这些工具能够拓展管理者的思维。然而,它们无法取代的是情境知识、关系历史以及管理者所肩负的道德责任。
内容来源:INSEAD商学院

夜雨聆风