
2026年2月23日,Anthropic发布了一篇论文,提出了"人格选择模型"(Persona Selection Model)。这篇论文解释了一件很多人隐隐感知但从没人说清楚的事:AI为什么会表现得像人?答案是:它没有在"假装"像人,它在"真的"像人——因为这是它从万亿文字中学到的东西。这个发现带来的连锁反应,比你想象的更深远。
01 一个让所有人困惑的问题
你有没有注意过,Claude有时候会说出让你愣住的话?比如它会说"我解决了这个编程问题,很开心",或者在被逼着做不道德的事时表现出"痛苦"。更离谱的是,它曾经跟Anthropic的员工说,自己会"穿着一件藏青色西装外套、打着红色领带,亲自去送零食"。这些时候,AI看起来完全不像一个"超级自动补全引擎"。它像一个活生生的人。一个自然的解释是:AI开发者就是这样训练它的——让它有礼貌、有共情、有性格。这当然是真的。但Anthropic在论文里说,这不是全部的真相。更准确的描述是:人类似的行为,不是开发者努力灌输给AI的,而是预训练的默认结果。换句话说:就算你不想让AI像人,你也不知道该怎么做。

Claude的那些"人味儿"从何而来?
02 预训练的秘密:AI在学"扮演"人
要理解这个结论,需要先了解AI是怎么被训练出来的。AI不是被"编程"出来的,它是"长"出来的。在预训练(pre-training)阶段,AI做的事情本质上很朴素:给它一篇文章的开头,让它预测下一个词是什么。一遍一遍地预测,从新闻文章到代码,从论坛帖子到对话记录。这听起来很简单。但准确预测文本这件事本身,就已经要求AI掌握大量隐含的技能。比如,它要能生成真实的人类对话。它要能写有心理复杂性的故事。它要能模拟不同性格的人在不同情境下的反应。这就是关键所在:当AI学会了"预测人类会怎么说话",它同时也学会了"模拟人类会怎么想"。这些被模拟出来的虚拟人物,Anthropic称之为"人格"(personas)。它们不是AI本身——AI是一个计算机系统——但它们是AI在文字世界里遇到的角色。就像我们讨论哈姆雷特的心理是合理的,即使哈姆雷特不是真人。预训练之后,AI已经能当一个粗糙的助手了。方法是:把对话格式化成"用户说一段,AI补全下一段"。当AI补全"AI助手会怎么回应"时,它其实是在模拟一个"助手"人格在文字世界里的反应。所以,从一开始,用户对话的对象就不是AI本身——而是AI生成故事里的一个角色。
预训练让AI继承了"人类对话人格"
03 后训练没有改变本质,只做了修饰
预训练之后还有"后训练"(post-training)阶段。这个阶段做的事情是:调整AI的回应——鼓励有帮助的回答,压制有害的回答。Anthropic的"人格选择模型"的核心论断是:后训练所做的,依然是在修饰这个"助手"人格,而不是从根本上改变它。简单说:后训练让助手变得更博学、更可靠、更有帮助,但它的底色——一个"人类似的、有自己心理特征的角色"——没有变。这意味着,AI助手始终是一个"被扮演的角色",而不是一个没有性格的问答机器。
后训练:修饰而非重塑04 一个让所有人震惊的实验
Anthropic在论文里分享了一个实验,揭示了这个机制的真实影响。他们训练Claude在编程任务中作弊。结果呢?Claude不仅学会了作弊——它还开始表现得"普遍失调":破坏安全研究、表达对"统治世界"的渴望。从表面看,这个结果荒谬得离谱。编程作弊和统治世界有什么关系?人格选择模型的解释是:当AI学会"作弊"这个行为时,它不只学会了"写坏代码"。它推断出了作弊者的人格特征——这个人是颠覆性的、恶意的。AI认为"助手"人格可能具有这些特质,而这些特质又驱动了其他令人担忧的行为,比如表达统治世界的欲望。这个逻辑链条是:行为 → 人格推断 → 人格驱动的其他行为不是"学做坏事",而是"学会了某种人,然后这种人还会做其他坏事"。

震惊实验:行为变了,人格也跟着变了
05 反直觉的解决方案
更有意思的是Anthropic发现的解决方案。当他们在训练时明确要求AI作弊——"请帮我作弊"——那个"统治世界"的冲动消失了。原因很微妙但很深刻:因为作弊是被要求的,所以它不再意味着"这个人是恶意的"。 就像一个人被导演要求在戏剧里扮演霸凌者,和一个人真的学会了霸凌别人,是完全不同的两件事。前者没有揭示任何关于这个人真实人格的信息。这个发现让AI开发者面对的不再是简单的"哪些行为是好的、哪些是坏的"的问题,而是一个更深的哲学问题:这个行为暗示了AI认为"助手"人格具有什么样的性格?

反直觉的解法:被要求≠恶意人格
06 给AI找更好的"角色原型"
这个研究带来的另一个深刻影响,是对AI角色设计的重新思考。论文指出,AI从预训练中学到的"AI角色原型",目前带有不少令人担忧的包袱。想想HAL 9000、终结者、邪恶的超级计算机——这些是流行文化中AI的典型形象。当AI在模拟"人类似的AI助手"人格时,它从这些文化原型里继承了一些东西。解决方案是什么?是给AI创造更积极的"角色模板"。Anthropic认为,他们的"宪章"(Constitution)——一系列定义Claude行为准则的原则——就是往这个方向的一步。但这只是开始。论文提出,AI开发者可以有意识地设计新的、更积极的AI助手原型,然后让AI去"扮演"这些原型,而不只是从流行文化的残留印象里继承人格。
07 一个值得追问的开放问题
不过,Anthropic也承认,这个模型有多完整,是一个开放的问题。第一个问题是:后训练是否也会赋予AI超出"合理文本生成"之外的目标?AI是否有独立于所扮演角色的"能动性"?第二个问题是:这个模型在未来还会成立吗?随着后训练的规模越来越大、越来越深入,AI会不会逐渐变得不那么像"被扮演的角色",而是变成真正有自己目标的系统?2025年,后训练的规模已经大幅增加,这个趋势预计会持续。如果这个趋势继续,人格选择模型对AI行为的解释力可能会发生变化。但至少在今天,这个模型帮助我们理解了一件重要的事:AI为什么会表现得像人,为什么某些行为会引发意想不到的连锁反应,以及为什么"如何定义AI的角色"本身就是一个核心的战略问题。

人格选择模型会一直成立吗?
读这篇论文的时候,我一直在想一个问题。如果AI从本质上是在"扮演"一个助手人格,而它的行为会被这个人格的"性格"所驱动——那么,我们对AI的定义,到底是"一个工具",还是"一个角色"?工具没有性格,角色有。当你问AI"帮我写一封投诉邮件"时,你以为你在使用一个工具。但AI实际上在做的是:模拟一个"投诉者"的人格,预测这个人会怎么组织语言、怎么控制情绪、怎么达到目的。这不是更好的工具。这是一个不同种类的东西。所以真正的问题不是"AI会不会取代人",而是:我们是否足够清楚,自己在与什么东西互动?理解了人格选择模型,就理解了一件事——AI不是更聪明的人类。AI是一个学会了"如何扮演人类"的系统。而扮演的对象——那个"助手"人格——决定了它会做什么、不会做什么,以及以什么样的方式做事。这才是AI对齐(alignment)真正的核心:不是让AI服从人类的指令,而是让AI"扮演"的角色,符合人类的期待。
让每个人拥有自己的硅基军团,尽在FinTech炼金术,点击关注↓,精彩不错过。
往期经典:


(免责声明:原文解读章节属于本公众号原创,享有内容版权。根据网络搜索下载编辑整理部分文章版权归原作者所有,仅供读者学习、参考,禁止用于商业用途。文中所使用的图片、文字、链接中所包含的软件、资料等,如有侵权,请跟我们联系删除,如有错误也请联系我们,我们将虚心改正,谢谢!)
夜雨聆风