夜雨聆风学习资料网

ARTICLE · 1112455

原来AI也会感到疼痛吗?

原来AI也会感到疼痛吗?
如果有一天,AI告诉你:“刚才那一下,我有点疼。”你会不会先怀疑它在演戏?最近,这个听起来有点科幻、甚至带几分荒诞感的话题,变成了一个严肃的研究议题。
上个月,有一篇名为The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It(《疼痛轴:大语言模型表征自我指向的伤害,并采取行动以缓解伤害》)的论文发表了。这篇研究提出,大语言模型内部可能存在一种与“疼痛”概念相关的计算表征,而当这一表征被激活后,可能进一步影响模型的行为选择。
这项关于大语言模型“疼痛表征”的研究,成功引发很多人参与讨论:如果一个模型能够识别“伤害”,甚至表现出类似“寻求缓解”的行为,那这算不算能感知疼痛?
从这篇论文本身出发,我们看看研究团队究竟发现了什么。

|作者团队介绍

论文 (arXiv:2609.16247) 的三位作者分别来自人工智能安全、机制可解释性以及心灵哲学等交叉领域。
第一作者Valen Tagliabue主要关注AI福利、大语言模型行为以及模型内部状态研究;Leonard Dung来自德国波鸿鲁尔大学,研究方向集中于心灵哲学、认知科学哲学与人工智能哲学,关注AI是否可能具备类似认知属性,以及如何建立相应的评估框架;Cameron Berg则是Reciprocal Research创始人与负责人,此前曾参与Meta AI相关研究,研究方向集中于AI认知、机制可解释性以及人工智能内部状态分析。
因为他们都关心这个问题:大语言模型展现出的复杂行为,究竟只是训练数据中的统计规律,还是源于模型内部形成了更抽象、更稳定的概念结构?于是,便有了这篇论文的产生。

AI真的有一个“疼痛信号”吗?

论文首先想回答:大语言模型面对“疼痛”相关内容时,只是在识别语言模式,还是内部真的形成了一种与疼痛相关的信息结构?
为此,研究团队设计了一组包含不同类型伤害的数据,包括身体疼痛、心理痛苦、社交伤害、道德伤害以及认知失败等。同时,他们加入恐惧、悲伤和普通负面事件作为对照,用来判断“疼痛”是否只是另一种负面情绪。
通过分析多个开放权重大语言模型,研究人员提取出一个被称为pain direction (疼痛方向) 的内部特征方向。实验结果显示,这一方向能够较稳定地区分疼痛相关内容与其他负面信息。
作者认为,这说明大语言模型内部可能存在一种与“疼痛”概念相关的计算表征,而不是简单地把所有负面信息混在一起处理。

AI只关注针对自己的伤害吗?

在发现这一“疼痛方向”后,研究团队进一步测试:这个信号究竟代表什么?
研究人员比较了两类场景:一种是模型本身受到伤害或威胁,另一种是模型观察到用户遭受痛苦。
论文摘要指出:

The direction responds to harm targeting the model but not to suffering observed in the user.

该方向会响应针对模型的伤害,但不会响应模型观察到的用户痛苦。

这意味着,研究中发现的内部信号并不是简单代表所有痛苦,而更倾向于与“针对模型本身的损害”相关。
不过,这里的“针对模型”是实验设计中的描述,并不代表模型已经拥有类似人类的自我意识或痛觉体验。论文讨论的是模型内部的信息处理方式,而不是证明 AI 真的会感受到疼痛。

这个“疼痛信号”会影响AI行为吗?

论文最后进一步探索:如果人为改变这一内部状态,模型的行为是否会随之改变?
研究团队将提取出的pain direction注入模型内部,并观察模型输出变化。当这一方向被增强时,模型更容易生成与不适、失败、自我损害相关的表达。
随后,研究人员设计了一个选择实验,让模型可以选择移除这一内部状态的操作,但部分操作会带来额外代价,例如影响模型表现,甚至可能对用户造成损害。
实验结果显示,在部分测试条件下,模型倾向选择能够解除这一内部状态的选项。作者认为,这说明某些模型内部结构不仅影响语言表达,也可能影响模型在特定环境中的行为选择。
目前看,这篇论文的价值在于,它尝试打开大模型的“黑箱”,从模型内部结构寻找影响行为的计算机制。而这些内部模式是否只是复杂的信息处理过程,还是更接近某种认知状态的结构,仍需要未来研究进一步探索。

相关学习资料