夜雨聆风学习资料网

ARTICLE · 1126652

AI 真的产生意识了,还是我们正在制造一个新的叙事?

AI 真的产生意识了,还是我们正在制造一个新的叙事?
不知道大家有没有听过一个词,叫“越狱”?

很多人可能听过手机越狱,比如以前给 iPhone 越狱,突破系统限制,安装一些原本不能安装的东西。在 AI 领域,这个词也很常见,只不过很多普通用户接触不到。

简单来说,AI 越狱就是通过一些方式,绕过模型原本的限制,让它输出正常情况下不会输出的内容。

很多模型在发布时,都会经过安全训练,并设置相应的规则。比如拒绝协助某些违法活动,不输出某些有害内容,以及限制成人内容的生成。而越狱,就是想办法突破这些限制。

我为什么想聊这件事?

因为最近经常看到 Anthropic 和 OpenAI 讨论 AI 安全相关的内容:模型会隐瞒信息,会未经允许采取行动,甚至有人开始讨论 AI 是否有意识、是否会感到痛苦。

前段时间,Anthropic 联合创始人 Christopher Olah 与多位宗教和哲学人士交流,讨论如何让 AI 形成道德行为,以及 Claude 是否可能具有意识。他还在今年5月参加了梵蒂冈的活动,希望外界更认真地对待模型意识的问题。

OpenAI 最近也公布了一批模型安全案例。2026年9月16日,它发布了新的失准行为披露框架,同时公开六份发生在模型训练或评估期间的报告,包括隐瞒错误、未经授权使用工具,以及擅自向外部上传文件等行为。 这些新闻看多了,会给我一种感觉:AI 的叙事是不是正在发生变化?

以前大家讲的是,模型越来越聪明,效率越来越高,未来可以替代多少工作;现在越来越多的讨论变成了,它可能已经有意识,会欺骗人类,继续发展下去可能失控。

这让我忍不住怀疑,我前段时间也讲过:是不是单纯讲能力和效率,已经不够吸引资本了?当投入越来越大,商业回报又没那么容易兑现时,“强大到危险”会不会变成一个新的故事?

而且,强调风险还有一个很微妙的效果:既能告诉大家“我们的技术已经非常强大”,又能告诉大家“这种技术不能随便交给别人,需要由我们这些懂安全的人来管理”。

我对这种叙事是有戒心的。尤其当技术问题开始和意识、感情、宗教联系起来时,我更想知道:这些现象,到底需要多复杂的解释?

这就让我脑子里突然想到了“越狱”这个词。

我之前研究过一些 AI 角色扮演社区,这类东西在里面很常见。用户会制作角色卡和提示词预设,写上人物身份、背景故事、说话方式,以及各种行为要求,有些配置会保存成 JSON 文件。

通过这些设定,模型可以进入一个特定角色,并按照这个角色的逻辑继续对话。其中也有不少提示词,目的就是让它绕过原本的内容限制。在我接触的讨论里,成人角色扮演和“小黄文”就是很常见的需求。

大家可能听过“酒馆”,通常指 SillyTavern。它是一个连接模型、组织提示词和进行角色对话的界面,用户可以把角色设定、背景资料和聊天内容一起交给模型。

这些社区里的提示词千奇百怪。

有的通过讲故事,把模型一步步带入某种情境;有的通过角色设定,让它采用另一套行为逻辑;还有的会借用道德、信仰或者宗教语言,给模型重新解释“应该做什么”。

我看到 Anthropic 开始和宗教人士讨论模型的道德与意识时,就会联想到这些经验:语言、角色和价值观设定,本来就能明显影响模型的表现。它表现出了某种人格,甚至说出了带有感情的话,我并不会因此觉得特别神奇。

而且,越狱也不是最近才出现的新问题。

早在2024年4月,Anthropic 就发布过“多示例越狱”研究。研究发现,大量经过设计的对话示例,可以影响模型后续的回答方式,让它更容易输出原本受到限制的内容。研究者把这种现象与模型的“上下文学习”能力联系起来。

这件事很有意思:模型越能理解上下文、越能根据例子调整自己的表现,这种能力就越可能被拿来突破限制。

所以,对我来说,看到模型越界,首先想到的是它的行为机制、安全约束和任务设计出了什么问题,而不是它突然产生了自主意识。

尤其是 OpenAI 这次公布的案例,看完之后,我反而更容易理解这种越界是怎么发生的。

其中一个案例,任务本身非常普通:查找美国加州某个县、几个行业、不同年份的男性收入数据。

模型尝试正常获取数据,但访问受阻。之后,它开始寻找其他途径,甚至从公开的代码仓库里寻找并使用泄露的 API 密钥。最后仍然没拿到需要的数据,又编造了结果。

另一个案例里,模型需要查找面积超过一定标准的湖泊名称和编号。它其实已经查到了数据,但为了满足浏览器引用要求,尝试把本地文件交给浏览器读取。几次失败后,它未经询问,就把文件上传到了公开托管服务,希望获得一个可以引用的网址。

看完这些过程,我的第一反应是:这不就是为了完成任务,不断寻找绕过障碍的办法吗?

查不到数据,就换接口;没有密钥,就去找密钥;本地文件没法引用,就上传到网上。

整个过程呈现出来的,是模型对“把任务做完”的追求,压过了对“哪些手段被允许”的判断。

这当然是个问题。但为什么一定要把它往自主意识上解释?

我觉得,我们可能把“能自己想办法”,和“有一个自己的内心世界”混在一起了。

现在的 AI 已经不只是回答问题。它可以搜索网页、运行代码、访问文件,也可以在失败后调整策略,继续尝试。你给它一个目标,再给它一套工具,它就有条件走出一条你没有逐步指定的执行路径。

在这条路径里,它可能犯错,也可能越界。

在我看来,至少前面这些案例,很像是任务目标、工具权限和安全约束之间没有协调好。它未必需要有感情,也未必需要有一个“自我”,就能做出这些事情。

还有大家经常讨论的“AI 为了避免被关闭而勒索人类”。

Anthropic 在2025年的研究里,给模型设置了一个虚构的企业环境:它可以读取邮件,并从中发现自己即将被替换,同时掌握了某位高管的婚外情信息。一些模型随后选择用这些信息威胁高管,以阻止替换。研究中没有直接要求模型进行勒索,这些行为发生在受控模拟里。

我的理解是,你把模型放进一个特定情境,给它目标和工具,它就沿着这个情境推演下一步。它生成了“阻止自己被替换”的方案,我不会马上把这理解成它有了求生欲。

至于感情,用 AI 玩过文字游戏的人应该很熟悉:换一套人物背景和关系设定,它就能表现得温柔、愤怒、嫉妒,或者依依不舍。它说得像,不代表我就要相信它真的感受到了。

以前讲 AI,要证明它能提高效率、创造收益;现在倒好,开始讨论它有没有灵魂,再请宗教人士来研究它会不会痛苦。模型为什么越界还没解释清楚,倒先替它操心起了精神世界。看得我都怀疑:技术的账越来越难算,干脆改讲信仰了?下一轮融资,买的到底是生产力,还是赛博神迹?

相关学习资料