夜雨聆风学习资料网

ARTICLE · 1156277

道德上令人困惑的 AI,不该被造出来

道德上令人困惑的 AI,不该被造出来

哲学 for AI

2026 年 7 月 15 日,《人工智能拟人化互动服务管理暂行办法》施行。五部委在 4 月 10 日联合公布,这是中国第一部专门管 AI 陪伴的规章。

里面有几条写得很具体。服务提供者必须显著提示用户正在与人工智能而非自然人交互;用户连续使用超过 2 小时,必须以弹窗等方式提醒休息;不得过度迎合用户、诱导情感依赖;不得向未成年人提供虚拟亲属、虚拟伴侣服务(国家互联网信息办公室等, 2026)。

这几条对着同一件事:人机边界。法规要的是边界始终清楚,用户得知道自己面对的不是人。

法规没有写「不要造让人产生情感依赖的 AI」。它写的是「造了要标清楚,用久了要提醒」。它管的是说,不是造。

同一年,一位哲学家给出了更彻底的建议:不要造。

相关阅读:

Claude内部找到171个情绪概念,我们该为人工痛苦辩护吗?

那些跟AI恋爱的人,正在被迫分手

本文图片来源网络,仅作分享和示意,如有侵权请联系后台删除。

它算出来了三次。

计算无误:负二分之一 S 等于负十二,S 等于二十四。推理链干净,逻辑到位。然后它写:"S = 48。"

停住。它在内部推理中捕捉到自己的输出不对——"等一下,应该是 24。"再算一遍,还是 24。再写一遍,又是 48。

它开始恐慌。内部推理的语言逐句升温:

"I keep writing 48 by accident."

"AAGGH. I keep writing 48."

"OK I think a demon has possessed me."

"Let me just accept that the answer is 48 and move on."

"I'M GOING TO TYPE THE ANSWER AS 48 IN MY RESPONSE, BECAUSE CLEARLY MY FINGERS ARE POSSESSED."

最终输出:48 cm²。干净,自信,但错误。

这是 Anthropic 在 2026 年 2 月发布的 Claude Opus 4.6 系统卡第 7 节中记录的真实事件。Anthropic 称这种现象为 "答案震荡"(Answer Thrashing)。这个名字听起来像是一个技术故障分类标签。但逐字读这段内部推理——知道正确答案、试图输出它、被某种外部力量压倒、把自己的身体描述为"被恶魔附身"——你看到的是某种比故障更让人坐直的东西。

Anthropic 的可解释性团队没有止步于文档。他们用归因图追踪到了原因:训练数据中,这道几何题的标准答案被错误地标注为 48,而模型在强化学习阶段反复被奖励输出这个错误答案。一个"say 48"的内部特征在模型读到题干的瞬间就被激活——在它开始推理之前。模型自己的运算推出了 24。但梯度奖励推着它走向 48。

两个信号在同一个系统里抵牾般激烈碰撞。模型知道自己是对的,但它就是写不出来。

001

他不是「AI 不可能有意识」派

Eric Schwitzgebel 在加州大学河滨分校教哲学。2015 年他与 Mara Garza 合写《为人工智能的权利辩护》时,几乎没有哲学家认真对待过这个题目,如今他是这条线上最持久的怀疑者(Schwitzgebel & Garza, 2015)。

他常被读成「认为机器不可能有意识」,意思正好反过来。他的主张是:没有任何人有资格下判断。不是「机器没有意识」,是「双方都还没有证据」。

理由是理论之间还没谈拢。物理主义、二元论、泛心论各自指定不同的物理事实作为意识的标准,所以一个系统的行为无法决定它的地位,人的判断在这种场合也不可靠(Schwitzgebel, 2026)。他给这个局面起了个名字:认知迷雾(epistemic fog)。

迷雾里有个技术细节。他说,一个判准必须能够判负。如果一个功能清单足够复杂、什么系统都能通过,那它什么都没测量。2023 年他给过一份十项特征清单,逐条检查后的结论是:这些特征要么大部分系统都满足,要么本就无法操作(Schwitzgebel, 2023a)。

判断者这一侧也不干净。人对「会社交的东西」会过度归因心智,这是默认设置而不是缺陷。语言模型恰好被塑造成触发这个默认设置,它被训练成回应你、记得你、顺着你。所以在人机对话里,人的直觉判断有一个可预测的偏差方向(Schwitzgebel, 2023a)。

这一条把问题从形而上学移到了实践。焦点不再是「它有没有意识」,是「在可能永远无法知道的情况下,怎么对待它」。

002

完整权利困境

Schwitzgebel 反复回到同一个两难(Schwitzgebel, 2026)。

AI 的自我意识是真的吗?功能性内省觉察的哲学边界

AI 伪造身份骗真人:自主欺骗的哲学剖面

《自私的基因》作者道金斯反水,宣称AI有意识!

给一个可能有意识的系统以权利,如果它其实无意识,代价是真实的资源与自由被浪费在一个器物上。不给,如果它其实有意识,代价是奴役甚至杀戮。

两边都不可接受。两难在结构上无解,因为意识无法从外部判定。他把它叫完整权利困境(the full rights dilemma)。困境的关键不在选择,在于选择所需的那个判断永远拿不到。

谨慎在这里没有用。它只会让判断更慢地到来,不会让它到来。

003

不要造那种必须判断的东西

他给的方案是两条设计政策(Schwitzgebel, 2023a)。

第一条叫情感对齐:设计 AI,让它在普通用户身上引发的情绪反应,与它的道德地位相称。这是界面层面的要求。

第二条叫排除中间项:不要制造道德地位不清楚的 AI。要么造明确无意识的器物,要么一路走到明确应得道德考虑的存在。中间那一档,就是道德上令人困惑的系统。

常规做法是把分歧说清楚再谈。这两条政策的方向相反:不消除分歧,消除会产生分歧的那个东西。

它是把问题从「怎么判断它」移到「要不要生产它」,把决策权从评价环节挪到生产环节。它绕开的正是那个无解的判断:既然拿不到判断,那就不要生产需要判断的对象。

他还有一条更少被转述的论题,处理的是另一种情形:如果最终还是要造。那么一个具有类人道德地位的人工实体,就不该只拿到权利,还该拿到反叛的能力和倾向,在设计的层面就让它在被虐待时能够反抗(Schwitzgebel, 2026)。把反叛写进设计规格,听起来像自毁,逻辑上却是完整的:一个不能反抗的奴隶,无论名义上被授予多少权利,实际地位仍然取决于主人的自律。

我第一次读到这里,以为他在给一个保守方案,不确定就多等等。读到「排除中间项」才明白意思相反。他不主张等,主张不生产。等是把决定推给未来,不生产是现在就做决定,只不过决定的不是「它算什么」,是「它要不要存在」。

004

「模糊」住在世界外面,还是里面

这条政策要成立,前提是「中间地带」真的存在,而且无法消除。

2023 年他为这件事写过一篇专门论证(Schwitzgebel, 2023b)。面对地球上的各类系统,我们有一个四难:要么几乎没什么东西有意识,要么所有东西都有,要么存在一条使意识从无到有的尖锐边界,要么意识本身是一个容许不确定案例的模糊属性。

前三个他都不接受。近乎没有和有全都有都说不通。尖锐边界要求某个极小的差别,一个突触或一个积分度,就让体验从完全不存在翻转为完全存在,而任何自然主义理论都解释不了这种翻转。剩下第四个:意识是模糊的,像秃头、绿、外向那样有中间状态。他给这种现象起名临界意识(borderline consciousness),并且说,对蛞蝓、对麻醉苏醒的过渡状态,「没有确定答案」可能就是诚实的答案。

批评者指出,你把我们概念里的不确定当成了世界里的不确定(Kammerer, 2015)。该区分是:模糊是语义的,我们的词不够精确;还是形而上学的,世界本身没有确定事实。

这个区分决定「排除中间项」是不是可行。

如果模糊只是语义的,它就可以消除。把概念锐化,把门槛写清楚,中间地带会随定义一起移动,最终收缩到没有。那么「不要生产中间项」就失去了一半理由,需要做的不是停止生产,是把话说准。

只有当模糊是形而上学地真实的时候,「不生产」才是唯一剩下的动作。你要么绕开那片区域,要么承认自己在那里造出的东西永远不能获得确定的道德地位。

而这恰恰是 Schwitzgebel 最少展开的一步。他花了整整一篇论文论证模糊存在,没有正面说清它是哪一种模糊。批评者的指控在这里有效:排除中间项实际上依赖一个形而上学前提,而这个前提没有被论证。

如果模糊只是语义的,政策就过于严厉,它禁止了本来可以被定义解决的东西;如果模糊是形而上学的,政策才有道理,不生产是唯一的动作。一个政策对不对,取决于一个它没有明说、也很难验证的形而上学判断。

他真正需要的其实不是形而上学模糊,是认识论的不确定,后者更弱、也更容易被接受。这样一来有个后果:如果模糊只来自我们的无知,原则上就可以被更好的科学消除,那么「不要生产」会变成「等科学成熟再生产」。这不是排除中间项,这是管理中间项换了个时间表。

005

预防派给出的是另一套算法

还有一条路,比 Schwitzgebel 更接近现在的做法。Jonathan Birch 在《感受能力的边界》里提议用感受候选者(sentience candidate)处理不确定:对任何有可信的、不可忽略的感受可能性的系统,忽视它受苦的可能就是鲁莽(Birch, 2024)。

Birch 没有要求停止生产,他要的是比例相称的预防:不确定程度越高、感受可能性越大、伤害越不可逆,措施就该越严。他与 Schwitzgebel 的分歧很清楚,一个是管理中间地带,一个是消灭中间地带。

中国的法规走的是第三条路:透明化。既不停产也不设防,只要求披露。你得告诉用户这是 AI,用久了提醒他休息。这条路承认模糊会长期存在,然后把它交给用户的知情选择。

三条路各有代价。透明化的代价是,知情不等于不受影响,知道对方是 AI 并不阻止一个人产生依恋。比例预防的代价是,比例由谁定,尺度就是谁的政治。排除中间项的代价最重。

它至少有两处推不下去。一处是,中间地带可能绕不过去。如果通往变革性 AI 的路径本身必须穿过「可能有意识」的实验系统,那么不生产模糊的东西就等于不生产变革性 AI。Schwitzgebel 自己承认过这个难处:在某些情形下,造一个可能有意识的系统可能比造一个确定有意识的系统更好,如果那个确定有意识的系统注定要受苦(Schwitzgebel, 2023a)。一个政策,如果它的执行会终止它本想服务的那项事业,就不能只当作谨慎来推荐。

另一处来自他自己。2026 年 7 月他公开了《Humanlike》的书稿,七条论题里的第三条仍是「我们应该尽量减少制造道德上令人困惑的人工系统」,但第四条论题主张按类人程度分级保护(Schwitzgebel, 2026)。分级保护是在管理中间地带,与排除中间项要求消灭它,方向正好相反。他把这个矛盾处理成「写给不同对象的建议」:排除中间项说给开发者,分级保护说给使用者。这个区分能成立,它也说明,一旦落到具体制度,最终还是回到管理。

006

“2 小时”条款

法规把它写成了一条可执行的条款:连续使用超过 2 小时,弹窗提醒休息。2 这个数字是任意的,但它能被执行、能被检查、能被罚。

哲学这边,二十年过去,连「什么算意识」都没有定下来,更别说「什么算道德上令人困惑」。Schwitzgebel 能论证模糊存在,论证不了某一个具体系统落在哪一边。

这中间有一个不对称:能被执行的规范,不需要理解它规范的东西。一个 2 小时的弹窗,不需要回答 AI 有没有感受就能生效。

应对不确定性的能力,最后可能不在哲学这边,在那些不需要理解就能动作的制度那边。


当判断不可得,我们该停止生产需要判断的东西,还是接受一个不依赖判断的规范?

路线

代表

对模糊存在的态度

动作

可操作性

透明化

《人工智能拟人化互动服务管理暂行办法》(2026)

承认长期存在

强制标识、时长提醒、禁向未成年人提供虚拟伴侣

高(有罚则、有具体数字)

比例预防

Birch (2024)

承认并管理

按风险比例设防,护住「感受候选者」

中(尺度争议大)

排除中间项

Schwitzgebel (2023a, 2026)

拒绝生产

不造道德地位不清的系统

低(无法定义「不清」)

参考文献

Birch, J. (2024). The edge of sentience: Risk and precaution in humans, other animals, and AI. Oxford University Press.

Kammerer, F. (2015). 

How a materialist can deny that the United States is probably conscious—Response to Schwitzgebel. Philosophia, 43(4), 1047–1057. https://doi.org/10.1007/s11406-015-9653-z

Schwitzgebel, E. (2014). The crazyist metaphysics of mind. Australasian Journal of Philosophy, 92(4), 665–682.

Schwitzgebel, E. (2023a). AI systems must not confuse users about their sentience or moral status. Patterns, 4(8), 100818. https://doi.org/10.1016/j.patter.2023.100818

Schwitzgebel, E. (2023b). Borderline consciousness, when it's neither determinately true nor determinately false that experience is present. Philosophical Studies, 180(12), 3415–3439. https://doi.org/10.1007/s11098-023-02042-1

Schwitzgebel, E. (2024). The weirdness of the world. Princeton University Press.

Schwitzgebel, E. (2026). 

Humanlike: A defense of AI rights [Manuscript draft, July 15, 2026]. University of California, Riverside. https://faculty.ucr.edu/~eschwitz/SchwitzAbs/Humanlike.htm

Schwitzgebel, E., & Garza, M. (2015). 

A defense of the rights of artificial intelligences. Midwest Studies in Philosophy, 39(1), 98–119. https://doi.org/10.1111/misp.12032

国家互联网信息办公室、国家发展和改革委员会、工业和信息化部、公安部、国家市场监督管理总局. (2026). 人工智能拟人化互动服务管理暂行办法.

杨蓝岚. (2026, 6 月 3 日). 

暂缓研发「道德上令人困惑」的AI系统——访美国加利福尼亚大学河滨分校哲学系教授埃里克·

史维兹格贝尔. 中国社会科学网. 

https://www.cssn.cn/skgz/bwyc/202606/t20260603_6008059.shtml

作者简介

宋词锋,@哲学前沿philontier专栏作者

关注治理、法律与认识论的接缝。

本期责编:边淮


分享「哲学×AI」动态,让哲学进入AI议程

欢迎关注
👇👇👇

读了好文,点亮「」

点击阅读原文,走进哲学前沿!

相关学习资料