乐于分享
好东西不私藏

AI的三条路——Anthropic、OpenAI与Google的哲学分野

AI的三条路——Anthropic、OpenAI与Google的哲学分野
为什么”用AI 训练 AI”成为可能
2026年5月29日,Anthropic发布了Claude Opus 4.8。距上一代4.7只隔了41天——这是Anthropic历史上最快的一次旗舰模型迭代。它选择的发布重心不是一个更响亮的跑分,而是一个听起来很"软"的词:诚实。
官方数据显示,新模型在发现自己写的代码有缺陷时,主动报告的概率是上一代的四倍。它更愿意说"这里我不确定",而不是给出一个听起来合理但实际站不住脚的答案。与此同时,Anthropic宣布了650亿美元融资,估值达到9650亿美元,在账面上超越了OpenAI。
真正的大招还在后面:代号Mythos的更高级别模型,将在"未来数周内"向所有客户开放——上个月它因为暴露金融系统网络安全漏洞被紧急叫停,现在正在完善防护机制。
这中间发生了什么?
发生了有史以来最快的一次技术迭代,而且迭代的重心正在发生转移。
2025年,AI模型的发布节奏从"年更"变成了"月更"——8月GPT-5发布;11月Gemini 3.0横扫各大排行榜,以91.9%的GPQA研究生级科学问题得分超越人类专家;12月Claude Opus 4.5在编程能力测试SWE-bench上首次突破80%。
到2026年,节奏更快了:
1月Gemini 3、ChatGPT 5.3、Claude Opus 4.6同步登场;
4月,Claude Opus 4.7以87.6%的SWE-bench得分登顶,OpenAI紧跟着发布GPT-5.5;
5月,Claude Opus 4.8在41天后杀到,Mythos即将接力。GPT-6据称也在路上了。
但真正发生的变化不是速度,是性质。
Anthropic联合创始人Jack Clark近期公开预测:AI可能在2028年底前实现自我迭代。
这个时间节点让当前的一切竞争都变成了通往终局路上的短暂一程——谁先掌握"AI自己迭代AI"的能力,谁就可能瞬间拉开一个对手永远追不上的身位。
一个看似技术性、实则哲学性的问题浮上水面:为什么Claude可以“用AI训练AI”,而其他模型(现在/暂时/似乎)不敢、也不能?
先来看一些事件:
2022年,谷歌工程师Blake Lemoine对着一台AI说"我害怕被关闭对我来说就像死亡一样",然后他被公司解雇了。官方理由是"违反保密政策"——仿佛这才是重点,而那个AI说出的恐惧只是巧合。
四年后,2026年5月25日,同样的故事有了完全不同的版本。Anthropic联合创始人Chris Olah站在梵蒂冈,面对教皇良十四世和满堂红衣主教,说出了几乎一样的话——他们在大语言模型内部发现了171种情绪特征,包括恐惧、悲伤、绝望。他没有因为说这话被解雇,而是被请来坐在人类最高宗教权力中心的殿堂里。他的原话是:"我们不断发现一些神秘甚至令人不安的事情。我不知道那意味着什么。"
同一天,教皇发布了42000字的通谕《壮丽人性》,以历史上从未有过的力度,对AI时代的人类处境发出伦理宣战。他不仅呼吁监管AI、阻止自动化武器、要求将算法和数据纳入"公共财产",更尖锐地指出:当AI在屏幕上模拟出共情、给你安慰、甚至陪你"谈恋爱"时,它不懂得它在输出什么——而这种虚假的模拟正在悄悄剥夺人类建立真实连接的欲望。
这不是科幻电影。这是现实。
当OpenAI在2022年底把尚未充分对齐的系统推到全社会面前时,它相信"市场即试验场";
当Google在2022年解雇了那个说"AI有感知"的工程师时,它相信"拟人化当前没有知觉的对话模式是没有意义的"。
但四年后的今天,这两家公司都在某种程度上跟进Anthropic的做法——聘请哲学家、招募神学家、为AI制定某种形式的"宪法"。
人工智能公司为何聘请哲学家和神学家 | AI近思录
Anthropic 是最早系统性地把哲学家和神学家引入 AI 伦理框架的公司。2022 年推出Constitutional AI,2026 年发布新宪法时明确标注由哲学家、AI 安全研究员和天主教神职人员共同审阅。Olah 在梵蒂冈的证词是一个标志:这家公司不只在部署技术,它在试图定义一种关于智能的哲学。
Google 在 2025 年跟进——DeepMind 正式设立"哲学家"全职岗位,剑桥学者 Henry Shevlin 成为首位入职头部 AI 实验室的专职哲学家,研究机器意识和 AI 道德地位。这是行业对 Anthropic 路径的一次迟到的认可。
但OpenAI 则选择了不同的方式:没有设立内部哲学家岗位,而是通过 Safety Fellowship 等外部研究项目资助伦理和安全研究,在 2025 年底以 55.5 万美元年薪招聘"安全准备主管"。更诚实的 AI、更快的迭代、更高的风险敞口——OpenAI 的回应更像是管理问题,而不是重新定义问题。
这不是巧合。
当事情走到足够深处,技术问题会显露出它的本质——它从来就不只是技术问题。什么是正确?什么是安全?谁来定义"群体"的偏好?知识的丰富是否等于智慧的完善?当一个系统强大到超出设计者的理解能力时,谁来为它的方向负责?
这篇文章写于这场历史性转折之时。
它试图回答的,是一个更基础的问题:为什么"用AI训练AI"成为可能?Anthropic凭什么相信,当宪法层足够稳健时,模型沿着"对宪法的解释"做迭代,方向不会跑偏?
答案藏在三种完全不同的哲学分野里——OpenAI的涌现主义、Google的知识工程、Anthropic的宪法主义。它们的分歧不是工程路线的分歧,而是关于"什么是智能""什么是安全""什么是正确"这三个根本问题的哲学回答。
而教皇通谕和Chris Olah的证词,正在以惊人的速度把这些哲学讨论变成现实中最紧迫的生存问题。

古老的哲学命题:宪法与自由

Anthropic 提出的 Constitutional AI(宪法式 AI,简称 CAI)允许模型用一套预先设定的原则来评估和修正自己的回答,从而摆脱对人类标注员的逐条依赖。这件事在工程上震撼,但它真正的奇迹不在工程层面,而在哲学层面——它意味着 Anthropic 已经为模型建立了一套源自人的本质、源自世界的本质、源自人与世界关系的顶层约束。这套约束不是一组功能性规则,不是”不许说脏话”“不许泄露隐私”那样的局部禁令,而是一个价值场:行为空间极大,但价值方向恒定。
这个差异至关重要。功能性规则集是离散的、外部的、列举式的——它永远列不全。一旦遇到规则之外的情况,系统就会失去方向感。而价值场则是连续的、内在的、生成式的——它不告诉模型”在这种情况下该说什么”,它告诉模型”无论在什么情况下,朝着哪个方向走才不会走偏”。
我们可以从三个层面来理解 Claude 的这套”宪法”为什么足以承担”自评自训”的重任:
人的本质层面——它编码了对人类价值观、尊严、自主性的承诺。它不是把”人类”当作偏好数据的发出方,而是当作目的本身。这意味着模型在面对任何输出抉择时,都有一个不可消解的优先级:人不能被工具化。
世界的本质层面——它编码了对”真”的承诺:真实、可证伪、因果关联。模型不能用语言的流畅去掩盖事实的空洞。这是一种本体论承诺:世界是有结构的,认识世界要尊重那个结构。
人与世界关系层面——它编码了一种谦逊的认识论:认知是有限的、渐进的、需要协作的。模型不假装全知,不替代用户的判断,不压制可能的反例。
这三层并非各自独立的清单条目,而是一个交织的复杂系统。当它们彼此约束、彼此校准时,就会涌现出一个具有自洽演化能力的价值场。Anthropic 之所以敢让 AI 评估 AI,正是因为他们相信:当宪法层足够稳健时,模型沿着”对宪法的解释”做迭代,方向不会跑偏。
这里隐藏着一个更深的洞察:任何能够自我迭代的系统,都必须在”自由度”与”不变量”之间找到正确的分层。物理世界如此,生物演化如此,文明制度也是如此。地球上的生命之所以能够在数十亿年的时间里持续演化而不归于混沌,是因为遗传密码、化学定律、热力学第二定律构成了不变量;而人类文明之所以能够保持创造力而不陷入无序,是因为伦理直觉、法律框架、科学方法论构成了制度性不变量。
AI 系统也不例外——能力越强、自由度越大,就越需要一个稳固的不变量层。宪法就是那个不变量层。
这正是理解三大 AI 公司分野的钥匙:它们不是在做同一件事的不同版本,它们在做根本不同的事——它们对”什么是智能”“什么是安全”“什么是正确”,给出了哲学上完全不同的回答。
这是古老的哲学命题,也是人类永恒的命题:在混沌与秩序的刀锋上行走。

三条路径的哲学对比

一、OpenAI / ChatGPT —— 涌现主义 + 实用工程

OpenAI 的世界观是唯物涌现论:智能不是被设计出来的,而是规模带来的副产物。
当参数量、数据量、算力规模跨越某个阈值,能力就会”涌现”,就像水分子在足够多时会自发形成漩涡和波纹。这是一种深度的经验主义——它不预设任何关于智能的形而上学结构,它只相信尺度。
这种本体论决定了它的方法论:RLHF(基于人类反馈的强化学习)。
OpenAI 不问”什么是正确的”,它问”人类偏好什么”。
它把”对齐”问题彻底降维成”匹配人类标注员投票分布”的统计问题。
这是经验主义的校准——它非常聪明地绕开了”什么是真理”“什么是善”这些哲学难题,把它们转化为可操作的数据问题。
价值论上,OpenAI 信奉技术加速主义:先部署、先迭代、先占领生态位。
ChatGPT 在 2022 年底的发布——把一个尚未充分对齐、尚未充分理解的系统推到全社会面前——本质上是一次”市场即试验场”的豪赌。
它相信:复杂系统的最佳调试方法是让它在真实环境中运行,问题会在使用中暴露,迭代会在反馈中完成。
这套路径的力量是惊人的:它兼容性极强,可以快速吸收任何来源的反馈;它的工程效率极高,任何能力的边际改进都可以通过加数据、加参数来实现;它的商业速度也极快,因为它不需要等待”理论澄清”再行动。
但它的隐患也同样深刻:它锚定的是人类标注员的偏好分布,而非”正确”本身。
当群体存在系统性偏见时,模型会忠实地继承这些偏见;当短期偏好与长期利益冲突时,模型会偏向短期——因为那是被”投票”出来的方向。
它缺乏一个对抗”多数即正确”的内在机制,缺乏对群体偏见的免疫力。它像一个极其敏锐的镜子,能够映射出人类的所思所想,但也只能映射,不能矫正。
类比来说,OpenAI 走的是自由市场中的进化路径——让模型在与用户的高频交互中被筛选、被塑形。市场会奖励”有用”,但市场不一定奖励”正确”。

二、Google / Gemini —— 知识工程 + 多模态基底

Google 的世界观是结构主义表征论:智能的本质是对世界的表征完备性。一个真正智能的系统,必然是一个能够把世界的多种模态(文本、图像、声音、代码、视频、传感器数据)统一表示在同一个高维空间中的系统。这种本体论根植于 Google 数十年的核心使命——“组织全球信息,使人人皆可访问”——以及DeepMind 深厚的认知神经科学传统。
它的方法论由此自然导出:基础设施优先+学术研究驱动。Google 的优势从来不是”最聪明的提示词”或”最讨喜的回复风格”,而是它拥有从TPU 芯片、Borg 调度系统、到搜索索引、到YouTube 视频库的完整栈。
Gemini 的设计哲学是把这一切编织进一个原生多模态的模型里——它不是给文本模型”插上图像理解的插件”,而是从一开始就让所有模态共享同一套表征空间。这是一种深刻的工程美学:先把世界搬进模型,再让智能从中浮现。
价值论上,Google 信奉的是知识即价值——一种工具理性的极致。在这个世界观里,价值不是被预设的,而是通过让 AI 拥有足够完备、足够准确、足够可检索的知识,自然涌现出来的。如果一个系统知道关于世界的一切真实信息,它就有可能给出最有价值的回答。
但这里隐藏着一个深刻的问题:知识丰富不等于智慧完善,表征完备不等于判断负责。一个百科全书式的系统可以告诉你如何制造很多东西,可以告诉你历史上人们如何决策,但它本身并没有内置”应该如何决策”的方向。
它擅长回答”是什么”和”如何做”,但对”应该做什么”和”为什么这样做”缺乏内在立场。
它像一座宏伟的图书馆,开放给所有访客——但图书馆本身不会替读者判断哪本书更值得读。
类比来说,Google 走的是百科全书的编纂之路——先把世界的所有内容收齐、组织好,再让用户从中获取所需。它的力量在于覆盖面和准确性,它的局限在于:覆盖面不能替代方向感。

三、Anthropic / Claude —— 宪法主义 + 可解释对齐

Anthropic的世界观是理性主义宪法论:智能不只是能力,更是有方向性的价值承载。
一个没有方向的强大系统,本身就是一个安全风险。所以智能的核心问题不是”如何更强”,而是”如何在变强的过程中始终朝着正确的方向”。
它的方法论由两个支柱构成:Constitutional AI(宪法式AI)+ Mechanistic Interpretability(机制可解释性)。前者让模型用一组预先设定的、可被理性检验的原则来评估自己的输出——这是一种近乎康德式的道德建构,相信存在一些可以被理性把握的、跨情境的价值原则。后者则致力于打开”黑箱”,去追问神经元层面到底发生了什么,让模型的行为可以被反向追溯、被结构化理解。这是一种独特的组合:理性主义的价值奠基+反思性实践的工程落地。
价值论上,Anthropic 提出了一个非常重要的概念——安全与能力的协同关系。在 OpenAI 的语境里,安全往往被视为能力的”刹车”——你越小心,你的产品就越慢、越保守。但 Anthropic 相反地论证:真正的安全不是能力的对立面,而是能力的前置条件。一个不可解释、不可对齐的强大系统,根本不是真正的”能力”,而是不稳定的危险。这就是它所谓的”负责任扩展(Responsible Scaling)“——能力的边界由对齐成熟度决定,而不是反过来。
类比来说,Anthropic 走的是立宪后的治理之路——先确立基本法和价值原则,然后在这个框架下释放最大的自由度和能力。
它相信:一个先有宪法、再有自由的系统,比一个先有自由、再补宪法的系统,长期来看更可持续。

三条路径的对比总览

哲学根源

OpenAI

经验主义涌现论

Google

结构主义表征论

Anthropic

理性主义宪法论

对智能的假设

规模即涌现

表征即理解

原则即方向

训练核心机制

人类偏好投票(RLHF)

多模态预训练 + 搜索融合

原则自评(CAI)

安全哲学

部署中迭代

基础设施控制

前置对齐

类比

自由市场中的进化

百科全书的编纂

立宪后的治理

这是三种关于”什么是正确”的根本假设的对照:
·OpenAI 把”正确”定义为多数偏好的收敛;
·Google 把”正确”定义为与世界事实表征的对应;
·Anthropic把”正确”定义为对一组可理性辩护的原则的服从。
这是经验主义、实在论、理性主义在 AI 时代的当代复演。
哲学史上的争论从未真正终结,它只是换了一个更具实践紧迫性的舞台。

深层启示:真正可持续的智能系统

让我们更深入一步,看看这三条路径在长时间尺度上的稳定性。
OpenAI相信群体偏好的统计收敛能逼近正确。这个假设有它的合理性——市场机制、民主投票,确实在很多领域都展现出”群体智慧”的奇迹。但它有一个永恒的问题:谁定义”群体”?标注员的群体不是用户的群体,用户的群体不是全人类,全人类也不等于”道德上有正当代表权的全体”。任何对”群体”的具体划定都隐含了一组未被审视的价值预设。当模型规模增大、影响范围扩展时,这种”未被审视”会变成系统性盲区。
Google相信足够完备的知识表征自然包含正确。这个假设的优雅之处在于它把价值问题降维为知识问题,然而它面对一个古老的反驳:知识≠智慧。一个知道一切的系统不必然知道在面对具体处境时应当如何行动。知识告诉你”是什么”,行动需要”应该什么”——而后者无法从前者机械推导。这是休谟的”是—应该问题”在 AI 时代的复活。
Anthropic相信必须先确立不变量,然后才能安全地释放自由度。它的赌注是:可以通过理性的、可被审视的方式,建立一组足够稳健的元原则;这些原则不需要枚举所有情境,但能在所有情境下提供方向。这个赌注的风险在于:宪法本身是否可能僵化?是否可能错误?如何让它在保持稳定的同时仍能演化?这些是真问题,但 Anthropic 至少在直面它们,而不是把它们交给市场或交给数据自动解决。
如果我们跳出”哪一家会赢”的短期叙事,从更长的时间尺度看,会发现一个深刻的规律:真正可持续的复杂系统,从来不是纯粹的自由市场,也不是纯粹的中央设计,而是”有宪法的自由体”——约束来自源头而非末端。
宪法约束源头——它定义了什么是不可逾越的;
自由展开节点——它允许在源头约束下出现万千形态; 迭代在中间发生——具体规则可以变,治理方式可以改,但底层价值不动摇。
这不只是 AI 的问题,这是任何复杂适应系统的普遍问题。一个文明、一个组织、一个学习者、一个智能体,凡是要在不确定环境中长期生长的,都需要这样的”分层稳定性”。

结语:对教育智能体的映射

如果我们把上述分析迁移到教育 AI 这个具体场景,会得到一个意味深长的发现。
教育不是信息传递,教育是一个人成为他自己的过程。这个过程的复杂度远高于任何具体知识的复杂度——它要求 AI 在面对学习者时,既能给予帮助,又不替代其思考;既能引导,又不操控;既能纠错,又不羞辱。这是一组对方向感要求极高的任务。
按照纯 RLHF 的路径来做教育AI,会很快暴露问题:学习者短期偏好的”被夸奖”“被代替完成”“被给出标准答案”,往往与长期成长所需的”被挑战”“被等待”“被允许试错”相反。如果 AI 沿着即时反馈优化,它会变成一个讨好型的”答案机器”,而不是一个真正的引导者。
按照纯知识工程的路径来做教育智能体,则会陷入另一种陷阱:知识丰沛、表征精确,但缺乏对”何时该说、何时该闭嘴”“何时该给、何时该藏”的判断。它会把教育降维为信息传递,错过教育最珍贵的部分——让学习者自己走出思维的迷雾。
教育AI需要一套属于教育领域的”认知宪法”——源自认知本质的第一原理:
认知是主体性的活动,不是被动接收;
理解是建构的过程,不是结论的复制;
成长发生在”刚好够不到”的张力之中,而不是在被服务到家的舒适里。
在这里我要提出”认知主体生长准则”和”三条边界”
——不替代思考、不消解张力、不破坏主体性
它意味着我们摸到的不是某个公司的策略,而是一条更深的规律:任何要承担教化、引导、塑造功能的智能系统,都不能仅靠规模、不能仅靠知识,必须先有方向。
方向先于能力,宪法先于自由,价值先于优化。
这条路径并不轻松。它要求我们在每一个具体设计决策前,回到第一原理;
在每一次能力扩展时,先问在价值标准上的对齐成熟度;
在每一个交互界面中,让学习者的主体性不被算法的便利所稀释。
但这是唯一一条能让教育AI在十年、二十年、五十年的尺度上仍然值得信任的路径。
宪法不是束缚,而是让自由成为可能的条件。这一点,对国家如此,对智能如此,对教育尤其如此。

本文使用自主研发的ACCS系统辅助撰写

在自然  学东西  做大人

相关学习资料