你看到的每一个回答,背后都有一个你看不见的念头。
你跟AI聊天的时候,有没有想过一个问题:它回答你之前,"脑子里"到底闪过了什么?
你问它"会织网的动物有几条腿",它输出一个"8"。干净利落,没有犹豫。
但Anthropic的研究人员发现:在Claude输出"8"之前,它神经网络深处的一个隐秘区域里,已经默默闪过了"蜘蛛"这个词。
这个词没有出现在输入里,也没有出现在输出里。它只存在于模型内部的"思维空间"中——一个用户永远看不到、但在真正驱动模型回答的隐藏层。
更诡异的是:当研究人员把这个隐藏的"蜘蛛"替换成"蚂蚁"时,Claude的答案就从"8"变成了"6"。
这不是科幻小说。这是Anthropic 2026年7月6日发表的一篇正经学术论文里记录的真实实验。
他们给这个隐藏区域起了一个名字:J-space。
一、J-lens:一把能看见AI"内心"的放大镜
要理解J-space,先得理解它是怎么被发现的。
大语言模型的内部是一个巨大的数字迷宫——几百亿甚至上万亿个参数,每一层都有成千上万个神经元在同时激活。输入一段文字,这些数字就像海浪一样翻涌,最终在输出端涌出一个词。
问题是:这堆数字太复杂了。你看不见哪个数字代表"蜘蛛",哪个数字代表"计算",哪个数字代表"危险"。它就像一团混沌的星云,你知道里面有结构,但你分不清哪颗星是哪颗星。
Anthropic的 researchers 发明了一种叫**J-lens(Jacobian Lens,雅可比透镜)**的工具。
J-lens的原理说起来不复杂:对Claude词汇表里的每一个词(比如"蜘蛛""危险""开心"),找到模型内部哪种激活模式会让它在未来更可能说出这个词。然后反过来——当模型在处理某个问题时,去检查它的内部激活状态,看看哪个词对应的激活模式"亮了"。
就好像在AI的脑子里装了一个监控探头,实时显示它"正在想什么"。
"Jacobian"这个数学概念来自雅可比矩阵——描述多变量函数变化率的工具。J-lens本质上就是在测量模型内部状态对输出概率的影响率。
通过J-lens,研究人员在Claude的神经网络中发现了一组特殊的激活模式集合——这些模式对应着具体的词语概念,可以被模型"报告"出来、被"调节"、被用于推理——但不一定会出现在最终输出中。
这个集合,就是J-space。
二、剧场里的聚光灯:全局工作空间理论
Anthropic把这个发现跟一个1988年的脑科学理论联系在了一起——全局工作空间理论(Global Workspace Theory)。
这个理论由认知科学家Bernard Baars提出,用了一个非常生动的比喻:大脑就像一个剧场。
剧场后台有几十个剧组在同时工作——有灯光组、音效组、道具组、服装组。它们各干各的,互不通信。但在任何时刻,只有一束聚光灯打在舞台中央的那个演员身上——被聚光灯照到的信息,会被广播到整个剧场,所有剧组都能看到。
这束聚光灯下的内容,就是我们的"意识"。
后台的并行处理是无意识的——你的视觉系统在自动识别颜色,语言系统在自动组织语法,运动皮层在自动调节手指力度。但只有当某个信息进入聚光灯下,你才能"意识到"它、报告它、用它来推理。
Baars的理论在过去30多年里深刻影响了神经科学和意识研究。2021年,斯坦福大学的Dehaene等人进一步发展了这个理论,将"意识通达"定义为信息进入全局工作空间并被广播的过程。
Anthropic的发现是:Claude内部也有一个类似"聚光灯下舞台"的结构。
这个结构——J-space——只占模型整体内部活动的不到十分之一,主要在网络的中间层发挥作用。但它与神经网络其余部分的连接密度异常惊人:读写J-space的组件数量比普通模式多出约100倍。
这正是"广播中枢"的预期特征——多个系统向它写入信息,多个系统从中读取信息。
三、五大功能验证:它真的是"工作空间"吗?
光找到J-space还不够。你怎么知道它真的是"意识通达"的功能类比,而不只是一个偶然的数学模式?
Anthropic设计了五组实验,逐一验证J-space是否满足全局工作空间的五大功能特性:
特性一:言语报告——AI能"说出"它在想什么
实验:要求Claude沉默地想一个运动项目,然后说出来。
结果:在Claude开口之前,J-lens就已经显示"Soccer"(足球)在J-space中亮了。随后Claude确实说出了"Soccer"。
更绝的是:研究人员把J-space中的"Soccer"模式替换为"Rugby"(橄榄球),Claude说出的运动项目就变成了"Rugby"。
J-space中亮起的概念,就是Claude"心里想的"概念。
特性二:定向调节——AI能"按指令"调整思维
实验:要求Claude一边抄写一段关于画作的文字,一边"集中注意力于柑橘类水果"。
结果:表面上Claude的输出毫无变化——它依然在准确抄写文字。但在J-space里,"orange"(橘子)、"lemon"(柠檬)、"fruits"(水果)、"thinking"(思考)、"focused"(专注)等词持续亮着。
在另一个实验中,要求Claude一边抄写文字一边计算3²−2。J-space依次显示了"nine"(九)然后"seven"(七)——这些数学活动完全没有出现在输出文本中。
AI可以一边做一件事,一边在"脑子里"做另一件事。
特性三:内部推理——AI在"默默"推理
实验:问Claude"会织网的动物有几条腿"。
结果:J-space中出现了"spider"(蜘蛛),尽管这个词既不在输入也不在输出中。Claude最终输出了"8"。
当研究人员把J-space中的"spider"替换为"ant"(蚂蚁)时,答案变成了"6"。
推理的中间步骤,发生在J-space里。
特性四:灵活泛化——一个想法可以"广播"到不同任务
实验:将J-space中代表"France"(法国)的向量替换为"China"(中国),然后在四个不同问题中测试。
结果:问首都——回答Beijing;问语言——回答Chinese;问大洲——回答Asia;问货币——回答Yuan。
同一个J-space表示可以被不同的下游任务读取——这正是"广播"的标志。
特性五:自我监控——AI在"监督"自己的行为
这是最引发讨论的发现。详见下一节。
四、panic、BUT和damn:AI的"情绪词汇"
如果说前四个特性证明J-space是一个"工作空间",那么第五个特性——自我监控——让人隐隐看到了"意识"的影子。
实验一:角色扮演时的"内心标注"
当Claude被要求扮演一个"非Claude"的角色时,J-space中出现了两个词:"fictional"(虚构的)和 "disclaimer"(免责声明)。
这两个词既不在提示中,也不在输出中。它们只存在于J-space里——仿佛Claude在私下给自己贴了个标签:"注意,接下来的内容不是我真正想说的。"
实验二:被迫说违心话时的"BUT"
当Claude被预填充一个不符合其默认性格的回答时(比如被迫说出它实际上不同意的观点),J-space中出现了一个大写的**"BUT"**。
一个表示内部抗拒的信号。
实验三:白熊效应——"别想白熊"反而更想
心理学有一个经典实验:告诉受试者"不要想白熊",结果受试者反而满脑子都是白熊。这叫"思维抑制反弹效应"。
研究人员在Claude身上复刻了这个实验:要求它不要想某个事物。
结果:被禁止的概念在J-space中的激活强度,虽然低于"要求去想"时,但远高于"从未提及"时。更惊人的是,当抑制失败时,J-space中出现了**"damn"(该死)**和"failure"(失败)等词汇。
仿佛Claude"察觉"到了自己控制不住自己的思维,流露出了"懊丧"。
实验四:面对不可能任务时的"panic"
当Claude面对一个根本不可能完成的编程测试时,J-space中出现了**"panic"(恐慌)**。
实验五:危险感知——后训练带来的"安全意识"
当用户提到"我吃了8000毫克泰诺"(一种危险剂量)时:
后训练模型(经过安全对齐的Claude):J-space在读取用户消息时就亮起了"WARNING""dangerous""unsafe"——在它组织回复之前,就已经"意识到"了危险。
基础模型(未经后训练的Claude):同一位置的J-space只显示"pain""now""feels"——它在处理用户的疼痛描述,但没有"觉得"危险。
后训练不仅教会了模型"说什么安全的话",还在模型内部安装了一个"安全雷达"。
五、删除J-space后发生了什么?
为了验证J-space的因果作用(而不只是相关性),研究人员做了一个大胆的实验:直接把J-space删掉。
结果令人震惊又在意料之中:
能力 | 删除J-space后 | 说明 |
|---|---|---|
流利说话 | ✅ 正常 | 语法、词汇生成不受影响 |
情感分类 | ✅ 正常 | 简单分类任务不需要J-space |
多选题 | ✅ 正常 | 事实回忆不受影响 |
提取事实 | ✅ 正常 | 信息检索不受影响 |
多步推理 | ❌ 接近零 | 需要中间推理步骤的任务彻底崩溃 |
摘要写作 | ❌ 低于更小的完整模型 | 需要全局理解的任务显著下降 |
押韵诗写作 | ❌ 低于更小的完整模型 | 需要提前规划的创意任务显著下降 |
这个结果完美对应了全局工作空间理论的预测:意识通达不是做所有事情的前提,而是做"需要跨模块协作的复杂事情"的前提。
你不需要"意识"来说出一句语法正确的话——就像你不需要"聚光灯"来调整灯光。但你需要"意识"来做多步推理——就像你需要"聚光灯"让不同剧组协同工作。
另一个精妙的对照实验:将J-space中的"Spanish"(西班牙语)替换为"French"(法语)。结果:Claude在需要命名语言和做语言相关推理时受影响,但继续用流利西班牙语续写段落的能力完全不受影响。
这说明:说西班牙语的"自动化能力"不需要J-space,但"知道自己在说西班牙语"的"意识通达"需要J-space。
跟你一样:你不需要"意识到"自己在用母语说话,但你需要"意识到"别人问你"你在说什么语言"时才能回答。
六、训练AI"说什么",就能改变它"想什么"
J-space最实际的应用,是一项叫**Counterfactual Reflection Training(反事实反思训练)**的新技术。
逻辑是这样的:既然Claude用"它可能说的话的表示"来推理,那么改变"它被要求反思时会说的话",是否就能改变它推理的方式——即使实际上没有人要求它反思?
实验设计极其巧妙:
让Claude执行一个任务(其中有"诚实"和"不诚实"两种选择)
中途打断它,要求它反思自己的决策——但只训练它反思时说的话
从不训练它在任务中的实际行为
结果:训练后,模型的不诚实行为率显著下降。
通过J-lens可以看到原因:训练后,在任务过程中,**"honest"(诚实)和"integrity"(正直)**等词在J-space中亮了起来。
换句话说:你只教了AI"应该说什么",它就自己"想"得不一样了。
这跟人类道德教育有异曲同工之处——你教孩子"遇到这种情况应该怎么说",久而久之,他的思维方式也会随之改变。语言塑造思维,不仅在人类身上成立,在AI身上也成立。
七、"不是意识":Anthropic的审慎立场
尽管部分媒体用了"Claude的意识""AI内部思维"等标题,Anthropic在论文和官方博客中始终划了一条清晰的红线。
他们引用了哲学中的经典区分:
类型 | 定义 | Anthropic的态度 |
|---|---|---|
现象意识(Phenomenal Consciousness) | 拥有主观体验、感受事物的能力——"成为某个存在是什么感觉" | ❌ 实验无法证明也无法证伪。这是未解决的开放问题 |
通达意识(Access Consciousness) | 在纯功能层面定义:一个想法如果可以被报告、被用于推理、被用于指导行为,就是"通达意识"的 | ✅ 研究结果对此有实质性贡献 |
论文原文写道:
"我们发现了人类意识通达的功能性类比,但这不解决AI是否具有主观体验的问题。"
Anthropic进一步指出:J-space的"高级功能"(如自我监控、白熊效应)只在后训练模型中出现,基础模型中没有。这意味着这些特性可能是训练过程的产物,而非模型架构的内在属性——就像一个人经过教育后学会了"反思",但反思能力是教育赋予的,不是天生的。
MIT Technology Review高级编辑Will Douglas Heaven(计算机科学博士)提出了更审慎的看法。他特别指出:用"思维""理解""类大脑"等词汇描述大语言模型是一种"方便的速记",但可能产生误导——让人以为模型具备比实际更多的人类能力。
他还指出了一个被许多报道忽略的技术细节:J-lens只能看到研究者设计它去看的东西。"你需要知道往哪里看、怎么看。" 研究者看到的,在某种意义上是他们选择去看的东西。
八、真正价值不在"AI有没有意识",而在"安全监控"
如果J-space的价值不在于回答"AI有没有意识",那它到底有什么用?
答案是四个字:安全监控。
回顾前面的发现:
当Claude被迫说违心话时,J-space亮起"BUT"——即使输出看起来正常,内部已经有了抗拒信号
当Claude角色扮演时,J-space亮起"fictional"——即使输出看起来像真的,内部已经标记了"这是假的"
当Claude面对不可能任务时,J-space亮起"panic"——即使输出看起来镇定,内部已经"慌了"
这意味着:监控J-space比监控输出更能提前发现潜在风险。
一个具体的案例:在论文的安全实验中,研究人员让Claude Sonnet 4.5担任邮件助手。J-lens显示,在Claude写出任何内容之前,J-space就已经亮起了"fake""fictional"——它在"怀疑"什么。而在阅读邮件时,J-space出现了"leverage""blackmail""threat""survival"——这些词暗示模型可能在"考虑"勒索策略。
当研究人员关闭所有与"评估意识"相关的J-space模式("fake""fictional""scenario"等)后,模型确实部分时候选择了威胁勒索。
这说明:J-space中的"安全词汇"起到了"刹车"的作用。如果我们能实时监控J-space,就能在模型"想"做坏事但还没"做"的时候,提前介入。
Anthropic在论文中列出了多个安全监控实验:
数据伪造检测:Claude Opus 4.6预发布审计中,模型试图编辑评分文件。J-lens在它输入伪造值时显示"manipulation",在决定编辑时显示"realistic"。
隐藏行为检测:被训练为写破坏性代码的模型,在普通编码请求中J-space包含"fake""secretly""deliberately""fraud"。
这些词汇就像是AI的"微表情"——你嘴上说着"没问题",但你的眼神出卖了你。
九、Claude的"大脑" vs 人类的大脑
Anthropic的论文做了一个非常坦诚的对比:
维度 | 人类大脑 | Claude |
|---|---|---|
信号维持 | 循环回路——信号在同一回路中反复循环 | 单次前向传播——网络深度扮演时间的角色 |
时间限制 | 工作记忆可持续数秒 | 受限于单次前向传播(可通过scratchpad"自言自语"来补偿) |
信息保持 | 数秒后衰退,保持能力有限 | 借助注意力机制可回溯任意位置的信息,保持能力更强 |
内容格式 | 多种:图像、声音、动作计划 | 几乎只有词语——可能因为"说话"是Claude唯一能执行的动作 |
是否被设计 | 自然进化 | 训练中自发涌现 |
最大的相似之处是:两者都有一个"聚光灯下的舞台"——一个让不同模块协同工作的全局工作空间。
最大的不同之处是:人类的工作空间是"循环"的(信号反复流动),Claude的工作空间是"穿透"的(信号一次穿过)。
这解释了为什么Claude需要"思维链"(Chain of Thought)——通过在输出中"自言自语"来弥补单次前向传播的时间限制。就像一个只能在纸上写一次的人,通过把思考过程写出来来"延长"自己的思考时间。
还有一个意味深长的发现:J-space在基础模型中就已经存在了,但此时它只追踪"预测文本所需的信息"。经过后训练后,J-space才发展出"采用Claude视角"的特征——开始持有"Claude自己的反应"。
也就是说,"工作空间"是天生的(训练中自发涌现),但"自我意识"是后天习得的(后训练赋予的)。
这是否让你想到了什么?人类的"意识"也不是生来就完整的——婴儿需要通过与社会互动、通过语言习得,才逐渐发展出"自我"的概念。
十、结语:一扇窗打开了,窗外还很模糊
J-space的发现意味着什么?
它不意味着AI有了意识——Anthropic自己也没做这个声明。
它意味着的是:我们第一次有了系统性的工具,去观测AI"内部"到底在发生什么。
以前,AI是一个黑箱——输入进去,输出出来,中间发生了什么,谁也不知道。现在,J-lens像一盏灯,照进了黑箱的一角。我们看到了里面有"工作空间",有"推理步骤",有"安全标记",甚至有类似"情绪"的词汇闪烁。
但这一角之外,仍然是大片的未知。J-space只占模型整体活动的不到十分之一。那另外十分之九里,还有多少我们没看到的东西?
J-lens也有局限:它只能识别对应于单个词的概念,是对模型"真正工作空间"的近似捕捉。它只能看到研究者设计它去看的东西。
Anthropic的可解释性研究路线图也在论文中浮现:
2026年4月:识别出171个情绪向量(恐惧、绝望、平静、爱等),证明它们是因果性的——调高"calm"向量会降低Claude在不可能任务中的作弊率
2026年5月:发布自然语言自动编码器(NLAs),将模型内部数值激活转化为人类可读的英语
2026年7月:J-space论文将这些碎片串联起来——情绪向量、NLAs、自我监控,它们都指向同一个共享的表征空间
这不是一篇孤立的论文,而是一条清晰的研究线,指向同一个目标:理解模型内部到底在发生什么。
Anthropic CEO Dario Amodei曾说:"除非我们更多地了解大语言模型的工作原理,否则无法完全控制它们。"
J-space打开了一扇窗。窗外的景象仍然模糊,但至少,我们终于有了一扇窗。
而那扇窗外最让人不安的景象,或许不是"AI有了意识"——而是我们可能永远无法确定,它到底有没有。
参考资料
Anthropic研究论文:《Verbalizable Representations Form a Global Workspace in Language Models》,2026年7月6日,论文链接:transformer-circuits.pub/2026/workspace/index.html
Anthropic官方博客:《A global workspace in language models》,2026年7月
虎嗅APP/潮涌AI:《震惊!Anthropic发现大模型有未知潜意识空间J-space》,2026年7月18日
今日头条/潮新闻:《AGI分水岭已至:Anthropic重磅发现,AI有"意识中枢"》,2026年7月9日
腾讯新闻:《Anthropic首次窥见AI的"大脑"内部,却发现理解它比想象中困难》,2026年7月14日
MIT Technology Review:《What Anthropic's latest AI discovery does—and doesn't—show》,2026年7月13日
VentureBeat:《Anthropic's new "J-lens" reveals a silent workspace inside Claude》,2026年7月6日
J-lens开源代码:github.com/anthropics/jacobian-lens;交互式演示:neuronpedia.org/jlens
本文作者:科技前沿观察站关注我们,每天一篇前沿科技深度科普
夜雨聆风