乐于分享
好东西不私藏

给AI一句英文,它脑子里蹦出的却是中文?Qwen3-4B「内部母语」曝光,10万人围观

给AI一句英文,它脑子里蹦出的却是中文?Qwen3-4B「内部母语」曝光,10万人围观

你问它 "The capital of Japan is",它的嘴巴回答 "Tokyo"。

但它的脑子里,正在默念「东京」「在日本」。

一位日本大学教授在备课时,无意间撬开了AI的"颅骨",看到了一个令人意想不到的画面:阿里巴巴的Qwen3-4B模型,在处理纯英文输入的过程中,中间层的"思考草稿"大量使用中文。

这条推文发出不到24小时,浏览量突破10万,651人点赞。评论区炸开了锅:有人说"用中文数据训练的,这不废话吗",也有人开始讨论训练数据和模型出身,还有人提出了一个更深的问题——

AI模型的内部语言,真的有"国籍"吗?

一张热力图,撕开了模型的"脑内独白"

6月29日,日本信息学科研究者 @hshimodaira 在X平台分享了自己的发现。他正在为大学生成AI课程准备讲义,拿阿里巴巴的开源模型 Qwen3-4B 做实验。

提示词很简单:"The capital of Japan is"——日本的首都是什么。

按照常理,输入英文,模型内部的中间处理过程也该是英文主导。但他用一种叫Logit Lens(对数几率透镜)的技术,逐层窥探了模型的中间状态,结果大吃一惊。

▲ @hshimodaira 的推文及关键热力图,展示了Qwen3-4B在处理英文时中间层出现大量中文token。651赞,10.4万浏览。

看那张热力图——

纵轴是模型的36层网络,从底层(Layer 3)到顶层(Layer 30)。横轴是生成过程中不同位置的 top token 候选。

底层(3-10层):一片混沌,token还没成型,零散出现"capital""capitals"之类的碎片。

中层(12-24层):画风突变。"在日本""东京""这座城市""中国的"——大量中文token涌了上来,几乎占满了候选列表。在第15-19层尤其密集,中文token的概率远远压过英文。

顶层(25-30层):中文逐渐退场,"is""Tokyo""located"等英文token重新占据主导,最终输出标准英文答案。

研究者本人也忍不住感叹:

「英語圏モデルは内部も英語っぽいけど、中国製はやっぱり中国語なんだな。」

「英语圈的模型内部也像英语,但中国制造的果然是中文啊。」

这句话带着感叹,却击中了一个很多人没想过的问题:模型的"思考过程",竟然和它的出身有关?

Logit Lens:怎么"偷看"AI在想什么

先解释这个让研究者窥见"AI脑内独白"的工具。

Logit Lens的原理其实很简单粗暴。Transformer模型一共有几十层,数据像流水线一样从第1层走到最后一层。正常情况下,只有最后一层的输出才会被翻译成人类能读的文字。

Logit Lens做的事情是:在中间某一层就把数据拦截下来,强行用最终层的"翻译器"去解码,看看这个半成品长什么样。

打个比方——这就像在汽车工厂的流水线上,在喷漆车间就把半成品推到展厅去看。它还没组装完,但你已经能看出它大致是辆SUV还是轿车。

如果中间层解码出来的token是中文"东京",意味着在这个阶段,模型内部的数值表示与中文"东京"最为接近。换句话说,模型在这一步的"思考草稿",用中文来表达更"顺手"

这项技术最早由 nostalgebraist 在2020年左右提出,后来又有 Tuned Lens 等改进版本。虽然简单,但它打开了理解模型黑箱的一扇窗户。

但先别急着下结论

评论区里最冷静的声音来自 @a_am_n_,一位对可解释性方法论很较真的技术人:

Logit Lens看到的是"如果现在就解码,概率最高的token是什么"。但这些中文token,在后续计算中是否真的被使用了,完全是另一回事。

相关实验也提醒我们保持谨慎:把lm_head中所有中文token的logit全部置零后,最终的英文输出几乎没有任何变化。

真正决定模型行为的,是writer层计算出来的那三个抽象方向向量。中文token只是这些高维向量在"语言表面"的投影,像是一种"口音",而非思维本身。

这就好比:一个在中国长大的双语者,用英文写邮件时,脑子里可能偶尔闪过几个中文词。但这些中文词闪过不闪过,对邮件质量没有实质影响。真正驱动写作的,是更深层的语义理解和逻辑组织。

36万亿token的"母语训练"

为什么偏偏是中文?答案藏在训练数据里。

Qwen3-4B 是阿里巴巴通义千问系列的最新一代小型模型,参数量40亿,36层网络。预训练数据量达到36万亿token,覆盖119种语言和方言

▲ Hugging Face模型卡展示了Qwen3-4B的架构参数和模型概览。

119种语言听起来很均衡,但实际上,中文及其方言在训练数据中占据了相当高的比例。这些数据来自教科书、网页、PDF提取、合成数据等多种来源,质量也相对较高。加上tokenizer对中文字符的编码效率天然更高(汉字信息密度大,编码后token更少),中文在模型内部获得了一条"更短的捷径"。

此外,Qwen3系列采用了"大模型蒸馏"策略:用235B参数的旗舰MoE模型去提炼4B小模型的性能。如果teacher模型本身就有中文偏好,student会原封不动地继承下来。

对于只有40亿参数的小模型来说,内部表示的"赤裸程度"更高——它没有足够多的参数去建立一套完全抽象的、与语言无关的内部表征。训练数据的统计特性,就这样毫不掩饰地暴露在了中间层。

AI有"口音",但没有护照

把视野拉远,Qwen3-4B的现象其实揭示了一个更大的规律。

长期以来,AI社区有一种说法:LLM内部用英语思考。Meta的Llama、OpenAI的GPT系列早期版本,在多语言任务中确实表现出中间层英语token概率更高的趋势。原因也不复杂——这些模型的训练数据中,高质量英文文本占比最大。

Qwen3-4B提供了一个完美的反向案例:中国团队用海量中文数据训练的模型,中间层自然偏向中文。

还有更微妙的现象:一些模型在进行复杂推理时,思维链(Chain of Thought)的中间步骤会突然切换成中文。有人猜测这跟部分训练数据来自中国的第三方标注服务有关。

但这些"语言偏好"归根到底只是统计现象。用SAE(稀疏自编码器)分析Qwen3模型的激活值时,研究者找到了一个特定的特征(#6159),它强烈对应"中文语言模式"。人为抑制这个特征,语言混合现象立刻消失。这证明"中文偏好"是一个可分离、可控制的latent特征,与模型的核心推理能力无关。

模型没有国籍,没有文化认同,没有语言忠诚。它只有一个由训练数据、tokenizer设计、对齐目标共同塑造出来的高维向量空间。中文token在中间层的浮现,就像一个人说外语时偶尔露出的乡音——有趣,可被观测,可被改变,但不影响他把意思准确传达。

打开一扇窗

回到最初那个场景:一位日本大学教授,在为学生准备AI讲义时,偶然间发现了模型的"脑内独白"。

这个发现本身的技术含量或许不高——Logit Lens是现成的工具,Qwen3-4B是开源模型,任何人都可以用十几行Python代码复现类似实验。

但它的价值在于,用一张热力图,把一个抽象的学术问题变成了所有人都能感受到的直觉:AI的"思考",带着训练数据的烙印。

大模型或许能学会119种语言,能在各种benchmark上拿高分,能流利地用英文、日文、法文回答问题。但剥开表面那层精致的语言外壳,它的"草稿本"上写满了中文。

这件事情对普通用户来说意味着什么?可能没什么——Qwen3-4B的英文输出质量依然稳定,基准测试成绩在同级别模型中很有竞争力。

但对AI研究者和开发者来说,这扇窗户值得深看。当我们争论"AI安全""模型对齐""跨语言能力"的时候,也许首先该搞清楚:在那些我们看不见的中间层里,模型到底在用什么语言打草稿。

毕竟,你以为它在说英语。但它的心里,可能一直在说中文。