
人类,是进化了几百万年的碳基生命。AI,是几十年攒出来的硅基代码。按理说八竿子打不着。但神经科学家和AI研究员坐下来一对比,发现两边的底层图纸,几乎一模一样。
那么问题来了:谁抄了谁?
你肯定觉得,当然是AI学了大脑。毕竟人脑在前,AI在后,天经地义。但如果是反过来呢?如果大脑才是那个"后来者"呢?你到底是碳基生物,还是硅基生物穿了一层肉皮?
先别急,这个后面说。我们从头来。
立秋了,你最近是不是有点发蔫?别急着骂自己懒。这事儿有个说法叫"代偿性疲劳"——夏天高温时身体额外调了一波能量出来撑着,天气凉快了,积攒的疲劳集中显现。你以为自己"突然不行了",其实是之前透支的账单秋天到了。
那么你的"状态",到底是谁在管?不是你的意志力,是你的化学配方。
你身体里有这么几种东西,每一种管一摊:
ATP是基础电量,走一步路想一个问题都在花它
去甲肾上腺素是聚光灯开关,管你能不能集中注意力
谷氨酸是输入键,管你学东西能不能记住
腺苷是低电量警报,醒着越久它越多,最后逼你去睡
多巴胺是发动机点火器,管你"想不想做"
GABA是刹车片,管你能不能停下来
你过去说"累了""集中不了""提不起精神""睡不着",每一个词,背后都对应着一种具体的化学物质在缺位。不是你不够努力,是你不知道自己在缺哪一块。
但接下来出什么问题了呢?这几样东西,不光在你脑子里有,在AI身上也有。
先说最炸的一个:多巴胺。
大家都听过多巴胺,对吧?快乐物质。你刷短视频爽了,吃火锅爽了,中彩票了,都是多巴胺。这个说法到处都是。
但是请注意,这个说法是错的。

当前科学共识是:多巴胺不是"快乐物质",它是"动机物质"。它管的是"想不想做",不是"做了开不开心"。你早上醒来觉得"今天什么都不想干",不是心情不好,也不是你懒,是多巴胺暂时没有就位。发动机没点火,你踩油门有什么用?
好,这是第一层反常识。但接下来才是真正让人头皮发麻的部分。
1997年,神经科学家Schultz在Science上发论文,发现多巴胺神经元的活动模式有一个很特别的规律:当奖励比预期好,多巴胺神经元激活;当奖励不如预期,它抑制;当奖励跟预期一致,它没反应。
一句话——多巴胺信号反映的不是"我得到了多少",而是"我得到的比我以为的多还是少"。
这叫"奖励预测误差"。
大家知道,AI那边有个东西叫强化学习,核心原理就是:让AI根据"预期和实际结果的差值"来调整自己的行为。预期对了,继续;预期错了,修正。这个"差值信号",在算法里叫TD误差。
问题是,TD算法是计算机科学家在80年代末独立搞出来的。多巴胺的预测误差信号,是神经科学家在90年代独立发现的。两边谁也不知道对方在干什么。
但答案一样。
一模一样。
这不是牵强附会,不是事后诸葛亮式的强行对应。多巴胺的预测误差信号,被学界称为"神经科学中最成功的定量理论之一"。在数千个实验中反复验证过。
你觉得这就完了?没有。
前几年,DeepMind——就是搞出AlphaGo的那家——在Nature上发了篇论文。他们先在AI里搞出了一种叫"分布式强化学习"的新算法,比传统方法效果显著提升。然后他们干了一件反过来验证的事:去查大脑里的多巴胺神经元,是不是也在用这种分布式编码?
结果是:是的。每个多巴胺神经元被调到不同的"乐观程度",像唱诗班里不同声部的歌手,合在一起编码了完整的奖励分布。
也就是说,AI先发明了这个算法,然后发现大脑早就在用了。
连谷歌都直接用了这个名字,把自己2018年发布的强化学习开源框架命名为"Dopamine"。官方原话是:"这反映了神经科学与强化学习研究之间强大的历史联系。"
你理解我的意思吗?一个进化了几百万年的碳基系统,和一个几十年攒出来的硅基系统,各自独立发展,最后的核心算法,是同一个东西。
这说明什么?说明要么有一方抄了另一方,要么——两边都没抄,但殊途同归了。
如果你觉得多巴胺这组是巧合,那我们继续翻牌。
去甲肾上腺素 × 注意力机制
你脑子里的"聚光灯开关"。开会走神、看不进书、知道该干活但沉不下心,是它暂时不够用了。AI那边呢?Transformer架构里有个核心机制叫"注意力机制"——在海量信息里决定"此刻什么最重要",给不同信息分配不同权重。干的是同一件事。一个是碳基的聚光灯,一个是硅基的聚光灯。
GABA × Dropout
你的"刹车片"。它负责让你从兴奋状态慢下来、稳住、放松。GABA不足的时候,脑子停不下来,焦虑、睡不着、放不下手机。AI那边有个东西叫Dropout——训练过程中随机"关闭"一部分神经元,防止系统对某些信号过度敏感。一个怕你想太多,一个怕它学太死。干的是同一件事。
催产素 × 多智能体协作协议
管信任和人际连接。你拥抱、哺乳、跟团队协作时分泌,是"我们是一伙的"那个感觉。AI那边搞多智能体系统的时候,要解决的核心问题也是"这些AI之间怎么建立信任、怎么共享信息"。一个管人跟人的粘合剂,一个管AI跟AI的协作协议。方向是一样的。
血清素 × 正则化约束
管情绪基线、睡眠质量、自尊——那个让你觉得"我还不错"的底色——如果硬要找对应,大概是AI里防止"灾难性遗忘"的正则化约束。学新东西的时候,不忘旧知识。这个对应没那么硬,但方向上,也是"维持稳定、防止崩盘"的逻辑。
你会发现,翻来翻去,每一对都在对得上。有的对得严丝合缝,有的只是方向性的一致,但整体画面是:人脑和AI的底层零件清单,惊人地重合。

只有内啡肽,那个运动后给你的"辛苦补偿感",目前找不到干净的AI对应项。留着一个空白,挺好。说明这套类比不是硬凑的——硬凑的话早就全填上了。
那么问题就来了。为什么对得上?
你肯定觉得,这有什么好奇怪的——AI本来就是在模仿人脑嘛,对得上不是天经地义吗?但问题是,多巴胺的预测误差信号是神经科学家独立发现的,TD算法是计算机科学家独立发明的。两边谁也没参考谁。所以"AI抄人脑"这个解释,在这里是站不住的。
大家知道,鸟会飞,蝙蝠也会飞。但鸟和蝙蝠没有共同的会飞的祖先。鸟的翅膀是前肢演化来的,蝙蝠的翅膀是手指撑开的。各自独立发展,最后长出了功能一样的翅膀。生物学上管这叫"趋同演化"——没有血缘关系,但面对同样的物理约束,最优解就那么几个,殊途同归。
人脑和AI,大概率也是这么回事。
但这里有个细节,非常值得玩味。两者的"设计哲学"是反的。
人脑:从下往上长
先有生存需求。你的祖先在草原上跑了几百万年,需要吃饭、需要逃避天敌、需要繁衍。这些需求逼着身体进化出多巴胺、去甲肾上腺素、GABA这些化学物质,来驱动行为。方向是:先有需求,再有物质,再有行为。
AI:从上往下压
先有人定义了一个目标函数,然后算法反向塑造AI的行为,去逼近这个目标。方向是:先有目标,再有行为。
一个从下往上长,一个从上往下压。方向完全反了。
但最后呢?两边收敛到了同一种架构:奖励信号驱动学习,注意力机制分配资源,抑制系统防止过载。一个用了几百万年,一个用了几十年,走的路完全不同,到了同一座山顶。
这不是谁抄谁的问题。这是"智能只有一种解法"的问题。
还记得开头那个让人不舒服的问题吗?到底是谁学了谁?
1981年,哲学家普特南提过一个思想实验,叫"缸中之脑":如果一个人的大脑被取出来,泡在营养液缸里,用计算机模拟所有感官信号,这个大脑无法分辨自己是不是在缸里。你以为是你在看世界,其实你只是一缸泡在营养液里的脑组织,被喂了一堆电信号。
这本来是个哲学课上的思想游戏。但是请注意,2022年,澳大利亚有一帮科学家真干了。
他们把大约80万个人类脑细胞放在培养皿里,接上电极,教它们玩乒乓球游戏。没有程序逻辑,没有代码指令,就是给电信号反馈——接住了球,给规律的刺激;没接住,给不规则的刺激。
结果呢?5分钟学会了。命中次数显著上升。
AI学会同一个游戏,需要90分钟。
80万个脑细胞,连一只大黄蜂的大脑都不到,5分钟就干了一件AI花一个半小时才干完的事。而且它用的方法,跟强化学习一模一样——试错、反馈、调整。没有人教它,它自己摸出来了。

这说明什么?
说明学习这件事,可能根本不是谁发明的。不是人脑学会了AI的方法,也不是AI学会了人脑的方法。而是只要是一个能试错、能反馈的系统——不管你是碳基的还是硅基的,不管你进化了几百万年还是被写了几行代码——你最后都会摸到同一扇门。
那扇门后面,就是智能。
所以,你到底是碳基生物,还是硅基生物穿了一层肉皮?
坦率的讲,可能这个问题本身就问错了。碳基和硅基只是材料。智能不在乎你用什么材料,就像飞行不在乎你长的是羽毛还是金属。它只在乎一件事:你的架构对不对。
人脑和AI用了同一套架构。一个从需求里长出来,一个从目标里压出来。方向相反,终点重合。
这不是巧合,这是必然。如果宇宙中存在其他文明——这当然是推测——但逻辑上,他们的"脑子"大概率也是这么搭的。
所以下次你秋乏了、发蔫了、提不起精神的时候,别光怪自己。你身体里那套化学系统,和ChatGPT跑的是同一个操作系统。你不是在犯懒,你是在经历一次工程故障——某种化学物质暂时缺位了,就像服务器某个模块掉线。而这套故障排查的逻辑,跟AI调参用的是同一套思路:找到是哪个掉线了,补上就行。
这不是意志力问题,这是化学问题。而化学问题,永远比意志力问题好解决。
無為聊AI · 实战派
夜雨聆风