为什么越来越多研究者,开始把计算从“嘴巴”搬回“大脑”?

这几年,我们判断一个 AI 厉不厉害,越来越容易陷入一个误区:
看它说得像不像人。
回答越长,感觉越聪明。
分析越详细,感觉越认真。
“首先、其次、最后”写得越多,我们越容易觉得:
这个模型好像真的在思考。
但最近一批 AI 论文正在提出一个完全不同的问题:
会说,真的等于会想吗?
这个问题可能比“下一个模型有多少万亿参数”更重要。
因为 AI 的下一阶段,很可能不是继续训练一个更加能说会道的聊天机器人。
而是开始训练一种:
即使不说话,也能持续计算、判断、试错的机器。
01 我们可能把“语言”看得太重要了
先做一个很简单的实验。
现在闭上眼睛,想象一下:
你家客厅是什么样子?
你脑子里大概率会出现:
沙发。
电视。
桌子。
窗户。
甚至你还能大致知道它们之间的位置。
但这个过程里,你有没有在脑子里念:
“沙发位于电视机的左前方约两米处……”
通常没有。
再比如:
你接住别人突然扔过来的一个球。
你的大脑会计算:
方向。
速度。
距离。
手的位置。
身体平衡。
但你不会在脑子里念:
“根据抛物线运动公式,我现在应该把手向右移动 13 厘米。”
我们大量的思考:
根本不是语言。
语言只是思考结果的一种表达方式。
这件事情放到 AI 上,就出现了一个非常有意思的问题:
为什么今天的大模型,偏偏要用语言作为主要“思考载体”?
02 因为现在的大模型,本质上是“下一词预测机器”
Transformer 的成功太巨大了。
它让一个非常简单的目标变得无比强大:
预测下一个 Token。
你输入:
今天天气不错,我们一起去……
模型预测:
公园。
然后:
散步。
再然后:
吧。
一个 Token 接一个 Token。
就这样,模型学会了:
写文章。
编代码。
翻译。
聊天。
回答知识。
甚至做数学题。
这件事最神奇的地方是:
一个“预测下一个词”的系统,竟然慢慢长出了推理能力。
但问题也恰恰从这里开始。
因为如果整个系统都是:
Token → Token → Token

那么模型想“多思考一点”,最自然的方法就变成:
多生成 Token。
于是 Chain-of-Thought 出现了。
03 Chain-of-Thought,其实是一次非常聪明的“外挂”
早期我们发现:
直接问模型:
27 × 14 是多少?
模型容易错。
但你告诉它:
请一步一步思考。
结果马上变好。
为什么?
因为模型不再需要一次跳到答案。
它可以先生成:
27 × 10 = 270
27 × 4 = 108
270 + 108 = 378
一步一步走。
这就是:
Chain-of-Thought,思维链。
它的重要性怎么说都不为过。
今天几乎所有 reasoning model,都深受这个思想影响。
但是它有一个隐藏问题:
思考被绑定在 Token 上了。
你想得越久:
Token 越多。
Token 越多:
计算越多。
时间越长。
成本越高。
所以一个非常奇怪的现象出现了:
AI 明明是在“自己思考”,
却要不断把中间想法:
翻译成人类语言。
然后再读回来。
然后继续想。
这就像一个人做数学题:
脑子里每产生一个念头,
必须先大声念出来,
然后耳朵听见以后,
大脑才能继续下一步。
有点荒谬。
04 所以 2025~2026 年,一个新方向突然越来越热
这个方向就是:
Latent Reasoning
潜在空间推理。
一句话解释:
AI 可以直接在内部向量空间里思考,而不是必须先变成文字。
传统推理:
问题
↓
“首先……”
↓
“然后……”
↓
“但是……”
↓
“所以……”
↓
答案
Latent Reasoning:
问题
↓
内部状态 1
↓
内部状态 2
↓
内部状态 3
↓
内部状态 4
↓
答案
中间发生了大量计算。
但你看不到。
也不需要看到。
这其实是一个非常大的思想变化。
以前:
语言既负责交流,也负责思考。
未来:
语言可能只负责交流。
思考本身,可以在另一个空间完成。
05 BDH-CQ 为什么值得关注?
上一篇我们讲过一个最新例子:
BDH-CQ。
它很特别,因为它不仅会“脑内思考”,还试图解决另一个问题:
AI 怎么临时学会一个从没见过的新规则?
比如给 AI 看:
红色 → 蓝色
黄色 → 绿色
圆形 → 向右移动
然后问它一个新图案。
它必须先理解:
今天这个游戏到底怎么玩?
然后再解题。
BDH-CQ 把这两件事拆开了。
第一步:
学规则。
模型不断更新一个 recurrent memory。
可以把它想成:
临时记忆板。
看一个例子:
写一点。
再看一个例子:
修改一点。
最后形成:
“哦,我大概懂这个游戏了。”
第二步:
解问题。
它建立另一个 reasoning state。
然后内部循环:
想一次。
再想一次。
再想一次。
最后输出答案。
所以它内部其实有两个不同的过程:
学习循环。
和:
思考循环。
这比单纯“多写一点 CoT”复杂得多。

06 真正重要的变化:参数量不再决定“想多久”
这里其实藏着一个非常重要的概念。
过去,大模型的能力提升通常来自:
Scaling
模型越大。
数据越多。
GPU 越多。
能力越强。
GPT-3 时代大家最关注:
参数量。
后来开始关注:
训练数据。
再后来开始关注:
上下文长度。
但现在出现了第四个维度:
Test-Time Compute
也就是:
模型在回答一个问题的时候,愿意花多少计算。
一个模型可能参数已经固定。
但是简单问题:
算 1 秒。
复杂问题:
算 10 秒。
极难问题:
算 1 分钟。
这件事情其实非常符合人类。
你不会因为一道数学题变难,就重新长一个更大的脑子。
你的脑子大小没变。
你只是:
多想一会儿。

最近一篇专门总结 Test-Time Scaling 的研究甚至指出,现在“多想一会儿”本身已经分成不同路线:
单一路径继续推理。
生成多个完整答案再投票。
或者在未完成的推理路径上搜索。
它们不能简单用一个“计算预算”混为一谈。
这意味着未来比较 AI:
可能不能只问:
这个模型多少 B?
还要问:
它用了多少推理计算?
07 一个 3.5B 模型,为什么能“展开”成更深的计算?
2025 年有一篇很重要的论文:
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
它的想法特别直观。
普通 Transformer:
第 1 层。
第 2 层。
第 3 层。
……
第 N 层。
跑完就结束。
而 recurrent model 可以:
跑一个 block。
↓
再跑一次。
↓
再跑一次。
↓
再跑一次。
同一组参数重复使用。
你可以把它想成:
传统模型像一栋固定 30 层的楼。
推理走完 30 层:
没了。
Recurrent model 更像一个跑步机。
机器还是那台机器。
但是:
你可以跑 5 圈。
10 圈。
50 圈。
论文训练了一个约 3.5B 参数的 proof-of-concept 模型,并观察到继续增加 recurrent depth,可以让某些任务的性能继续提高;在部分设置里,它展开的计算量可以达到相当于远大于模型参数规模的水平。
这句话非常重要:
参数量 ≠ 实际计算深度。
过去大家经常把:
“大模型”
理解成:
“大脑更大”。
未来可能变成:
脑子不一定特别大,但是可以反复思考很多轮。
08 AI 可能正在经历一次“CPU 化”
这里可以打一个有趣的比方。
早期 AI 很像:
查表。
问题来了。
直接找答案。
后来像:
大型数据库。
知道的越来越多。
再后来像:
一个会写草稿的学生。
边写边想。
但未来可能越来越像:
CPU。
给它一个任务。
它内部跑计算。
跑循环。
保存状态。
调用工具。
继续计算。
最后返回结果。
这时候:
AI 的核心价值就不再只是:
生成文字。
而是:
执行认知计算。
这可能是整个行业非常重要的一次身份变化。
09 这也解释了为什么 Agent 会成为下一战场
假设你雇了一个真正的员工。
你让他说:
帮我调查一下这家公司。
真正优秀的员工不会从坐下第一秒开始,就不停向你汇报:
“我现在打开网页了。”
“我正在看第二份财报。”
“我发现这里有个数字。”
“等等,我要重新算。”
“现在我准备打开第三个页面。”
你会疯。
真正好用的员工通常是:
收到任务。
自己查。
自己想。
自己核对。
必要时问你。
最后:
给结果。
这就是为什么 Latent Reasoning 对 Agent 特别有吸引力。
因为 Agent 需要:
思考。
搜索。
规划。
调用工具。
反思。
继续行动。
但大部分中间过程:
根本没必要变成人类语言。
2026 年已经出现专门针对 Agent 的研究,例如 Adaptive Latent Agentic Reasoning(ALAR),其思路就是默认使用 latent reasoning,只有在当前步骤确实需要更深显式推理时,才切换到 explicit Chain-of-Thought。
这其实非常像人:
平时很多动作靠直觉。
难题来了:
才坐下来认真写草稿。
10 更激进的事情已经发生:AI 和 AI 之间,甚至可能不说人话
如果一个 AI Agent 和另一个 AI Agent 合作:
为什么它们一定要说英语?
今天多 Agent 系统一般像这样:
Agent A:
“根据我的分析,我认为……”
Agent B:
“谢谢你的分析,我补充以下几点……”
看起来非常像几个 AI 在开会。
问题是:
这些话本来就是给机器看的。
机器 A:
内部向量
↓
翻译成英文
↓
Token
↓
发送
↓
机器 B 读 Token
↓
重新变成内部向量
为什么?
这中间可能浪费了大量计算。
于是已经有研究开始尝试:
Agent 直接在 latent space 交流。
一项相关工作发现,latent-space communication 可以把 Agent 间的信息压缩成连续表示,从而避免完整自然语言交换。
另一项 LatentMAS 工作报告,在其 9 个数学、科学、常识和代码 benchmark 上,相比文本式 multi-agent baseline,最高准确率提升 14.6%,输出 Token 减少 70.8%~83.7%,端到端推理速度提升约 4×~4.3×。
这件事情想深一点非常有意思:
未来两个 AI Agent 之间的交流,
可能根本不是:
“你好。”
“根据数据,我建议……”
而是一串我们完全无法读懂的:
高维向量。
11 但是问题来了:如果 AI 不说出思考过程,我们怎么监督它?
这其实是 latent reasoning 最大的争议之一。
Chain-of-Thought 有一个天然优势:
至少看起来可以读。
比如 AI 给出答案:
42。
同时写了:
10 + 20 = 35。
你马上知道:
它算错了。
但 latent reasoning:
你只看到:
输入。
↓
黑箱。
↓
42。
那内部到底怎么想的?
不知道。
2026 年已经有研究专门研究:
Latent Reasoning Model 到底能不能解释。
结论并不乐观。
相关研究指出,latent reasoning 虽然可能更省推理成本,也可能在内部保留更丰富的候选路径,但代价就是:
中间计算更难监控。
这会变成未来 AI 一个非常重要的矛盾:
效率 vs 可解释性。
你想让 AI 想得快。
最好别把所有东西都说出来。
但你想监督它:
又希望它把理由讲清楚。
12 所以“解释”可能会和“思考”彻底分开
这是我认为未来几年非常值得关注的一点。
现在大家潜意识觉得:
AI 给出的 reasoning:
就是它真正的思考过程。
未来可能不是。
AI 可能首先:
在 latent space 里完成真实计算。
然后再进行第二个任务:
“请把刚才的结论解释给人听。”
也就是说:
Reasoning
和:
Explanation
会变成两个不同模块。
举个例子。
你问医生:
为什么你觉得我应该做这个检查?
一个有经验的医生可能先凭:
大量经验。
检查数据。
模式识别。
形成判断。
然后再组织语言:
“因为你的这几个指标组合起来……”
医生说出的解释:
并不等于他脑中所有神经活动。
它是:
为人类沟通重新整理过的一套表达。
未来 AI 很可能也是如此。
13 这件事甚至会改变我们判断 AI 是否“聪明”的方式
今天很多人看 reasoning model:
“哇,它写了 8000 字。”
感觉:
好聪明。
但很可能未来正好相反。
真正强的系统可能是:
你问:
这段代码为什么偶尔会死锁?
AI 沉默 3 秒。
内部:
检查调用图。
模拟线程状态。
搜索假设。
否定两个方案。
找到 race condition。
然后回答:
问题在第 173 行和第 241 行的锁顺序不一致。
就两句话。
但内部实际算了很多东西。
所以未来:
输出长度会越来越不能代表思考深度。
这可能是一个非常重要的认知变化。
14 AI 的未来可能是“快思考 + 慢思考”
心理学里有一个很出名的比喻:
System 1:
快。
直觉。
自动。
System 2:
慢。
认真。
推理。
AI 很可能也会越来越像这样。
简单任务:
不需要几十轮推理。
直接回答。
中等任务:
内部 latent reasoning 几轮。
复杂任务:
开始增加 test-time compute。
非常复杂:
搜索多个路径。
调用工具。
甚至启动多个 Agent。
也就是说:
未来 AI 不一定每一个问题都“全功率运行”。
它可能动态判断:
这题值得想多久?
这才是真正好的计算系统。
因为你不会为了回答:
“1+1 等于几?”
调用一万块 GPU。
15 真正的竞争,可能从“谁模型更大”变成“谁更会花计算”
这一点其实非常深。
过去十年 AI 的竞争逻辑主要是:
训练一次。
然后所有问题都用同一个模型。
未来可能变成:
模型只是一个基础能力。
真正的差距出现在:
怎么使用计算预算。
简单问题:
花 1。
复杂问题:
花 10。
极难问题:
花 1000。
甚至:
先快速试。
发现不会。
再增加计算。
还不会。
再搜索。
再验证。
这种模式其实更接近:
计算机科学里的算法。
而不仅仅是:
“神经网络更大。”
所以未来一个 AI 系统的能力可能来自:
模型。
Memory。
Search。
Latent Reasoning。
Verifier。
Tools。
Agent。
而不是单一的:
Parameter Count。
16 这也是为什么“150M 的 BDH-CQ”会引起关注
并不是因为:
150M 已经比 GPT 强。
它没有。
真正让人感兴趣的是:
它展示了一种可能性。
推理能力不一定只靠堆参数。
它的 150M 配置在 ARC-AGI-1 public evaluation 上达到 29.5% pass@2,论文估算推理成本约 0.0007 美元/题。
这个数字背后真正有意义的问题是:
如果未来这种方法扩大 10 倍、100 倍,会发生什么?
现在我们还不知道。
也不要过度吹。
但研究价值就在这里。
17

我更关心的,其实不是“它今天有多强”
而是它代表了一个方向。
过去 AI 的发展路线:
更多参数。
↓
更多数据。
↓
更长上下文。
↓
更长 Chain-of-Thought。
下一步越来越可能加入:
更多内部计算。
这就是为什么最近你会不断看到:
Latent Reasoning。
Recurrent Depth。
Test-Time Scaling。
Adaptive Reasoning。
Latent Agents。
这些词。
它们看起来是不同论文。
但背后其实都在解决同一个问题:
怎样让一个已经训练好的模型,在遇到真正困难的问题时,再临时多动一点脑子?
最后
过去的大模型最令人震撼的地方是:
它会说话。
你给它一句话。
它能给你写一篇文章。
写代码。
翻译。
聊天。
那个阶段解决的是:
机器能不能像人一样表达?
现在,研究开始进入下一层。
大家慢慢发现:
语言可能只是表面。
真正更难的问题是:
机器能不能形成自己的内部计算过程?
能不能临时学习规则?
能不能保存中间状态?
能不能尝试多个方案?
能不能发现自己不会?
能不能决定:
这道题,我需要再想一会儿。
如果这些能力逐渐成熟,
我们以后回头看今天的大模型,
可能会觉得:
2023~2025 年那些不停输出几万字 Chain-of-Thought 的 AI,
很像一个刚刚学会思考的小孩:
每想一步,
都必须说出来。
而真正成熟之后,
它可能只需要安静几秒。
然后告诉你:
“我想好了。”
下一代 AI 的竞争,可能不是谁最会说。
而是:
谁最会利用那几秒钟的沉默。

夜雨聆风