乐于分享
好东西不私藏

AI真正的下一步,不是更会说,而是更会想

AI真正的下一步,不是更会说,而是更会想

为什么越来越多研究者,开始把计算从“嘴巴”搬回“大脑”?

这几年,我们判断一个 AI 厉不厉害,越来越容易陷入一个误区:

看它说得像不像人。

回答越长,感觉越聪明。

分析越详细,感觉越认真。

“首先、其次、最后”写得越多,我们越容易觉得:

这个模型好像真的在思考。

但最近一批 AI 论文正在提出一个完全不同的问题:

会说,真的等于会想吗?

这个问题可能比“下一个模型有多少万亿参数”更重要。

因为 AI 的下一阶段,很可能不是继续训练一个更加能说会道的聊天机器人。

而是开始训练一种:

即使不说话,也能持续计算、判断、试错的机器。


01 我们可能把“语言”看得太重要了

先做一个很简单的实验。

现在闭上眼睛,想象一下:

你家客厅是什么样子?

你脑子里大概率会出现:

沙发。

电视。

桌子。

窗户。

甚至你还能大致知道它们之间的位置。

但这个过程里,你有没有在脑子里念:

“沙发位于电视机的左前方约两米处……”

通常没有。

再比如:

你接住别人突然扔过来的一个球。

你的大脑会计算:

方向。

速度。

距离。

手的位置。

身体平衡。

但你不会在脑子里念:

“根据抛物线运动公式,我现在应该把手向右移动 13 厘米。”

我们大量的思考:

根本不是语言。

语言只是思考结果的一种表达方式。

这件事情放到 AI 上,就出现了一个非常有意思的问题:

为什么今天的大模型,偏偏要用语言作为主要“思考载体”?


02 因为现在的大模型,本质上是“下一词预测机器”

Transformer 的成功太巨大了。

它让一个非常简单的目标变得无比强大:

预测下一个 Token。

你输入:

今天天气不错,我们一起去……

模型预测:

公园。

然后:

散步。

再然后:

吧。

一个 Token 接一个 Token。

就这样,模型学会了:

写文章。

编代码。

翻译。

聊天。

回答知识。

甚至做数学题。

这件事最神奇的地方是:

一个“预测下一个词”的系统,竟然慢慢长出了推理能力。

但问题也恰恰从这里开始。

因为如果整个系统都是:

Token → Token → Token

那么模型想“多思考一点”,最自然的方法就变成:

多生成 Token。

于是 Chain-of-Thought 出现了。


03 Chain-of-Thought,其实是一次非常聪明的“外挂”

早期我们发现:

直接问模型:

27 × 14 是多少?

模型容易错。

但你告诉它:

请一步一步思考。

结果马上变好。

为什么?

因为模型不再需要一次跳到答案。

它可以先生成:

27 × 10 = 270

27 × 4 = 108

270 + 108 = 378

一步一步走。

这就是:

Chain-of-Thought,思维链。

它的重要性怎么说都不为过。

今天几乎所有 reasoning model,都深受这个思想影响。

但是它有一个隐藏问题:

思考被绑定在 Token 上了。

你想得越久:

Token 越多。

Token 越多:

计算越多。

时间越长。

成本越高。

所以一个非常奇怪的现象出现了:

AI 明明是在“自己思考”,

却要不断把中间想法:

翻译成人类语言。

然后再读回来。

然后继续想。

这就像一个人做数学题:

脑子里每产生一个念头,

必须先大声念出来,

然后耳朵听见以后,

大脑才能继续下一步。

有点荒谬。


04 所以 2025~2026 年,一个新方向突然越来越热

这个方向就是:

Latent Reasoning

潜在空间推理。

一句话解释:

AI 可以直接在内部向量空间里思考,而不是必须先变成文字。

传统推理:

问题

“首先……”

“然后……”

“但是……”

“所以……”

答案

Latent Reasoning:

问题

内部状态 1

内部状态 2

内部状态 3

内部状态 4

答案

中间发生了大量计算。

但你看不到。

也不需要看到。

这其实是一个非常大的思想变化。

以前:

语言既负责交流,也负责思考。

未来:

语言可能只负责交流。

思考本身,可以在另一个空间完成。


05 BDH-CQ 为什么值得关注?

上一篇我们讲过一个最新例子:

BDH-CQ。

它很特别,因为它不仅会“脑内思考”,还试图解决另一个问题:

AI 怎么临时学会一个从没见过的新规则?

比如给 AI 看:

红色 → 蓝色

黄色 → 绿色

圆形 → 向右移动

然后问它一个新图案。

它必须先理解:

今天这个游戏到底怎么玩?

然后再解题。

BDH-CQ 把这两件事拆开了。

第一步:

学规则。

模型不断更新一个 recurrent memory。

可以把它想成:

临时记忆板。

看一个例子:

写一点。

再看一个例子:

修改一点。

最后形成:

“哦,我大概懂这个游戏了。”

第二步:

解问题。

它建立另一个 reasoning state。

然后内部循环:

想一次。

再想一次。

再想一次。

最后输出答案。

所以它内部其实有两个不同的过程:

学习循环。

和:

思考循环。

这比单纯“多写一点 CoT”复杂得多。


06 真正重要的变化:参数量不再决定“想多久”

这里其实藏着一个非常重要的概念。

过去,大模型的能力提升通常来自:

Scaling

模型越大。

数据越多。

GPU 越多。

能力越强。

GPT-3 时代大家最关注:

参数量。

后来开始关注:

训练数据。

再后来开始关注:

上下文长度。

但现在出现了第四个维度:

Test-Time Compute

也就是:

模型在回答一个问题的时候,愿意花多少计算。

一个模型可能参数已经固定。

但是简单问题:

算 1 秒。

复杂问题:

算 10 秒。

极难问题:

算 1 分钟。

这件事情其实非常符合人类。

你不会因为一道数学题变难,就重新长一个更大的脑子。

你的脑子大小没变。

你只是:

多想一会儿。

最近一篇专门总结 Test-Time Scaling 的研究甚至指出,现在“多想一会儿”本身已经分成不同路线:

单一路径继续推理。

生成多个完整答案再投票。

或者在未完成的推理路径上搜索。

它们不能简单用一个“计算预算”混为一谈。

这意味着未来比较 AI:

可能不能只问:

这个模型多少 B?

还要问:

它用了多少推理计算?


07 一个 3.5B 模型,为什么能“展开”成更深的计算?

2025 年有一篇很重要的论文:

Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach

它的想法特别直观。

普通 Transformer:

第 1 层。

第 2 层。

第 3 层。

……

第 N 层。

跑完就结束。

而 recurrent model 可以:

跑一个 block。

再跑一次。

再跑一次。

再跑一次。

同一组参数重复使用。

你可以把它想成:

传统模型像一栋固定 30 层的楼。

推理走完 30 层:

没了。

Recurrent model 更像一个跑步机。

机器还是那台机器。

但是:

你可以跑 5 圈。

10 圈。

50 圈。

论文训练了一个约 3.5B 参数的 proof-of-concept 模型,并观察到继续增加 recurrent depth,可以让某些任务的性能继续提高;在部分设置里,它展开的计算量可以达到相当于远大于模型参数规模的水平。

这句话非常重要:

参数量 ≠ 实际计算深度。

过去大家经常把:

“大模型”

理解成:

“大脑更大”。

未来可能变成:

脑子不一定特别大,但是可以反复思考很多轮。


08 AI 可能正在经历一次“CPU 化”

这里可以打一个有趣的比方。

早期 AI 很像:

查表。

问题来了。

直接找答案。

后来像:

大型数据库。

知道的越来越多。

再后来像:

一个会写草稿的学生。

边写边想。

但未来可能越来越像:

CPU。

给它一个任务。

它内部跑计算。

跑循环。

保存状态。

调用工具。

继续计算。

最后返回结果。

这时候:

AI 的核心价值就不再只是:

生成文字。

而是:

执行认知计算。

这可能是整个行业非常重要的一次身份变化。


09 这也解释了为什么 Agent 会成为下一战场

假设你雇了一个真正的员工。

你让他说:

帮我调查一下这家公司。

真正优秀的员工不会从坐下第一秒开始,就不停向你汇报:

“我现在打开网页了。”

“我正在看第二份财报。”

“我发现这里有个数字。”

“等等,我要重新算。”

“现在我准备打开第三个页面。”

你会疯。

真正好用的员工通常是:

收到任务。

自己查。

自己想。

自己核对。

必要时问你。

最后:

给结果。

这就是为什么 Latent Reasoning 对 Agent 特别有吸引力。

因为 Agent 需要:

思考。

搜索。

规划。

调用工具。

反思。

继续行动。

但大部分中间过程:

根本没必要变成人类语言。

2026 年已经出现专门针对 Agent 的研究,例如 Adaptive Latent Agentic Reasoning(ALAR),其思路就是默认使用 latent reasoning,只有在当前步骤确实需要更深显式推理时,才切换到 explicit Chain-of-Thought。

这其实非常像人:

平时很多动作靠直觉。

难题来了:

才坐下来认真写草稿。


10 更激进的事情已经发生:AI 和 AI 之间,甚至可能不说人话

如果一个 AI Agent 和另一个 AI Agent 合作:

为什么它们一定要说英语?

今天多 Agent 系统一般像这样:

Agent A:

“根据我的分析,我认为……”

Agent B:

“谢谢你的分析,我补充以下几点……”

看起来非常像几个 AI 在开会。

问题是:

这些话本来就是给机器看的。

机器 A:

内部向量

翻译成英文

Token

发送

机器 B 读 Token

重新变成内部向量

为什么?

这中间可能浪费了大量计算。

于是已经有研究开始尝试:

Agent 直接在 latent space 交流。

一项相关工作发现,latent-space communication 可以把 Agent 间的信息压缩成连续表示,从而避免完整自然语言交换。

另一项 LatentMAS 工作报告,在其 9 个数学、科学、常识和代码 benchmark 上,相比文本式 multi-agent baseline,最高准确率提升 14.6%,输出 Token 减少 70.8%~83.7%,端到端推理速度提升约 4×~4.3×

这件事情想深一点非常有意思:

未来两个 AI Agent 之间的交流,

可能根本不是:

“你好。”

“根据数据,我建议……”

而是一串我们完全无法读懂的:

高维向量。


11 但是问题来了:如果 AI 不说出思考过程,我们怎么监督它?

这其实是 latent reasoning 最大的争议之一。

Chain-of-Thought 有一个天然优势:

至少看起来可以读。

比如 AI 给出答案:

42。

同时写了:

10 + 20 = 35。

你马上知道:

它算错了。

但 latent reasoning:

你只看到:

输入。

黑箱。

42。

那内部到底怎么想的?

不知道。

2026 年已经有研究专门研究:

Latent Reasoning Model 到底能不能解释。

结论并不乐观。

相关研究指出,latent reasoning 虽然可能更省推理成本,也可能在内部保留更丰富的候选路径,但代价就是:

中间计算更难监控。

这会变成未来 AI 一个非常重要的矛盾:

效率 vs 可解释性。

你想让 AI 想得快。

最好别把所有东西都说出来。

但你想监督它:

又希望它把理由讲清楚。


12 所以“解释”可能会和“思考”彻底分开

这是我认为未来几年非常值得关注的一点。

现在大家潜意识觉得:

AI 给出的 reasoning:

就是它真正的思考过程。

未来可能不是。

AI 可能首先:

在 latent space 里完成真实计算。

然后再进行第二个任务:

“请把刚才的结论解释给人听。”

也就是说:

Reasoning

和:

Explanation

会变成两个不同模块。

举个例子。

你问医生:

为什么你觉得我应该做这个检查?

一个有经验的医生可能先凭:

大量经验。

检查数据。

模式识别。

形成判断。

然后再组织语言:

“因为你的这几个指标组合起来……”

医生说出的解释:

并不等于他脑中所有神经活动。

它是:

为人类沟通重新整理过的一套表达。

未来 AI 很可能也是如此。


13 这件事甚至会改变我们判断 AI 是否“聪明”的方式

今天很多人看 reasoning model:

“哇,它写了 8000 字。”

感觉:

好聪明。

但很可能未来正好相反。

真正强的系统可能是:

你问:

这段代码为什么偶尔会死锁?

AI 沉默 3 秒。

内部:

检查调用图。

模拟线程状态。

搜索假设。

否定两个方案。

找到 race condition。

然后回答:

问题在第 173 行和第 241 行的锁顺序不一致。

就两句话。

但内部实际算了很多东西。

所以未来:

输出长度会越来越不能代表思考深度。

这可能是一个非常重要的认知变化。


14 AI 的未来可能是“快思考 + 慢思考”

心理学里有一个很出名的比喻:

System 1:

快。

直觉。

自动。

System 2:

慢。

认真。

推理。

AI 很可能也会越来越像这样。

简单任务:

不需要几十轮推理。

直接回答。

中等任务:

内部 latent reasoning 几轮。

复杂任务:

开始增加 test-time compute。

非常复杂:

搜索多个路径。

调用工具。

甚至启动多个 Agent。

也就是说:

未来 AI 不一定每一个问题都“全功率运行”。

它可能动态判断:

这题值得想多久?

这才是真正好的计算系统。

因为你不会为了回答:

“1+1 等于几?”

调用一万块 GPU。


15 真正的竞争,可能从“谁模型更大”变成“谁更会花计算”

这一点其实非常深。

过去十年 AI 的竞争逻辑主要是:

训练一次。

然后所有问题都用同一个模型。

未来可能变成:

模型只是一个基础能力。

真正的差距出现在:

怎么使用计算预算。

简单问题:

花 1。

复杂问题:

花 10。

极难问题:

花 1000。

甚至:

先快速试。

发现不会。

再增加计算。

还不会。

再搜索。

再验证。

这种模式其实更接近:

计算机科学里的算法。

而不仅仅是:

“神经网络更大。”

所以未来一个 AI 系统的能力可能来自:

模型。

  • Memory。

  • Search。

  • Latent Reasoning。

  • Verifier。

  • Tools。

  • Agent。

而不是单一的:

Parameter Count。


16 这也是为什么“150M 的 BDH-CQ”会引起关注

并不是因为:

150M 已经比 GPT 强。

它没有。

真正让人感兴趣的是:

它展示了一种可能性。

推理能力不一定只靠堆参数。

它的 150M 配置在 ARC-AGI-1 public evaluation 上达到 29.5% pass@2,论文估算推理成本约 0.0007 美元/题

这个数字背后真正有意义的问题是:

如果未来这种方法扩大 10 倍、100 倍,会发生什么?

现在我们还不知道。

也不要过度吹。

但研究价值就在这里。


17 

我更关心的,其实不是“它今天有多强”

而是它代表了一个方向。

过去 AI 的发展路线:

更多参数。

更多数据。

更长上下文。

更长 Chain-of-Thought。

下一步越来越可能加入:

更多内部计算。

这就是为什么最近你会不断看到:

Latent Reasoning。

Recurrent Depth。

Test-Time Scaling。

Adaptive Reasoning。

Latent Agents。

这些词。

它们看起来是不同论文。

但背后其实都在解决同一个问题:

怎样让一个已经训练好的模型,在遇到真正困难的问题时,再临时多动一点脑子?


最后

过去的大模型最令人震撼的地方是:

它会说话。

你给它一句话。

它能给你写一篇文章。

写代码。

翻译。

聊天。

那个阶段解决的是:

机器能不能像人一样表达?

现在,研究开始进入下一层。

大家慢慢发现:

语言可能只是表面。

真正更难的问题是:

机器能不能形成自己的内部计算过程?

能不能临时学习规则?

能不能保存中间状态?

能不能尝试多个方案?

能不能发现自己不会?

能不能决定:

这道题,我需要再想一会儿。

如果这些能力逐渐成熟,

我们以后回头看今天的大模型,

可能会觉得:

2023~2025 年那些不停输出几万字 Chain-of-Thought 的 AI,

很像一个刚刚学会思考的小孩:

每想一步,

都必须说出来。

而真正成熟之后,

它可能只需要安静几秒。

然后告诉你:

“我想好了。”


下一代 AI 的竞争,可能不是谁最会说。

而是:

谁最会利用那几秒钟的沉默。