什么是玄学?
不是封建迷信,而是当系统的参数过多、变量间的系数纠缠过于复杂、且呈现高度非线性时,人类无法用低维逻辑去解释的现象。
AI就是典型的玄学。
几千亿个参数在高维向量空间里相互作用,最后吐出一个正确答案。为什么是这个答案?没人知道。OpenAI不知道,Anthropic也不知道。我们只知道,参数堆到那个量级,真相就浮现了。
这符合物理学里的全息理论:你拥有的参数越多,对现实的逼近就越完整。Scaling Law本质上就是这个逻辑的物理体现——大力出奇迹。
很多人总在期待,Scaling Law之后会不会诞生新的“XX Law”,会不会有新的基础范式颠覆一切。
我的答案是:没有了。
There is no other way.
Scaling Law的本质,不是参数的堆叠,而是对全息的逼近。参数越多,维度越高,你对现实世界的映射就越完整。当逼近达到临界点时,必然会爆发“质变”——也就是我们看到的“涌现”。因为全息等于事实本真,你无限逼近了本真,自然就掌握了真相,这叫缘聚显化。
所以,AI的基础范式已经锁死,这在逻辑上是确定的。也就是说,我们永远逃离不了Scaling Law了。
这听起来超级悲观,本质上是因为大家对AI寄予的期望太大了。每个人都冥冥之中知道Scaling Law是有天花板的,越是知道这个天花板拆不掉,就越是希望它不存在,这是一种心理学效应。
我来讲清楚,为什么这个天花板就是拆不掉。
因为反身性原理。
我们是凡人,是被造物。当我们试图用算力去模拟一个包含几十亿人的文明系统,或者推演一场复杂的地缘冲突时,我们需要的参数规模是天文数字。事实是——你无法用低于造物主的算力,去完全模拟造物主创造的、包含了你自身的系统。这不符合热力学定律,也不符合逻辑自洽性。
换句话说,人类在世界中所能获取的资源所转化成的算力永远不足以彻底改变人类自身的命运。 我们能做的,只是在局部、在浅层、小范围内做一些扰动。
这就引出了我对AI未来的判断:基础范式已经穷尽。
Transformer架构、Attention机制、Scaling Law……这些底层逻辑的红利在短短几年内已经被挖掘殆尽。接下来的AI发展,不再是算法的革命,而是工程的修罗场。
未来的AI竞赛,比的是什么?
不是谁的博士多,而是谁冷却系统做得更好;
不是谁的模型新,而是谁电力供应更稳定;
不是谁的算法巧,而是谁晶圆制程更先进;
不是谁的参数大,而是谁通信带宽更大。
这像什么?这像极了炒菜。
顶级大厨告诉你,这道菜要大火爆炒30秒,加盐3克。这3克盐,就是那几万个关键的超参数。但为什么是3克?为什么是30秒?没法用公式推导,只有真正上手颠勺几千次的人才知道。这就是“大厨秘方”。
可别小瞧了做菜,这可是浓缩版的复杂系统,是一门艺术!
AI正在从一门“科学”,退化为“复杂系统秘方”,工程调优术!
当算法趋同,剩下的就是那些无法被量化的经验、那些对物理极限的极致压榨、那些对复杂系统的微妙调优。这又回到了我所说的“玄学”范畴——一种基于高维直觉的手艺。
------
顺着这个判断再推一步,我会给出一个看似莽撞的预言:
未来,中国必将拥有全世界最强大的AI系统。
不是因为有了摩尔线程、沐曦、燧原、华为、寒武纪、平头哥,不是因为有DeepSeek和Kimi,不是因为梁文峰和杨植麟,而是因为:
AI走到后算法时代,中国人的复杂系统调优天赋开始起作用了。
具体来看,是中国的三个底层禀赋同时起作用:做菜的手艺、国家电网的复杂系统操控、以及物理层面最小的内部藩篱与最大的数据密度。
第一个论据,论做菜中国人能做到极致,所以最懂“工程秘方”。
AI后期的调优,本质就是炒菜。
几分几秒放几粒盐,火候差一格,出锅就是两道菜。这个东西没法写进论文,没法回归出公式,只能靠手上千万次颠勺的knowhow。
而“烹饪”这件事,中国人做了三千年。我们文化中一直有一股把高维不可量化系统收成低维可执行动作的本能——火候、刀工、焯水顺序、勾芡浓度,全是参数过多、系数纠缠、非线性响应的“人工玄学”。
这股手艺直觉,平移到AI工程里,就是:
知道什么时候该降压超频,什么时候该让显卡喘口气;
知道西部绿电和东部推理集群之间,该用哪种储能缓冲;
知道液冷管路里那零点几℃的温差,会怎样改写三个月后的故障率。
做菜是传统手艺,要找到第二个更现代的一层证据?也有。
第二个论据,是中国国家电网这个神奇的存在。
中国电网是人类历史上最大的实时复杂系统,本身就是一种物理AI。中国国家电网(State Grid)运营着世界上供电范围最广、服务人口最多、新能源并网规模最大的特大型电网,管理超400万公里输电线路、4.6亿台配电设备、11亿用户,每天PB级数据流动。
在物理空间里的电网调度和在数字空间里训练大模型,本质上是同构的。
新能源波动 ≈ 训练集分布漂移
负荷侧错峰
≈ 推理流量突发潮流收敛与安核 ≈ 梯度更新与稳定性约束
源网荷储协同 ≈ 算电协同与异构资源调度
国家电网已经把这个“同构问题”跑了几十年。
这意味着什么?
这是什么?这就是一个千亿级参数的“大模型”在物理世界的运行!
西方科技巨头为电网接不进数据中心发愁时,中国已经有一张现成的、全球最复杂的、带自主决策回路的实时控制系统在天天运转。
为什么这张网稳定性如此之强?因为有真实物理世界中无数次的故障数据和模式经验总结。
这和AI的持续进化对高质量训练场景的渴求如出一辙。
AI,只不过继做菜、调度电网之后的第三个类似的历史作业。中国人一样能完成,结果必然类似。
第三个论据,不讲比喻了,摆事实,直接看物理底座。
- 电:2025年中国全社会用电量破10万亿度,超美国两倍;数据中心电价约3美分/度,是美国三分之一;十五五国网固定资产投资预计4万亿。
- 链:全球60%变压器产能在中国,特高压46条,西电东送+东数西算把绿电直接变算力。
- 数据:14亿人口、11亿用户、5亿只电表、400万公里线路——这是任何开源爬虫都爬不出来的垂直金矿。
- 藩篱:中国就是“世界上的一个小世界”,内部标准、支付、物流、政务、产业协同的摩擦远低于多国拼盘。物理层面的最小内部藩篱,意味着参数流通损耗最低。
Scaling Law撞墙后,谁有最便宜的电、最稳的冷却、最密的场景、最顺的数据流转,谁就把“模型之外的复杂系统”先跑通。这一项,中国已经形成代差。
不过,很多人不相信。
没有英伟达、没有OpenAI,中国怎么会是第一?
这就好比:没有西门子、施耐德电气、德州仪器、日立、ABB,中国电网怎么会是全球最佳电网?
可事实证明,中国电网就是全球最佳。
那他们的思路到底错在什么地方?
错在他们眼里的先进,是单点指标:
哪颗芯片制程最小?哪台变压器绝缘纸最薄?哪个断路器灭弧速度最快?哪块显卡浮点最高?...
按这个切片标准,中国电力设备确实不是每一件都居世界顶端——有些高端绝缘材料、部分特种传感器、个别精密部件,欧美日仍有其长板。
但是悖论就在于:
部件级落后,系统级照样领先。
破除这个迷思,就要杜绝“切片思维”,升级到“系统思维”!
一个优秀的厨师,不需要每一味调料都是顶级的,但他知道如何在现有的条件下,通过火候、时序、配比,把整桌宴席做到极致。这就是中国天赋——在限制中寻找最优解(做题天赋)。
这种赢法挺让人无奈的,因为它是个脏活。
也许赢得不炫酷,但是赢得很扎实。
所以未来十年,大概率的光景是
美国继续在算法童话里堆参数,等待电网公司批准接电;
中国在炒菜锅里调火候,把国家电网、特高压、液冷集群、国产算力卡、行业大模型焊成一台机器。
AI的Alpha不在大模型本身,而在模型之外的复杂系统调优,这进入了中国的优势局。
不过,上面说的全是物理层面与工程层面。人心层面呢?那不得而知。
我只说前半句:中国会拥有最强的AI系统(物理意义、工程意义、复杂系统意义)。
基于这个判断,该怎么投资?
第一,我不会再投大模型了,而是关注拥有“系统级工程调优护城河”的隐形冠军。
这个护城河,可以是任何有形的无形是东西,低价政策也行,技术专利也罢,高质量数据经验也好,只要有用、有独家性,就有价值!
包括但不限于:
电力/能源公司(拥有低价基荷电力的数据中心运营商)、先进冷却技术(液冷/浸没式散热创业公司)、芯片互联IP(NVLink/Infinity Fabric级技术)、高密度封装(CoWoS、SoIC等先进封装产能)、边缘算力调度(分布式推理的网络效应)、算电协调等。
发现了吗?每个的护城河所护的方面都不一样,但只有他们所有结合起来,才能补完一个强大的系统。
对于这类公司,我会关注的指标不再是单领域的(例如算力多少GW),而是协同性的:
- 每瓦特Token产出(能效比)
- 电力采购成本(cents/kWh)
- 芯片锁单周期(months)
- 数据独占指数( proprietary data %)
- 能效拐点、电力合约价格、芯片交货周期、冷却系统故障率...
诸如此类。
第二,凡是宣称“AI将完全预测/控制/取代XX"的叙事,本质都是“不可证伪的信仰”,不适合作为投资锚点。真正可投资的,是AI作为工具增强人类决策(AI Augmented Decision-Making)这条线,而非AI取代人类!
理由很简单,还是反身性。
AI 被用来预测市场 → 预测改变市场 → 市场不再服从被预测的规律的 → 模型失效。
AI 被用来模拟文明 → 模拟结果影响文明决策 → 文明偏离原轨迹 → 模拟失效。
任何试图“完全模拟自身”的系统,都会因自指而崩溃。
第三,如果非要投资LLM,务必要进一步深度理解Scaling Law的哲学本质:全息涌现。
“越多越好”当然好,但是“刚刚好”才是最好。
现实中,并非所有问题都需要百亿/千亿参数。
一个"结构清晰、参数精练"的 70B 模型,在垂直场景可能优于"结构臃肿"的 500B 模型。关键不是参数总量,而是"参数到真相"的映射效率。
用 80 B 张量搭建一个K12教育答题大模型是浪费;但如果你想推演一个多主体参与的周期性行业,80000 B 张量可能都无法实现。
这也是为什么现在大部分的团队放弃做通用模型,而是做垂类模型,因为垂类模型更容易把控“刚刚好”的参数规模这个度。
你看,人类趋利避害的自然行为的演化结果,是不是和上面的理性推理走向了同一条路?
-----
完
夜雨聆风