夜雨聆风学习资料网

ARTICLE · 1057601

“芯片网红”:AI算力瓶颈早已不是算力芯片,而是先进封装、互连延迟与存储层级

“芯片网红”:AI算力瓶颈早已不是算力芯片,而是先进封装、互连延迟与存储层级

当市场在为科技巨头数千亿美元的AI资本支出(Capex)能否回本而焦虑时,产业最前沿的硬件工程师们却在关注另一个更本质的命题:摩尔定律的经济学已经破产,算力竞赛的真正瓶颈,从来不在芯片本身,而是从“设计更快的芯片”变成了“控制从硅片到机架的物理堆栈”。

近日,在知名科技播客Frictionless Podcast by Logan Jastremski的专访中,“芯片网红”、资深芯片设计师、知名硬件分析专家“Mr. Bubble”就当前AI算力供应链的核心瓶颈、未来架构演进及AI投资的最终价值归宿进行了深度剖析。这场对话从晶体管密度讲到存储层级,从机架设计讲到大模型实验室的战略意图,核心结论只有一个:

AI算力基础设施真正的瓶颈,已经从"造更快的芯片"转移到了封装、互连延迟与存储层级这三个更底层、更难解的物理问题上。

(图为Frictionless Podcast主持人Logan Jastremski)

对于当前市场最热门的几个方向——英伟达路线图的可执行性、HBM之后的存储竞争、推理侧的架构分歧,以及大模型实验室"踩边界"背后的真实动机——Mr. Bubble均给出了不少与市场主流叙事相悖的判断。分析认为,与其押注于“互相厮杀”的前沿AI实验室,不如牢牢握住底层的硬件与供应链。

摩尔定律的“经济学破产”与先进封装的崛起

长期以来,市场习惯于用摩尔定律(晶体管密度每两年翻倍)来衡量芯片的进步,但 Mr. Bubble 强调,这一逻辑在经济学层面已经断裂。

“推动这些制程节点(Node)发展所需的资金已经膨胀到了惊人的地步,现在可能需要花费数百上千亿美元。而你甚至无法让晶体管数量翻倍,可能只能获得15%到20%的密度提升。” Mr. Bubble 表示,正是因为晶圆光刻微缩成本呈非线性指数级增长,“先进封装成为了新的摩尔定律”

他指出,行业不再死磕将更多晶体管塞进同一单位面积,而是通过封装技术“扩大面积”,将多颗芯片连接起来使其像一颗芯片一样运作。这一趋势直接改变了产业链的价值分布。

Mr. Bubble表示,正是因为看清了这一趋势而早于市场看多英特尔——原因是英特尔的封装技术EMIB远超台积电当时的水平,而台积电此后也在向该方向转型。但他直言,"真正应该做多的其实是PCB板厂商",因为当英伟达被迫将Rubin Ultra从四芯片单封装降规成两个独立封装通过PCB连接时,PCB制造商反而成了整个计算链路的新瓶颈。

Mr. Bubble拿英伟达的路线图举例,揭示了其受制于供应链的现实:“如果你看英伟达的路线图,你会发现它并不受英伟达控制,而是受制于内存和封装。” 

他透露,英伟达最初计划在 Rubin Ultra 架构中封装 4 颗裸片(Die),但受制于物理和封装极限,最终被迫降级妥协(传闻改为每组封装 2 颗裸片,再通过 PCB 连接两组封装)。

“现在,PCB 制造商成了英伟达让这些相隔几厘米的芯片像一颗芯片一样运作的瓶颈所在。”

"每次我看英伟达的路线图,我看到的都是'今天不可能','今天不可能'。"他强调,Feynman代计划默认搭载四颗芯片,并配备更多HBM,"这些我们直觉上就知道根本不可能实现的东西,我很好奇他们打算怎么解决。"

"人们只是摊开双手说,这是英伟达,Jensen什么都能做。我的回应是:他受制于SK海力士、三星和台积电能做什么,也许将来还要看英特尔能做什么。"

算力的真实单位:不再是芯片,而是“整个机架”

随着大模型参数量级跃升,算力的重心已从“横向扩展(Scale out)”转向了“纵向扩展(Scale up)”。数据中心的算力形态正在重构。

“你不能再在真空中设计芯片了。” Mr. Bubble 强调,“这些系统不再只是一两颗芯片,甚至不是一台服务器,它们是一个完整的机架(Rack),甚至可能是多个机架。在未来,无论AI训练还是推理,设计重点必须是整个机架。”

在纵向扩展领域,互连(Interconnect)的吞吐量和延迟决定了集群的生死。他对比了两种截然不同的架构路线:

英伟达通过NVL72系统和庞大的NVSwitch交换机网络来解决高带宽互连问题,占据了本可用于 GPU 的物理空间;

而谷歌的 TPU 团队则交出了另一种惊艳的答卷,“他们的Scale-up规模达到了惊人的 9600 颗芯片……他们将部分路由逻辑直接构建在了芯片内部,让芯片同时充当伪路由器。”

“基于你的扩展域,你可以改变你的芯片设计。”他举例说,如果拥有极低延迟、高带宽的扩展域且中间交换较少,就可以减少单芯片的内存配置,用“堆更多芯片”代替“堆更多内存”。这也解释了为何谷歌的TPU芯片单卡HBM配置少于英伟达,却依然能撑起超大规模训练。

Mr. Bubble认为,这种系统级的设计能力,将成为未来AI硬件厂商的核心壁垒。

此外,推理侧的"预填充-解码分离(prefill-decode disaggregation)"正成为主流架构范式。Kimi的参考设计已将两个阶段部署在不同节点上,"这正变得无处不在,因为这两个操作在根本上就是完全不同的事情。"

HBM之后,存储战场的真正竞争者是闪存

在 AI 推理端,随着大模型上下文窗口(Context Window)从128K暴增至100万甚至更高,内存容量正面临前所未有的考验。市场普遍认为需要无休止地堆砌昂贵的HBM(高带宽内存),但Mr. Bubble提出了不同的务实解法。

“归根结底,大模型的‘权重(Weights)’应该放在 HBM 里。但如果我们不是一次性使用所有的上下文,为什么要在 HBM 中存放海量的上下文数据呢?”

他指出,推理过程中,占据大量内存空间的其实是用户的历史对话和上下文,而非单纯的模型权重。为了解决这一吞吐量和成本矛盾,行业正在走向“闪存卸载(Flash Offload)”的道路。

英伟达已经推出了针对此类场景的网络附加闪存驱动器机架设计,而更廉价、更高容量的 HBF(高带宽闪存)甚至常规的闪存,结合优秀的闪存控制器设计,完全可以承载海量上下文的需求。

对于未来内存的终极形态,Mr. Bubble 给出了明确的预测:“如果有人想了解我认为内存的未来是什么,那就是3D DRAM。” 他提到,将DRAM直接键合在逻辑芯片上方,通过物理距离的无限拉近(局部性优势)来同时降低延迟、提高带宽并降低功耗,这将是下一次硬件革命的焦点。

“买下建造铁路的人”

对话最后,Mr. Bubble将矛头指向了大模型实验室近期流行的“pacing the frontier(踩边界/放缓前沿)”叙事。

他的核心质疑是:“踩边界是为了我们,不是为了他们自己。”大模型实验室没有暂停任何数据中心建设计划,没有削减任何资本支出,“那些数据中心都是多年期承诺,如果他们是真心的,就应该取消这些开支。但这不会发生。”

在AI安全论上,他坦言自己不是AI终结者叙事的信徒:“让这些GPU持续运行的成本极高,所以它去统治互联网、把一切搞垮,这听起来就是在浪费资源。”他认为更现实的风险在于法律责任,而非科幻式的失控场景。

他真正感兴趣的问题是:踩边界究竟有多少是垂直整合与高价值问题攻坚,有多少只是“监管俘获”。他举例,解决千年数学难题(如Navier-Stokes)"花了1500万美元赚了100万,好吧,但那个问题可能并没有那么高的价值",而Terence Tao的数学研究奠定了LTE通信基础,那才是真正价值数十亿美元的成果。

在投资逻辑上,他的立场一以贯之:“我是一个坚定的信徒,我只相信拥有硬件层、拥有铁路,或者拥有那些构成这一切的核心部件。

Mr. Bubble 给出了一针见血的投资判断:“你是想投资Anthropic 和OpenAI这种注定会竞争到死、且其超额收益(Alpha)会随着人员跳槽而消散的公司?还是想拥有那些有 10 年、20 年业绩记录,并在开发不可或缺的硬件方面拥有深厚护城河的公司?”

关于让华尔街最头疼的“资本支出回本”问题,Mr. Bubble用最直接的经济账给出了回应:“我认为我们将迎来一次快速的起飞。我的意思是,只要借助AI研发出5到10种新药,就能收回所有的资本支出。”

全文如下(由AI辅助翻译):

第一章:简介 & 为什么硬件才是AI真正的核心话题

Mr. Bubble:

我们会给这些服务器增加更多内存。说到底,问题在于用哪种内存?是HBM?是DRAM?还是闪存?我猜更多会是闪存。现在大家都在讨论如何减少对HBM的需求量。因为说实话,到头来,权重(weights)放在HBM里可能还说得过去。但如果我们不是同时用到所有上下文,为什么要在那里放大量的上下文呢?

Mr. Bubble:

我非常相信一件事,就是要拥有硬件层,或者说拥有"铁路",拥有构成它的那些东西,对吧?所以你是想投资Anthropic和OpenAI这种会互相竞争到死、最终随着人员流动alpha也会扩散出去的公司呢?还是想拥有那些有着10年、20年研发历史和护城河、专门开发核心硬件的公司?是的,他们是在为我们推进前沿,而不是为他们自己。但我,我倾向于非常看多。我是说,现在有利率和伊朗的这些情况,但我不知道,我有种感觉,我们用AI找到几种药物,把对的研究人员聚在一起,或者我们想出办法让5G不需要在一平方英里内建一千座基站。我是说,Starlink,随便什么,只要更高效的东西。我是说,我们会迎来快速起飞。我觉得光靠五到十种药物,就能把所有的资本开支(capex)都合理化掉。

Logan Jastremski:

Mr. Bubble,非常感谢你来参加这个播客。这是我第一次尝试做一个更聚焦于AI的播客,而不是我传统的加密货币播客。所以我非常感谢你的到来,更重要的是,我非常欣赏你在Twitter和X上的各种观点。

Logan Jastremski:

就像我们在按下录音键之前说的,最重要的是,我认为你有一种非凡的天赋,能把技术概念解释得非常简单,而这是很难做到的。所以我非常期待这次对话,真正把你今天所看到的,乃至未来我们认为事情走向的一切都拆解清楚。谢谢你。

Mr. Bubble:

谢谢你邀请我。我要说,我所谓的"简化事物的天赋",很多人其实不喜欢,但我首先是一个芯片设计师。所以我必须简化和抽象,否则我会被各种细节搞得崩溃。另外,如果你是一个交易员,或者像我喜欢说的——赌徒,你真的只需要有一个高层次的概览。我觉得有时候人们会陷入细节的泥潭,对吧?我同意。说到底,你得知道什么是重要的,无论是从芯片角度还是从经济角度。因为我见过有人为某种SerDes的误码率(bit error rate)或某种材料在功耗上好了几瓦而吵架,我只想说,伙计们,算了吧,这个东西到底要做什么,那才是它对世界的经济价值。这里那里差一点点根本无所谓。

Logan Jastremski:

我完全同意。我觉得我们在加密货币领域也有很多这种书呆子式的争论。总体来说,就像Elon喜欢说的——简化,然后删除。架构和设计越简单,通常获得的采用率就越高。我相信在AI领域也有很多类似的情况。

Mr. Bubble:

我一直以来,不是要在播客一开始就跑题,我以前很喜欢哲学,其实我只读古代的东西,大概到斯多葛派为止,但他们有一整套关于事物本质的观点,就像柏拉图的理念论。本质是什么?核心是什么?从那个核心出发,你可以推导出其他一切。这就是我在处理这些话题时的方式——主要的东西是什么? 然后从那里出发,我们再谈细节,看它们是否重要。

Logan Jastremski:

我觉得这是一个很好的出发点。所以我想为所有观众和听众从零到一地讲起,因为我觉得你在解释这些概念方面确实做得非常出色。也许就从摩尔定律这样基础的东西开始,讲讲为什么摩尔定律最终走到了尽头,从那里开始,然后我们再跳到一些更有趣的内容。

Mr. Bubble:

好的,在谈摩尔定律之前,你得先大致了解它在说什么。它说的大体上是晶体管密度。它基本上说,在大约一年半到两年的时间里,具体数字不太重要,你大概能获得双倍的晶体管密度。也就是说,在单位面积内,你能放下更多晶体管。那为什么这很重要?因为晶体管是构建数字逻辑的方式。当我们制造芯片时,我们写程序,程序被转换成数字逻辑,数字逻辑再被转换成一堆晶体管阵列。我们能塞进去的越多,晶体管做得越小,计算机能完成的工作就越多,对吧?就把它想象成你写了一个程序,但它放不进内存里,这当然是非常粗糙的简化,但大概就是这个意思。就是我们有这个操作,这个流程,这个工具,但我们实际上放不下它。所以从一个角度来说,它非常重要——它基本上每两年左右就让性能翻倍,随着晶体管数量越来越多,你能完成的工作也越来越多。但从经济角度来说,它也非常重要,因为你可以为你的资本开支做合理化。你可以预测,"嘿,如果我花一亿美元,我实际上会获得投资回报,因为这些芯片会好这么多。芯片好这么多,我就可以收溢价,可以获取市场份额。"所以从这个角度来说,它相当重要。我觉得从工程角度来说,当然,它很酷,很重要。但真正来说,我认为从商业角度,它极其重要

不过我认为人们没有意识到的是,有一件事像是摩尔定律的一个分支,我甚至不知道它有没有名字,但我们可以叫它"泡泡定律",或者我只是喜欢借用别人的东西……就是:提升晶体管密度需要花多少钱? 在早期的每一个工艺节点,花费并不多,对吧?你不需要花几十亿美元来让晶体管密度翻倍。而现在,你可能需要花几百亿甚至上千亿美元,才能让晶体管数量不翻倍,对吧?也许每个节点之间,你只能获得15%到20%甚至更少的晶体管密度提升。所以我之所以从经济角度来阐述,是因为这个模式正在崩溃。推进这些节点所需的资金已经膨胀到这样一个程度——真正只有一两家公司能负担得起这样的投入。如果你不投资,你就会落后,对吧?然后就是一个永恒的恶性循环——"哦,你的节点更差,我不想用。"当你没有客户,你实际上就没有资金或时间去迭代来改进你的节点。所以我认为这是摩尔定律的关键所在。我认为人们忽视的一件事就是,就是让这些晶体管翻倍的成本。从大约60年代到90年代,这个成本相对来说几乎是免费的。到2000年代初,我们才开始需要在这方面动点脑筋。

第二章:芯片从0到1

Logan Jastremski:

在某个时间点,我相信是在90年代中期,或者也许是2000年代后期,在哪个时间点我们开始从单核性能转向多核,以及这种转变,我认为,改变了事物的动态格局。

Mr. Bubble:

我认为是在2000年代中期。我不一定记得很清楚。也许是奔腾处理器,是第一款双核处理器。我记不住名字了,但大概是在2000年代中期。这背后的部分原因就是:一个核心归根结底是做什么的?它处理指令。你能多快地处理指令?这取决于核心能跑多快,而这只是你时钟频率的函数,对吧?现在时钟频率已经触顶了。这与摩尔定律无关,更多的是与瑟布尔定律有关,以及晶体管能切换多快的问题。

但时钟频率触顶了,世界意识到,如果有些指令可以并行执行呢?并不是每条指令都依赖于另一条,图形处理是最明显的例子,我们称之为"令人尴尬的可并行化"工作负载,对吧?矩阵运算是令人尴尬地可并行化的。 这就是多核系统开始兴起的原因,因为对于某些类型的工作负载来说,这是一种可以提升性能的方式,但对于其他工作负载则不然。所以直到今天,如果你有一个单线程工作负载,或者就是某种逐条指令执行的瓶颈任务,说实话,如果你是一个非常优秀的程序员,你可能可以用一台老电脑就把它搞定,只要它还有相当高的时钟频率。你可以想想英特尔酷睿i9-14900KS,我认为这是有史以来面向公众发布的时钟频率最高的处理器,它的频率大约达到了6GHz的峰值。我们今天实际上还没有任何单核处理器能跑得比这更快。 这对大多数人来说不那么重要。但如果你有一个非常重要的单线程工作负载,比如网络数据包处理,你是一个字节接一个字节地接收数据,那时钟频率就非常关键了。

Logan Jastremski:

最终,正如你提到的,这让位于GPU。英伟达在这方面主导了一段时间。正如你指出的,矩阵乘法与AI的映射相当吻合。你能谈谈AI这边是如何开始扩大规模的吗?我想,是关于更大规模的预训练运行的问题。

Mr. Bubble:

也许我们就从英伟达为什么存在、他们为什么擅长这件事说起。我是说,图形处理说到底,这听起来像个玩笑,但它就是形状旋转,是三角形和正方形,你做一个矩阵乘法来移动和旋转它们。这与我们在AI中使用的数学大致相同,对吧? 但AI的好处是你不需要那么高的精度,而图形处理则需要。如果你考虑物理模拟或速度计算,使用64位浮点数,或者用更多位来表示小数部分,对那些工作负载来说是相当重要的。英伟达,当时并不是唯一的图形芯片公司,但很明显图形处理将需要一个专用处理器,对吧?因为你看,我们已经在CPU领域做到了双核,但那远远不够运行一个60帧的完整游戏,对吧?所以你必须把图形处理卸载到一个新的加速器上。所以英伟达做得非常好,我认为。

有趣的问题是,英伟达为什么能长期主导这个领域? 因为当时这个领域有很多其他公司。我对这个问题的回答是:英伟达从一开始就将其GPU设计得具有很强的灵活性和可编程性。有一个著名的故事,黄仁勋说英伟达差点破产,因为图形API发生了变化,也就是渲染图形的协议改变了,而英伟达不支持它。所以他们不得不立刻流片一块全新的芯片来支持那个协议,否则他们就会被淘汰,因为微软在背后支持那个协议,而微软是那个巨无霸。但英伟达,甚至从最早的时候起,他们就在做一些事情,比如并行化IO,比如GPU的虚拟化IO。他们从一开始就非常强调可编程性,因为那时是蛮荒时代,而这最终得到了回报。 很多选择走固化路线的公司都消亡了。但英伟达,直到今天,这仍然是一条相当深的护城河。他们有很强的可编程性,新模型出来了,英伟达似乎在一两天之内就能跑起来,对吧?所以我认为这就是英伟达优势的核心论点。

那么,你说的"固化",是指定制加速器吗?对,是定制加速器。但我的意思是,英伟达在往GPU里加的东西,甚至超出了规范的要求。就像如果规范改变了,如果我们想做这件事,我们能不能让加速器来分担这个工作?这就是为什么他们很快就进入了科学计算领域,因为他们让那个协议变得非常有用,对吧?没有其他图形芯片公司进入了科学计算领域,这是有原因的。 而那正是他们在进入AI之前的起点,对吧?所以,为英伟达点个赞,他们从一开始就努力让这些大型、复杂、可并行化的处理器变得更具可编程性。我认为那是正确的选择。事后来看,那确实是正确的选择,对吧?对于现在的AI来说,这是否仍然是正确的选择?我们不知道,事情会变化。但就目前而言,显然这为他们带来了巨大的成功。

Logan Jastremski:

那么也许再深入探讨一下,你已经开始——我想先退一步说——你因为对英特尔的判断而出名,真正谈到了封装,认为封装是新摩尔定律。你能解释一下为什么你认为封装是新摩尔定律,以及为什么封装比光刻机更有意思?

Mr. Bubble:

是的,就像我一开始说的,你知道,如果我们能一遍又一遍地缩小晶体管,每两年翻一番,那封装可能没那么重要。但我们现在需要用一切手段来获得更多晶体管,对吧?因为光刻缩放近年来已经基本到顶了,或者说没有以同样的速度在缩放。也许我们只能获得10%、12%的提升——而我们花了什么,200亿、400亿美元才达到这个水平。也许更聪明的做法就是把更多的芯片加在一起并连接起来,让它们表现得像一颗芯片。所以这是在增加面积,对吧?与其试图把晶体管缩小到一个单位面积里,我们是在扩大面积,对吧?这对我来说非常清楚,因为如果你对光刻有任何了解,你就知道在先进制程节点上流片的成本极其高昂,比7纳米节点要贵出好几个数量级,5纳米节点的流片成本大概是它的两倍,然后2纳米节点又是那个的两倍,对吧?所以成本就这样急剧膨胀。获得性能提升的更好方式其实就是增加面积,这是一种新的缩放范式,对吧?现在大家都在谈论缩放范式,但这是一种新的范式,对吧?所以,封装就是人们现在试图扩展晶体管数量的方式,在一颗完整的芯片内给你提供更多晶体管。

英特尔,当我——你知道,我当时真的非常关注英特尔,现在也是——主要是因为我理解他们试图推进的光刻节点。我的意思是,他们试图通过更早采用高NA EUV等技术以及推动封装技术来超越台积电。这需要大量的投资,对吧?正如我所说,每一个节点的投资都呈非线性指数增长,对吧?所以这就变成了一种垄断、双寡头的局面。所以他们唯一能追上台积电的方式就是烧钱。但我对这个策略确实有很高的信心,如果你真的有把握能出货的话,这其实是个不错的策略。另一件我可能比别人更早发现的事情就是,他们的封装技术——叫做EMIB——比台积电当时提供的技术领先太多了。而现在台积电正在采用EMIB已经有的东西,对吧?他们正试图将自己的封装技术向那个方向转变。这在当时非常重要,因为如果你看英伟达的路线图,它依赖于什么?它实际上并不依赖于任何英伟达自己掌控的东西。它依赖于内存,它依赖于封装。

第三章:封装作为新摩尔定律

Mr. Bubble:

这两件事英伟达实际上都不自己做,对吧?我的意思是,他们与合作伙伴合作,试图去影响它。但归根结底,这些都是给他们提供这些东西的供应商和合作伙伴,对吧?他们既不自己制造,也不自己设计,对吧?所以如果你看英伟达的路线图,它是从H100的一颗大芯片,到B200的两颗芯片,然后Rubin默认是两颗芯片,Rubin Ultra本来应该是四颗芯片。瞧,发生了什么。Rubin Ultra无法把四颗芯片放在一个封装里。他们不得不多次降低规格。现在的传言是,一个封装里放两颗芯片,然后两个封装,对吧?所以它们通过某种PCB连接方式连接在一起。所以对于任何了解封装发展方向的人来说,这是显而易见的。我通过做多英特尔来布局这个,效果很好。你知道,我很高兴英特尔现在表现得更好了,但真正的机会其实可能是做多PCB制造商,因为现在他们已经成为英伟达的瓶颈——英伟达需要让这两颗相隔也许几英寸或几厘米的芯片表现得像一颗芯片。这并不一定容易,也不是迄今为止一直以来的做法。

Logan Jastremski:

总体来说,我认为主要的瓶颈就是提高芯片之间的数据吞吐量,确保它们能够相互通信,几乎像一颗芯片一样运作。

Mr. Bubble:

是的,吞吐量,还有信号完整性。因为随着传输距离变长,信号会失去它的能量或完整性。我的意思是,我们有输电线路,对吧?我们以前在电话线上有中继器来放大信号并重复传输。归根结底是同样的物理原理,只不过现在你是在PCB上传输几厘米。所以信号现在需要被转换成某种其他格式、某种其他物理介质,然后需要来回传输,这在高速情况下并不容易做到,而且还要保证良好的信号质量。所以,Rubin Ultra还没有出货。我的意思是,我认为Rubin现在正在爬坡。我们看看Rubin Ultra明年能不能出货,但他们遇到了相当多的麻烦。还有一件事,你看,我们现在关注Rubin Ultra是因为它在新闻里,但Feynman本来应该默认就是四颗芯片,对吧?所以这成了一个巨大的问题。Feynman本来应该有更多的HBM,对吧?所有这些我们直觉上就知道今天不可能实现的东西。每次我看英伟达的路线图,我就觉得这今天不可能,这今天不可能,对吧?所以我很好奇他们打算如何解决这个问题。人们只想举手投降说,哎,这是英伟达,老兄,黄仁勋什么都能做到。而我说,好吧,你知道,我相信他是个出色的运营者,他能做很多事情,但他受制于SK海力士、三星和台积电能做什么,以及也许未来英特尔能做什么,对吧?

Logan Jastremski:

是的,我认为这在晶体管方面——无论是时钟速度的扩展还是多核扩展——都是非常清晰的从0到1的过程。甚至包括芯片die的扩展。不过我很好奇,现在随着这些发展,我们显然已经扩展到了更大规模的集群,从几百个,到现在几千个,再到几十万个互联的GPU。而关键在于规模扩展。这些用于大规模预训练的数据中心。所以有意思的是,你不仅需要在芯片上有相当高的吞吐量,还需要在机架内部以及机架之间都有高吞吐量。那么,随着我们在训练方面扩展到更大的集群,你能谈谈这些事情是如何扩展的吗?

Mr. Bubble:

是的,那么。 我觉得首先要说明的是,为什么要扩展规模,对吧?一方面,单纯地把封装推到极限,比如NVL72本来就要有72个封装,把这些全放进一个封装里,实际上是不可行的。 但同时,这些AI算法是非常可并行化的,对吧?所以它的好处在于,你可以让一块芯片处理问题的一部分,另一块芯片处理问题的另一部分,这样你就能获得更高的吞吐量,对吧?这就是它的优势所在。如果我们处理的是像……我不知道,比如更偏向单线程的工作负载,那根本就不需要扩展规模,对吧?那样做毫无意义,但AI不同。而且你知道,这种矩阵运算越来越具有可并行性。所以规模扩展领域正在成为真正的瓶颈。我认为延迟和吞吐量都极其重要。但延迟方面更为关键,这是因为人们并行化的方式——无论是流水线并行还是张量并行——你在芯片之间实际传输的数据量并不是特别大。英伟达今天的系统是为巨大的带宽和NVLink设计的,对吧?我认为大约是每秒900千兆比特,对吧?这对训练工作负载更为相关,因为在训练时,你需要在GPU之间来回传输大量的激活值和大量的部分乘积结果。所以根据你构建的集群类型,无论是推理集群还是训练集群,互联网络需要针对你要做的事情来设计。如果你试图把一个训练风格的互联网络用于推理,我的意思是,它能用,但你必须想办法绕过那个巨大的延迟瓶颈。是的,对于这一点。但是,我要说的是,很多其他公司在规模扩展领域的做法非常不同。我最近参加了Hot Chips大会,GPU团队——我认为他们真的做得很好,可能是目前世界上最优秀的硬件团队之一——他们的规模扩展域达到了9600块芯片。这是一个惊人的芯片数量。 对吧。由此带来的一个结果是,他们芯片上的HBM比英伟达的要少。而且他们目前也没有做这种——至少据我所知——他们目前没有做这种多芯片、多大尺寸die封装在一起的方案,对吧?所以。这非常。

Logan Jastremski:

只是因为他们在规模扩展上做得好得多

Mr. Bubble:

是的,他们擅长扩展互联网络。所以如果你非常擅长做这件事,并在芯片之间进行流量调度,因为在9600块芯片的规模下,你可以路由到的地址数量是巨大的。这是数量惊人的芯片。所以你如何在芯片之间切换互联,实际上将决定延迟,对吧?NVL72系统有一个大的——不止一个,我认为里面有4个NVL交换机,对吧?这些交换机占用了本可以放GPU的机架空间。但TPU团队没有这样做。他们实际上把一部分路由逻辑直接内置在芯片里了。所以这些芯片本身也充当了伪路由器的角色。就是这样的技巧。 不过我要说,规模扩展领域对芯片设计也变得越来越重要,因为正如你所说,这些系统不再只是芯片了。它们不只是一两块芯片,不是四块芯片,不是一台服务器,而是一整个机架,甚至可能是多个机架。我认为这在计算机体系结构领域是比较新的概念,过去我们被教导要关注缓存命中率和内存访问时间。但当你在多块芯片之间进行统筹调度时,你必须分析整个系统,对吧?而且根据你的规模扩展域,你可以改变你的芯片设计。对吧。所以如果你拥有一个低延迟、高带宽的规模扩展域,并且中间没有太多的交换,你或许可以减少芯片上的内存,因为你可以用更多的芯片来解决问题,而不是用更多的内存来解决问题。芯片设计是一种平衡的艺术。 我认为很多工程都是如此。但芯片设计真的是一种平衡的艺术。一切都像是,我在哪里可以做出取舍,以便在其他地方获得收益?一切都关乎平衡。

Logan Jastremski:

这真的非常有趣,因为理论上,正如你所提到的,如果在单台服务器内,你有比如说50太字节的吞吐量,并且你有一个50太字节的线路或互联,你就可以做一些非常有趣的事情,比如构建定制的机架,里面可能全是内存,或者全是GPU,但你受到了瓶颈限制,因为你没有那个50太字节的互联,而这才是真正的核心问题,再加上你提到的延迟问题。

Mr. Bubble:

是的,你还触及到了另一件事,那就是解耦(disaggregation),对吧?这些模型,或者说用于推理和训练的这些技术,正在意识到,实际上,流水线的某些部分或某些操作,应该在不同的硅片上或不同的内核上运行,对吧?使用不同的利用率或不同的程序来运行。这样实际上效率更高。Kimi的参考设计就为推理的预填充(prefill)步骤和解码(decode)步骤设置了独立的节点。而这正在变得无处不在,这已经成为提供推理服务的标准方式,因为它效果好太多了,因为归根结底,这两者是完全不同的操作。所以规模扩展域如今变得更加重要。我认为,是的,我认为AI训练的未来,甚至推理的未来,就是设计整个系统,整个机架。你不能再只是设计一块芯片了。你不能在真空中设计一块芯片。对于本地机器或小规模应用来说这没问题。但对于我们现在运行的这些规模,我们必须在系统层面进行优化。我认为未来会有更多的解耦。我们说的是预填充和解码,但我认为还可以有更多。

第四章:机架、托盘与计算单元

Logan Jastremski:

我确实很想聊聊预填充和解码,但也许我们先聚焦在训练和预训练这一块。 随着封装规模不断扩大,数据中心的机架也在不断扩展,从1吉瓦到多吉瓦,你觉得在训练这边,还有没有什么你认为值得关注的瓶颈?还是说主要还是集中在封装和互联这块?

Mr. Bubble:

是的,我觉得在训练这块,我要说英伟达的芯片在训练方面真的很强,对吧?如果你要跑大量高算力的工作负载,它们非常适合,因为它们能提供大量的浮点运算能力,而且有很大的带宽。 当然,这些问题并非没有其他解决办法,但在训练这一侧,我觉得能做的硬件优化越来越少了。比如说把一些东西卸载到闪存,或者把某些计算保存起来留到后面用,这样就不用重新计算了。但这些都属于非常偏算法层面的事情,对吧?所以我觉得在训练这边,想要继续堆浮点算力越来越难了。如果你真的想要一个疯狂堆算力的芯片,你就需要大量的乘加运算单元,说到底就是需要一块巨大的芯片,巨大的面积,有点像Cerebrum那种风格,可以做大量的计算。

Logan Jastremski:

这不就是马斯克当时想用他们内部项目Dojo做的事吗?

Mr. Bubble:

我不太了解,不过——

Logan Jastremski:

他们已经把它关掉了,所以我觉得应该没成功。

Mr. Bubble:

这我一点都不意外。 我是说,在训练这块,关键在于你有海量的数据,而在推理这边,你有的是用户的查询、用户的上下文,再加上模型权重,基本上就这些。但在训练中,你有各种各样层次的数据,比如激活值、各种状态、权重本身,你还要在训练过程中不断做检查点保存,因为如果任务中断了,你想从上次停的地方继续跑,对吧?还有你用来训练的数据本身,这都是海量的数据问题。所以我觉得把一些东西卸载到更便宜的存储介质上,知道什么时候去访问它们,同时为计算节省时间,这在训练中也许是可以做的,但能做的空间我觉得要少得多。训练这边,我们只能寄希望于做算法和机器学习的人能在训练层面想出什么办法,这可能已经超出我在硬件层面能管的范围了。

Logan Jastremski:

说得有道理。那我们可以转到推理这块了。 我做过一个挺有意思的实验,就是——AI领域一直有个广泛的说法,认为所有东西最终都会在本地运行,你会在你的MacBook Pro或者iPhone上跑模型。我就去看了一下Open Router,拉了前10名的模型,看了看需要多少算力。就是说,对于一块H100或者同等级别的高带宽内存,你需要多少张网络芯片才能跑起这个模型?即使是前10名里最差的那个,我觉得大概也要2到4张。而每张H100现在好像还要两三万美元。

Mr. Bubble:

对,差不多,大概两万四到两万八。

Logan Jastremski:

然后我再看了看那些更流行的模型,比如GILM 5.2,那是个万亿参数量级的模型。我就想,好,光是把权重装进去,你就需要40到50张H100,更重要的是还需要相应的内存容量。所以我想问你一个大问题:现在这些模型越来越大,而且看起来还会继续变大,这最终会对内存产生什么影响?是会继续留在SRAM或者高带宽内存上,还是会转移到闪存?因为看起来不只是吞吐量,内存容量的需求也在不断扩大。

Mr. Bubble:

是的,我的意思是,这个问题涉及很多内容。如果我们来看,你的数字大致是对的,我认为即使是 llama 70b,在实际运行中你也需要大概4块GPU才能真正跑起来。对吧。我认为你关于内存的问题非常有趣,因为,你在内存里存的是什么,这真的很重要,对吧?如果你存的是权重的话,我的意思是。是的,权重在扩展,但有一种观点认为,这方面在某种程度上已经趋于平稳,或者说人们并没有像以前那样在权重扩展上使劲推进。我认为,现在已经是公开的知识,或者说是普遍的传言,新的 GPT 六使用了一种技术,让同样的权重反复循环使用。你可以叫它 transformers,对吧? 所以,我的意思是,这很有意思,因为,是的,如果单纯靠堆更多更多的权重就能奏效,那我们至少在权重这块就需要越来越多的内存,对吧?

我认为很多研究已经表明,这些权重里,很多其实是空的,你知道,它们非常稀疏。并不是每一个权重的每一个比特里都包含大量信息,这也是为什么量化和剪枝这类技术效果非常好。还有像,你知道的,投机解码也非常有效,因为并不是每个权重对你的问题贡献都是一样的。

但当我们看其他方面,比如什么东西占用了大量空间?在推理服务的时候,其实是上下文(context)。是你的对话,或者你之前的对话。 就因为这些模型生成下一个 token 的方式,是自回归地遍历你整个上下文,对吧?字面意思就是一次只生成一个 token。我的意思是,人们大量使用投机解码,一次生成更多,但我们做的大体上就是这个,对吧?而当你去看它,我的意思是,上下文随着权重数量、注意力头数量,以及用户数量一起扩展,对吧?所以上下文实际上,有一个观点可以提出,就是上下文在推理中实际上比权重更重要。 根据模型的不同,它可能占据更多,甚至是大部分的空间,对吧?所以

Logan Jastremski:

上下文这个话题超级有意思,因为我的意思是,是的,我总喜欢想,好吧,如果在未来我们能挥一挥魔法棒,我们想要什么?这有点像电影《她》(Her)里面的感觉。或者就是,它了解关于你的一切。和你的电脑对话,希望是以好的方式,但就像上下文窗口从128到256到512,现在大概在一百万左右了。我很好奇,你认为它们会,如果你可以拥有越来越大的上下文窗口,而你也许不再受限于,我的意思是,每样东西,我猜一切都受硬件限制,但你认为上下文窗口会走向何方?你认为它们会从一百万增长到一千万,然后从一千万增长到一亿吗?

Mr. Bubble:

所以我认为单纯靠扩展非常困难,就因为硬件的限制。即使是我们现在所说的一两百万,也不是真正意义上的一两百万。 因为你需要在一两百万的长度上训练,而实际上要找到一两百万长度的数据是相当困难的,对吧?

但不管怎样,我确实认为更多的上下文是会到来的。你知道,这些模型会拥有更多关于你的信息。问题是,它们如何获得这些信息?也许不是像,也许是,你知道,一段来自多年前的缓存对话,被存储起来,然后它们去搜索它、提取它,并把它保存在它们的一两百万上下文里。也许是在你的上下文上进行后训练,对吧?我认为如果某件事情足够重要,就像即使是作为人类,如果某件事对一个人来说足够重要,你可能就会把它烧进你的神经元里,对吧? 你不需要去搜索你的文件然后想起那个,你知道,也许如果是你说的某件小事,但你知道你住在迈阿密或佛罗里达,这可能就应该直接烧进权重里,对吧?所以我认为我们通过后训练,把重要的东西烧进权重里,从而获得更有效的上下文,对吧。但同时我们也可能会存储大量关于人的数据。我的意思是,想想 meta 和 Google 这些公司,他们存储了大量关于我们的信息,对吧?这些模型最终也会这样做。而上下文的一大好处是,我们可能没有深入解释过,但你通过计算来生成上下文,这叫做预填充(prefill)。但在解码(decode)的时候,你只需要去取它,对吧?你只需要获取它然后在那里得到下一个 token,所以一大好处是,如果你已经有了上下文,你可以避免做预填充,直接开始解码。

第五章:内存层级结构:HBM、DRAM 以及下一层级

Mr. Bubble:

所以 GPU 或硬件的利用率要低得多。它消耗的功耗也少得多。你可以在很多模型上看到这一点。它们对上下文命中的收费方式是不同的。所以我认为 Kimi 收费大概是 5 美元或 3 美元,如果你没有设置上下文的话。但如果你设置了上下文,它们收费就少得多。所以这是其中一部分原因。我认为上下文这件事,可能甚至不会存在于实际的硬件层面。它将体现在整个系统设计中,对吧?所以 Nvidia 对此有他们的答案,也就是说,你知道,网络附加闪存驱动器,对吧?他们有一种纯闪存机架,那将是他们的方式,你知道,用来获取 Logan 的上下文或获取 bubble 的上下文,对吧?Logan 提到了一些关于汽车的事情。好吧,我们去搜索那次关于汽车的对话,对吧?然后快速获取它。诸如此类的事情。

我的意思是,对于智能体相关的工作,它现在变得非常重要,因为智能体说到底就是上下文。它们只是一个框架,本质上就是一堆提示词注入。是的,当我发现这一点的时候我也感到很惊讶。但是,我的意思是,如果每次你都必须重新执行那个提示词,那只会消耗 GPU,而且你的首个 token 的生成时间会永远那么长,对吧?所以智能体的最大好处是,你知道,像 LLM cash 或 LLM cake 这样的东西,它们是围绕着缓存你的智能体框架并一直重复使用它来构建的,对吧?就是这么简单的一件事。

Logan Jastremski:

我在智能体这一侧得出了同样的结论,就是你只是想要越来越多的上下文。因为我当时在思考如何实现最长的长程智能体。而且行业似乎——我很好奇你的看法——对于仅仅通过像 Grok 这样的方式最大化解码侧的吞吐量非常感兴趣。由于 SRAM 具有非常高的吞吐量但容量相对有限,将所有内容存储在 SRAM 中并最大化吞吐量是比较困难的。 但当你降到像高带宽内存这样的层级时,我认为现在大约是 8 TB,你跳到了 100 到 300 GB 的容量,但如果你想运行得更快,这通常还是不够的。所以我认为你一直是高带宽闪存的支持者。我很好奇你在这方面的最新想法,但大概就是能够保持相对较高的吞吐量,同时拥有更多的上下文。所以,是的,正如你提到的 Nvidia 和 CMX,我认为对我来说有趣的事情,也许也是我想问你的问题是,你认为这个行业是否对吞吐量过度优化了? 如果智能体正在兴起,而且它们对于存储关于你生活的上下文以及你想让它们做什么更加重要的话。

Mr. Bubble:

所以这个行业确实一直专注于吞吐量,这是因为更高的 token 吞吐量可以让他们赚更多的钱。你说得很到点子上。如果我必须不断地获取上下文,而上下文在这些 GPU 的内存占用中占了很大一部分。那么,是的,我的意思是,你可能可以通过更智能地处理上下文来获得更好的吞吐量。我认为 HBF 对我来说非常有趣。说实话,我一直开玩笑说,你知道,如果你想改变世界,要么找到治愈癌症的方法,要么发明一种新型内存。 没有多少人在尝试做新型内存。很多人在癌症方面努力着,我希望,你知道,我们能先攻克那个。但发明一种新型内存总是值得称赞的,对吧?所以内心深处的我一直渴望一种新型内存。当你看它的时候,是的,闪存具有更好的位密度,对吧?所以我们可以在那里存储更多的东西。如果我们能从中获得哪怕是有竞争力的带宽,那就太棒了。你知道,我们应该在这些加速器上以更低的每比特成本拥有更高的密度,也就是更低的总容量或 GB 成本,对吧?

我认为我在高带宽闪存方面看到的问题,很多人都说过,哦,这是一个可靠性问题。我认为可靠性问题实际上是可以解决的。你必须是一个非常出色的闪存控制器设计师才能做到这一点。而且你必须针对手头的问题来设计你的闪存控制器。我们今天设计闪存控制器的方式是,我们把它们设计成用来存储数据库、存储文件或存储你的电脑游戏,对吧?上下文是非常不同的。 你知道,上下文是以某种特定方式被获取的。上下文并不总是需要永久保存的,对吧?所以我是否总是需要以完美的比特分辨率存储你两年前关于假期的对话?也许不需要,对吧?所以也许我们可以接受丢失其中的一小部分。而且关于闪存的问题一直是,你知道,写入,向闪存写入一直是损害其可靠性的因素。所以它是持久存储,但在一定程度上,取决于你向它写入多少次。

我认为 HBF 的问题一直是,它的市场在哪里?如果你有 HBM,为什么要用 HBF?我们真的能从加速器上更多 GB 的存储中获得更多好处吗?我不这么认为。因为如果是这样的话,为什么 Google 要用内存更少的 9600 规模的扩展域呢?我认为对于这些解码来说,关键一直就是带宽,对吧?所以密度实际上并不能给你带来太多好处。它只是让你能够存储更多的上下文。但说实话,如果你在移动数据方面非常聪明,你可能只需要把那些上下文存储在普通闪存中,在需要的时候去获取就可以了。

所以我认为 HBF 一直是这样一个东西,它非常有趣。有理由认为它是有用的。它对卸载上下文有用吗?我认为你完全可以使用普通闪存来做到这一点。我认为你不会获得太多的性能提升,HBF 的延迟和专门为 AI 设计的高端普通闪存的延迟都是 5 微秒,对吧?所以我们得不到太多好处。它的带宽低于 HBM,每比特成本也更低,但总体上可以说和 HBM 差不多,你知道,对吧?所以 HBF 的客户是谁?在我看来,是那些无法获得 HBM 的人,对吧?这就是我最终看到的情况。

也许有理由认为你可以将它用于本地推理,但在数据中心产品中,现在很难说。我就透露一个内部消息,因为,你知道,你邀请我上了这个播客。我听说,你知道,目前来自大约两三个人的消息,HBF 的主要客户是中国人,他们对此非常感兴趣。 考虑到我刚才说的一切,这非常有道理,因为如果你没有办法获得这种高端 HBM,而且你也无法制造它,你实际上就没有办法制造那么多加速器,对吧?所以你可能愿意接受一个次等产品,如果它,你知道,如果它能达到 H100 或 B200 的水平的话。对。它不会处于领先边缘。而如果你能以稍微便宜一点的价格获得它,那就有一个使用场景。

我认为 HBF 现在还处于非常早期的阶段。我们必须弄清楚如何对其进行标准化,但同时使用场景目前也非常不确定。在我看来,我确实相信,整个机架需要从内存控制器到闪存内存控制器,针对项目进行协同设计。所有东西都需要为 AI 应用而设计,对吧?

Logan Jastremski:

所以你更看好 Nvidia 的方案,就是用 CMX 把越来越多的东西卸载到闪存上,拥有几个TB、几个TB那样的闪存空间?

Mr. Bubble:

我不,我不会说我特别看好那个方案。那也许比 HBM 要好一些。对,我同意。Nvidia 也是这么认为的,行业里很多人也这么认为。我只是觉得我们可以做得比那更好,对吧?我认为我们需要做的是跨所有层面非常智能化的调度编排。这甚至包括从算法层面入手,比如用于压缩和存储上下文的算法,对吧。

Logan Jastremski:

那么你觉得随着时间推移,我们能不能从现在姑且叫它——我知道不是一百万,但就叫它今天的一百万——发展到五百万、一千万、一亿?这主要会是由算法上的进步驱动,还是更多由硬件层面的提升驱动?

Mr. Bubble:

有一种观点认为,推理(inference)会开始越来越像训练(training)。我们正在用测试时计算(test time compute)来实时地在你的上下文上进行训练。那么在这种情况下,我们还需要那么多闪存吗?可以说,不需要了。我们不需要存储每一张图片和每一条信息,但这真的还很难说,取决于什么样的架构才是最合适的,我是说。我们现在,你知道,大家最近都想紧跟前沿,但我们本身就在前沿,所以我们也不一定知道最好的技术是什么。我的看法是,你会把东西卸载到闪存上,但不会是所有东西。不会是你写的每一份文档。对于大型企业来说,有这样一种逻辑:嘿,如果我有这个大型数据库,我为什么不直接把它喂给我的 LLM,然后,瞧,我就有了上下文。我直接和我的数据库对话,对吧?这种情况是有可能存在的,对吧。

Logan Jastremski:

那你觉得这个行业,从宏观角度来说,是否会继续优先追求吞吐量(throughput)——因为这是他们在推理侧获取收入的主要方式——而不是去做一些更专门化的方案,让你拥有更大的上下文窗口,但吞吐量可能稍微低一些?

Mr. Bubble:

这是个好问题。我觉得这个行业目前肯定是在专注于吞吐量,但这些公司怎么赚钱呢?他们靠服务更多的用户来赚钱。如果你能用更少的硬件服务更多的用户,那赚的钱会远远多于只是提供长上下文窗口。 对,我是说,想象一下,你就有一个 NVL72 机架,然后通过一些闪存卸载或者一些非常智能的算法改进,你能服务的用户数量翻倍甚至翻三倍,对吧?这对 AI 实验室来说更有价值。但那种超快的模型,或者专门解码速度很快的模型,我觉得也会存在相当长一段时间。我也很惊讶,很多人喜欢那种东西,就连 AI 研究人员也非常喜欢那种东西。但我认为,未来对于 AI 实验室来说,归根结底的价值在于,如果他们问:我们是把所有东西都放到 Cerebras 上然后收更高的价格,还是说,我们能不能就用我们现有的硬件,把服务的用户数量扩大三倍?我认为他们会选择在同样的硬件上服务三倍的用户。 如果你能用同样数量的硬件服务更多的人,成本就会下降,对吧?每个人的每个 token 的成本都会降低。

第六章:纵向扩展 vs 横向扩展

Mr. Bubble:

所以我不知道这是否回答了你的问题,但我认为新的能力,我觉得将会是一种有趣的赚钱方式,对吧?我不知道我和你还有普通人能不能得到这个机会,但也许企业会得到,对吧?就像,如果你能直接在我的数据库上做后训练,然后把它内置到我的LLM里,那就太好了。

我的意思是,这基本上就是 Thinking Machines 正在做的事情,对吧?他们在做更长的上下文。嗯,他们在人们的数据上做后训练,以便在这些数据上获得更好的结果。从某种意义上说,那就是上下文,对吧?

Logan Jastremski:

我看过一个 Thorio 的播客,不记得是哪一期了,但他谈到了——随着时间的推移,他认为上下文窗口会持续扩展。正如你提到的,你会对上下文本身做某种强化学习或后训练,然后再把这些内容重新烘焙回模型中,这让我对上下文更加看好。所以,我想我从你这里听到的,也许对所有正在收听的人来说,最好的表达方式是什么呢?是在公开市场这边吗?是做多 Cerebras 吗?

对,我猜是 Grok,但他们被收购了,而在公开市场上,好像是做多像 Etched 这样的公司?

Mr. Bubble:

我认为做多像 Etched 这样的公司,如果你能做到的话,会是一个非常好的投资,但他们还没有上市。我认为在公开市场这边,很难找到一个清晰的投资标的。AI的魅力在于,很多这类公司都是新公司,还没有上市。所以在这个领域有一些有趣的公司,比如 Weka,他们做的是用于闪存卸载的软件,或者说就是帮人们在各种集群中存储数据,对吧?所以我认为,是的,你可以尝试在商品侧,或者说所谓的商品侧,或者就叫它硬件侧来布局。我认为未来在实际的软件层面,或者闪存控制器方面,会有一些有趣的机会,对吧?所以我认为,目前还没有哪家公开公司的算力能超过 Nvidia,也许当有人带着有趣的东西上市时,这种情况会改变,对吧?但是,这是你可以布局的一种方式。你知道,如果你认为上下文会被烧录进权重里,那我们就需要做大量的后训练或测试时计算,对吧?

所以,任何能以低成本提供算力的人,都将变得极其有价值。

Logan Jastremski:

有意思。是的,我觉得对我来说,未来几年内 Agent 会越来越多地承担日常工作、电脑操作,这似乎是显而易见的。对于普通人来说,大多数人无法进入私募市场,而那些实验室公司的估值已经达到了万亿以上,普通人怎么能表达这种观点呢?

Mr. Bubble:

是的,这很有意思。也许将 Agent 进入市场这件事变现的最好方式,是那些使用 Agent 的公司,也就是那些被 Agent 所替代工作的公司。我真的认为这可能行得通,就像保险公司一样,这是一种非常反直觉的看法。我们现在还没有哪家保险公司在大力宣传 AI Agent,但我认为那可能是最好的变现方式,对吧?我认为 Agent 将会变得就像互联网,或者就像云计算一样。如果你没有一个 Agent 化的使用场景,你根本就不在这个游戏里,你知道吗,每个人都会拥有它,对吧?

所以也许这个论点是,那些正在非常积极地采用 AI 的人,也就是大型科技公司,他们同时也是提供 AI 服务的人。

Logan Jastremski:

是的,这说得通。那么从长远来看,你提到了 Weka,这也超级有意思。我深入研究过他们,他们在并行化闪存以提高吞吐量方面做了很多很酷的事情,我觉得这很棒。但是,在内存方面,你主要对提高吞吐量感兴趣吗?你是否也对 CXL 或其他技术感兴趣?

Mr. Bubble:

是的。在解码端,当然,提高吞吐量意味着提高内存带宽,对吧?所以任何能提高内存带宽的方式都极其有趣。现在剩下的方法已经很少了,人们甚至在争论只保留最低限度的内存带宽。但是,我一直喜欢 CXL 的原因是,它允许内存被添加进来,或者挂载在外面,看起来就像你普通电脑上的内存一样,对吧? 至少从编程模型来看,它对程序员是透明隐藏的。这有什么用呢?嗯,正如我们一直在暗示的,你可以把东西卸载到内存里,比如 VLLM 就把上下文卸载到 RAM 里,对吧?如果我们能构建一种直连的方式来做到这一点,就能增加集群的价值,对吧?所以我真正想说的,或多或少是:同样的硬件,加上新类型的内存,再写出更好的代码,你就能从你的硬件中获得更多价值。 至少是同样的加速器。

Logan Jastremski:

一个有趣的问题,也许是个有点大胆的想法,我很好奇你对此的看法。大多数人谈论光子学都是从规模扩展的角度来说的。你是如何从计算层面来思考光子学的?因为当你能够在给定通道内并行化矩阵乘法时,这会变得非常有趣。

Mr. Bubble:

是的,我觉得我应该写一篇文章,在白板上给大家推导一下这个数学。但如果你看看我们正在运行的AI模型,它们有多大,甚至隐藏维度有多大,矩阵有多大。光子矩阵乘法的运作方式基本上是在模拟域中进行的,对吧?你是在让光束跨越距离传播。你可能需要一个足球场那么大的空间,才能得到等效的矩阵尺寸,在所谓的"光子学"中进行乘法运算,到那时就变成自由空间光学了。所以,光子计算,我看好它吗?并不太看好。在数据中心这一侧,它也许可以作为某种物联网或嵌入式设备使用。比如,如果Waymo的激光雷达系统开始对传入的传感器信息进行一些计算,我不会感到惊讶,但这会非常困难。我对光子计算并不太看好。我不认为这只是有点异想天开,我不想说得更负面,但确实如此。 我觉得有些人在那里卖空头支票,对吧?让我们看看需要多长时间才能实现吧。

Logan Jastremski:

我觉得我们已经很好地涵盖了数据中心从0到1的广泛内容,包括预填充、解码、训练等方面。你个人对什么感到兴奋?你在大方向上一直判断得很准确,但你说有些问题已经解决了。现在是否只是把这些扩展到更多客户,让更多人能够广泛使用AI?还是说仍然存在一些让你感到兴奋的未解决的工程问题?

Mr. Bubble:

我觉得作为一名工程师,最让我感兴趣的一直是内存。这也是为什么我一直喜欢 HBM,尽管到目前为止我对它有些挑剔。我是说,它是对已有技术的一种很好的应用,对吧?我认为我们将会看到内存领域更多的创新,我对此非常期待。 我认为人们正在意识到,当你在进行推理时,如果你事先了解将要执行的操作或需要的数据,你就可以组织你的内存来加以利用。所以 Jalapeno 出现在 Hot Chips 大会上,这是 OpenAI 的芯片。他们谈到了内存局部性,我们通常把内存看作一个大型存储库,一次性全部获取。但这些实际的内存芯片有不同的通道,它们在物理上距离计算部分有一定距离。看起来距离不远,我们说的可能只是几毫米,但这仍然很重要。他们意识到并展示的是,保持某些内存组,让计算引擎能够获取靠近它的或在空间上接近的数据,能带来更好的性能。 所以我认为,让内存更靠近计算需要它的地方这个想法,在未来会变得越来越重要。 我认为人们正在谈论将内存集成在计算之上的3D技术。在这些情况下,这将极为重要,因为你不再只有一条宽大的总线来回传输数据。你会有一堆非常细小的线路,每次只能传输几个字节。所以你必须在空间上组织这些线路。所以字面上来说,知道芯片中各个部分的物理位置是一个巨大的优势。 我认为这可能会在不依赖更好的 HBM 的情况下,在吞吐量和功耗方面带来更多的提升。

Logan Jastremski:

我有点好奇,这更多是关于局部性的问题,还是更多关于吞吐量或延迟的问题?

Mr. Bubble:

嗯,两者都可能有,对吧?我是说,更好的局部性意味着更低的延迟,对吧?但如果你有更多的内存通道,你就能获得更多的带宽。 所以也许你只需要在那个特定芯片或那组或那个可寻址内存块中拥有恰好满足需求的带宽,这就够了。但延迟会低很多,对吧?是的。所以我认为,每个人都在谈论,我自己也谈论这个,我做过一段时间的芯片设计,每个人都在谈论内存带宽和延迟。我认为有一件事人们没有谈到,就是你什么时候需要这个访问时间。 你知道,如果我知道GPU要执行的操作需要10毫秒,而我只在第11毫秒才需要这个数据。那么它需要那么多带宽或那么低的延迟吗?不需要。你只需要知道什么时候需要获取它,对吧? 所以控制好这一点会很有趣。这与局部性有关。我认为这里有很多有趣的东西。我会说,如果有人想了解我认为内存的未来是什么,那就是 3D DRAM,对吧?

第七章:AI对齐

Mr. Bubble:

有点像,那家公司叫什么来着?他们最近在 Hot Chips 上展示了一种将 DRAM 封装在逻辑芯片上方的技术。我们等会儿再查一下。

Logan Jastremski:

Hot Chips 怎么样?D matrix。

Mr. Bubble:

D matrix。就是 D matrix。就是那家公司。Hot Chips 办得很好。我是说,我搬到帕洛阿尔托的一个重要原因就是,去年我来参加 Hot Chips,我当时心想,我是个纽约人,那边没人懂芯片,也没人在乎,这当然没什么问题,人们关心别的事情。但我来到这里,感觉到处都是传奇人物,大家说着同一种语言,互相交流想法。感觉就像置身于启蒙时代伦敦的咖啡馆里,每个人都在探讨:我们怎么才能让这些芯片变得更好? 但今年人满为患,里面挤满了各种各样的金融圈人士,不全是,但有很多来自对冲基金之类机构的人,我觉得这非常有意思。去年更多的是高频交易公司的人,他们其实也需要了解这些芯片的工作原理,对吧?他们当时就在那儿,心想,哦,我也得跟这些芯片打交道。我觉得看到金融圈的人向演讲者提问,挺有意思的,也挺好笑的。但不管怎样,我认为 3D DRAM 会非常厉害。我希望能看到更多人在这方面探索新的方案,因为这是我们获得更高带宽、更低延迟的一种途径。不过芯片的设计难度会稍微大一些。

Logan Jastremski:

有意思。你还提到了功耗。我觉得 Jensen 一直在反复强调这样一个观点:如果你只有一个 1 吉瓦的数据中心,那你的上限就是 1 吉瓦。所以更好的办法是提升不同层面的能效。你有没有深入研究过功耗或者能耗这个方向?

Mr. Bubble:

在一定程度上有。我觉得可以大致估算出每瓦的 token 产出,也就是每千瓦或每兆瓦能处理多少 token,随便你怎么算。我觉得,Jensen 说得对,我们在功耗方面确实有一些可以做的事情,可以降低功耗,但这可能会牺牲 token 吞吐量,或者你能服务的用户数量。所以你真的需要从经济角度去理解这件事,站在那些真正在卖 token 的人的角度,也就是那些大型实验室。他们非常在意能服务更多用户,在意更高的批处理量,这是关键词。他们希望批处理量尽可能高,这样就能用同一套硬件服务更多用户。是这样的,批处理量越高,产出的 token 就越多,每瓦产出的 token 也越多。那么,花大力气去做各种复杂的操作来降低这些芯片的功耗,到底值不值?我觉得,也许值,也许不值。这是一个很大的平衡问题。在功耗方面,我认为降低这些数据中心的功耗难度其实很大,是一个巨大的挑战。你可能更应该去找便宜、更清洁的电力来源。 有道理吗?总体来说是这样,我还想补充一点:数据中心最大的成本根本不是电费,而是硬件成本。 所以如果你想创办一家新的云服务公司,电费算什么?无关紧要。土地成本是多少?GPU 要花多少钱?哦天哪,你最好有充足的融资才行,对吧?

Logan Jastremski:

所以你认为最值得关注的事情仍然是内存,尤其是考虑到,模型权重的总体大小可能不再持续增长,但上下文长度普遍在增加。而且即便这些今天保持不变,你也需要更多内存来支持更多并发用户。

Mr. Bubble:

是的,没错。我们最终会给这些服务器增加更多内存。归根结底,问题在于用什么类型的内存?是 HBM?是 DRAM?还是闪存?我猜更多会是闪存。大家都在讨论如何降低对 HBM 用量的需求。因为说实话,归根结底,权重应该放在 HBM 里。如果我们并不是同时用到所有的上下文,为什么要在那里存放大量的上下文呢?对吧?

Logan Jastremski:

有道理。有意思。好的。我觉得从大方向来说,我的问题基本上都问完了,除非你还有什么有趣的事情,或者什么让你感到兴奋的事情想聊聊。

Mr. Bubble:

我想聊聊"追赶前沿"这个话题。说真的,我很想知道这到底是怎么回事。我的意思是……

Logan Jastremski:

说得好。

Mr. Bubble:

我非常好奇这到底是什么意思,因为这个概念根本就没有被明确定义过。我一直在越来越多地思考这件事。我是说,我们听说他们解决了那些千禧年难题,花了1500万美元才赚了100万,好吧,但那个问题可能本身也没那么有价值,对吧?我是说,就像Stokes方程,我们,世界会因此一夜之间改变吗?如果我们解决了它,我觉得可能只是在CFD(计算流体动力学)模拟里节省了一些计算资源。但数学和理论领域里确实有很多真正有价值的问题,对吧。我想到像 Terrence Tao,他的很多研究都在与EE(电气工程)领域相邻的方向,比如信号处理、估算,还有稀疏信号的重建。他的数学研究奠定了现在手机运作方式的基础,比如LTE和蜂窝通信,对吧?因为他的数学研究,我们使用了更少的带宽。那么这样的数学问题到底有多大价值?它可能价值数十亿。

所以我很好奇,"追赶前沿"到底有多少是垂直整合、去攻克有价值的问题,又有多少是真正出于安全考虑? 说实话,我不太相信所谓的安全问题。我们谈过电力的问题,我是说,我们可以直接断电。我觉得安全方面更大的问题在于,这些实验室可能要承担法律责任,对吧?如果他们的AI对某人的电脑做了什么非常糟糕的事情,那就是起诉的理由。说到底,我觉得我们国家有法律框架,可以用正确的方式来规范这件事。我们可以签一份合同,说好了,你要承担责任,你签了这份合同,如果这个AI agent失控了,那是你的责任。我不知道。我不太相信那种"终结者"式的场景,说这些agent会直接接管互联网、把一切都搞垮,光是因为维持这些GPU运行的成本就已经很高了。所以这看起来就是一种对资源的糟糕利用,对吧?我同意。

我一直在想这件事。我在看空和看多之间来回摇摆,但是。我觉得,我从来没有……好,这里有个非常大胆的观点。我一直在用AI,但我从来都不是那种会说"哦,AI太厉害了,太疯狂了,我们都得跟上"的人。在我看来,AI适合帮我做那些脏活累活、那些繁琐的事务性工作。但真正的思考,很遗憾,还是得靠我自己。 我从来没有感觉到它已经能替代这一点了。如果你去问那些初中生或者高中生,他们其实也没用那么多AI,因为他们能用来干什么呢?他们能做什么?无非是写个关于George Washington之类的小作文。

第八章:AI实验室的未来

Mr. Bubble:

这没什么太大用处。所以我一直在想的一件事就是,你知道,AI应该,真正强大的AI和高算力资源,应该用于重要的问题,以及那些真正能够解决这些重要问题的人。这一直是看多的理由,对吧?我们想想,如果一台GPU或者配备GPU的服务器,有可能发现一种药物,哪怕只是提高了10%的概率,那这台服务器的价值应该是多少?而那种药物价值数十亿美元,或者一种新材料,你知道,可能帮我们节省大量能源。

从AI的角度来看,这对我来说一直是最重要的事情。这也是为什么,到目前为止,我其实并不太在意那些。我是说,写代码很酷,做网站很酷,那些垃圾内容就是垃圾,但是,让我们做真正有价值的工作吧。所以我不知道,"放缓前沿"这件事,到底有多少是在做决策——认为所有这些算力资源和这些疯狂的模型,应该更好地用于解决真正重要的问题——又有多少只是,你知道,监管俘获的问题。

Logan Jastremski:

我同意。我觉得大部分都是SCOP的问题。我是说,我不在湾区,所以我不像那边的人那样被各种群体思维所影响,但对我来说,我同意。我不认为这些模型……我从一个朋友那里听到这个说法,我不同意他的观点,他说这些模型现在几乎相当于iPhone,只是在边际上有所改进,不会有太大进步。但是……

Mr. Bubble:

iPhone是最好的例子,因为我们所有人都对iPhone上瘾了。我们出门都离不开它。对,它现在正在成为我们工作中不可或缺的东西。所以——

Logan Jastremski:

我确实认为它最终会达到那个水平。但就像你说的,你可以问它问题,它显然会给你还不错的答案,但它还没有到可以替代你,或者说你今天就能完全依赖它的程度,就是那种,你知道,它给出的答案明显更好的感觉。你还是得去核实它,你得检查它的上下文里有什么,它在预填充时引入了什么,它引用了哪些不同的来源。对我来说,就像你说的,它更多地是在做那些基础性的重复劳动,比如,好,你能帮我回复邮件吗?对我来说,就是你加入越来越多的上下文,它确实变得越来越有趣、越来越有用。但现在,这些模型总体上还是有"失忆症"的。它们足够聪明,但还没有聪明到能一步到位解决所有问题的程度。所以我不认为我们已经到了拥有超级智能的阶段。因此,在很大程度上,我确实认为这主要是SCOP的问题,他们想要放缓,也许他们只是想在内部使用这些模型来继续推进研究。

Mr. Bubble:

这听起来是个很好的做法,因为如果我有一定量的算力资源,运行这些东西要花很多钱。那它可以用来服务更多用户,我向他们收费,不知道,每月20美元之类的。或者它可以用来,你知道,发现一种新材料,或者解决信号处理领域中一个非常重要的问题,诸如此类。所以我并不反对这件事本身,我反对的是它的呈现方式。

我真的非常希望,人们能把AI用于这些有价值的、你知道的,重大发现上,因为我们在人力方面受到了太多的瓶颈制约,对吧?人类有大量的好直觉,我们能想出各种各样解决问题的思路。但归根结底,你还是得付出实际的工作才能真正解决它,你知道,去验证它。所以那里有太多可以做的事情,但我认为如果我们不谈"放缓前沿"这个话题,那就是我们的失职,对吧?

Logan Jastremski:

我同意。你对开源与闭源的看法是什么?因为大家普遍认为开源模型相对落后。但看起来,如果说有什么的话,它们其实非常接近了。当然,很难判断闭源实验室是否在把他们最新的模型藏得越来越久,但从硬件角度,或者说投资角度来看,这些模型似乎都无法在普通硬件上运行,除非你跑的是那些非常老旧、不那么智能的模型,除非他们在特定任务上做了大量强化学习。

Mr. Bubble:

你说得对。我的意思是,运行这些模型确实需要一定的技术积累,这是个挑战。这也是为什么专门帮人运行开源模型已经成为一门大生意,对吧?开源对我来说一直都是在商品化编程。现在 GPT-6 在视频游戏、图形处理这类事情上已经相当不错了。所以我相信那些也会被商品化。但前沿领域一直是关于突破极限的,对吧?而我们在电脑上能做的事情,到目前为止已经差不多做完了。你知道,我们能写代码、能发邮件、能用 Excel 工作,但我们需要跳出电脑的范畴。我们需要改变现实的底层结构,也就是发现新事物,去解决比网页应用、iPhone 应用更重要的问题。我是说,如果你能从那些东西里获得价值,那当然也挺好的。但我认为现在有一种可能,我们会迎来递归式自我改进。AI 是在递归地让自己变得更好吗?更可能的是 AI 在让我们变得更好——AI 发现新事物,自动化我们大量的工作,让我们更快、更高效,对吧?所以我认为这才是前沿应该坚守的方向。我之所以提这个,是因为如果追赶前沿意味着服务更少的用户,去攻克这些高价值的问题,这真的会从根本上改变商业模式,并且影响到下游的一切。这可能是好事,也可能是坏事,但我们现在还不知道。我认为,Navier-Stokes 问题的潜在突破并不一定说明 AI 在所有其他问题领域都会同样有效,对吧?这说得通。而且据说那个突破也是来自某个人的人类直觉,对吧?所以,是的……

Logan Jastremski:

所以我听到的是,前沿应该继续推进。可以问一个更直接的问题吗——如果你有机会以当前的估值投资这些实验室,姑且说是一万亿美元,你认为这比投资一个 neo cloud——也就是那种可能只是专门服务开源模型的公司——更有意思吗?

Mr. Bubble:

我非常相信直接拥有硬件层,或者说拥有铁路,拥有那些构成基础的东西,对吧?所以你是想投资 Anthropic 和 OpenAI——这两家会竞争到两败俱伤,最终随着人员跳槽流动,他们的超额收益会逐渐扩散消失——还是你想拥有那些有着十年、二十年积累和护城河、专注于开发这一切所需的核心硬件的公司?甚至包括,你非常擅长运营数据中心。我是说,有一个论点是,如果你拥有大量 GPU,并且非常擅长保持高可用性,那你就是一家非常有价值的公司

第九章:结语与价值下一步将流向何处

Mr. Bubble:

我确信大多数投资者不会这样思考,他们只会,你知道的,无脑追捧这些东西,这也可能是他们应该做的。但归根结底,我用过一个非常好的经验法则来判断一家公司是否具有强大的价值主张——如果这家公司消失六个月,所有人会有多惨? 比如我想到 TSMC,那会很糟糕,对吧?Nvidia,也会很糟糕,甚至像 Sandisk,嗯,我们可能可以从京瓷那边搞到替代品,对吧?有些地方你可以争辩说人们愿意在产品之间切换,对吧?最好的公司就是那种让你永远没有理由离开的公司,对吧?那些才是真正的好公司。所以如果一家 AI 实验室开始做到这一点,那将会非常有意思,对吧?但我觉得他们还没聪明到那个程度,你知道吗?不过我们拭目以待。我觉得,是的,我很期待这些 IPO。我的意思是,它们会成为很好的做空对象,我想。我很确定这会是很好的投资组合 beta 对冲工具。所以我非常兴奋。能有一个新的金融工具用于对冲,感觉很好。

Logan Jastremski:

所以继续做多硬件。我觉得这不是,

Mr. Bubble:

这可能才是真正的创新。

Logan Jastremski:

是的,对冲,新增千兆瓦的数量。我是说,能不能获得能源供应当然还有待观察。但是,我的意思是,对我来说。回到"引领前沿"这个说法,它之所以看起来像是一场闹剧,是因为他们不可能对正在建设中的那些数据中心按下暂停键。

Mr. Bubble:

对我们来说是"引领前沿",但对他们自己来说可不是。

Logan Jastremski:

是的,他们自己不会放慢速度。如果说有什么变化的话,他们一直在谈论想要引入更多千兆瓦,用于训练和推理。所以,光是建设数据中心本身就已经是多年期的承诺了。所以如果他们是真的认真对待这件事,我觉得他们应该会取消那些资本支出。但他们没有。这不会发生的。

Mr. Bubble:

是的,我倾向于非常看涨。我是说,我们现在有利率问题和伊朗局势,但是。我不知道。我的意思是,我有一种感觉,你知道,我们用 AI 发现几种新药,把合适的研究人员聚集在一起,或者我们找到一种方法让 5G 不需要在一平方英里内建一千座基站。是的,是的,是的,随便什么,只要是更高效的东西。是的,我是说。我们将会迎来一次快速起飞。 我是说,光靠五到十种新药就能为所有的资本支出提供合理依据。我是这么认为的。

Logan Jastremski:

非常对。好的,Mr. Bubble,非常感谢你来参加节目。非常有趣。感谢你陪我聊天,并分享了你的独家见解。

Mr. Bubble:

当然。谢谢你,Logan。感谢你邀请我。

相关学习资料