乐于分享
好东西不私藏

把多台旧电脑拼成AI超级计算机,这个开源项目做到了.

把多台旧电脑拼成AI超级计算机,这个开源项目做到了.

上周我写了一篇文章,讲一个叫 colibrì 的纯 C 引擎,能让一台只有 25GB 内存的家用电脑跑起 7440 亿参数的大模型。文章发出来后,后台涌进来的留言里问得最多的一个问题是:如果我想跑更大的怎么办?一台电脑不够,能不能把几台电脑拼起来用?

答案来了。而且它来得比我预期快得多。

它叫 Mesh LLM,一个开源项目,核心功能一句话就能说清楚:把你手头多台电脑的 GPU 和内存池化,拼成一台虚拟的 AI 超级计算机,对外暴露一个跟 OpenAI 兼容的 API。

两台破电脑,拼起来顶一台好电脑。三台旧笔记本,拼起来跑得动一个中型模型。这个逻辑,正在从一个"想想而已"的愿景变成代码现实。

Mesh LLM 的技术底座是一个叫 iroh 的网络库。这个东西最核心的能力是点对点连接,不需要中央服务器。在你的几台电脑之间,它们自己就能发现对方、建立连接、分配任务。没有中心节点,没有单点故障,不需要租一台云服务器当调度器。

这意味着什么?意味着它的部署门槛几乎为零。你不需要搭建复杂的基础设施,只要在每台电脑上装一个约 18MB 的软件包,启动服务,它就在 localhost:9337 上给你一个 OpenAI 兼容的 API 端口。所有你之前用过的、兼容 OpenAI API 的工具和应用,现在都可以直接接上你自己的"分布式 AI 集群"来用了。

18MB,一个 API 端口,几台旧电脑。就这么简单。

它的任务调度也很聪明,有三种模式。

第一种是本地优先。如果请求的模型已经在某台电脑的 GPU 上加载好了,就直接在那台电脑上执行。这是最高效的模式,不需要网络传输模型。

第二种是路由分发。如果本地没有已经加载好模型的节点,它会自动找到集群里最适合的那一台,把请求路由过去,让那台电脑的 GPU 来跑。你只管发请求,它自己搞定调度。

第三种是最厉害的模式,内部代号叫"Skippy"。它能把一个大模型按层切成几段,分到不同的电脑上,用流水线的方式同时跑。比如模型的第 1 到第 10 层在电脑 A 上跑,第 11 到第 20 层在电脑 B 上跑,第 21 到第 30 层在电脑 C 上跑。数据像流水一样一层层流转过去。这样哪怕每台电脑的单卡显存都装不下完整模型,三台的显存加起来就够了。

它内置了超过 40 个模型的配置,从 5 亿参数的小模型到 2350 亿参数的 MoE 巨模型,全都能支持。也就是说,你不用自己折腾模型配置,装上就能跑。

而且 iroh 这个底层网络库本身的设计哲学也很符合分布式系统的理想:去中心化、端到端加密、天然穿透 NAT。这意味着你的几台电脑不需要在同一个局域网里,也不需要一个公网 IP。你在家里的台式机能跟公司在另一栋楼的笔记本直接通信,数据全程加密,不需要经过任何第三方服务器。这种"去中介"的设计,既是技术上的优雅,也是隐私上的刚需。你不需要信任任何云服务商,因为根本没有中间人。

把 Mesh LLM 和 colibrì 放在一起看,你会发现一个特别有意思的趋势正在成形:AI 算力正在从"集中式"向"分布式"转移,而且都是开源项目在推动。

colibrì 解决的是"一台电脑怎么跑大模型"的问题,用流式加载和量化把单机的潜力压榨到极致。Mesh LLM 解决的是"多台电脑怎么拼成一台"的问题,用点对点网络和模型切分把闲散算力聚沙成塔。两个项目一个往下钻,一个往外扩,共同的底层逻辑是一样的:让 AI 算力不再是少数人的特权。

以前你想要跑大模型,要么花大价钱租云 GPU,要么只能望洋兴叹。现在你有两条新路:一条是用更聪明的软件把单机榨干,另一条是用更聪明的网络把多台机器拼起来。两条路都是开源的,都不要钱,门槛都在肉眼可见地降低。

这让我想起一个比喻。互联网刚起来的时候,很多人觉得"做网站"是一件要大公司才能干的事。后来有了开源框架、有了云主机、有了各种免费工具,一个人也能搭出一个服务千万人的网站。AI 算力现在正在经历同样的事情。当下看起来高不可攀的门槛,正在被一个个开源项目敲成碎片。

如果把 colibrì 和 Mesh LLM 的出现放在更大的历史背景里看,你会发现 AI 的算力民主化正在经历类似"个人电脑革命"的进程。当年 IBM 的大型机只有大企业和政府机构才用得起,是苹果和微软把计算带到了每个人的桌上。现在,云端的万卡集群就是当年的"大型机",而 colibrì 和 Mesh LLM 这些开源项目,正在扮演那个"把算力带到每个人桌上"的角色。虽然它们现在还粗糙、还慢、还不够好用,但它们打开的那扇门,一旦开了就再也关不上了。

技术发展的真正力量,不是让强者更强,而是让"做不到"变成"能做到"。Mesh LLM 做的,就是把"我买不起 GPU"变成了"我找几台旧电脑也能凑一凑"。这比任何跑分榜上的数字,都更接近技术进步该有的样子。

而且 Mesh LLM 这样的项目还有一个容易被忽略的好处:它让算力变得"抗脆弱"了。集中式的云服务,一旦某个机房出问题,所有人都受影响。但分布式的算力网络没有单点,一台电脑下线了,集群自动把任务切到其他节点。这种容错性在商业场景里价值极大,但它不是靠巨额投资买来的,而是靠一个聪明的架构设计"长"出来的。

还有一个场景值得想:教育和公益领域。很多学校、乡镇、非营利组织的电脑配置都不高,单独跑 AI 模型根本跑不动。但如果能把一个机房里的几十台教学电脑用 Mesh LLM 串起来,它们就有了一个共享的 AI 推理能力。一台电脑不够用,三十台可能就够用了。对于资源有限的场景来说,这比等云厂商降价或等硬件升级要现实得多。

这才是开源项目最动人的地方。它解决的不是"最有钱的人怎么用 AI",而是"钱不多的人怎么也能用上 AI"。前者的答案永远是买更多卡,后者的答案需要用创意和共享来换。