夜雨聆风学习资料网

ARTICLE · 1102193

大模型塞进笔记本电脑,内存只装9.9GB

大模型塞进笔记本电脑,内存只装9.9GB

大模型塞进笔记本电脑,内存只装9.9GB

GitHub 上有个叫 Colibrì(意大利语「蜂鸟」)的开源项目,把 744B 的 GLM 塞进了普通电脑:约 370GB 的权重住固态硬盘,内存只常驻 9.9GB,9 月底 star 已超 3.8 万。

原理是笔 MoE 的算术账:每出一个字,744B 里只有约 40B 被点名干活。必带部分量化后 9.9GB 常驻内存,19456 个路由专家约 370GB 全住硬盘,路由器点到谁,谁才被调进内存。作者的类比是「权重的 JIT」。

速度分三档,别被「跑通」两个字骗了:
25GB 内存开发机,冷缓存 0.05-0.1 tok/s,一分钟 3-6 个字,能跑但极慢;
128GB 纯 CPU 桌面约 1.8 tok/s,算可用;
6 张 RTX 5090 全常驻 5.8-6.8 tok/s,这才叫流畅。

底线在 README 里:专家放哪里只决定速度,不改模型行为,不偷偷少算、不改路由、不降精度。

想试的门槛不高:16GB 内存起步(推荐 24GB),一块 NVMe 固态,三平台有预编译版,程序几百 KB,权重约 370GB 自己下。敲 coli chat 直接聊;coli web 能看 19456 个专家哪个被点亮、住在哪层。

带走的判断:MoE 时代,跑大模型的门槛正从显存挪到硬盘加耐心,「装不下」变成了「放哪里」。

我押半年内:321B 的 GLM-5.3-Flash 能在无独显、16GB 内存的机器上跑过每秒 1 个 token。你觉得能成吗?评论区押注。
关注我,盯这条路线的下一跳。

作者提示: 个人观点,仅供参考
安徽,19分钟前,

相关学习资料