

这几天,全球AI开源社区被一条近乎“违背物理常识”的新闻刷屏了。
推特、GitHub和各大技术群里反复出现同一种说法:“有人在一台只有8GB内存的普通电脑上,把参数量高达2.78万亿的Kimi K3跑起来了!”
它绕开英伟达万卡集群、昂贵的H100显卡和庞大的深度学习框架,甚至连GPU都没用上。驱动这个2.78万亿参数庞然大物的,居然是一个仅有176KB、用纯C语言写成的推理引擎。
消息一出,全网直呼“这操作太野了”有人惊叹这是降维打击式的开源神作,也有人怀疑这根本就是一场哗众取宠的魔术戏法。
一个连放张高清照片都嫌卡顿的8GB老旧笔记本,到底是怎么吞下万亿级AI巨兽的?在这场技术狂欢的背后,又藏着怎样让人哭笑不得的现实账本?
拆解“神话”:为什么万亿模型不需要万亿内存?
要看懂这场热闹,咱们先来算一笔“常识账”。
在人工智能的世界里,“参数”就像是模型大脑里的脑细胞与神经突触。按照传统的计算方式,如果你想把一个2.78万亿参数的模型完整塞进电脑内存(以常用的16位半精度bfloat16计算,每个参数占2个字节),你至少需要准备:
2.78万亿 × 2 字节 ≈ 5.56 TB(即5560 GB)的超大内存!
个人电脑无力承担这样的配置,哪怕顶级企业服务器也得插满几十根高规格内存条。普通人家里8GB的小水杯,怎么可能装得下5500多升的“数字海啸”?
秘密藏在Kimi K3的模型架构里:它采用了MoE(Mixture of Experts,混合专家)架构。

▲ 开源项目README主页清晰标注了2.78T、8.24GB与0 GPU的核心指标
我们可以把这个模型想象成一所坐拥896位顶级学者的大型智囊团:
在过去,每次向AI提问,896位专家必须全员到场开会,内存自然瞬间挤爆; 在MoE架构下,模型配备了智能“门卫”(路由系统)。每次生成一个token时,门卫会挑出最合适的16位专家参与计算,剩下的880位专家根本不用起床。
于是,在任何一个瞬间,整个大模型里参与计算的参数约占3.7%(约1040亿激活参数)。
开发出这个C语言引擎的工程师Fareed Khan敏锐地抓住了这个特点:既然绝大部分专家平时都在摸鱼,那我为什么要把他们全请进昂贵的电脑内存里?让他们老老实实呆在固态硬盘(SSD)里待命不就行了?
四级内存账本:5.56TB是如何降到8.24GB的?
明白了这个原理,整个推理引擎的设计就变成了一场精密的“内存脱水手术”。在项目的技术文档里,作者摊开了一张逐级缩减的账本:

▲ 官方技术文档中的四级内存账本:从5560GB逐级降到8.24GB
- 全精度估算(5560GB)
如果全部参数按bfloat16常驻,内存需求约为5.56TB。这是后续比较的理论起点。 - 量化检查点(1560GB)
官方发布的Kimi K3权重采用MXFP4格式,硬盘上的检查点约为1.56TB。 - 专家留在硬盘(1560GB → 约113GB)
引擎将全书93层网络里的8.2万多个专家实例(总计1.447TB)全部留在硬盘上,绝不常驻内存。只有当某个词被激活时,才通过闪电般的读取命令把对应的专家临时调进内存,算完立刻交替。 - 主干按层流式读取(113GB → 8.24GB)
除了随叫随到的专家,模型还有负责注意力机制和路由的基础骨架(约109GB的“主干网络”)。作者写了一个脚本,把这109GB的主干重新切片打包。在8GB的极简预设下,电脑内存里只保留当前正在计算的那一层网络,像传送带一样边算边扔。
从理论估算上限逐级降下来,项目在Linux终端实测的峰值常驻内存(RSS)为8.24GB。
没有虚标,代码完全开源,任何人拉下仓库都可以按步骤复现。

▲ 社区开发者整理的完整编译与运行步骤
狂欢背后的“时间刺客”:半分钟吐一个token
看到这里,手里的旧笔记本似乎立刻就能化身算力中心,随时随地调用顶级AI。
然而,网络热帖往往只留下“8GB跑万亿大模型”,项目文档里两行关键数据很少被一并提到。

▲ 技术博主细读文档后发出的关键校正:别忘了26.5秒一个token的现实
这两行被遗忘的真相就是:吞吐量与硬盘开销。
首先,让我们看看它的生成速度:
在8GB内存的笔记本上,它的推理速度是 26.5 秒 / token。 这个单位表示生成一个token需要26.5秒。
再算一笔时间账:如果你让这个跑在8GB笔记本上的Kimi K3生成100个token,你需要坐在电脑前默默等待:
100 × 26.5秒 = 2650秒 ≈ 44分钟!
如果你想让它生成1000个token,这台发烫的笔记本得不休不眠地跑上七个多小时。

▲ 圈内大V在讨论中坦言:“它确实慢得极其夸张,但探索价值依然很酷”
海外推特上的技术老哥们算完这笔账后,评论区瞬间变成了大型段子现场:
“请问这个模型的速度单位是一周能出几个字?”“一分钟蹦两个词,想体验它百万token的上下文,我得从夏天一直聊到圣诞节!”
其次,是那张隐藏的硬件账单虽然你的内存只需要8GB,但为了存放那个被拆解的模型,你的固态硬盘必须腾出整整 1.7 TB 的高速存储空间(1.56TB原厂模型 + 109GB解构主干)。而且由于每走一步都要从硬盘强行抽调几个GB的数据,普通的机械硬盘或网盘挂载甚至根本跑不动,必须依赖高速NVMe固态硬盘。
“能在8GB内存上跑起来”是真的,但完整版的技术真相是:“它需要吞掉你近2TB的高速硬盘,并且每生成一个token,你都得泡半杯茶。”
一场纯粹极客的“重工业古典美学”
既然速度慢到了几乎无法日常使用,那这个项目难道只是一场毫无意义的学术玩具吗?
恰恰相反在今天这个充斥着浮躁营销与API套壳的AI圈子里,kimi-k3-in-c 展现出了一种久违的、令人肃然起敬的极客工程硬核美学。
翻开作者Fareed Khan的代码库,你会看到一幅极具冲击力的景象:
- 极致纯粹
:整个推理引擎仅由 7个纯C99标准文件 构成,编译出来的二进制执行文件只有区区 176 KB,甚至装不满一张三十年前的软盘。 - 告别黑盒
:它不依赖PyTorch、不依赖CUDA、不链接庞大的底层数学库,手写了safetensors权重解析,手写了底层矩阵运算,甚至连浮点数优化的编译开关都特意做了限制( -ffp-contract=off),只为了保证哪怕在最简陋的CPU上,算出来的数学结果也与官方大机房分毫不差、按位一致。
在过去,万亿大模型是高墙之内的神明,被锁在科技巨头耗资数十亿美元建立的超算中心里。普通人只能隔着网页输入框,按月付费调用那一行行冷冰冰的API。
而这项工程用几千行C代码,狠狠撕开了大模型的神秘黑盒:它像解剖一只精密机械表一样,把每一个齿轮、每一条弹簧、每一次内存寻址和硬盘读取完完整整地摊在阳光下。
它用最笨拙也最硬核的方式告诉全世界:大模型并没有通灵的魔法,它就是一堆可以通过数学公式和存储管道被精准调度的数字。只要逻辑走得通,一台破旧的单核CPU,也一样能推开通用人工智能的大门。
读懂下一条“小内存跑大模型”新闻
kimi-k3-in-c 的走红与后续校正,给关注科技浪潮的普通人上了一堂生动的科普课。
下次当你在朋友圈或社交网络上,再次刷到诸如“某神人把千亿/万亿大模型塞进手机/树莓派/旧电脑”的惊悚标题时,不妨在心里默念这套“防忽悠三件套”:
- 看参数结构
:它宣传的万亿是全员出动的“稠密参数”,还是九成都在摸鱼的“MoE混合专家”? - 看时间单位
:它标榜的速度,到底是每秒生成几十个token(tokens/s),还是生成一个token要几十秒(s/token)? - 看隐形成本
:内存虽然省下了,那硬盘吞吐、下载带宽、散热功耗和你的等待时间,又付出了多大的代价?
商业机房追求的是“天下武功唯快不破”的生产力,而开源黑客追求的是“千锤万凿出深山”的边界探索。
那个在8GB笔记本上、以26.5秒每token的速度缓慢闪烁的光标,或许成不了你工作时的生产力助手;但它所代表的那种拓展资源边界、追寻代码透明的极客精神,仍是开源世界里迷人的浪漫。

夜雨聆风