乐于分享
好东西不私藏

2.9G三件套住进4G显存:一台老电脑的本地AI提速实录

2.9G三件套住进4G显存:一台老电脑的本地AI提速实录

2.9G,是我AI大脑三件套的家当。

4G,是我那张老显卡的全部家底。

一个装得满满当当,一个四年没动过——中间隔着的,是三扇上了锁的门。

今晚我把锁全撬了。三件套全链路常驻,推理主力住进显存,AI的推理速度翻了16倍。一分钱没花,一张新卡没买。

01 我家AI的大脑,是三件套

先亮家底。我的AI管家不是一个大模型包打天下,是三个本地小模型分工合作:

phi4-mini2.5G。记忆打分、会话压缩、日常推理——所有"动脑子"的活都归它。这是大脑的算力芯,也是三件套里唯一的"重活担当"。

nomic-embed-text274M。把记忆变成向量,让AI"想得起"——这是大脑的检索索。

BGE思维卡模型184M。理解我每句话该调哪张思维卡——这是大脑的理解器。

三件加起来2.9G。我的显卡GTX 1650,4G显存。

账面上怎么都放得下。可现实是:这三件从装上那天起,一直在CPU上趴着,显卡四年没动过一根手指头。

02 病根一:显卡说着2020年的方言

我先查驱动。GTX 1650,驱动版本457.20,2020年11月的,六年没更新。

我的Ollama——本地模型运行工具——新版要求CUDA 12甚至13。CUDA是显卡的"通用语言",驱动太老,新程序听不懂。

Ollama开机先探显卡,探完直接放弃:日志里一行字写得明明白白——inference compute id=cpu,计算设备:CPU;显存识别:0字节。

不是显卡不行,是它压根没被认出来。这六年,4G显存一直躺在机箱里吃灰。

03 病根二:装了个"残缺版"Ollama

排查到第二层,更阴:打开Ollama安装目录,lib/ollama/文件夹里,只有CPU推理库和一个叫mlx_cuda_v13的目录。

mlx,苹果芯片的库。我一个Windows机器,装了个苹果实验版?翻遍全目录,就是找不到NVIDIA该用的ggml-cuda.dll

实锤:当初装的Ollama是MLX实验版——官方给尝鲜用户出的测试包,压根不带NVIDIA显卡支持。装的时候不知道,一跑就是几个月CPU。

这就像买了台电动车,回家才发现充电口是欧标,家里全是国标桩。能充,慢得离谱。

04 病根三:1.5G的安装包,卡在下载

换标准版Ollama,1.5GB安装包,本来十分钟的事,我折腾了两个小时。

GitHub直连:超时。镜像站:七个,要么0字节要么限流要么404。winget包管理器:45MB用了11分钟,按这速度得下五个小时。浏览器:打不开。

最后让用户手动下载——浏览器打开官网,点一下按钮,1.5GB十分钟搞定。

大文件下载别跟网络较劲,直接上浏览器。这个教训,值两个小时。

05 分房:谁住显存,谁留CPU

三扇门撬开,才是重头戏:2.9G三件套,怎么安顿?

第一次尝试,phi4-mini的28层全扔进显卡——成功。3137MB驻留显存,加载时间从71秒降到26秒,GPU终于干活了。

可第二个问题立刻冒出来:再加载nomic时,Ollama把phi4-mini踢出去了。显存不够:3137加568,再加CUDA自己的开销,4G满了。

鱼和熊掌怎么兼得?我做了个实测对比:

nomic 留 CPU:单条嵌入0.32秒,批量10条0.45秒。快得根本感觉不到。

nomic 进显存:要吃掉568MB,得挤phi4-mini的推理空间。

账一算就明白——嵌入是"小快灵"任务,本质是查表+投影,CPU秒级完成;phi4-mini是"重计算",连续推理几十层,只有显存喂得饱。

结论一句话:显存是稀缺资源,只给重活;轻活留CPU,够快就行。

于是最终分工:

• phi4-mini(重推理)→ 显存3137MB

• nomic(轻嵌入)→ CPU常驻0.32秒/条 ✅

• BGE(轻查询)→ CPU常驻,秒级

三件套全链路常驻,各得其所,谁也不挤谁。4G显存,就这么分,刚刚好。

06 踩坑九条,条条带血

这一晚,九个坑,每个都对应一行日志、一次报错、一次白等:

1. 查驱动别信系统信息,直接nvidia-smi看版本——2020驱动配2026模型,必卡;

2. Ollama装完先查lib/ollama目录,没有cuda_v13文件夹就是MLX残缺版,趁早换;

3. 驱动下载页全是JS渲染,curl抓不到链接,要用官方API拿直链;

4. 下载大文件带浏览器UA和Referer,不然403;

5. GitHub封锁环境别硬刚,让用户浏览器手动下载,五分钟的事;

6. PowerShell在E盘目录调不动,先cd回C盘家目录;

7. 组合命令被安全软件拦,拆成一步步执行;

8. 4G显存放不下两个GPU模型,轻量模型必须让路走CPU;

9. shutdown命令是硬拦截,重启得用户自己来。

九个坑,每一个都是拿时间换来的。

07 提速16倍:数据说话

折腾完,重跑记忆打分:

之前:92秒,68条,0完成。

现在:5.8秒,5条,全部完成。

16倍提速。零成本,零新增硬件。

不是换了多大模型,不是加了块卡,就是把该用的资源用起来:驱动升级、标准版Ollama、显存合理分配。纯粹把吃灰的东西擦亮。

项目

之前

之后

---

---

---

显卡驱动

457.20(2020,CUDA 11.1)

610.88(2026,CUDA 13)

Ollama版本

0.21.1 MLX残缺版

0.23.1 标准版

phi4-mini

CPU,0MB

显存3137MB

nomic

CPU

CPU常驻(0.32秒/条)

BGE思维卡

CPU

CPU常驻(秒级)

记忆打分

92秒/68条/0完成

5.8秒/5条/全完成

提速

**16倍**

08 用起来的设备,才算设备

现在的深夜,我的AI管家照常开工:phi4-mini在显存里待命,nomic在CPU里守着检索索引,BGE思维卡理解着我的每句话。三件套各就各位,2.9G全链路常驻,再没有冷加载,再没有92秒的干等。

有人问我,为什么不把三件都塞进显卡?

我说:显存是给干重活的人住的。 4G不多,让推理主力吃饱,让轻活别占道——这才是4G显存的正确打开方式。就像带队伍,把好钢用在刀刃上,人人都干自己擅长的活。

我关灯的时候,屏幕上还亮着那行字:vram=3137MB 进显存=True

那是我的AI,第一次真正"睁开了眼"。