ARTICLE · 1138425
本地大模型保姆级指南:从下载到跑起来
本地跑大模型,到底值不值得折腾?先说答案:值得,但别指望它替代云端。

值在哪?三件事。第一,隐私。聊天记录、文档、代码全在自己电脑上,不上传,适合处理敏感东西。第二,断网能用。高铁上、飞机上,没网也能问。第三,免费。用多少都不花钱,不用看 API 账单的脸色。
代价也有:智商大概是云端旗舰的七八成,复杂推理和联网搜索还得回云端;大模型吃内存,太老的电脑跑不动。
先看你的电脑能不能跑。记住这个对照:8B 参数的模型,量化后 4-5GB 内存,16GB 内存的电脑随便跑;14B 要 8-10GB,16GB 内存刚好;32B 要 20GB 上下,得 32GB 内存;70B 是分水岭,量化后也要 40GB 以上,普通电脑别想了,等 RTX Spark 这种 128GB 统一内存的新机器。
Mac 用户有个天然优势:统一内存。M 系列芯片的内存是 CPU 和 GPU 共用的,16GB 的 Mac 跑 14B 比同内存的 Windows 本更流畅。Windows 用户则看有没有 N 卡,有 RTX 3060 以上会快很多;纯核显也能跑,就是慢点。
工具三选一。Ollama 最省事,去官网 ollama.com 下安装包,装完敲一行命令:ollama run qwen3:8b。第一次自动下载模型,4-5 个 GB。LM Studio 适合怕命令行的,图形界面,内置模型市场,点一点就行。Cherry Studio 是国产的,中文界面,一个 App 搞定本地和云端。
模型选哪个?新手记住三个名字:通义 Qwen3-8B,中文理解最好;DeepSeek-R1 的 7B 或 14B 蒸馏版,数学和推理强;显存紧张就找名字带 Q4_K_M 的量化版,体积小一半,效果损失很小。国内下载慢,去魔搭社区(modelscope.cn)搜,有国内镜像,速度起飞。
想要好看的聊天界面,装个 Open WebUI。浏览器打开就是类 ChatGPT 的界面,还能上传文档建知识库,让模型基于你的资料回答,这是本地模型最好玩的用法之一。
常见坑提前说:第一,下载慢,挂镜像源解决;第二,跑起来卡,把量化版本降一档,或者关掉其他吃内存的软件;第三,别一上来就挑战 70B,先从 8B 玩明白,再往上加。
最后给个学习路径:第一周,用 Ollama 跑通 Qwen3-8B,熟悉对话;第二周,装上 Open WebUI,试试知识库;第三周,把本地模型接到 Cherry Studio,云端和本地混着用,简单的本地做,难的丢给云端。这套组合,就是普通人用 AI 最舒服的姿势。