
不是 "Ollama 跑 Llama" 那种入门操作。这 8 个是真能替代 Copilot 的本地 AI 工具链——自托管代码补全、IDE 插件接本地模型、消费级显卡跑 70B、CPU 也能跑的轻量方案。每一个都附了真香时刻和踩坑记录。
开头说一句
用 ChatGPT 写代码,一个月 20 美元。用 Claude API,一个月烧几十到几百美元。用 Copilot,一个月 10 美元。这些钱不多,但真正的问题不是钱——是你的代码被传到别人服务器上了。
很多公司已经禁用 ChatGPT 写代码了。三星、亚马逊、苹果都出过事。你在对话框里贴的那段核心业务逻辑,可能变成了别人的训练数据。
于是我开始折腾本地部署。折腾了两个月,踩了无数坑,最后留下 8 个真正好用的开源项目。从模型推理引擎到 IDE 插件,从代码补全到 RAG 问答,一套组合拳打下来,体验已经接近 Copilot 的 70%,但零 API 费、零数据外泄。
下面 8 个我都装了、跑了、用在了真实工作里。每个三段:工具是干嘛的、为什么被低估、真香时刻(含踩坑)。
1. Ollama · 一行命令装模型 🟢
工具是干嘛的:本地大模型的"包管理器"。ollama run deepseek-coder 一行命令,自动下载模型、配置推理、启动服务。你不用管 GGUF 格式、不用管量化参数、不用管显存分配。
为什么被低估:大家都以为它只是"跑 Llama 聊天"的玩具。但它的真正价值是当后端——Continue.dev、Open WebUI、PrivateGPT 全都能接 Ollama。它就是你本地 AI 工具链的地基。
真香时刻:我现在的配置是 Ollama 跑 DeepSeek-Coder 6.7B 做代码补全 + Llama 3 8B 做问答。两个模型同时驻留显存,16G 显卡够用。踩坑:默认端口 11434 不带认证,局域网内谁都能调。生产环境务必加反向代理 + 鉴权。
2. Tabby · 自托管的 Copilot 替代品 🟢
工具是干嘛的:自托管的 AI 代码补全服务。你把它部署在服务器上,团队所有人连过来,体验跟 Copilot 一样——行内补全、函数补全、聊天问答。支持 CodeGeeX、StarCoder、DeepSeek 等模型。
为什么被低估:README 写得像个企业产品,个人开发者一看"self-hosted"就以为要配 Kubernetes。其实 docker run 一行就能跑。而且它的 IDE 插件支持 VSCode 和 JetBrains,装上就能用。
真香时刻:团队 5 个人共用一个 Tabby 实例,跑在一张 4090 上。每个人打开 IDE 都有补全,不用各自买 Copilot。一个月省 50 美元。踩坑:模型选错了性能差很多。我们试过 StarCoder(快但蠢)、CodeGeeX(好但慢),最后定 DeepSeek-Coder,速度和质量的平衡点。
3. Continue.dev · IDE 里的本地 AI 助手 🟢
工具是干嘛的:VSCode 和 JetBrains 的 AI 编程插件。最大特点:不绑定模型。你可以接 OpenAI、接 Anthropic、接 Ollama 本地模型、接任何 OpenAI 兼容的 API。代码补全用小模型、聊天用大模型,分开配。
为什么被低估:名字太普通("Continue"),搜 "vscode ai" 出来一堆,它排在第三页。而且它同时支持云端和本地,很多人以为"又是 Copilot 套壳"就滑走了。但你花 10 分钟看它的 config,会发现它比 Copilot 灵活 10 倍。
真香时刻:我的配置是代码补全走 Ollama 本地 DeepSeek-Coder(零延迟),聊天问答走 Claude API(质量高)。平时写代码 90% 用本地模型,只有复杂问题才调云端。一个月 API 费从 80 美元降到 12 美元。踩坑:本地补全的延迟取决于模型大小,6B 模型延迟约 200ms,可以接受;14B 就卡了。
4. llama.cpp · 消费级显卡跑大模型的秘密 🟢
工具是干嘛的:C++ 写的 LLM 推理引擎。它的杀手锏是量化推理——把 70B 模型从 140GB 压到 40GB,塞进一张 4090。还支持 CPU 推理,虽然慢但能跑。
为什么被低估:Ollama 底层就是用的它,所以大家觉得"我用 Ollama 就行了,为啥要直接用 llama.cpp"。但 Ollama 封装了一层,有些高级参数(KV cache 量化、Flash Attention、多 GPU 分片)只有 llama.cpp 能调。
真香时刻:用 llama.cpp 跑 DeepSeek-Coder 33B,4-bit 量化,一张 4090 22GB 显存刚好。补全质量比 6B 高了一个档次,延迟只多了 100ms。关键参数:-ngl 99 -c 4096 --flash-attn。踩坑:编译时没开 CUDA,变成纯 CPU 跑,慢到怀疑人生。务必 cmake -DGGML_CUDA=ON。
5. DeepSeek-Coder · 开源代码模型的王者 🟢
工具是干嘛的:DeepSeek 开源的代码生成模型,从 1.3B 到 33B 全覆盖。HumanEval 得分超过 GPT-3.5,接近 GPT-4。支持 87 种编程语言,中文理解能力比 StarCoder 强。
为什么被低估:DeepSeek 这个名字在国内 AI 圈太响了(做量化基金那个),很多人以为它的模型只适合金融场景。而且 "Coder" 后缀让它看起来只是个补全工具——其实它的指令跟随能力很强,做代码问答也行。
真香时刻:6.7B 版本是甜点模型——12GB 显存跑得动,补全质量吊打 CodeGeeX。我拿它跟 GPT-3.5 做 blind test,同事分不出来哪个是 AI。踩坑:33B 版本虽然强,但推理延迟 500ms+,做行内补全太卡。大模型适合做聊天问答,小模型做补全。
6. Open WebUI · 给本地模型套个 ChatGPT 界面 🟡
工具是干嘛的:ChatGPT 的开源替代品。你接上 Ollama,它给你一个一模一样的聊天界面——多轮对话、代码高亮、文件上传、知识库。还能管理多个模型,一键切换。
为什么被低估:长得太像 ChatGPT 了,大家以为"不就是套了个壳"。但它真正强的功能是多用户管理——你部署一个实例,团队所有人用各自的账号登录,聊天记录隔离,管理员能看用量统计。
真香时刻:公司不让用 ChatGPT,我部署了一个 Open WebUI + Ollama,内网访问。全公司 30 个人共用,体验跟 ChatGPT 几乎一样,IT 部门也不管(因为数据没出去)。踩坑:第一次部署用 SQLite,30 个人同时用就卡了。换成 PostgreSQL 后流畅。
7. PrivateGPT · 把代码库喂给本地 AI 🟡
工具是干嘛的:本地 RAG 工具。你把整个代码仓库、文档、PDF 扔给它,它建索引,然后你可以问"这个项目的鉴权逻辑在哪""这个函数被哪些地方调用"。全部在本地跑,数据不出去。
为什么被低估:RAG 这个概念被吹烂了,大家看到 "PrivateGPT" 以为又是一个文档问答玩具。但它的代码场景特别能打——因为代码的结构化程度高,RAG 的准确率比问文档高得多。
真香时刻:接手了一个 10 万行的老项目,文档为零。把源码喂给 PrivateGPT,问"用户注销时 session 怎么清理的",它直接定位到 3 个文件 + 相关函数。比自己 grep + 阅读快 5 倍。踩坑:索引构建慢,10 万行代码首次建索引要 20 分钟。后续增量更新快。
8. GPT4All · CPU 也能跑的本地 AI 🟡
工具是干嘛的:CPU 推理的本地 AI 助手。不需要显卡,不需要 NPU,普通笔记本就能跑 7B 模型。还内置了 RAG、代码补全、聊天功能,一个软件全搞定。
为什么被低估:被当成"没有显卡的穷人的选择"。但它的使用场景其实很广——出差用笔记本、公司电脑没显卡、想在 Chromebook 上写代码。而且它有桌面版 GUI,不用敲命令,对非技术用户友好。
真香时刻:出差一周没带显卡,在酒店用 Surface Pro 7 跑 GPT4All + 7B 模型。补全延迟 800ms,虽然慢但能用。在飞机上没网也能写代码。踩坑:CPU 推理发热严重,风扇狂转,续航只剩 2 小时。建议配一个散热底座。
一张表帮你选
一句话总结:这 8 个不是平行替代关系,而是一条工具链。Ollama 是地基,llama.cpp 是引擎,DeepSeek-Coder 是大脑,Continue.dev 是界面,Tabby 是团队版,Open WebUI 是聊天版,PrivateGPT 是知识库,GPT4All 是轻量版。按需组合,不用全装。
真正的教训
1. 本地 AI 的核心瓶颈不是模型,是显存。DeepSeek-Coder 33B 比 6.7B 强很多,但 33B 要 22GB 显存,6.7B 只要 12GB。大多数人的显卡跑不了 33B。所以选模型的逻辑是:先看你有几张卡、多少显存,再倒推能跑多大模型。别反过来。
2. 补全用小模型,问答用大模型,这是本地 AI 的最优解。Copilot 之所以体验好,是因为它背后是 GPT-4 级别的大模型。但本地跑不了那么大。解法是分层:行内补全用 6B(低延迟),复杂问答调云端 API(高质量)。Continue.dev 天然支持这种混合配置。别执着于纯本地,混合才是现实最优。
3. "数据不出门"这件事的价值远超 API 费。省下的 20 美元/月不是重点。重点是你可以把真正的核心代码贴给 AI 看——鉴权逻辑、支付流程、数据库结构——不用担心泄露。这个自由度是云端 AI 给不了的。一旦你体验过"把整个支付模块喂给 AI review"的爽感,就回不去了。
夜雨聆风