导语:那个让我半夜惊醒的账单
上周收到一封邮件,标题写着"Your API usage this month"。
点开之前,我还挺平静。
点开之后,我盯着那个三位数美元的账单,愣了整整十秒。

冷静下来想了想,我也没干什么大事——
就是白天写代码让 Claude 补全,晚上让它帮我看 Bug,
偶尔让它重构个函数。就这么点活儿,账单炸了。
我不是一个人。前阵子 HN 上有个帖子火了,
有人用 AI Agent 跑了一晚上,醒来一看 AWS 账单——6000 美金。
亚马逊、Uber、Coinbase 这些大厂,已经在内部搞"Token 预算管理"了,
给每个团队发配额,花超了得自己掏腰包(打工人的噩梦)。
我突然悟了:与其每天盯着 Token 用量心惊肉跳,
不如把模型搬到自己 Mac 上跑。
电费几块钱,账单永远是零。
今天就把我从零搭好的全过程整理出来。
照着做,一杯咖啡的功夫,你也能有个不收月租的 AI 编程搭子。
三条路:选哪个
本地跑大模型,主流就三条路。
我先帮你把坑都踩明白,省得你自己交学费。
Ollama:懒人之光
一句话:装上就能用,命令行一把梭。
brew install ollama
ollama run qwen2.5-coder:7b第一行装好,第二行直接开聊。
模型自动下载、自动量化、自动管显存,你啥都不用操心。
缺点是可调参数少,想深度魔改不太行。
但对 99% 想快速上手的人来说,这就够了。
LM Studio:图形党福音
如果你一见命令行就头疼,LM Studio 是你的菜。
它是个带图形界面的 App,像 App Store 一样
点一下就能搜模型、下模型、跑模型。
还能一键开个本地 API 服务,和现成工具无缝对接。
缺点是占资源比 Ollama 重一点,免费但闭源。
llama.cpp:硬核玩家专属
直接拿模型的原始权重,自己编译、自己调参数。
榨干每一滴性能,速度能比别人快一截。
代价是配置麻烦,编译环境、量化参数、内存管理全得自己搞。
适合喜欢折腾、追求极致的开发者。

我的建议:新手直接上 Ollama,别犹豫。
等你用熟了、觉得不够爽,再折腾另外两个也不迟。
下面所有步骤,都以 Ollama 为主。
模型怎么选:先看你的内存
这是最关键的一步——别贪大,你的 Mac 内存说了算。
跑模型的铁律:模型越大越聪明,但也越吃内存、越慢。
硬塞大模型进小内存,电脑会卡成 PPT,风扇响得像起飞。

按内存对号入座:

几个实操经验:
8GB 别硬上 14B。 我试过,一个补全要等五六秒,
还不如自己手打。老老实实用 7B,或者考虑加内存。
Qwen2.5-Coder 是目前本地编程模型的天花板之一。
阿里的开源货,编程能力在同级别里能打,中文也理解得好。
不确定就先下 7B 试水。 觉得不够再升级,模型随时能换。
手把手配置:从零到能用
第一步:装 Ollama
打开终端,一行命令:
brew install ollama没有 Homebrew 的同学,先去 [brew.sh](https://brew.sh) 装一下,
两分钟的事。装完验证:
ollama --version看到版本号,说明装好了。
第二步:下载模型
按你的内存选一个。我以 16GB 的 Mac 为例,下 7B:
ollama pull qwen2.5-coder:7b第一次下载要几分钟,文件大概 4-5GB。
下完之后,随时能离线用,不用再联网。
想换个大的?同理:
ollama pull qwen2.5-coder:14b
第三步:先在命令行里试两把
模型下好了,先直接跑跑看:
ollama run qwen2.5-coder:7b进入对话模式,随便问它:
>>> 用 Python 写一个快速排序它会当场给你写出来。能跑通,说明模型没问题。
退出按 `Ctrl + D`,或者输入 `/bye`。
第四步:让 Ollama 在后台服务
刚才那种是"前台聊天模式"。
要给编辑器用,得让它跑成后台服务:
ollama serve这会在本地 `localhost:11434` 起一个 API 服务。
开着的终端别关,或者设置开机自启。
macOS 用户如果用的 App 版 Ollama,双击图标就自动后台跑了,
不用手动 serve。
第五步:连上 VS Code
这是真正"AI 编程助手"体验的开始。
在 VS Code 插件市场搜 Continue,安装。
(喜欢 Cline 的同学原理一样,我拿 Continue 演示。)
装完按 `Cmd + Shift + P`,搜 "Continue: Open config",打开配置文件。
找到 `models` 部分,加上本地 Ollama:
{
"models": [
{
"title": "Qwen2.5 Coder (本地)",
"provider": "ollama",
"model": "qwen2.5-coder:7b",
"apiBase": "http://localhost:11434"
}
]
}保存。现在你的 VS Code 右下角,
就能切到本地的 Qwen 模型了。

打开任意代码文件,按 `Cmd + I` 唤出 Continue 对话框,
问它问题,让它改代码,全程不花一分钱 API 费。
想体验自动补全?在配置里加一条 `tabAutocompleteModel`:
"tabAutocompleteModel": {
"title": "Qwen2.5 Coder 自动补全",
"provider": "ollama",
"model": "qwen2.5-coder:7b"
}这样敲代码时,它会像 Copilot 一样在行内给你提示,
Tab 键采纳。区别是——这个 Copilot 永久免费。
实测:本地模型到底能打几分
光说不练假把式。我用同一批任务,
对比了本地 Qwen2.5-Coder:7B 和线上的 Claude。

任务一:写个简单函数
"用 Go 写一个读取 JSON 文件并解析成结构体的函数。"
两边都一次写对,代码质量差不多。
本地模型耗时约 8 秒,Claude 约 2 秒。本地慢,但能用。
任务二:定位一个 Bug
贴了一段报错的 TypeScript 代码让它分析。
本地模型准确定位了空值问题,给出了修复方案。
Claude 的解释更详细,会顺带讲原理。本地够用,Claude 更贴心。
任务三:重构一个大模块
"把这个 200 行的上帝类拆成三个职责单一的类。"
本地 7B 直接翻车——理解了意图,
但拆出来的代码有两类互相依赖搞不清,跑不起来。
Claude 一把过,还顺手补了测试。
结论很清楚:
- ✅ 代码补全、写小函数、解释报错 → 本地模型完全够用
- ⚠️ 中等复杂度的修改 → 本地能用,但要你多盯着点
- ❌ 大规模重构、复杂架构设计 → 还是得上 Claude / GPT

这不矛盾。我的用法是:
**日常补全和小活儿交给本地模型,免费无限用;
遇到硬骨头再切回线上模型,省着点花。**
两边配合,账单直接砍掉一大半。
💡 打工人的碎碎念
搭完这套东西,我算了笔账,心情很复杂。
之前一个月 API 费用大概 80 美金,折合人民币五百多。
现在本地跑了一个月,电费多了——查了下电表,大概多花了三块钱。
三块钱。一杯蜜雪冰城都买不起。

但我也得说实话,免得你期望太高。
本地 7B 模型,本质是个"勤快但脑子一般"的实习生。
让它补全代码、写小工具、解释报错,它任劳任怨,干得不错。
但你让它设计架构、做复杂重构、跨文件理解整个项目,
它就开始一本正经地胡说八道了。
这时候你会发现,Claude 那点 API 费,花得也不是没道理。
所以别把本地模型当成 Claude 的平替。
把它当成一个免费的日常搭子,干那些量大但简单的活儿。
真正费脑子的,还是留给线上大模型。
这套打法,说白了就是打工人的智慧——
能用免费的绝不花钱,该花钱的地方精打细算。
毕竟现在连公司都开始给 Token 设预算了,
咱自己兜里的钱,更得省着点造。
还有个意外收获:公司代码不外传。
以前用 API,敏感代码得小心翼翼地脱敏,
生怕哪个密钥泄露出去。现在全在本地跑,断了网也能写代码,
隐私这块直接拉满。
这大概是我被 AI 使唤以来,最舒坦的一段时间——
白天让本地模型帮我干杂活,不用心疼 Token;
晚上打开 Claude 搞点有难度的,偶尔请客的感觉。
从一个"为 AI 付月租的打工人",变成了"AI 模型的小房东"。

总结:一张图记住全流程
brew install ollama
↓
ollama pull 模型
↓
ollama serve
↓
VS Code 装 Continue
↓
配置指向 localhost:11434
↓
开干,零账单
五步走完,你的 Mac 就成了一个不收月租的 AI 编程工作站。
核心就三件事:
装 Ollama、按内存选模型、连上编辑器。
没别的玄学。
模型推荐再强调一遍,别贪大:
8GB 上 7B,16GB 上 7B 或 Lite,
32GB 才考虑 14B,64GB 以上随便造。

能力边界要认清:
本地模型擅长补全和小函数,
复杂重构还得靠线上大模型。
两边配合用,才是最聪明的省钱姿势。
📌 **相关链接**
- [Ollama 官网](https://ollama.com)
- [Continue 插件](https://continue.dev)
- [Qwen2.5-Coder 模型库](https://ollama.com/library/qwen2.5-coder)
- [HN 讨论:Local AI coding on Mac](https://news.ycombinator.com/item?id=48507020)
如果觉得有帮助,欢迎点赞转发!有什么想了解的 AI 话题,评论区告诉我 👇
夜雨聆风