用 AI 是不是总在充钱?ChatGPT、Claude 的订阅费一年动辄上千; 公司数据敏感,是不是不敢把文档往云端 API 里传? 出差在飞机上、身处内网环境,是不是一断网 AI 就"失联"?
这些问题,其实有一个统一的解法——本地部署大模型。
用 Ollama 或 LM Studio 在你的电脑上把开源模型跑起来,再接入 Cherry Studio 或 WorkBuddy 使用:完全免费、数据不出本机、断网也能用。
今天这篇保姆级教程,从零开始带你搭完全流程,四个工具一次讲透。
一、四大主角登场:它们分别是什么?
1. Ollama —— 命令行派的"模型管家"
官网:ollama.com | 开源免费 | 跨平台
一句话介绍:用一条命令,就能跑起开源大模型的利器。
安装即用, ollama run llama3.2一键下载并运行模型;内置 OpenAI 兼容 API(默认端口 11434),任何能调 OpenAI 接口的程序都能直接对接,这也是它能被各种应用"接走"的关键; 支持 Llama、Qwen(千问)、DeepSeek、Mistral、Gemma 等主流开源模型,还能自建私有模型库; Windows / macOS / Linux 全覆盖; 纯命令行操作,资源占用极低,适合喜欢终端、追求极简的玩家。 

2. LM Studio —— 图形界面派的"模型收藏馆"
官网:lmstudio.ai | 免费 | 跨平台
一句话介绍:连代码都不用写一行,人人能上手的可视化本地大模型客户端。
全图形化操作:下载模型、加载运行、调参数,全靠鼠标; 内置模型浏览器,可直接从 Hugging Face 搜索下载 GGUF 格式模型; 可视化调节上下文长度、GPU 层数、量化等级等参数; 同样提供 OpenAI 兼容 API(默认端口 1234); 对 Apple Silicon(M 系列芯片)优化极佳,MLX 后端效率很高; 还能加载嵌入模型(Embedding),为知识库应用提供支持。

3. Cherry Studio —— 你的"AI 万能客户端"
官网:cherryai.com.cn | 开源免费 | 桌面端
一句话介绍:一个应用,装下所有 AI——云端的、本地的都行。
聚合主流云厂商模型:OpenAI、Claude、Gemini、DeepSeek、Kimi、MiniMax 等,一个界面全搞定; 原生支持 Ollama、LM Studio 本地模型服务,本地与云端一键切换; 内置知识库(RAG):上传文档,让 AI 基于你的资料做问答; 支持 MCP(模型上下文协议)、智能体、技能、联网搜索、全局记忆等进阶能力; 多会话、多频道管理,聊天体验接近商业客户端。
4. WorkBuddy —— 你的"AI 编程搭档"
官网:codebuddy.cn | 腾讯出品 | 桌面端
一句话介绍:既能聊天,更能干活——写代码、跑自动化任务的 AI 智能体工作台。
内置主流大模型(DeepSeek、GLM、Kimi、MiniMax、混元等),多模型随时切换; 支持配置第三方 OpenAI 兼容模型——包括本地跑的 Ollama 和 LM Studio; 不只是问答:改代码、修 Bug、执行多步自动化任务(Agent 模式); 支持技能(Skills)扩展与多模态输入,能处理图片; 模型配置(含 API Key)仅保存在本地,不上传云端。 
简单说:Ollama / LM Studio 是"发动机",Cherry Studio / WorkBuddy 是"整车"。发动机你选一个装,整车随你用。
二、搭建前准备
一台电脑(Windows / macOS / Linux 均可); 硬盘预留 10~30GB(模型文件较大); 内存建议 16GB 以上(8GB 也能跑小模型,稍慢而已)。
三、第一步:装"发动机"
方案 A:装 Ollama
打开 ollama.com,下载对应系统的安装包,双击安装; 打开终端(Windows 是 CMD 或 PowerShell),下载并运行模型(以千问 7B 为例):
ollama pull qwen2.5:7b # 只下载模型ollama run qwen2.5:7b # 下载并直接进入对话验证:浏览器访问 http://localhost:11434/,看到 "Ollama is running" 即成功。
小知识:Ollama 安装后默认就开启了 OpenAI 兼容接口(
http://localhost:11434/v1),无需任何额外配置。
方案 B:装 LM Studio
打开 lmstudio.ai,下载安装; 打开左侧「模型」页,搜索并下载一个模型(如 Qwen2.5-7B-Instruct 的 GGUF 版本); 点击模型卡片上的 Load,把它加载进内存; 打开「Server」标签页,点击 Start Server,看到状态变绿即启动成功(默认端口 1234)。
提示:Ollama 和 LM Studio 可以同时安装、互不冲突(监听端口不同)。你可以两个都试试,看哪个顺手。
四、第二步:接入 Cherry Studio(聊天 + 知识库方向)
打开 Cherry Studio,进入左下角「设置」→「模型服务」; 点击「添加提供商」,在列表中选择 Ollama 或 LM Studio; 填写连接参数(API Key 留空即可,本地推理无需鉴权):
添加模型: Ollama:点击「+ 添加」,手动输入模型名(如 qwen2.5:7b);LM Studio:先确认模型已 Load 进内存,再点击「获取模型列表」,自动拉取; 回到聊天界面,顶部模型下拉框选择刚配置的本地模型,开聊! 
到这里,你已经拥有一个完全离线、免费、数据不出本机的 AI 聊天助手。还能用 Cherry Studio 的知识库功能上传文档,让 AI 基于你的私有资料问答。
五、第三步:接入 WorkBuddy(编程 + 智能体方向)
打开 WorkBuddy,进入「设置」→「模型」→「添加模型」; 本地模型有两种接法:
方式一:Ollama 接入(官方预设,推荐)
接入方式选择 Ollama; 地址填 http://localhost:11434;模型名填 ollama list中看到的名称(如qwen2.5:7b);保存即可。

方式二:LM Studio 接入(自定义 / Custom)
接入方式选择 自定义 / Custom; URL 填 http://localhost:1234/v1;API Key 填任意字符(本地不校验); 模型名填 LM Studio 中已加载的模型名(如 qwen2.5-7b-instruct);保存即可。
在模型选择器中切到本地模型,就能让 WorkBuddy 用本地模型写代码、跑任务了。
小知识:为什么 WorkBuddy 能接上本地模型?因为 Ollama 和 LM Studio 都实现了 OpenAI 兼容的
/v1/chat/completions接口,所以任何支持"自定义 OpenAI 兼容模型"的应用都能直接对接,这套玩法也适用于其他支持自定义模型的工具。
六、模型怎么选?照着配置抄
中文场景优先考虑 Qwen系列和 DeepSeek 系列,中英双语能力都很能打,对于编码来说我更青睐GLM。
七、常见问题
Q1:连不上本地模型? 先确认 Ollama / LM Studio 正在运行;再用浏览器访问对应端口看能否返回内容;最后检查防火墙是否拦截了本地端口。
Q2:回复特别慢? 模型对配置要求高。换更小的模型,或在 LM Studio 中降低量化等级(如 Q8 → Q4)。
Q3:本地模型和云端模型能混用吗? 完全可以。Cherry Studio 和 WorkBuddy 都支持多模型并存——敏感内容切本地,复杂任务切云端,各取所长。
Q4:数据安全吗? 本地部署最大的优势就是数据不出本机,所有对话都保存在你自己的电脑上。
写在最后
四个工具各司其职,拼起来就是一个完整的「私有 AI 工作台」:
Ollama / LM Studio —— 提供本地模型引擎; Cherry Studio —— 负责日常聊天与知识库问答; WorkBuddy —— 负责写代码与自动化任务。
从今天起,你的 AI 不必再按月付费,敏感数据也不必再交给云端。动手装起来吧!
如果这篇文章对你有帮助,欢迎点赞、在看、转发,也欢迎在评论区晒出你的本地 AI 配置。
注:本文涉及的工具均为免费开源或官方免费版本,配置步骤基于各官方文档整理(2026 年 7 月),界面细节以实际版本为准。
夜雨聆风