数据不敢往外传:六步把模型装进办公电脑

资料不敢往外发?
数据不敢往外传:
六步把模型装进办公电脑
Ollama 本机部署 · 六步跑通 · 断网可用
③ AI商业新生代
📦 3 Parts + Conclusion
👉 滑动
PART 01
硬件门槛
动手前:先看你的电脑
PART 02
安装
第一步:装 Olla
PART 03
选型
第二步:挑一个体量合
01
PART
动手前:先看你的电脑够不够格
STANDARD · 上手教程
这是最容易踩空的一步。很多人直接装完发现卡成幻灯片,然后得出「本地不行」的结论,其实只是模型选大了。
判断标准就一条:看内存,不是看硬盘。模型运行时要整个加载进内存(有独立显卡的话是加载进显存),内存不够就会疯狂读写硬盘,速度直接掉到不可用。
一份粗略的对照:
8GB 内存:能跑 3B 级别的小模型。适合翻译、改写、简单问答,别指望它写长文或做复杂推理。
16GB 内存:能跑 7B 到 8B 级别。这是性价比最高的档位,日常办公需求基本都能接住,也是大多数人的机器配置。
32GB 内存及以上:能跑 14B 甚至 32B。质量明显上一个台阶,接近在线中端模型的水平。
有独立显卡:显存 8GB 以上会快很多,速度可能是纯 CPU 的五到十倍。没有也能跑,只是要多等几秒。
苹果 M 系列芯片的机器是个惊喜,内存和显存共用,16GB 的 MacBook 跑 7B 模型体验相当顺。
先记下自己机器的内存数,第二步选型要用。如果是公司发的老笔记本,8GB 内存加机械硬盘,那还是老实用在线版吧,本地体验会让人劝退。

本机离线模型六步部署流程图,绿系节点箭头串联,从硬件自查到日常纪律
02
PART
第一步:装 Ollama
WRITING · 上手教程
Ollama 是目前最省事的本地模型运行工具。它把下载、加载、内存管理这些麻烦事全包了,你只需要打一行命令。
去官网 ollama.com 下载对应系统的安装包,Windows、macOS、Linux 都有。安装过程就是一路下一步,没有需要勾选的选项。
装完之后它不会弹出任何窗口,这是正常的——它是个后台服务。验证是否装成功,打开终端(Windows 是命令提示符或 PowerShell,macOS 是「终端」应用),输入:
```
ollama --version
```
回车后能看到版本号,就说明装好了。看到「不是内部或外部命令」这类提示,通常是需要重启一下电脑让环境变量生效。
这一步唯一要留意的是磁盘空间。Ollama 本身很小,但后面下载的模型文件动辄几个 GB,默认存在系统盘。C 盘紧张的话,可以设置环境变量 `OLLAMA_MODELS` 指向别的盘,比如 `D:\ollama-models`,改完重启服务。
03
PART
第二步:挑一个体量合适的模型
SEARCH · 上手教程
这是决定体验好坏的关键一步,比装软件重要得多。
模型名字后面的 B 是参数量,B 越大越聪明,也越吃内存。选型的唯一原则是:宁可小一号,也别卡。一个反应快的小模型,实用性远高于一个要等半分钟才吐第一个字的大模型。
按内存对照着选,几个中文表现不错的推荐:
16GB 内存的主力选择,在终端输入:
```
ollama run qwen3:8b
```
通义千问系列对中文的理解和输出都比较自然,8B 这一档是甜点位。第一次运行会自动下载,大约 5GB,看网速可能要等十几分钟。
8GB 内存的轻量选择:
```
ollama run qwen3:4b
```
体量减半,日常翻译改写够用。
32GB 以上想要更好质量:
```
ollama run qwen3:14b
```
如果主要写代码,可以换成专门的代码模型:
```
ollama run qwen2.5-coder:7b
```
下载完会自动进入对话模式,光标停在那儿等你输入。这时候可以先随便问一句试试手感。想退出对话,输入 `/bye` 回车。

本机模型选型对照矩阵,横轴内存档位纵轴任务类型,绿系色块标注推荐区间
04
PART
第三步:第一次对话,确认真的跑通了
OFFICE · 上手教程
别急着上生产任务,先做两个验证。
验证一:速度能不能忍。 让它写一段一百来字的东西,观察出字速度。理想状态是像有人在快速打字,一秒能出好几个字。如果是一个字一个字往外蹦,说明模型对你的机器来说太大了,退回上一步换小一号。
验证二:真的断网可用。 这是本地部署的全部意义所在。把 Wi-Fi 关掉、网线拔掉,再问它一个问题。如果照常回答,恭喜,这台机器上的 AI 已经彻底属于你了。
顺便说一个很多人不知道的细节:Ollama 在模型闲置几分钟后会自动把它从内存里卸载,释放资源。下次提问时会重新加载,所以第一句话会慢几秒,之后就顺了。这不是故障。
05
PART
第四步:换个图形界面,别一直用命令行
VIDEO · 上手教程
终端里对话能用,但没法保存记录、不能翻历史、复制粘贴也别扭。装个图形客户端,体验立刻从「极客玩具」变成「日常工具」。
最省事的是 Chatbox,去官网下载安装,打开后在设置里把模型提供方选成 Ollama,地址填默认的 `http://localhost:11434`,它会自动扫出你已经下载的模型。界面和常见的在线对话产品几乎一样,有会话列表、有历史记录、支持 Markdown 渲染。
想要更完整的功能可以装 Open WebUI,它更接近一个完整的工作台,支持多用户、文档上传、提示词库,代价是需要用 Docker 部署,稍微麻烦一点。个人使用 Chatbox 完全够。
配好之后建议做一件事:在客户端里建几个固定角色。比如一个「中英互译,只输出译文不要解释」,一个「把口语记录整理成条理清晰的纪要」,一个「代码审阅,指出问题并给修改建议」。以后直接切角色用,不用每次重复交代要求。
06
PART
第五步:把自己的资料喂给它
COMPARISON · 上手教程
到这一步,本地模型才真正拉开和在线版的差距——你可以放心把敏感文档丢进去。
最轻的做法是直接在对话里贴。Chatbox 支持上传文件,把一份合同、一份报告拖进去,然后问「这份文件的付款条件是什么」。因为整个过程在本机,贴什么都不用犹豫。注意小模型的上下文窗口有限,几十页的长文档可能塞不下,可以先拆成章节分别问。
想要长期可查的知识库,用 Open WebUI 的文档功能,把一批文件建成一个集合,提问时它会自动检索相关片段再回答。适合放产品手册、内部规章、历史项目文档这类会反复查的资料。
这里有个务实的建议:别指望本地模型替代搜索。它不联网,不知道昨天发生了什么,训练数据也停在某个时间点。它的强项是处理你给它的材料,不是回答开放性事实问题。分清这两件事,用起来就不会失望。
07
PART
第六步:给日常使用定三条纪律
CHOICE · 上手教程
工具装好只是开始,用法不对照样浪费时间。
第一条:分流,不是替代。 涉密的、内部的、不方便外传的走本地;需要联网查证的、要求高质量长文的、复杂推理的走在线。两边各干各的活,别较劲。判断标准很简单——这段内容如果泄露出去你会不会紧张,会就走本地。
第二条:小模型要给足上下文。 在线大模型能猜你的意图,本地小模型不能。同样一句「帮我改改」,在线版可能改得不错,本地版大概率跑偏。要明确说清楚改成什么风格、给谁看、多长、有什么禁忌。指令越具体,小模型表现越接近大模型。
第三条:定期清理和更新。 模型文件占空间,试用过觉得不好的记得删掉,命令是 `ollama rm 模型名`。用 `ollama list` 可以看当前装了哪些。开源模型迭代很快,每隔一两个月去看看有没有新版本,重新 `ollama run` 一下就会更新。
08
PART
什么情况下别折腾本地
DROPPED · 上手教程
说点反面的,免得白花时间。
机器太老的别折腾。 8GB 以下内存、五年以上的老机器,跑起来的体验会差到你根本不想用第二次。这种情况老老实实用在线版,注意脱敏就好。
只做公开内容创作的别折腾。 写公众号、做方案、查资料,这些内容本来就要公开,没有保密压力,在线大模型的质量优势很明显,没必要给自己降级。
需要最新信息的别折腾。 本地模型是个知识截止在过去某一天的封闭系统,问它今年的政策、这个月的行情,它要么不知道要么胡编。
本地部署的价值场景其实很清晰:手里有不能外传的材料,且需要反复处理它们。法务看合同、HR 处理简历、财务读报表、研发审代码——这些人装一个,收益立竿见影。其他人可以先观望。
09
PART
收尾
ROLE · 上手教程
整套流程压缩成一张便签:查内存 → 装 Ollama → 按内存选模型 → 断网验证 → 配 Chatbox → 喂本地资料 → 守三条纪律。
顺利的话,从下载到跑通不超过半小时,其中大半时间在等模型下载。真正需要动脑的只有第二步选型,而选型的原则就一句话:宁可小一号,也别卡。
装完记得做那个断网测试。看着网络图标上的叉,它还在一行行往外吐字,那种「这东西真的是我的」的踏实感,是在线服务给不了的。
合集 · 上手教程
上一篇
下一篇
本文关键词 · 进入相关话题
关注 AI商业新生代
普通人用得上的 AI 商业玩法
如果您觉得文章不错,欢迎举手之劳点赞、在看。
您的支持,是我持续更新的动力。
也欢迎把本号设为星标,后续不错过我的每篇文章。

扫码关注 AI商业新生代

夜雨聆风