乐于分享
好东西不私藏

本地部署AI大模型,不用联网也能用(附安装+使用教程)

本地部署AI大模型,不用联网也能用(附安装+使用教程)
点击上方蓝字关注 → 每天AI一下

完全免费 · 纯本地运行 · 支持4500+模型 · 一行命令部署 · 隐私不外传

📌 一句话讲清楚:Ollama是目前全球最流行的本地大模型运行工具。装上它,你的电脑就变成一台离线AI服务器——不需要联网、不花一分钱、聊天数据不外传,一行命令跑Llama、Qwen、DeepSeek等4500+开源模型。

很多人以为AI大模型一定要联网用、一定要付月费。其实不然。2026年开源模型的能力已经逼近甚至在某些任务上超越GPT-4,而Ollama让本地运行这些模型变得像装个QQ一样简单。

这篇从零教你上手Ollama:它是什么、怎么装、跑什么模型、能做什么、有什么坑,纯实操视角。

📋核心信息速览
详情
开发方
Ollama Inc.(美国,开源社区驱动)
定位
本地LLM运行与推理引擎,一键拉取运行开源大模型
当前版本
v0.30.11(2026年6月25日发布)
平台
Windows / macOS / Linux / Docker
支持模型
4,500+模型(Llama / Qwen / DeepSeek / Gemma / Kimi等)
硬件要求
极低:3B模型仅需2-3GB内存/显存;入门独显即可跑7B模型
费用
完全免费,没有任何付费墙
隐私
100%本地运行,数据绝不外传
API支持
支持OpenAI兼容API + RESTful API,可接入任意应用
GitHub
120k+ Stars,社区极其活跃
🔍Ollama到底是什么?

Ollama本质上是一个本地大模型"管家"。它帮你解决三个最头疼的问题:

① 模型下载与管理:以前跑开源模型你得找权重文件、配环境、调参数。Ollama一个命令就拉下来跑起来。

② GPU/CPU自动适配:不管你用NVIDIA、AMD还是Apple Silicon,它自动选最优引擎,不用手动配置CUDA。

③ API服务化:模型跑起来后自动提供OpenAI兼容API,任何支持ChatGPT API的软件都能无缝切换到本地模型。

用一个比喻说明白:

ChatGPT 像是在餐厅点菜——菜端上来你只管吃,但厨房怎么做你完全看不见。
Ollama + 开源模型 像是你家厨房——菜在自己家做,配方自己调,吃什么、怎么做、谁来吃,全部你说了算,还不用付餐费。

用Ollama和其他AI工具的对比一目了然:

对比
Ollama + 开源模型
ChatGPT/豆包等在线AI
费用
完全免费
每月100+元起
联网需求
离线可用
必须联网
隐私
数据不离开电脑
数据上云
次数限制
无限制
免费版有限制
模型选择
4500+模型任选
平台指定模型
自定义
完全可控
受平台限制
🔥2026年6月最新动态

Ollama在2026年6月一口气发布了10个版本(v0.30.2 → v0.30.11),以下是几个最值得关注的变化:

① Claude Code和opencode自动安装:首次运行 ollama launch claude 或 opencode 时自动拉取安装,不再需要手动配置开发环境。

② Apple Silicon MLX引擎大幅提速:推测解码统一调优后,Mac用户在长文本场景下速度提升明显。

③ 上下文溢出保护:单条消息超过上下文窗口时不再静默截断或卡死,而是给出明确错误提示。

④ Cohere2Moe混合专家架构支持:可以跑最新的MoE模型,更省内存更快。

⑤ API行为对齐:generate接口现在和chat模板完全对齐,开发者切换更顺滑。

一句话总结:Ollama现在不只是"跑模型的工具",它正变成一个完整的本地AI开发平台——从聊天到编程到Agent,全部能在本地完成。

📥安装Ollama(3-5分钟)

Windows安装最傻瓜:

 浏览器打开 ollama.com,点击 Download,选 Windows 版本下载安装包(约800MB)。

 双击安装,一路下一步。安装完右下角托盘会出现 Ollama 羊驼图标。

 打开终端(Win+R 输入 cmd 回车),输入验证命令:

ollama --version
  # 输出:ollama version 0.30.11

macOS安装也很简单:

brew install --cask ollama

装完自动后台运行,完全不用配置环境变量。3分钟搞定

⚠️ 安装常见问题:
① Win7不兼容:Ollama仅支持Win10及以上。
② 安装后ollama命令无效:关闭终端重开一扇,或重启电脑让PATH生效。
③ 启动报"port 11434 in use":有旧实例在跑,任务管理器结束ollama进程后重试。

🚀第一次使用:一行命令跑起你的第一个AI

装完别急着看文档。打开终端,输入这一行:

ollama run qwen3:8b

↑ 自动下载Qwen3 8B模型(约5GB),下完直接进入对话

终端会变成对话界面,输入问题按回车,模型秒回。这就是本地AI——不联网、不花钱、不限次数。

退出对话按 Ctrl+D 或输入 /bye

常用命令速查:

命令
作用
ollama pull 模型名
下载模型(不下直接run也会自动下载)
ollama run 模型名
进入交互式对话
ollama list
查看已下载的所有模型
ollama rm 模型名
删除模型释放空间
ollama show 模型名
查看模型详细信息(参数量/大小/架构)
ollama serve
启动后台API服务(默认端口11434)
🧠该跑什么模型?按场景推荐的10个最佳选择

这是最大的信息差。Ollama有4500+模型,新手最容易掉进的坑就是不知道该选哪个。以下是按场景实测推荐:

场景
推荐模型
RAM要求
拉取命令
入门体验
Llama 3.2 3B
~2-3GB
ollama run llama3.2:3b
中文最好
Qwen3 7B
~6.5GB
ollama run qwen3:7b
写代码
Qwen3.6 27B
~22GB显存
ollama run qwen3.6:27b
数学推理
DeepSeek-R1 7B
~6.5GB
ollama run deepseek-r1:7b
图片理解
Gemma 4 E4B
~6GB
ollama run gemma4:e4b
小机器最强
gpt-oss 20B
~16GB
ollama run gpt-oss:20b
多语言翻译
Mistral Small 3.1
~5GB
ollama run mistral-small:latest
CPU也能跑
Gemma 2 2B
~1.7GB
ollama run gemma2:2b
超长上下文
Llama 4 Scout
~55GB
ollama run llama4:scout
AI Agent
Gemma 4 E4B
~6GB
ollama run gemma4:e4b

💡 选择建议:
8GB内存电脑 → 跑3B模型(Llama 3.2 3B / Gemma 2 2B)
16GB内存 / 6-8GB显存 → 跑7B模型(Qwen3 7B / DeepSeek-R1 7B)
24GB显存 → 跑Qwen3.6 27B(消费级最强)
32GB+显存 → 跑任何你想要的模型

进阶玩法:让Ollama变成你的AI引擎

玩法一:自定义系统提示(Modelfile)

创建一个自定义AI角色,比如专写公众号爆款标题的助手:

# 创建Modelfile文件(内容如下)
  FROM qwen3:7b
  PARAMETER temperature 0.8
  SYSTEM "你是一个微信公众号爆款标题专家。每个标题20字以内,
  必须包含数字或情绪词,直接给5个选项,不要解释。"

  # 保存后创建自定义模型
  ollama create bxbt -f Modelfile

  # 使用
  ollama run bxbt "给我5个关于AI写作的标题"

玩法二:接入任意应用(OpenAI兼容API)

Ollama自带API服务(端口11434),完全兼容OpenAI格式。任何能用ChatGPT API的软件——Obsidian、VS Code、Chatbox等——都能切到本地模型。

# Python调用本地Ollama(OpenAI兼容格式)
  from openai import OpenAI

  client = OpenAI(
      base_url="http://localhost:11434/v1",
      api_key="ollama"  # 本地不需要真实key
  )

  response = client.chat.completions.create(
      model="qwen3:7b",  # 填你拉取的模型名
      messages=[{"role": "user", "content": "帮我写一段Python代码"}]
  )
  print(response.choices[0].message.content)

玩法三:图片理解(视觉模型)

Gemma 4 或 Llama 3.2 Vision 支持上传图片让AI分析。比如截图一段代码让它改bug,或传一张设计稿让它写CSS:

ollama run gemma4:e4b
  /image C:\Users\你\Desktop\截图.png
  请分析这张图片里有什么

玩法四:在Chatbox等聊天客户端中使用

不习惯终端界面?下载Chatbox、Open WebUI等客户端,选"Ollama"作为模型提供商,输入 http://localhost:11434,就能用ChatGPT一样的聊天界面使用本地模型。

💼6大实战场景:Ollama能干什么
场景
推荐模型
能做什么
公众号写作
qwen3:7b
写文案、改写润色、起标题、翻译外文素材
写代码Debug
qwen3.6:27b
找bug、优化代码、解释技术概念、生成脚本
数据分析
deepseek-r1:7b
分析Excel规律、推算业务指标、写SQL
学习助手
qwen3:7b
翻译文献、总结PDF、解释专业概念
内容总结
mistral-small
浓缩长文、提炼会议纪要、整理信息碎片
AI Agent
gemma4:e4b
工具调用、自动操作文件、读写数据库
⚠️5个新手必踩的坑
#
正确做法
1
不看硬件就跑大模型
用 ollama show 模型名 先查大小,8GB内存别碰7B以上
2
把本地模型当GPT-4用
7B级别的模型能力有限,复杂推理任务选DeepSeek-R1或大参数版本
3
下载完不清理旧版本
模型占空间很大,定期 ollama list + ollama rm 清理不用的
4
不设置温度就做创意任务
写作/起标题时在Modelfile设 temperature 0.8-1.0,代码/翻译设0.1-0.3
5
API暴露到公网
Ollama默认监听127.0.0.1,只改 OLLAMA_HOST 为0.0.0.0会导致任何人都能调用你的模型
Ollama快速上手指南

安装阶段

□ 去 ollama.com 下载安装包

□ 终端输入 ollama --version 验证安装

□ 确认电脑内存/显存容量(8GB → 3B模型 / 16GB → 7B模型 / 24GB → 27B模型)

使用阶段

□ 先跑 ollama run llama3.2:3b 测试能否正常工作

□ 按需求选择模型:中文选Qwen / 推理选DeepSeek / 代码选Qwen3.6

□ 学会 ollama list / ollama rm / ollama show 三个管理命令

□ 尝试 Modelfile 创建自定义角色(temperature / system prompt)

□ 下载Chatbox等客户端,接入 http://localhost:11434 提升体验

进阶阶段

□ 用OpenAI兼容API把本地模型接入VS Code / Obsidian / 自己的程序

□ 定期 ollama update 更新到最新版

□ 尝试视觉模型(gemma4:e4b / llama3.2-vision)实现图片理解

✍️ 小编总结:Ollama是2026年每个AI使用者都该装的一个工具。它就像在电脑里装了一个永远免费的本地ChatGPT——速度快、隐私好、不限次数、模型随便换。不管是写作、编程、学习还是接API做自动化,它都能成为你最可靠的AI基础设施。

从装好Ollama、拉一个模型、到开始用AI解决实际问题,整个流程不超过15分钟。剩下的就是不断尝试不同模型,找到最适合你场景的那一个。