完全免费 · 纯本地运行 · 支持4500+模型 · 一行命令部署 · 隐私不外传
📌 一句话讲清楚:Ollama是目前全球最流行的本地大模型运行工具。装上它,你的电脑就变成一台离线AI服务器——不需要联网、不花一分钱、聊天数据不外传,一行命令跑Llama、Qwen、DeepSeek等4500+开源模型。
很多人以为AI大模型一定要联网用、一定要付月费。其实不然。2026年开源模型的能力已经逼近甚至在某些任务上超越GPT-4,而Ollama让本地运行这些模型变得像装个QQ一样简单。
这篇从零教你上手Ollama:它是什么、怎么装、跑什么模型、能做什么、有什么坑,纯实操视角。
| 📋 | 核心信息速览 |
| 🔍 | Ollama到底是什么? |
Ollama本质上是一个本地大模型"管家"。它帮你解决三个最头疼的问题:
① 模型下载与管理:以前跑开源模型你得找权重文件、配环境、调参数。Ollama一个命令就拉下来跑起来。
② GPU/CPU自动适配:不管你用NVIDIA、AMD还是Apple Silicon,它自动选最优引擎,不用手动配置CUDA。
③ API服务化:模型跑起来后自动提供OpenAI兼容API,任何支持ChatGPT API的软件都能无缝切换到本地模型。
用一个比喻说明白:
ChatGPT 像是在餐厅点菜——菜端上来你只管吃,但厨房怎么做你完全看不见。
Ollama + 开源模型 像是你家厨房——菜在自己家做,配方自己调,吃什么、怎么做、谁来吃,全部你说了算,还不用付餐费。
用Ollama和其他AI工具的对比一目了然:
| 🔥 | 2026年6月最新动态 |
Ollama在2026年6月一口气发布了10个版本(v0.30.2 → v0.30.11),以下是几个最值得关注的变化:
① Claude Code和opencode自动安装:首次运行 ollama launch claude 或 opencode 时自动拉取安装,不再需要手动配置开发环境。
② Apple Silicon MLX引擎大幅提速:推测解码统一调优后,Mac用户在长文本场景下速度提升明显。
③ 上下文溢出保护:单条消息超过上下文窗口时不再静默截断或卡死,而是给出明确错误提示。
④ Cohere2Moe混合专家架构支持:可以跑最新的MoE模型,更省内存更快。
⑤ API行为对齐:generate接口现在和chat模板完全对齐,开发者切换更顺滑。
一句话总结:Ollama现在不只是"跑模型的工具",它正变成一个完整的本地AI开发平台——从聊天到编程到Agent,全部能在本地完成。
| 📥 | 安装Ollama(3-5分钟) |
Windows安装最傻瓜:
① 浏览器打开 ollama.com,点击 Download,选 Windows 版本下载安装包(约800MB)。
② 双击安装,一路下一步。安装完右下角托盘会出现 Ollama 羊驼图标。
③ 打开终端(Win+R 输入 cmd 回车),输入验证命令:
ollama --version
# 输出:ollama version 0.30.11macOS安装也很简单:
brew install --cask ollama装完自动后台运行,完全不用配置环境变量。3分钟搞定。
⚠️ 安装常见问题:
① Win7不兼容:Ollama仅支持Win10及以上。
② 安装后ollama命令无效:关闭终端重开一扇,或重启电脑让PATH生效。
③ 启动报"port 11434 in use":有旧实例在跑,任务管理器结束ollama进程后重试。
| 🚀 | 第一次使用:一行命令跑起你的第一个AI |
装完别急着看文档。打开终端,输入这一行:
ollama run qwen3:8b↑ 自动下载Qwen3 8B模型(约5GB),下完直接进入对话
终端会变成对话界面,输入问题按回车,模型秒回。这就是本地AI——不联网、不花钱、不限次数。
退出对话按 Ctrl+D 或输入 /bye。
常用命令速查:
| 🧠 | 该跑什么模型?按场景推荐的10个最佳选择 |
这是最大的信息差。Ollama有4500+模型,新手最容易掉进的坑就是不知道该选哪个。以下是按场景实测推荐:
💡 选择建议:
8GB内存电脑 → 跑3B模型(Llama 3.2 3B / Gemma 2 2B)
16GB内存 / 6-8GB显存 → 跑7B模型(Qwen3 7B / DeepSeek-R1 7B)
24GB显存 → 跑Qwen3.6 27B(消费级最强)
32GB+显存 → 跑任何你想要的模型
| ⚡ | 进阶玩法:让Ollama变成你的AI引擎 |
玩法一:自定义系统提示(Modelfile)
创建一个自定义AI角色,比如专写公众号爆款标题的助手:
# 创建Modelfile文件(内容如下)
FROM qwen3:7b
PARAMETER temperature 0.8
SYSTEM "你是一个微信公众号爆款标题专家。每个标题20字以内,
必须包含数字或情绪词,直接给5个选项,不要解释。"
# 保存后创建自定义模型
ollama create bxbt -f Modelfile
# 使用
ollama run bxbt "给我5个关于AI写作的标题"玩法二:接入任意应用(OpenAI兼容API)
Ollama自带API服务(端口11434),完全兼容OpenAI格式。任何能用ChatGPT API的软件——Obsidian、VS Code、Chatbox等——都能切到本地模型。
# Python调用本地Ollama(OpenAI兼容格式)
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama" # 本地不需要真实key
)
response = client.chat.completions.create(
model="qwen3:7b", # 填你拉取的模型名
messages=[{"role": "user", "content": "帮我写一段Python代码"}]
)
print(response.choices[0].message.content)玩法三:图片理解(视觉模型)
Gemma 4 或 Llama 3.2 Vision 支持上传图片让AI分析。比如截图一段代码让它改bug,或传一张设计稿让它写CSS:
ollama run gemma4:e4b
/image C:\Users\你\Desktop\截图.png
请分析这张图片里有什么玩法四:在Chatbox等聊天客户端中使用
不习惯终端界面?下载Chatbox、Open WebUI等客户端,选"Ollama"作为模型提供商,输入 http://localhost:11434,就能用ChatGPT一样的聊天界面使用本地模型。
| 💼 | 6大实战场景:Ollama能干什么 |
| ⚠️ | 5个新手必踩的坑 |
ollama show 模型名 先查大小,8GB内存别碰7B以上 | ||
ollama list + ollama rm 清理不用的 | ||
OLLAMA_HOST 为0.0.0.0会导致任何人都能调用你的模型 |
| ✅ | Ollama快速上手指南 |
安装阶段
□ 去 ollama.com 下载安装包
□ 终端输入 ollama --version 验证安装
□ 确认电脑内存/显存容量(8GB → 3B模型 / 16GB → 7B模型 / 24GB → 27B模型)
使用阶段
□ 先跑 ollama run llama3.2:3b 测试能否正常工作
□ 按需求选择模型:中文选Qwen / 推理选DeepSeek / 代码选Qwen3.6
□ 学会 ollama list / ollama rm / ollama show 三个管理命令
□ 尝试 Modelfile 创建自定义角色(temperature / system prompt)
□ 下载Chatbox等客户端,接入 http://localhost:11434 提升体验
进阶阶段
□ 用OpenAI兼容API把本地模型接入VS Code / Obsidian / 自己的程序
□ 定期 ollama update 更新到最新版
□ 尝试视觉模型(gemma4:e4b / llama3.2-vision)实现图片理解
✍️ 小编总结:Ollama是2026年每个AI使用者都该装的一个工具。它就像在电脑里装了一个永远免费的本地ChatGPT——速度快、隐私好、不限次数、模型随便换。不管是写作、编程、学习还是接API做自动化,它都能成为你最可靠的AI基础设施。
从装好Ollama、拉一个模型、到开始用AI解决实际问题,整个流程不超过15分钟。剩下的就是不断尝试不同模型,找到最适合你场景的那一个。
夜雨聆风