从零基础到技术进阶均有覆盖。
一、方案概览与选型建议
方案 核心组件 难度 适用人群 方案一:小白友好型 Cherry Studio + Ollama ⭐ 零基础,追求快速上手 方案二:开源均衡型 AnythingLLM + Ollama ⭐⭐ 初学者,功能较完整 方案三:专业定制型 Dify / MaxKB + Ollama ⭐⭐⭐ 技术爱好者,需深度定制
二、方案一:Cherry Studio + Ollama(最简单推荐)
这是目前对新手最友好的方案,支持 Windows/Mac,界面中文友好,半小时内即可完成部署 。
所需工具
Ollama:本地大模型运行引擎,支持 CPU/GPU 推理
Cherry Studio:桌面客户端,提供可视化界面和知识库管理功能
操作步骤
1. 安装 Ollama
访问 ollama.com 下载对应系统版本
安装后,打开终端(命令行)运行以下命令拉取模型:
# 拉取中文对话模型(7B参数,约4.7GB)
ollama run deepseek-r1:7b
# 或拉取通义千问中文模型
ollama pull qwen2:7b-q4_0
首次运行会自动下载模型,完成后可在终端中测试对话
2. 拉取向量模型(知识库核心)
# 中文专用向量模型,用于文档语义检索
ollama pull bge-m3
# 备选方案
ollama pull bge-large-zh
⚠️ 注意:使用英文向量模型处理中文文档会导致检索结果完全不相关,必须更换为中文模型
3. 安装 Cherry Studio
访问 cherry-ai.com 下载安装
启动后,点击左下角「设置」→「模型服务」→「Ollama」
开启 Ollama 开关,API 地址保持默认 http://localhost:11434
点击「管理」,会自动读取已安装的模型,点击「添加」即可
4. 创建知识库
点击左侧「知识库」→「添加」
取名(如"工作资料库"),嵌入模型选择 bge-m3
点击「确定」后,即可拖拽上传 PDF、Word、TXT 等文档
每个文档处理完成后会出现绿色勾,表示可以被检索
5. 开始提问
回到聊天界面,顶部选择 deepseek-r1:7b | Ollama
输入框下方选中刚创建的知识库
直接问问题,AI 会从你的文档中找答案,并标注引用来源
硬件要求
最低配置:CPU 4核,内存 16GB,无独显也可运行(CPU 推理较慢)
推荐配置:CPU 8核,内存 32GB,NVIDIA 6GB 显存起步
Mac 用户:M系列芯片的 MacBook 有统一内存优势,16GB 即可流畅运行
三、方案二:AnythingLLM + Ollama(功能更完整)
如果你想在本地 Web 界面管理知识库,或需要更丰富的文档管理功能,推荐此方案 。
核心组件
Ollama:同上,运行大模型
AnythingLLM:开源知识库管理工具,支持 Web 界面,自动文档切片、向量化
操作步骤
1. 安装 Ollama 并拉取模型
# 安装 Ollama
# 拉取中文模型
ollama pull qwen2:7b-q4_0
# 拉取向量模型
ollama pull bge-large-zh
如果网络不佳导致 bge-large-zh 拉取失败,可先用 nomic-embed-text 临时替代
2. 安装 AnythingLLM
桌面版(新手首选):访问 useanything.com 下载安装包,一路下一步
Docker 版(企业推荐):适合长期稳定运行,数据隔离更干净
docker run -d --name anythingllm -p 3001:3001 \
-v ~/anythingllm:/app/server/storage \
mintplexlabs/anythingllm
3. 核心配置
打开 AnythingLLM,首次进入设置管理员密码
部署模式选择「Local 本地部署」
配置 LLM 模型:设置 → LLM 提供商 → 选择 Ollama,地址填 http://localhost:11434,模型选 qwen2:7b-q4_0
配置向量模型(重中之重):设置 → Embedding 提供商 → 选择 Ollama,模型选定 bge-large-zh
优化文本分块参数:
Chunk Size(单块长度):500 ~ 800 字符
Chunk Overlap(重叠长度):100 ~ 200 字符
4. 上传文档与问答
左侧「工作区」→ 新建工作区,命名(如"合同库")
拖拽上传 PDF、Word、Excel、TXT、Markdown 等文件
点击「Save and Embed」完成向量化
完成后即可提问,AI 回答会自动附带文档来源
四、方案三:MaxKB / Dify(专业级定制)
适合有技术背景、需要深度定制检索流程的用户。推荐 Llama3 + MaxKB 组合,在功能完整性和资源消耗之间取得较好平衡 。
以 MaxKB 为例的操作步骤
1. 部署 Ollama 与模型
ollama run llama3:8b
ollama pull bge-m3
2. 使用 Docker 部署 MaxKB
docker run -d --name maxkb -p 8080:8080 \
-v ~/.maxkb:/var/lib/postgresql/data \
-e OLLAMA_HOST=http://host.docker.internal:11434 \
1panel/maxkb
浏览器打开 http://localhost:8080 完成初始化
3. 配置与应用
进入「模型管理」→ 新建模型,选择 Ollama 类型,模型 ID 填入 llama3:8b
创建知识库,导入文档(自动分块和向量化)
创建问答应用,关联知识库和模型
五、关键优化技巧
模型选择建议
硬件配置 推荐模型 显存需求 16GB 内存,无独显 qwen2:3b-q4_0(3B量化版) <4GB 16GB 内存 + 6GB 显存 deepseek-r1:7b / qwen2:7b-q4_0 约 6GB 32GB 内存 + 12GB 显存 deepseek-r1:14b 约 9GB 64GB 内存 + 24GB 显存 deepseek-r1:32b(量化版) 约 15GB
文档预处理要点
扫描版 PDF:先用 OCR 工具提取文字,保存为 TXT 再导入,否则会解析乱码
复杂表格:单独整理成 TXT 再上传,避免排版错乱
文件命名规范:YYYYMMDD_主题_版本,便于多文档管理
提问技巧
用描述代替关键词:问"去年记录的关于深圳跨境电商合规的注意事项",比只搜"跨境电商"找得准
精准提问公式:任务指令 + 数据范围 + 输出格式,如"对比[2023-2025财报]的研发投入数据,用[表格]呈现"
常见问题排查
现象 原因 解决 回答中英混杂、胡编乱造 用了英文模型或内存不足 切换 qwen2 系列量化模型 检索内容与问题不匹配 向量模型不支持中文 更换 bge-large-zh,重新生成向量库 回复速度极慢 未开启 GPU 加速 安装 NVIDIA CUDA 驱动;更换 3B 小模型 Docker 连不上 Ollama 地址配置错误 Windows/Mac 填 host.docker.internal,Linux 填宿主机内网 IP
六、总结
三种方案的核心技术栈一致:Ollama(本地模型引擎)+ 向量模型(语义检索)+ 知识库管理工具,区别仅在于前端界面和功能丰富度 。
个人推荐:零基础用户直接选方案一(Cherry Studio),半小时内即可拥有一个能回答你私人文档问题的 AI 助手。数据完全存在本地,断网也能用,隐私安全有保障 。
夜雨聆风