乐于分享
好东西不私藏

用开源工具 Khoj 打造你的“AI 第二大脑”

用开源工具 Khoj 打造你的“AI 第二大脑”

用开源工具 Khoj 打造你的"AI 第二大脑"

你电脑里那些笔记、PDF、文档,其实都是宝藏。可惜它们躺在文件夹里,想找的时候找不到,想用的时候用不上。今天介绍一个开源工具 Khoj,它能把你的所有个人资料变成一个可以对话的"AI 第二大脑"——你问问题,它从你的文档里找答案。

◆ 一、它解决了什么问题?

先想一个场景:你花了一年时间,把工作心得、读书笔记、收藏的文章分别记在 Obsidian、Word 和几十个 PDF 里。

某天你想找"去年关于某某方案的结论",于是开始翻文件夹。你可能记得大概内容,却想不起在哪篇文档里。翻了一个小时,一无所获。

这就是 Khoj 要解决的问题:让电脑里的资料"活"起来

普通的搜索工具(比如电脑自带的搜索)只能按文件名或关键词匹配,你记不清原文就搜不到。而 Khoj 的做法完全不同——它先"读"一遍你所有的文档,把它们变成一种电脑能快速理解的格式(专业说法叫"建立索引"),然后你用日常说话的方式提问,它就能理解你的意图,从你的资料里找出真正相关的内容,并给出带出处的回答。

简单说:你的文档 + 一个开源软件 = 一个了解你所有资料的私人 AI 助手。而且它完全开源,可以自己搭建。如果使用本地模型,可以让核心数据处理留在自己的设备上,更方便控制数据隐私。

◆ 二、完整工作流程:从"一堆文件"到"随问随答"

Khoj 的工作流程可以分为三个阶段,就像整理一间书房:

第一阶段:把资料搬进书房(导入)

你把文档交给 Khoj。它支持的格式很广:Markdown 笔记、PDF、Word 文档、纯文本、Notion 笔记等。你可以直接上传文件,也可以连接你常用的笔记软件账号。

  • 读懂文档
    :把 PDF、Word 这类"锁起来"的文件打开,提取出里面的文字。
  • 切成小段
    :把长文档切成一个个小片段,方便后续查找。
  • 变成向量
    :用一个专门的 AI 模型,把每个小片段"翻译"成一串数字(专业上叫向量)。这串数字能代表这段文字的意思。意思相近的片段,它们的数字也会相近。

第二阶段:给每本书做"图书索引"(建立索引)

这是最核心的一步。Khoj 会做三件事:

  • Khoj 把你的问题也变成同样格式的向量。
  • 它在所有文档片段里快速比对,找出"意思最接近"的几个片段。
  • 它把这些片段连同你的问题一起交给一个大语言模型(就是 ChatGPT 那种 AI),让 AI 基于这些资料组织回答。
  • 回答会标注来源,你点击就能看到依据是哪篇文档。

第三阶段:你提问,它回答(问答)

当你问一个问题时:

这就是一个完整的"检索增强生成"流程:先检索你的资料,再生成回答。这种方式可以让回答更多地基于你的资料,降低 AI 凭空回答的概率。

◆ 三、每个步骤用什么工具?各起什么作用?

为了让步骤更清楚,我用一张表列出关键环节:

步骤
工具
工具作用
导入文档
Khoj 客户端(网页/桌面/Obsidian 插件等)
接收你的文件或连接笔记账号,把资料送进系统
提取文字
文档解析器
打开 PDF、Word 等文件,把里面的文字"读"出来
文字转向量
嵌入模型(AI 模型)
把每段文字变成一串数字,代表它的含义,供快速比对
存储与检索
向量数据库
存放所有文档片段和向量,能按"意思相近"快速查找
生成回答
大语言模型
根据你找到的相关资料,组织成通顺、有出处的回答
提供问答界面
Khoj 服务端 + 聊天界面
接收你的问题,展示回答,支持追问和对话

补充说明:Khoj 的"嵌入模型"和"大语言模型"都可以选择。想省钱、想完全离线,可以用免费的开源模型在本地运行;想效果更好,也可以接入 OpenAI、Anthropic(Claude)等商业服务。这是个人选择,不是必须付费。

◆ 四、手把手:怎么自己搭建一个 Khoj?

如果你想把 Khoj 部署在自己的电脑上,可以使用官方提供的自托管方式。下面介绍比较直接的一条路——用 Docker 容器运行。

准备工作

  • 一台电脑(Windows、Mac、Linux 都可以)。
  • 安装 Docker Desktop(一个能让你电脑上运行"集装箱式"软件的工具),并确保它能正常运行。
  • 可选:准备一个 AI 服务的 API 密钥(比如 deppseek的),或者不准备,后面用免费本地模型。

第一步:下载配置文件

打开终端(Windows 上建议用 WSL 终端或 PowerShell),依次输入:

  • 创建一个专属文件夹:mkdir ~/.khoj
  • 进入这个文件夹:cd ~/.khoj
  • 下载 Khoj 的配置文件:wget https://raw.githubusercontent.com/khoj-ai/khoj/master/docker-compose.yml

第二步:填写关键信息

  • KHOJ_ADMIN_PASSWORD
    :管理员密码,自己设一个。
  • KHOJ_DJANGO_SECRET_KEY
    :系统密钥,随便生成一长串字符即可。

用文本编辑器打开刚下载的 docker-compose.yml,找到 server 服务部分,设置两个必填项:

如果你想用 OpenAI、Anthropic 或 Google 的 AI 模型,再把对应的 API 密钥填进去;不填也没关系,之后可以在界面里配置本地模型。

第三步:启动

在同一个文件夹下输入:docker-compose up,然后等待下载和启动。看到类似"服务已就绪"的日志后,Khoj 就运行起来了。

第四步:首次使用

  • 打开浏览器,访问 http://localhost:42110
  • 首次登录后,建议重启一次服务(先按 Ctrl+C 停止,再重新 docker-compose up),让所有设置生效。
  • 在界面里上传你的文档,或连接你的笔记软件,等待系统建立索引。
  • 索引建好后,就可以开始提问了!

如果不想装 Docker?

Khoj 也支持直接用 Python 安装,但需要电脑上有 Python 3.11 以上版本,且安装过程稍复杂。对新手来说,推荐先用官方云端版体验,或者用 Docker 方式,两条路都不需要写代码。

◆ 五、总结

Khoj 做的事情,一句话概括就是:把你的个人资料变成可以对话的 AI 知识库

  • 文档解析
    ——把各种格式的文件变成电脑能读的文本。
  • 向量化
    ——把文字变成数字,让"意思相近"可以被计算出来。
  • 检索增强生成
    ——先找资料,再让 AI 基于资料回答,避免瞎编。

它用到的三个关键技术,其实每个普通用户都能理解:

Khoj 是开源项目(GitHub 上有 3.6 万+ star),这意味着:代码公开、可以自行部署,也可以搭配本地模型使用;如果接入商业模型 API,则可能产生相应的服务费用和数据传输。对于想整理个人知识库、又在意数据隐私的朋友,它是一个非常值得尝试的工具。

如果对个人 AI 知识库感兴趣,也可以通过 Khoj 的官方文档和 GitHub 仓库进一步了解这个项目。


本文为案例拆解文章,介绍的是开源项目 Khoj(GitHub: khoj-ai/khoj)。文章不构成任何商业推荐,文中涉及的服务价格与功能以官方最新信息为准。