用开源工具 Khoj 打造你的"AI 第二大脑"
你电脑里那些笔记、PDF、文档,其实都是宝藏。可惜它们躺在文件夹里,想找的时候找不到,想用的时候用不上。今天介绍一个开源工具 Khoj,它能把你的所有个人资料变成一个可以对话的"AI 第二大脑"——你问问题,它从你的文档里找答案。
◆ 一、它解决了什么问题?
先想一个场景:你花了一年时间,把工作心得、读书笔记、收藏的文章分别记在 Obsidian、Word 和几十个 PDF 里。
某天你想找"去年关于某某方案的结论",于是开始翻文件夹。你可能记得大概内容,却想不起在哪篇文档里。翻了一个小时,一无所获。
这就是 Khoj 要解决的问题:让电脑里的资料"活"起来。
普通的搜索工具(比如电脑自带的搜索)只能按文件名或关键词匹配,你记不清原文就搜不到。而 Khoj 的做法完全不同——它先"读"一遍你所有的文档,把它们变成一种电脑能快速理解的格式(专业说法叫"建立索引"),然后你用日常说话的方式提问,它就能理解你的意图,从你的资料里找出真正相关的内容,并给出带出处的回答。
简单说:你的文档 + 一个开源软件 = 一个了解你所有资料的私人 AI 助手。而且它完全开源,可以自己搭建。如果使用本地模型,可以让核心数据处理留在自己的设备上,更方便控制数据隐私。
◆ 二、完整工作流程:从"一堆文件"到"随问随答"
Khoj 的工作流程可以分为三个阶段,就像整理一间书房:
第一阶段:把资料搬进书房(导入)
你把文档交给 Khoj。它支持的格式很广:Markdown 笔记、PDF、Word 文档、纯文本、Notion 笔记等。你可以直接上传文件,也可以连接你常用的笔记软件账号。
- 读懂文档
:把 PDF、Word 这类"锁起来"的文件打开,提取出里面的文字。 - 切成小段
:把长文档切成一个个小片段,方便后续查找。 - 变成向量
:用一个专门的 AI 模型,把每个小片段"翻译"成一串数字(专业上叫向量)。这串数字能代表这段文字的意思。意思相近的片段,它们的数字也会相近。
第二阶段:给每本书做"图书索引"(建立索引)
这是最核心的一步。Khoj 会做三件事:
Khoj 把你的问题也变成同样格式的向量。 它在所有文档片段里快速比对,找出"意思最接近"的几个片段。 它把这些片段连同你的问题一起交给一个大语言模型(就是 ChatGPT 那种 AI),让 AI 基于这些资料组织回答。 回答会标注来源,你点击就能看到依据是哪篇文档。
第三阶段:你提问,它回答(问答)
当你问一个问题时:
这就是一个完整的"检索增强生成"流程:先检索你的资料,再生成回答。这种方式可以让回答更多地基于你的资料,降低 AI 凭空回答的概率。
◆ 三、每个步骤用什么工具?各起什么作用?
为了让步骤更清楚,我用一张表列出关键环节:
补充说明:Khoj 的"嵌入模型"和"大语言模型"都可以选择。想省钱、想完全离线,可以用免费的开源模型在本地运行;想效果更好,也可以接入 OpenAI、Anthropic(Claude)等商业服务。这是个人选择,不是必须付费。
◆ 四、手把手:怎么自己搭建一个 Khoj?
如果你想把 Khoj 部署在自己的电脑上,可以使用官方提供的自托管方式。下面介绍比较直接的一条路——用 Docker 容器运行。
准备工作
一台电脑(Windows、Mac、Linux 都可以)。 安装 Docker Desktop(一个能让你电脑上运行"集装箱式"软件的工具),并确保它能正常运行。 可选:准备一个 AI 服务的 API 密钥(比如 deppseek的),或者不准备,后面用免费本地模型。
第一步:下载配置文件
打开终端(Windows 上建议用 WSL 终端或 PowerShell),依次输入:
创建一个专属文件夹: mkdir ~/.khoj进入这个文件夹: cd ~/.khoj下载 Khoj 的配置文件: wget https://raw.githubusercontent.com/khoj-ai/khoj/master/docker-compose.yml
第二步:填写关键信息
KHOJ_ADMIN_PASSWORD:管理员密码,自己设一个。 KHOJ_DJANGO_SECRET_KEY:系统密钥,随便生成一长串字符即可。
用文本编辑器打开刚下载的 docker-compose.yml,找到 server 服务部分,设置两个必填项:
如果你想用 OpenAI、Anthropic 或 Google 的 AI 模型,再把对应的 API 密钥填进去;不填也没关系,之后可以在界面里配置本地模型。
第三步:启动
在同一个文件夹下输入:docker-compose up,然后等待下载和启动。看到类似"服务已就绪"的日志后,Khoj 就运行起来了。
第四步:首次使用
打开浏览器,访问 http://localhost:42110。首次登录后,建议重启一次服务(先按 Ctrl+C 停止,再重新 docker-compose up),让所有设置生效。在界面里上传你的文档,或连接你的笔记软件,等待系统建立索引。 索引建好后,就可以开始提问了!
如果不想装 Docker?
Khoj 也支持直接用 Python 安装,但需要电脑上有 Python 3.11 以上版本,且安装过程稍复杂。对新手来说,推荐先用官方云端版体验,或者用 Docker 方式,两条路都不需要写代码。
◆ 五、总结
Khoj 做的事情,一句话概括就是:把你的个人资料变成可以对话的 AI 知识库。
- 文档解析
——把各种格式的文件变成电脑能读的文本。 - 向量化
——把文字变成数字,让"意思相近"可以被计算出来。 - 检索增强生成
——先找资料,再让 AI 基于资料回答,避免瞎编。
它用到的三个关键技术,其实每个普通用户都能理解:
Khoj 是开源项目(GitHub 上有 3.6 万+ star),这意味着:代码公开、可以自行部署,也可以搭配本地模型使用;如果接入商业模型 API,则可能产生相应的服务费用和数据传输。对于想整理个人知识库、又在意数据隐私的朋友,它是一个非常值得尝试的工具。
如果对个人 AI 知识库感兴趣,也可以通过 Khoj 的官方文档和 GitHub 仓库进一步了解这个项目。
本文为案例拆解文章,介绍的是开源项目 Khoj(GitHub: khoj-ai/khoj)。文章不构成任何商业推荐,文中涉及的服务价格与功能以官方最新信息为准。
夜雨聆风