夜雨聆风学习资料网

ARTICLE · 1053241

跨文档一问就答偏?LightRAG 图谱轻量 RAG,五模式检索+WebUI

跨文档一问就答偏?LightRAG 图谱轻量 RAG,五模式检索+WebUI

点击下方【IT开源项目精选

关注」、选择「设为星标

每天三分钟、打卡阅读

最快获取全网学习干货、行业资讯

前言

大家好,这里是 IT开源项目精选!

传统向量 RAG 擅长「找相似片段」,一到跨文档归纳、实体关系推理,就容易答偏或答浅。GraphRAG 一类方案能补关系,但实现重、成本高,工程上难落地。

本期拆解港大 HKUDS 开源的 LightRAG。它用知识图谱做索引,再按 local / global 双层键检索,并提供可本地跑的 WebUI 与 API。若你要的是「比纯向量更懂关系、又比重型图谱方案轻」的 RAG 底座,值得对照论文与仓库实测。

简介

LightRAG 仓库:github.com/HKUDS/LightRAG。截至 2026 年 9 月 20 日,约 39766 Star、5597 Fork。协议 MIT。最新发行版 / PyPI 包 lightrag-hku 为 v1.5.7(需 Python ≥3.10)。论文 arXiv:2410.05779,标注 EMNLP 2025。主页推送仍活跃(约 2026-09-20)。

定位:Simple and Fast Retrieval-Augmented Generation。索引阶段用 LLM 抽实体与关系、建图;查询阶段生成低层实体键与高层主题键,召回实体、关系与原文块。默认查询模式为 mix(融合 local、global、naive)。另提供 WebUI(文档 / 图谱 / 检索)、API Server(默认端口 9621),存储可接 Neo4j、PostgreSQL、MongoDB、OpenSearch 等。

同团队还有 RAG-Anything(多模态)、MiniRAG、VideoRAG 等旁支;本文只评 LightRAG 本体。多模态能力现可通过集成 RAG-Anything / MinerU / Docling 扩展,是否默认全开要以当前文档为准。

核心能力

一、图谱索引

• 从文本块抽取实体与关系,并做去重与描述生成;

• 节点 / 边保留来源 chunk,便于追溯;

• 支持多种切块策略(Fix / Recursive / Vector / Paragraph 等,以当前版本文档为准)。

二、五模式检索

• local:偏实体与局部事实;

• global:偏主题与跨文档关系;

• hybrid:local + global;naive:纯向量块检索;

• mix:三者融合,文档称默认且通常效果最好,耗时略高于 naive。

三、WebUI 与 Server

• 网页侧可管文档、看知识图谱、做检索;

• lightrag-server 一键起 API + 前端产物;

• 可用 uv / pip 装 lightrag-hku[api],或 Docker Compose。

四、工程向能力

• Reranker、引用、文档删除后图谱再生;

• 角色化 LLM 配置(抽取 / 查询 / 关键词 / VLM 等可分设);

• 评估与追踪可接 RAGAS、Langfuse(文档有更新说明)。

系统架构与界面

推荐路径:配好 LLM 与 Embedding → 导入文档建索引 → WebUI 看图谱与试问 → 再按场景选 local / global / mix。索引质量强依赖抽取用的模型;关系乱时,再强的 mix 也救不了口径。

▲ 图1 总体架构:图谱索引 + 双层检索

▲ 图2 索引流程示意(向量 / KV 与图谱)

▲ 图3 查询流程示意(双层检索与生成)

▲ 图4 WebUI 知识图谱可视化

技术栈与环境

语言/包: Python ≥3.10 · PyPI lightrag-hku 1.5.7

运行: lightrag-server · 默认 PORT=9621 · WebUI 路径 /webui

依赖: 需自备 LLM + Embedding(可云可本地)

可选存储: Neo4j · PostgreSQL · MongoDB · OpenSearch 等

论文: arxiv.org/abs/2410.05779

快速开始

一、PyPI 安装 Server(推荐先体验)

uv tool install "lightrag-hku[api]"

注:也可用 pip install "lightrag-hku[api]"

cp env.example .env

注:在 .env 填入 LLM / Embedding;生产务必配鉴权

lightrag-server

浏览器访问 http://127.0.0.1:9621/webui(以 .env 中 HOST/PORT 为准)。

二、Docker Compose

git clone https://github.com/HKUDS/LightRAG.git

cd LightRAG

cp env.example .env

docker compose up

三、源码开发

克隆后可用官方 make dev 或 uv sync 装依赖,构建 lightrag_webui 前端后再启动 server。细节见仓库 README 与 docs。

实操要点

先锁鉴权再暴露端口。默认可绑 0.0.0.0;未配 LIGHTRAG_API_KEY / AUTH_ACCOUNTS 时接口近乎公开。公网或局域网共用前必须配鉴权,或只绑 127.0.0.1。

建索引就是在烧 LLM。实体关系抽取按块调用模型,语料一大,费用与耗时会上去。先小样本验证抽取质量,再全量灌库。

查询模式按问题选。细节事实试 local;跨章总结试 global / mix;只要基准向量检索对比时用 naive。默认 mix 不等于所有场景最优。

Embedding 选快且够用即可。文档认为检索质量对 Embedding 依赖有限,更建议低维、快的多语种模型;抽取与生成侧的 LLM 才是关键。

适用边界:什么情况别用它

① 只要最简向量问答、语料极小。naive / 普通向量库可能更省事,不必上图谱抽取链路。

② 不能接受建库时的 LLM 成本与等待。LightRAG 的「轻」相对重型 GraphRAG 工程,不是零成本索引。

③ 无模型密钥、又不愿自建本地 LLM/Embedding。空转不起来。

④ 把 WebUI 当开箱公网 SaaS。未加固就暴露 9621,风险直接。

⑤ 期望纯图片 / 视频理解开箱即用。那是 RAG-Anything、VideoRAG 等旁支的主场,需按文档单独集成。

适合谁

适合要做企业知识问答、且问题常跨文档的 Python / RAG 工程师;想可视化知识图谱、用 WebUI 快速试检索的团队;愿意配模型密钥、接受建索引成本的研究与产品试点。

不适合:零运维、零模型预算的演示需求;只要关键词检索的静态站内搜;安全基线禁止裸奔 API 却不愿改 .env 的部署。

更新进度

100 期优质开源项目更新进度:018/100。欢迎在留言区交流你对 LightRAG 的建库与 mix 模式实践,或提名下一期想拆解的开源项目。

开源地址

GitHub:github.com/HKUDS/LightRAG

PyPI:pypi.org/project/lightrag-hku

论文:arxiv.org/abs/2410.05779

本地默认:http://127.0.0.1:9621/webui

获取更多精彩内容和优质开源项目

请关注微信公众号「IT开源项目精选」

每天早上 5 分钟,看懂一个值得收藏的开源项目

免责声明

1、本文所分享的软件、代码或资源,均来自开源社区,遵循其原始许可证(MIT)。仅供学习和研究使用,严禁用于任何违法行为。

2、使用者在下载、部署或使用本项目时,需自行判断其适用性与合法性,由此产生的一切风险与责任均由使用者自行承担。部署时请自行配置鉴权与网络安全。

3、本文数据(Star、Fork、版本号)来自 GitHub / PyPI 公开信息,采集时间为 2026 年 9 月 20 日,项目迭代迅速,实际版本可能已更新。

4、本文配图来自项目仓库与公开教程素材,版权归原作者所有;本文不对开源软件的安全性、可用性或完整性做任何保证。

5、本文与项目作者无商业合作,所有观点基于公开资料得出;若您为相关资源的版权方并对内容有异议,请联系我们,我们将在第一时间处理。

相关学习资料