乐于分享
好东西不私藏

OpenRAG:开源智能文档检索与RAG平台

OpenRAG:开源智能文档检索与RAG平台

一站式RAG解决方案,集成Langflow、OpenSearch、Docling,支持多模态文档与Agent驱动的智能检索


项目背景

RAG(检索增强生成)已成为企业落地大语言模型的核心技术路径。然而,搭建一套完整的RAG系统并不简单:文档解析、向量存储、语义检索、对话编排……每个环节都需要选型、集成和调优。

2026年3月,Langflow团队在GitHub开源了OpenRAG——一个开箱即用的智能文档检索平台。它将Langflow、OpenSearch、Docling三大组件打包整合,让开发者可以在几分钟内搭建起生产级的RAG服务。

最关键的是:OpenRAG不仅提供了完整的前后端界面,还支持MCP协议,可以与Cursor、Claude Desktop等AI工具无缝集成


OpenRAG是什么?

OpenRAG是一个全栈RAG平台,覆盖从文档上传到智能对话的完整链路:

文档处理:支持PDF、Word、PPT等多种格式,智能解析表格、图片

语义检索:基于OpenSearch的向量引擎,支持混合检索

对话编排:Langflow驱动的Agent工作流,支持多轮对话与重排序

可视化配置:拖拽式工作流编辑器,无需编码即可定制流程


核心特性

开箱即用

OpenRAG将所有核心工具预装并打通。只需一条命令启动,无需手动配置OpenSearch集群或搭建文档解析服务:

pip install openrag
openrag

启动后访问本地界面即可上传文档、开始对话。

Agent驱动的RAG工作流

传统RAG是线性的:检索→拼接→生成。OpenRAG引入了Agent机制,可以:

智能路由:判断问题是否需要检索,还是直接回答

多步推理:分解复杂问题,多次检索后综合答案

重排序:对检索结果进行二次排序,提升相关性

拖拽式工作流编辑

Langflow的可视化编辑器让RAG流程的调试变得直观:

拖入组件、连线、配置参数

实时预览检索结果

支持自定义Python节点扩展

企业级扩展性

OpenSearch作为底层向量引擎,提供:

分布式架构:支持PB级数据

高可用:副本与分片机制

安全审计:细粒度权限控制


工作原理

OpenRAG的处理流程分为三个阶段:

1. 文档摄入

Docling负责解析各类文档,它基于深度学习模型,能够:

识别版面结构:标题、段落、表格、图片

提取表格数据:保持行列关系

OCR支持:处理扫描件PDF

2. 向量化存储

解析后的文本被切分并嵌入向量,存入OpenSearch:

支持多种Embedding模型

可配置切分策略(固定长度、语义边界)

混合检索:向量+关键词

3. 智能检索与生成

用户提问时,OpenRAG执行:

1.问题理解:提取关键实体和意图

2.语义检索:在向量库中查找相关片段

3.上下文组装:将检索结果与问题组合

4.LLM生成:调用大模型生成回答


快速上手

安装方式

OpenRAG提供多种部署选项:

# 方式一:Python包(最简单)
pip install openrag

# 方式二:Docker部署(推荐生产环境)
docker run -p 3000:3000 langflow/openrag

基本使用流程

1.启动服务:运行openrag命令

2.上传文档:通过Web界面添加PDF/Word文件

3.开始对话:直接在聊天框提问,系统自动检索相关内容

Python SDK集成

如果你想将OpenRAG嵌入自己的应用:

import asyncio
from openrag_sdk import OpenRAGClient

async def main():
    async with OpenRAGClient() as client:
        response = await client.chat.create(
            message="这份文档的主要结论是什么?"
        )
        print(response.response)

asyncio.run(main())

MCP协议支持

Model Context Protocol(MCP)是OpenRAG的一大亮点。通过MCP,你可以将OpenRAG的知识库连接到Cursor或Claude Desktop:

{
  "mcpServers": {
    "openrag": {
      "command": "uvx",
      "args": ["openrag-mcp"],
      "env": {
        "OPENRAG_URL": "http://localhost:3000"
      }
    }
  }
}

配置后,在Cursor中直接提问,AI会自动检索你的文档库并引用来源


适用场景

企业知识库

将公司内部文档、手册、政策统一管理,员工通过自然语言快速查找信息。

技术文档问答

把API文档、架构图、运维手册丢进去,开发运维人员不再需要翻阅大量页面。

客服机器人

结合产品FAQ和工单历史,自动回答用户问题,减少人工客服压力。

研究文献管理

研究人员可以上传论文PDF,通过对话快速了解多篇文献的核心观点。


与其他方案对比

特性 OpenRAG LlamaIndex Dify
开箱即用 ✅ 完整前端 ❌ 需开发
工作流可视化 ✅ Langflow
MCP支持 ✅ 原生
向量引擎 OpenSearch 可选 Qdrant
文档解析 Docling Simple 内置

OpenRAG的优势在于”一站式”:文档解析、向量存储、对话编排、可视化配置全部内置,不需要自己拼凑组件。


技术栈

后端:FastAPI(Python)

前端:Next.js(React)

向量引擎:OpenSearch

工作流编排:Langflow

文档解析:Docling

协议支持:MCP(Model Context Protocol)


总结

OpenRAG是一个非常适合快速落地RAG项目的开源平台。它解决了传统RAG搭建中的碎片化问题,将核心组件打包整合,大幅降低了技术门槛。

如果你正在寻找一个开箱即用的文档问答解决方案,或者想把私有知识库接入Cursor、Claude等AI工具,OpenRAG值得一试


相关链接

GitHub仓库:https://github.com/langflow-ai/openrag

官方文档:https://docs.openr.ag

Python SDK:https://pypi.org/project/openrag-sdk

TypeScript SDK:https://www.npmjs.com/package/openrag-sdk

本站文章均为手工撰写未经允许谢绝转载:夜雨聆风 » OpenRAG:开源智能文档检索与RAG平台

猜你喜欢

  • 暂无文章