
企业推进 AI 落地其实很难。
我观察到的核心问题,是数据智能链路不完整。如果解析不稳定,知识难以做多模态融合检索,结构化抽取也不准确,最终 AI 应用很难起到效果。
很多企业在几个环节各自选型、各自集成,中间缺少一条可部署、可私有化、能持续产出的数据产线。
好在,Think 系列产品就是按这条数据产线来设计的:
ThinkParse 做解析,ThinkDoc 做知识库与多模态融合检索,ThinkExtract 做结构化抽取与领域建模;向上再做智能体接入,包括工作流编排、定制化开发或通用智能体。
今天给大家全面介绍一下。
官网 https://bluedigit.ai/
一张图看懂全景
企业级应用场景主链路是这样。

所以,Think 系列是面向企业级的数据智能产品,覆盖解析、知识库、结构化抽取三层能力,再向上提供智能体接入。
ThinkParse:核心是把解析做成能进机房的服务
痛点
做知识库或抽取流水线,第一步几乎都是把 PDF、Word、扫描件变成结构化文本。解析引擎本身往往够用,难的是上生产:大文件 OOM、同步超时、API 与 Worker 绑死、多机结果对不齐。
典型场景
知识库 / RAG 需要稳定的解析 HTTP 服务 数据中台批量消化合同、年报、论文、扫描件 下游系统把解析当成独立微服务调用
核心竞争力
ThinkParse 卖的是产线能力,不是又一次封装解析模型。FastAPI 收任务,Redis 排队,Celery Worker 跑 MinerU / MarkItDown,结果可落本地或 S3/MinIO。大文件自动分页、优先级队列、重试、API/Worker 分拆扩容、Docker 部署,业务只对接稳定 API。
项目地址 https://github.com/wzdavid/ThinkParse
产品页 https://bluedigit.ai/zh/thinkparse

ThinkDoc:核心是企业级知识库与多模态融合检索
痛点
文档进了共享盘,不等于进了知识库。复杂版式、图表、扫描件混在一起时,单一文本切块很难召回对的内容;回答说不清出处,权限与审计也跟不上。智能体要查库时,更需要稳定的检索契约。
典型场景
企业研究院 / 职能部门建设私有化知识库 论文、报告、图纸、表格等多模态材料统一入库与检索 给业务系统或智能体提供可复用的检索 API,回答要能回到证据
核心竞争力
ThinkDoc 聚焦两件事:企业级知识库,以及多模态融合检索。它把文档与组织知识收成可管理、可权限控制的知识资产,再用融合检索把文本、版式与多模态线索用起来,检索效果不再只依赖一层向量相似度。证据与来源跟着检索结果走,方便人和智能体一起用。
产品页 https://bluedigit.ai/zh/thinkdoc
演示 https://screen.studio/share/o2Nx2yF9

ThinkExtract:核心是领域建模,加上大批量高质量抽取
痛点
科研与情报场景里,真正贵的往往是把成百上千篇文献里的材料体系、工艺参数、性能指标、催化剂条件等字段,抽成可对比的数据集。问一句摘要解决不了这层需求。手工建表慢、难复现;字段定义一变,整条流水线就要重来;抽出来的结果若回不到原文,也难过审。
典型场景
新能源 / 材料企业研究院做文献情报与实验条件对照 材料 CRO、高校课题组建设领域数据集 情报与研发部门要可审计导出,字段必须对齐原文证据
核心竞争力
ThinkExtract 的重心有两块。
第一,智能化领域数据建模。用自然语言定义 Schema,沉淀可版本管理的 Template,把领域里要抽什么、约束是什么、怎样才算合格,写成可复用的模型。每次临场写提示词,撑不起可版本、可复现的数据工厂。
第二,大批量、高质量的数据集抽取。按 Schema / Template 规模化跑抽取,字段对齐原文证据,再进人机审阅;审过的结果反哺 Template,质量可以持续抬升。交付物是带 provenance 的数据集,能审、能导出、能复用。
产品页 https://bluedigit.ai/zh/thinkextract

智能体接入:底座之上的三种方式
数据产线跑通之后,价值要落到智能体应用。标题里的「智能体接入」,在产品分层上对应三种方式。
1. 工作流编排
适合流程相对固定、需要可视化编排与快速发布的场景。用 Dify、Coze 等平台把 ThinkParse、ThinkDoc、ThinkExtract 的 API 挂成工具节点,拼出可上线的应用。
例如:文献入库后自动触发解析与抽取,审阅完成后推送通知;用户提问时先检索 ThinkDoc,再按 ThinkExtract 的结构化结果生成对比报告;把整条流程发布成 API 或企业内部网页。
2. 定制化开发
适合低代码平台覆盖不了、需要按业务深度定制 Agent 逻辑的场景。一般通过 LangChain、LangGraph 等智能体框架开发,在 Agent 代码里直接调用 Think 产品 API。Parse、Doc、Extract 都是 API First 设计,解析、检索、结构化查询、触发抽取等能力都以稳定 HTTP 接口暴露。
例如:用 LangGraph 搭建「检索 → 结构化查询 → 证据汇总 → 生成报告」的多步 Agent,各节点直接调 ThinkDoc 检索 API 与 ThinkExtract 结构化查询 API;按客户规则定制 prompt、状态机与失败重试;项目制交付专属科研助手,对接客户指定的模型、权限与发布渠道。
3. 通用智能体
适合探索性强、以对话驱动操作为主的场景。既可以是 WorkBuddy、RCESBot 这类个人客户端,也可以做成多用户的企业级通用智能体服务。企业侧通常调用 ThinkDoc 检索与 ThinkExtract 结构化能力;个人侧则通过 Skill 把数据与工具挂到通用智能体上。
例如:研究员在本机用科研智能体 RCESBot 边读文献边查库、边触发抽取任务;企业部署多用户 Agent 服务,团队共享同一套文献库与权限边界;配合 ThinkWiki Skill,在本机维护个人研究笔记与决策页。
三种方式可以并存。工作流编排负责把标准应用快速发出去,定制化开发负责用智能体框架做深度定制,通用智能体负责灵活探索与日常操作。底下的解析、知识库与结构化抽取,由 Think 企业级数据智能产品统一供给。

链路打通了,企业级部署也成熟了
企业主路径可以写成一条线。
导入文献 → ThinkParse 解析 → ThinkDoc 做企业知识库与多模态融合检索 → ThinkExtract 做领域建模与大批量高质量抽取 → 向上接入工作流编排、定制化开发或通用智能体。
解析、知识库、结构化工厂,以及向上的三类智能体应用接口,可以在同一套底座上按需组合,不必再各买各的、各接各的。
企业级部署按可上线标准交付:
ThinkParse 已开源,Docker 部署,API/Worker 分拆,适合作为生产解析层 ThinkDoc、ThinkExtract 支持私有化,数据可留在客户域内 可按解析先行,再叠加知识库与抽取;也可按场景裁剪组合 智能体应用侧,工作流编排通过工具节点接入;定制化开发直接调 API;通用智能体通过 API 或 Skill 对接底座
试点我通常建议选一个垂直场景,先拿 50–200 篇样本,用 2–4 周跑出可审阅的数据集,并接上一条检索或问答工作流。
ThinkWiki:一个 Skill,却代表一种新模式
写完企业主链路,再单独说 ThinkWiki。
它本身很轻:开源、遵循 Agent Skills 规范,装到支持 Skill 的通用智能体上就能用。数据以本机 Markdown 为真相源,支持 Inbox 复核、HTML 工作台和内容知识图谱。
项目地址 https://github.com/wzdavid/ThinkWiki
我更看重它代表的模式:通用智能体 + Skill(数据 / 工具调用)。
过去做个人知识库,往往要再装一套完整应用。现在更自然的路径是,通用智能体已经在本机或企业里跑着,你只需要给它装上 Skill,把「采集、入库、检索、图谱、治理」这些能力以工具形式挂上去。Agent 负责对话与编排意图,Skill 负责确定性的数据与工具动作。
这意味着两件事。
对企业主链路,ThinkDoc、ThinkExtract 也可以按同样思路,通过 API / Skill 被通用智能体调用。对个人与超级个体,ThinkWiki 让「养一份会生长的本地 wiki」不必另起一套重系统。
痛点很具体:资料散落在收藏夹、下载目录和聊天记录里;云端库不放心,纯文件夹又难治理。典型场景是用 RCESBot、WorkBuddy、OpenClaw、Cursor、Claude Code 等通用智能体,边读边沉淀研究笔记与决策页。ThinkWiki 要证明的是这种模式走得通,不必再为个人知识单独堆一套重型产品。
产品页 https://bluedigit.ai/zh/thinkwiki

你可以从哪一头开始
开发者 / 中台,先装 ThinkParse https://github.com/wzdavid/ThinkParse 要企业知识库与多模态检索,看 ThinkDoc https://bluedigit.ai/zh/thinkdoc 要领域建模与大批量高质量数据集,看 ThinkExtract https://bluedigit.ai/zh/thinkextract 要做工作流编排,用 Dify、Coze 等接入 Think 产品 API,先跑通一条问答或抽取流程
要做定制化开发,基于 LangChain、LangGraph 等框架,直接调用 Think 产品 API 搭建专属 Agent
要用通用智能体,对接 RCESBot、WorkBuddy等客户端,或通过 Skill 挂载数据与工具
想体验通用智能体 + Skill,装 ThinkWiki https://github.com/wzdavid/ThinkWiki
写在最后
企业 AI 应用落地的瓶颈,越来越多落在有没有一条经得起审计的数据产线,以及这条产线能不能稳稳接到智能体应用。
Think 系列数据智能产品各有焦点:Parse 做解析,Doc 做知识库与多模态融合检索,Extract 做结构化抽取与领域建模。向上通过工作流编排、定制化开发或通用智能体完成接入。ThinkWiki 则用一个 Skill,把通用智能体 + 数据 / 工具调用这条路径摊开给人用。
链路已经打通,企业级部署也按生产标准在交。开源两端随时可试;私有化落地欢迎约演示,把你们库里最难啃的那一批文献拿来跑一遍。
相关网址
官网 https://bluedigit.ai/ ThinkParse https://github.com/wzdavid/ThinkParse ThinkDoc https://bluedigit.ai/zh/thinkdoc ThinkExtract https://bluedigit.ai/zh/thinkextract ThinkWiki https://github.com/wzdavid/ThinkWiki
夜雨聆风