乐于分享
好东西不私藏

AI工具 | 上海AI实验室 | Sciverse做了个100PB的科学数据库,MinerU把PDF解析做成了5.9万Star的开源项目

AI工具 | 上海AI实验室 | Sciverse做了个100PB的科学数据库,MinerU把PDF解析做成了5.9万Star的开源项目

大家好,我是小黄。

最近在做AI+材料方向的东西,不可避免地要跟大量文献打交道。整理过程中发现两个值得单独拿出来说的工具——Sciverse 和 MinerU,都出自上海人工智能实验室,一个管数据,一个管解析,配合起来挺有意思。今天就来聊聊。

做科研的人都知道这个痛

说句实在话,大模型现在什么都能干,唯独"读懂一篇论文"这件事,还是没那么靠谱。

不是模型不行,是数据进不去。你扔给它一份 PDF,多栏排版、跨页表格、嵌着公式和图片——模型看到的是一坨乱码。这个问题搞过 RAG 的朋友应该深有体会:Garbage in, garbage out,前面解析歪了,后面再怎么调 prompt 都白搭。

上海AI实验室大概是觉得这件事不能再忍了,于是同时推了两样东西出来。

Sciverse:100PB 的科学数据底座

先说大的。

2026 年 3 月,上海人工智能实验室在浦江 AI 学术年会上发布了"AGI4S 珠穆朗玛计划",核心基建之一就是 Sciverse——一个目标 100PB 级别的科学智能数据库。

100PB 是什么概念?大概是你实验室那块 4TB 硬盘的 25000 倍。

具体数字是这样的:涵盖 2500 万篇公开文献,积累了 6000 亿词元,覆盖自然科学十多个核心学科。不是简单地把论文堆在一起,而是分成了三层——

通识层(Sci-Base)做基础知识覆盖,跨界层(Sci-Align)做学科之间的关联映射,高阶层(Sci-Evo)面向前沿科学发现。三层递进,从"知道有什么"到"知道怎么连"再到"能帮你发现新东西"。

说实话,这个分层思路我是认可的。现在大部分科学数据库还停留在"把论文转成文本存起来"的阶段,能想到做学科交叉映射的并不多。材料科学的人都知道,一个高温合金的配方可能跟高分子领域的某个聚合机理暗合,但这种跨领域的关联靠人脑去翻文献基本不可能。

Sciverse 通过 API 和 Skill 接口对外开放,可以直接对接大模型训练和科研 Agent。换句话说,它想做的不是"一个给你查文献的网站",而是"一个让 AI 能直接调用的科研数据基座"。

这个定位,跟传统的知网、Web of Science 完全不是一个赛道。

MinerU:把 PDF 拆得明明白白

再说小的——说"小"其实有点不公平,因为 MinerU 在 GitHub 上已经拿到了接近 5.9 万 Star,是文档解析领域目前最火的开源项目之一。

MinerU 做的事情用一句话概括:把 PDF 变成结构化的 Markdown。

听起来好像没什么技术含量?

那你试试就知道了。一篇 Nature 的双栏论文,左边是正文右边是补充说明,中间夹着个跨栏表格,表格里还有嵌套的数学公式——你让普通 PDF 解析器去拆,拆出来基本是一锅粥。

MinerU 不一样。它的版面分析能力可以精准还原多栏排版的阅读顺序,支持中英文 OCR、竖排文本甚至印章识别。数学公式直接转 LaTeX,旋转的、没有边框的表格也能解析。最后输出的 Markdown 对大模型非常友好——这恰恰是它跟其他 PDF 工具拉开差距的地方。

在权威基准测试上,MinerU Pro 版综合最高分拿到了 95.69,英文识别误差率 0.061,中文 0.215,都是第一。处理 20 页文档大概 8.3 秒,显存占用 6GB 左右。

这些数字意味着什么?意味着你一下午能解析几百篇文献,而且解析质量足够直接喂给大模型做下游任务。

用法也简单:

pip install minerumineru -p paper.pdf -o output

三行搞定。Python SDK、Docker 部署也都支持,官方还做了 LangChain 适配,搭 RAG 系统可以直接用。

今年最新版本(3.3/3.4)又加了几个实用的东西:Hybrid 引擎支持 "medium" 和 "high" 两档精度,默认 medium 就够用了;VLM 模型迭代到 2.5-Pro,复杂版面解析更强;还接入了 PP-OCRv6,识别准确率又涨了约 11%。

完全开源,Apache 2.0 协议,企业私有化部署也没问题。

有一点要提:MinerU 对 GPU 有要求。纯 CPU 跑不是不行,但速度会慢很多。如果你要批量处理文献,最好有张还不错的显卡。

两个工具之间的关系

讲到这里你可能已经猜到了——Sciverse 那 2500 万篇文献,底层就是用 MinerU 来解析的。

MinerU 负责"拆":把非结构化的 PDF 变成干净的结构化数据。Sciverse 负责"装":把解析好的海量数据组织成 AI 能直接调用的三层体系,再通过 API 喂给大模型和科研 Agent。

一个管入口,一个管出口。

我之前提到过,做 AI+材料最大的瓶颈之一就是高质量数据的获取和结构化。现在有了 MinerU 可以自己解析文献,有了 Sciverse 可以直接调用现成的科学数据——这个链条比以前顺畅多了。

当然,Sciverse 目前还在建设中,100PB 是目标而不是现状。但光是已有的 2500 万篇文献和 6000 亿词元,已经是个相当可观的起点了。

对我们意味着什么

坦白说,这两个工具的出现反映了一个趋势:科学 AI 的基础设施正在快速成熟。

以前做科研,数据收集、清洗、结构化这些脏活累活占据了大量时间。现在 MinerU 把文档解析这件事做到了开源可用的程度,Sciverse 在尝试把整个科学文献体系搬进一个 AI-ready 的数据库——做研究的人可以把更多精力放在"想问题"上,而不是"整理数据"上。

对做材料信息学的人来说,MinerU 是现在就能用的利器。装一个,把你手头那些乱七八糟的 PDF 论文、报告、标准文档统统转成 Markdown,再喂给你的模型或者 RAG 系统,效果会有明显提升。

Sciverse 则值得持续关注。等它的 API 完全开放、数据覆盖更全之后,可能会成为做科研 AI 绕不开的基础设施。


感谢上海人工智能实验室团队在科学智能基础设施方面的投入,Sciverse 和 MinerU 正在从不同层面解决"AI 读不懂科学文献"这个老问题。

如果觉得这篇文章有用,帮忙点个赞、转发一下,或者在评论区聊聊你平时是怎么处理文献 PDF 的,我很想听听大家的方案。

你们用 AI 读论文的时候,遇到过最头疼的问题是什么?

参考来源:

  • • Sciverse 科学智能数据库:百度百科
  • • 上海AI实验室发布"AGI4S珠穆朗玛计划":量子位
  • • MinerU 深度评测:掘金
  • • MinerU 近期更新速览:SegmentFault
  • • MinerU GitHub 项目:OpenDataLab/MinerU