github 热门分享:一个 pdf 解析神器这是一个pdf转md的工具,为RAG或知识库场景设计,在处理PDF时无需一上来就进行OCR。它会先自动识别文档类型(文本型、扫描件、图片或混合内容),并标记出真正需要OCR处理的页码;对于原生文本内容,则在本地重建阅读顺序、标题结构以及表格信息,最终输出为结构化的 Markdown。#github#pdf识别#ai工具