论文、报告和书籍经常以 PDF 交付。它的优势是跨设备展示稳定,但当我们需要继续编辑、检索、引用、构建知识库或进入出版系统时,PDF 页面不一定能直接提供清晰的结构。


自动模式
标准模式
增强模式

Markdown:继续阅读和编辑
Canonical JSON:程序和知识库复用
质量报告:决定先检查哪里
资源 ZIP:独立获取图表资源
Canonical XML:结构交换
JATS XML:进入学术出版结构
标注 PDF:视觉验收
结构化 HTML:浏览器审阅


标题和章节层级是否正确? 双栏内容的阅读顺序是否正确? 公式、上下标和编号是否一致? 表格行列、表头和合并单元格是否保留? 图片、图注与正文引用是否对应? 页眉、页脚和页码是否混入正文? 文内引用与参考文献是否正确分开? OCR 页面是否存在错字、缺字和断行? JATS 或 XML 是否通过目标下游校验?

查看失败页和原因。 判断是否涉及方法、结果、表格或参考文献等核心内容。 下载当前可用产物和质量报告。 在实际入口可用时,对失败页进行定向重试。 重试后再次验收整体结构。

上传 PDF→ 预检文件→ 选择模式与产物→ 确认当前报价→ 跟踪任务→ 下载产物→ 质量报告导航→ 人工验收与修订

先写清转换后的用途:继续编辑、程序处理、图表复用、出版结构还是视觉验收。再查看 PDF 专题页了解产物类型,实际入口确认后按预检结果选择模式。
阅读原文:还可以阅读当前使用指南,确认任务流程和能力边界后,再按需要决定是否体验。
夜雨聆风