夜雨聆风学习资料网

ARTICLE · 1128514

AI读完PDF了,先核对这三处

AI读完PDF了,先核对这三处

一份PDF上传后,AI很快给出摘要,还算好了表里的合计。你准备直接把数字写进汇报。

先打开它引用的那一页。回答写得完整,不足以说明文件也被完整、准确地读进去了。

有的工具提取PDF文字,有的会识别页面图片;具体路径要看工具。扫描页可能需要文字识别,也就是OCR。可复制的文字也可能来自识别结果,仍需与原页核对。Adobe的说明就提供了把识别文字与扫描图像对照、纠正疑似错误的操作。

一张表怎样变成错误结论

下面是教学虚构,不是产品实测。假设有一份4页的付款报告,我们把原页内容用文字展示。

第3页表头:单位:万元。A项目:计划18.0,实际支付8.0。B项目:计划6.0,实际支付6.0。

第4页注释:“实际支付”截至8月31日;另有2.0万元待付款,未计入本表。

模拟提取结果却是:A项目:计划18.0,实际支付80。B项目:计划6.0,实际支付6.0。第4页:无提取文字。

小数点没了,单位也没进来。若照这段文字计算,实际支付就是86;随后再写成“项目全部支出86万元”,又越过了原表的时间和状态边界。

我们要核对三个地方

第一处是页。文件有4页,提取结果只覆盖3页,就回到第4页看它是否含有正文、附注或图片。空白提取可能对应真正的空白页,也可能是扫描页未被识别,不能仅凭“无文字”跳过。

第二处是格。放大第3页,逐格对应行名、列名、数字和单位。A的实际支付在原图上是8.0,纠正后为8.0;B仍为6.0。合计8.0+6.0=14.0万元。不要只查合计,因为错位后的数字相加也可能看起来合理。跨页续表要连同标题查看,避免把下一张表的数字接进来。

第三处是注。第4页限定了截止日期和待付款范围。补回注释后,可以写:“截至8月31日,表内实际支付合计14.0万元;另有2.0万元待付款。”这是从原页核对后得到的表述。

pypdf的官方文档提醒,PDF表格常由按位置排列的文字组成,提取时可能难以恢复行列关系。这说明,即使文字能复制,也不能据此认定表格已经正确还原。

先提取,再归纳

下一次可以先给出这段要求:“请按PDF页序列出识别结果,保留表头、单位和附注;无法读取的页、单元格标明待核,暂不补写,也暂不计算。”

这段要求方便发现缺口,不能代替人工检查。重点核对将进入结论的页、关键数字、单位、否定词和附注;需要确认全篇完整时,仍要逐页对应。模糊原图看不清,就找更清晰的原件,保留待核状态,别靠上下文猜出金额。

把核对过的文字再交给AI归纳,并保留PDF页序位置,后面才能回到原页复查。

技术出处:Adobe“Fix text issues in scanned PDFs”;pypdf“Extract Text from a PDF”。

资料:Adobe Acrobat: Fix text issues in scanned PDFshttps://helpx.adobe.com/acrobat/desktop/create-documents/scan-documents-to-pdfs/fix-scanned-text.html

资料:pypdf: Extract Text from a PDFhttps://pypdf.readthedocs.io/en/stable/user/extract-text.html

说明:本文方法和教学示例由证据工具箱整理,正文与封面使用AI辅助制作;示例不代表实际调查或产品实测。资料核对日期:2026年9月30日。

相关学习资料