PyPDF2为例,PdfReader('文件.pdf')负责读取,for page in pdf_reader.pages遍历每一页,最后用page.extract_text()把文字提取出来打印。pdfplumber,它对文本顺序和表格的解析更精准。pytesseractOCR库做图像识别。PyPDF2为例,PdfReader('文件.pdf')负责读取,for page in pdf_reader.pages遍历每一页,最后用page.extract_text()把文字提取出来打印。pdfplumber,它对文本顺序和表格的解析更精准。pytesseractOCR库做图像识别。