pip3 install pdf2docx
from pdf2docx import Converterpdf_path = "1.pdf"docx_path = "成果集.docx"cv = Converter(pdf_path)cv.convert(docx_path)cv.close()
cd ~/Desktoppython3 convert.py核心原因:版本不兼容
你安装了 PyMuPDF‑1.26.5(新版本),但是 pdf2docx==0.5.8 内部代码调用了旧版 PyMuPDF 里的.get_area()方法;新版 PyMuPDF 把get_area()废除了,所以代码执行失败。
pdf2docx 0.5.8 并不适配 PyMuPDF‑1.26+,这是库之间的版本适配 BUG。
次要可能性:你的 PDF 含有图片、特殊矢量元素,新版 PyMuPDF 解析 Rect 矩形对象逻辑改动。
python3 -m pip install PyMuPDF==1.23.8图片版 PDF 的局限性
pdf2docx默认只能提取可复制的文字 PDF;如果 PDF 只是一张图片,pdf2docx 转换之后 Word 里面依旧只有图片,文字不能编辑,这是它的短板。
python‑pdf2docx 本身不带 OCR 文字识别。
https://www.ilovepdf.com
视频转二维码:
https://ma3you.com
草料二维码(免费版限制最多五人观看)
https://cli.im/multimedia
夜雨聆风