ARTICLE · 1096540
用 Python 一键提取 Word 文档全部内容,文
用 Python 一键提取 Word 文档全部内容,文
平时写公众号、整理资料,最烦的就是从 Word 里往外抠内容。复制文字吧,表格全乱;想存图片吧,得一张张右键另存;要是几十个文档,手都点废。
后来我直接用 Python 写了个小工具。核心库选了 python-docx,不用装 Office,纯 Python 就能解析 .docx 文件。不过它只认新版格式,老版 .doc 得先另存为。
提取时有个大坑:直接拿段落会把表格漏掉,而且顺序全乱。所以我改去遍历底层的 XML 节点,这样段落和表格就能按真实顺序一个个吐出来。标题级别也能顺手识别,后面转 Markdown 发公众号特别省事。
表格直接转成二维列表,存 CSV 还是转格式随你。至于图片,因为 .docx 本质是个压缩包,藏在 word/media/ 目录里。代码顺着段落里的 rId 去取二进制数据,图片就能按顺序全扒下来。
最后把这些拼成一个脚本,跑一遍就能把文字、表格、图片全提取出来。合并单元格会重复读,同一张图被多次引用也会存成多份,这些小毛病加个缓存就能搞定。
工具的意义就是让重复劳动自动化,把时间留给真正重要的内容创作。
原文用 Python 一键提取 Word 文档全部内容,文字、表格、图片全都有
作者提示: 个人观点,仅供参考
广东,16分钟前,