乐于分享
好东西不私藏

PDF处理——PyPDF2合并与分割

PDF处理——PyPDF2合并与分割

一、PDF合并

1.1 基本合并

import PyPDF2

defmerge_pdfs(pdf_list, output_path):
"""合并多个PDF文件"""
    writer = PyPDF2.PdfWriter()

for pdf_path in pdf_list:
withopen(pdf_path, 'rb'as file:
            reader = PyPDF2.PdfReader(file)
for page in reader.pages:
                writer.add_page(page)
print(f"已添加: {pdf_path} ({len(reader.pages)} 页)")

withopen(output_path, 'wb'as output:
        writer.write(output)
print(f"合并完成: {output_path} ({len(writer.pages)} 页)")

# 使用
pdf_files = ['cover.pdf''chapter1.pdf''chapter2.pdf''appendix.pdf']
merge_pdfs(pdf_files, 'merged.pdf')

1.2 按顺序合并

import PyPDF2
import os
from pathlib import Path

defmerge_pdfs_sorted(folder_path, output_path, pattern='*.pdf'):
"""按文件名排序合并PDF"""
    pdf_files = sorted(Path(folder_path).glob(pattern))

ifnot pdf_files:
print("未找到PDF文件")
return

    writer = PyPDF2.PdfWriter()

for pdf_path in pdf_files:
withopen(pdf_path, 'rb'as file:
            reader = PyPDF2.PdfReader(file)
for page in reader.pages:
                writer.add_page(page)
print(f"已添加: {pdf_path.name} ({len(reader.pages)} 页)")

withopen(output_path, 'wb'as output:
        writer.write(output)
print(f"合并完成: {output_path} ({len(writer.pages)} 页)")

# 使用
merge_pdfs_sorted('./chapters''complete_book.pdf')

1.3 选择性合并

import PyPDF2

defmerge_pdfs_selective(pdf_list, page_ranges=None):
"""
    选择性合并PDF
    pdf_list: [{'path': 'file.pdf', 'pages': [0, 2, 4]}]
    """

    writer = PyPDF2.PdfWriter()

for item in pdf_list:
        filepath = item['path']
        pages = item.get('pages'None)  # None表示所有页

withopen(filepath, 'rb'as file:
            reader = PyPDF2.PdfReader(file)

if pages isNone:
# 添加所有页
for page in reader.pages:
                    writer.add_page(page)
print(f"已添加所有页: {filepath} ({len(reader.pages)} 页)")
else:
# 添加指定页
for page_num in pages:
if0 <= page_num < len(reader.pages):
                        writer.add_page(reader.pages[page_num])
print(f"已添加 {len(pages)} 页: {filepath}")

return writer

# 使用
pdf_config = [
    {'path''cover.pdf''pages'None},
    {'path''report.pdf''pages': [012]},
    {'path''appendix.pdf''pages': [048]}
]

writer = merge_pdfs_selective(pdf_config)
withopen('selected_merged.pdf''wb'as output:
    writer.write(output)
print("选择性合并完成")

二、PDF分割

2.1 按页分割

import PyPDF2

defsplit_pdf_by_page(filepath, output_prefix='page'):
"""按页分割PDF"""
withopen(filepath, 'rb'as file:
        reader = PyPDF2.PdfReader(file)
        total_pages = len(reader.pages)

for i, page inenumerate(reader.pages):
            writer = PyPDF2.PdfWriter()
            writer.add_page(page)

            output_path = f"{output_prefix}_{i+1:03d}.pdf"
withopen(output_path, 'wb'as output:
                writer.write(output)
print(f"已保存: {output_path} ({i+1}/{total_pages})")

print(f"分割完成,共 {total_pages} 个文件")

split_pdf_by_page('document.pdf')

2.2 按范围分割

import PyPDF2

defsplit_pdf_by_range(filepath, ranges, output_prefix='part'):
"""
    按范围分割PDF
    ranges: [(start, end), (start, end)]
    """

withopen(filepath, 'rb'as file:
        reader = PyPDF2.PdfReader(file)
        total_pages = len(reader.pages)

for i, (start, end) inenumerate(ranges, 1):
            writer = PyPDF2.PdfWriter()

# 确保范围有效
            start = max(0min(start, total_pages))
            end = min(max(start, end), total_pages)

for page_num inrange(start, end):
                writer.add_page(reader.pages[page_num])

iflen(writer.pages) > 0:
                output_path = f"{output_prefix}_{i}.pdf"
withopen(output_path, 'wb'as output:
                    writer.write(output)
print(f"已保存: {output_path} ({len(writer.pages)} 页)")

# 分割为多个部分
ranges = [
    (010),   # 第1-10页
    (1020),  # 第11-20页
    (2030)   # 第21-30页
]
split_pdf_by_range('large_document.pdf', ranges)

2.3 按章节分割

import PyPDF2
import re

defsplit_pdf_by_chapter(filepath, chapter_pattern=r'Chapter \d+'):
"""
    按章节分割PDF(根据文本内容)
    """

withopen(filepath, 'rb'as file:
        reader = PyPDF2.PdfReader(file)

        chapters = []
        current_chapter = None
        current_pages = []

for i, page inenumerate(reader.pages):
            text = page.extract_text()

# 检查是否包含新章节标题
if re.search(chapter_pattern, text, re.IGNORECASE):
if current_chapter isnotNone:
                    chapters.append({
'title': current_chapter,
'pages': current_pages.copy()
                    })

# 提取章节标题
match = re.search(chapter_pattern, text, re.IGNORECASE)
                current_chapter = match.group(0)
                current_pages = [i]
else:
if current_chapter isnotNone:
                    current_pages.append(i)
else:
# 第一章之前的页
                    current_chapter = 'Introduction'
                    current_pages = [i]

# 最后一章
if current_chapter isnotNone:
            chapters.append({
'title': current_chapter,
'pages': current_pages
            })

# 保存各章节
for i, chapter inenumerate(chapters, 1):
            writer = PyPDF2.PdfWriter()
for page_num in chapter['pages']:
                writer.add_page(reader.pages[page_num])

# 清理文件名
            filename = f"chapter_{i:02d}_{chapter['title']}.pdf"
            filename = re.sub(r'[^\w\s-]''', filename)
            filename = re.sub(r'[-\s]+''_', filename)

withopen(filename, 'wb'as output:
                writer.write(output)
print(f"已保存: {filename} ({len(writer.pages)} 页)")

# 使用
split_pdf_by_chapter('book.pdf'r'第[一二三四五六七八九十]+章')

三、高级合并操作

3.1 带页眉页脚合并

import PyPDF2

defmerge_with_header_footer(pdf_files, output_path, header_pdf=None, footer_pdf=None):
"""合并PDF并添加页眉页脚"""
    writer = PyPDF2.PdfWriter()

# 读取页眉页脚
    header_pages = []
    footer_pages = []

if header_pdf:
withopen(header_pdf, 'rb'as f:
            header_reader = PyPDF2.PdfReader(f)
            header_pages = header_reader.pages

if footer_pdf:
withopen(footer_pdf, 'rb'as f:
            footer_reader = PyPDF2.PdfReader(f)
            footer_pages = footer_reader.pages

for pdf_path in pdf_files:
withopen(pdf_path, 'rb'as file:
            reader = PyPDF2.PdfReader(file)

for i, page inenumerate(reader.pages):
                writer.add_page(page)

# 添加页眉(如果有)
if header_pages:
                    header_page = header_pages[i % len(header_pages)]
# 这里需要合并页面,但PyPDF2不支持直接合并
# 可以使用其他库或手动合并

withopen(output_path, 'wb'as output:
        writer.write(output)
print("合并完成(带页眉页脚)")

3.2 交错合并

import PyPDF2

definterleave_pdfs(pdf1_path, pdf2_path, output_path):
"""交错合并两个PDF(交替页面)"""
    writer = PyPDF2.PdfWriter()

withopen(pdf1_path, 'rb'as f1, open(pdf2_path, 'rb'as f2:
        reader1 = PyPDF2.PdfReader(f1)
        reader2 = PyPDF2.PdfReader(f2)

        max_pages = max(len(reader1.pages), len(reader2.pages))

for i inrange(max_pages):
if i < len(reader1.pages):
                writer.add_page(reader1.pages[i])
if i < len(reader2.pages):
                writer.add_page(reader2.pages[i])

withopen(output_path, 'wb'as output:
        writer.write(output)
print(f"交错合并完成: {output_path} ({len(writer.pages)} 页)")

# 使用
interleave_pdfs('doc1.pdf''doc2.pdf''interleaved.pdf')

3.3 带目录合并

import PyPDF2

defmerge_with_toc(pdf_files, output_path, toc_data):
"""
    合并PDF并生成目录
    toc_data: [{'title': 'Chapter 1', 'page': 1}]
    """

    writer = PyPDF2.PdfWriter()

# 添加所有页面
    page_offset = 0
for pdf_path in pdf_files:
withopen(pdf_path, 'rb'as file:
            reader = PyPDF2.PdfReader(file)
for page in reader.pages:
                writer.add_page(page)
            page_offset += len(reader.pages)

# 添加目录(在文档开头)
# 这里使用简单方法:创建一个包含目录的页面

withopen(output_path, 'wb'as output:
        writer.write(output)
print(f"合并完成: {output_path} ({len(writer.pages)} 页)")
print("目录信息:")
for item in toc_data:
print(f"  {item['title']} - 第{item['page']}页")

四、实战案例

4.1 报告合并器

import PyPDF2
from pathlib import Path
import os
from datetime import datetime

classReportMerger:
"""报告合并器"""

def__init__(self):
self.writer = PyPDF2.PdfWriter()
self.report_info = []

defadd_report(self, filepath, title=None, description=None):
"""添加报告"""
ifnot os.path.exists(filepath):
print(f"文件不存在: {filepath}")
return

withopen(filepath, 'rb'as file:
            reader = PyPDF2.PdfReader(file)

            start_page = len(self.writer.pages)
for page in reader.pages:
self.writer.add_page(page)
            end_page = len(self.writer.pages)

self.report_info.append({
'file': filepath,
'title': title or Path(filepath).stem,
'description': description,
'pages': reader.pages,
'start_page': start_page + 1,
'end_page': end_page
            })

print(f"已添加: {Path(filepath).name} ({len(reader.pages)} 页)")

defgenerate_toc(self):
"""生成目录"""
# 在文档开头添加目录页
# 注意:这里需要先保存再添加目录,或者使用其他方法
pass

defsave(self, output_path):
"""保存合并的报告"""
withopen(output_path, 'wb'as output:
self.writer.write(output)

print(f"\n报告合并完成: {output_path}")
print(f"总页数: {len(self.writer.pages)}")
print("\n报告列表:")
for info inself.report_info:
print(f"  {info['title']}: 第{info['start_page']}-{info['end_page']}页")
if info['description']:
print(f"    {info['description']}")

# 使用
merger = ReportMerger()
merger.add_report('cover.pdf''封面')
merger.add_report('executive_summary.pdf''执行摘要''项目概述')
merger.add_report('technical_report.pdf''技术报告')
merger.add_report('appendix.pdf''附录')
merger.save('complete_report.pdf')

4.2 批量分割工具

import PyPDF2
from pathlib import Path
import os

classPDFSplitter:
"""PDF分割工具"""

def__init__(self):
self.stats = {
'processed'0,
'pages'0,
'files_created'0
        }

defsplit_by_pages(self, filepath, output_dir='split_output'):
"""按页分割(每页一个文件)"""
        os.makedirs(output_dir, exist_ok=True)

withopen(filepath, 'rb'as file:
            reader = PyPDF2.PdfReader(file)
            base_name = Path(filepath).stem

for i, page inenumerate(reader.pages):
                writer = PyPDF2.PdfWriter()
                writer.add_page(page)

                output_path = os.path.join(output_dir, f"{base_name}_page_{i+1:03d}.pdf")
withopen(output_path, 'wb'as output:
                    writer.write(output)

self.stats['files_created'] += 1
print(f"已保存: {output_path}")

self.stats['processed'] += 1
self.stats['pages'] += len(reader.pages)

print(f"分割完成: {filepath} -> {len(reader.pages)} 个文件")

defsplit_by_page_range(self, filepath, ranges, output_dir='split_output'):
"""按页范围分割"""
        os.makedirs(output_dir, exist_ok=True)

withopen(filepath, 'rb'as file:
            reader = PyPDF2.PdfReader(file)
            base_name = Path(filepath).stem
            total_pages = len(reader.pages)

for i, (start, end) inenumerate(ranges, 1):
                writer = PyPDF2.PdfWriter()

                start = max(0min(start, total_pages))
                end = min(max(start, end), total_pages)

for page_num inrange(start, end):
                    writer.add_page(reader.pages[page_num])

iflen(writer.pages) > 0:
                    output_path = os.path.join(output_dir, f"{base_name}_part_{i:02d}.pdf")
withopen(output_path, 'wb'as output:
                        writer.write(output)

self.stats['files_created'] += 1
print(f"已保存: {output_path} ({len(writer.pages)} 页)")

self.stats['processed'] += 1
self.stats['pages'] += total_pages

defsplit_by_size(self, filepath, pages_per_file=10, output_dir='split_output'):
"""按文件大小分割(每N页一个文件)"""
        os.makedirs(output_dir, exist_ok=True)

withopen(filepath, 'rb'as file:
            reader = PyPDF2.PdfReader(file)
            base_name = Path(filepath).stem
            total_pages = len(reader.pages)

for i inrange(0, total_pages, pages_per_file):
                writer = PyPDF2.PdfWriter()

                end = min(i + pages_per_file, total_pages)
for page_num inrange(i, end):
                    writer.add_page(reader.pages[page_num])

                part_num = i // pages_per_file + 1
                output_path = os.path.join(output_dir, f"{base_name}_part_{part_num:02d}.pdf")
withopen(output_path, 'wb'as output:
                    writer.write(output)

self.stats['files_created'] += 1
print(f"已保存: {output_path} ({len(writer.pages)} 页)")

self.stats['processed'] += 1
self.stats['pages'] += total_pages

defget_stats(self):
"""获取统计信息"""
returnself.stats

# 使用
splitter = PDFSplitter()

# 按页分割
splitter.split_by_pages('document.pdf')

# 按范围分割
ranges = [(05), (510), (1020)]
splitter.split_by_page_range('document.pdf', ranges)

# 按大小分割
splitter.split_by_size('document.pdf', pages_per_file=5)

print(f"统计: {splitter.get_stats()}")

4.3 文件整理工具

import PyPDF2
from pathlib import Path
import os
import shutil

classPDFOrganizer:
"""PDF整理工具"""

def__init__(self):
self.organized = []

deforganize_files(self, folder_path, output_dir='organized'):
"""整理PDF文件"""
        os.makedirs(output_dir, exist_ok=True)

        pdf_files = Path(folder_path).glob('*.pdf')

for pdf_path in pdf_files:
try:
withopen(pdf_path, 'rb'as file:
                    reader = PyPDF2.PdfReader(file)

# 获取文件信息
                    info = {
'filename': pdf_path.name,
'pages'len(reader.pages),
'size': os.path.getsize(pdf_path),
'path': pdf_path
                    }

# 根据页数分类
if info['pages'] <= 5:
                        category = 'small'
elif info['pages'] <= 20:
                        category = 'medium'
else:
                        category = 'large'

                    info['category'] = category
self.organized.append(info)

# 复制文件到分类目录
                    dest_dir = os.path.join(output_dir, category)
                    os.makedirs(dest_dir, exist_ok=True)
                    shutil.copy2(pdf_path, dest_dir)

print(f"已整理: {pdf_path.name} -> {category} ({info['pages']} 页)")

except Exception as e:
print(f"处理失败: {pdf_path.name} - {e}")

self._generate_report(output_dir)

def_generate_report(self, output_dir):
"""生成整理报告"""
        report_path = os.path.join(output_dir, 'report.txt')

withopen(report_path, 'w', encoding='utf-8'as f:
            f.write("PDF文件整理报告\n")
            f.write("="*50 + "\n")
            f.write(f"总文件数: {len(self.organized)}\n")

# 统计分类
            categories = {}
for item inself.organized:
                cat = item['category']
                categories[cat] = categories.get(cat, 0) + 1

            f.write("\n分类统计:\n")
for cat, count in categories.items():
                f.write(f"  {cat}{count} 个文件\n")

            f.write("\n文件列表:\n")
for item inself.organized:
                f.write(f"  {item['filename']} - {item['pages']} 页 - {item['category']}\n")

print(f"报告已生成: {report_path}")

# 使用
organizer = PDFOrganizer()
organizer.organize_files('./pdfs''organized_pdfs')

五、总结

# 快速参考

# 1. 合并PDF
writer = PyPDF2.PdfWriter()
writer.add_page(page)
withopen('output.pdf''wb'as f:
    writer.write(f)

# 2. 分割PDF
for i, page inenumerate(reader.pages):
    writer = PyPDF2.PdfWriter()
    writer.add_page(page)
withopen(f'page_{i+1}.pdf''wb'as f:
        writer.write(f)

# 3. 选择性合并
writer = PyPDF2.PdfWriter()
pdf_config = [
    {'path''file1.pdf''pages': [024]},
    {'path''file2.pdf''pages'None}  # 所有页
]

# 4. 交错合并
for i inrange(max_pages):
    writer.add_page(reader1.pages[i]) if i < len(reader1.pages)
    writer.add_page(reader2.pages[i]) if i < len(reader2.pages)

# 5. 批量处理
files = Path(folder).glob('*.pdf')
for file in files:
    process(file)

PyPDF2提供了完整的PDF合并与分割功能,可以灵活地组合和拆分PDF文件。通过合理使用这些功能,可以实现文档的自动化处理,提高工作效率。根据实际需求,可以组合使用不同的操作来实现复杂的PDF处理流程。