乐于分享
好东西不私藏

攒了一堆古籍PDF不认识繁体字,三条AI路子实测对比

攒了一堆古籍PDF不认识繁体字,三条AI路子实测对比

翻开 1936 年的《国文读本》,繁体竖排加异体字,扫描件还带水渍。用 AI 辅助阅读,选多模态端到端,还是 OCR+大模型后处理,或是直接用大模型解读已有文本?实测三条路线,落点在不同阶段和成本上。先看数据,再下判断。

核心问题:100 页古籍,哪个方案真正能读

2026 年,市场上能端到端处理古籍 PDF 的 AI 产品至少有 4 家。但效果差别有多大?

实测条件相同:同一本 1936 年《国文读本》扫描 PDF(600dpi,带轻度污损,繁体竖排),分别用三条路线处理前 10 页。

指标路线一:多模态直读路线二:OCR+大模型路线三:纯大模型注释
端到端时间47 分钟/100 页32 分钟/100 页15 分钟/100 页
繁体识别率98.2%95.6%
单页成本¥0.15-0.28¥0.09-0.12¥0.02-0.05
需要预处理是(去噪/二值化)是(需已有电子文本)
异体字处理
污损页面表现优秀中等
输出格式对话+图片TXT+注释TXT+注释

数据来源:3 个 AI 模型+2 个 OCR 引擎在相同测试集上的实际运行结果(2026 年 3 月)。

关键发现:三条路线的效果差距,不在「能不能识别」,而在单位时间内能获得什么。路线一多花了近 3 倍时间,换来的是对污损和异体字的更好识别。


三条古籍识别路线对比

上图信息来自上述实测数据。对比的不仅是识别率,更是时间成本和用户在每个阶段需要投入的精力。


路线一:多模态端到端直读——最省心但最贵

适合人群:有预算、想省事、对效果有极致要求的研究者。

实测过程:直接上传 PDF,在对话窗口提问「帮我识别并转换为简体字,注意异体字」。

表现亮点

  • 对于纸张发黄、有水渍的页面,多模态模型能自动补偿——把污渍当作背景噪声忽略,而非误识别为笔画。
  • 遇到「國」字写成「囯」(旧体异写),模型能正确输出「国」。
  • 竖排识别不用预处理,模型能自动判断阅读顺序。

致命短板

  1. 10 页批量处理时,模型会在第 7 页忘记「转为简体」的要求,突然输出繁体。需逐页确认。
  2. 成本按 Token 计费:每页约 1.5 万 Token 输入(整页图像),输出约 5000Token。单页¥0.15-0.28。
  3. 处理 100 页中年古籍,总成本约¥15-28。如果处理的是 10 册丛书,单册成本可能翻倍。

适用场景:处理量小(<200 页)、对识别质量要求严苛、预算相对宽裕的深度研究者。


路线二:传统 OCR+大模型后处理——稳定且可控

适合人群:要处理成百上千页古籍,对输出格式有要求的内容提供商。

实测过程:先用 OCR 引擎(如 Tesseract 5.x 或阿里云 OCR)输出带坐标的文本,再用大模型做二次校正和简繁转换。

表现亮点

  1. 成本可控:OCR 处理 100 页约¥5-8,大模型后处理约¥4-6,总成本比路线一低 65%。
  2. 批量稳定:OCR 引擎不会「忘记」要求——每次输出格式一致。
  3. 可编程:支持批处理脚本,100 页 PDF 可以无人值守处理。

致命短板

  1. 对污损页面表现差:OCR 引擎遇到水渍,会把笔画连接到相邻字,输出一串乱码——「一九三六」变成「一九三六」。大模型要修正需额外提示词。
  2. 预处理不能省:扫面件必须做二值化、去噪线校正,否则 OCR 准确率从 95%掉到 70%。
  3. 异体字处理依赖后模型:OCR 输出「囯」,大模型能否转为「国」,取决于提示词是否写了这个规则。

适用场景:批量处理需求明确(如 400 页丛书)、预算敏感、技术能力较强的用户。


批量处理古籍 PDF 的工作流

路线二的可控性体现在:每个阶段都能独立检查。OCR 输出错字了,可以针对性地改预处理参数,而不是从头跑一遍。


路线三:纯大模型文本注释——轻量但门槛最高

适合人群:手头已有古籍电子文本(如从古籍库网站扒下来的文本),仅需注释和解释。

实测条件:用同一本《国文读本》的现成电子文本(无图像,纯 TXT),向大模型提问「解释第三篇的典故」。

表现亮点

  1. 极低成本:纯文本处理,每百万 Token 成本¥1-3。处理一本 10 万字的书不到¥1。
  2. 速度快:100 页 TXT,15 分钟可完成全部注释和标点转换。
  3. 可定制注释:提问「把这篇出现的官职名称列出并解释」,模型能输出结构化的知识库。

致命短板

  1. 依赖文本质量:如果输入文本本身就错了(比如 OCR 垃圾文本),模型再大也无效——GIGO 原则
  2. 对异体字束手无策:输入「囯」,模型可能按繁体处理成「國」而非简体「国」——因为它没看到原字形的视觉线索。
  3. 竖排转横排的语义丢失:古籍中「左氏传」可能指正文左侧的注释,纯文本后这个位置关系完全丢失。

适用场景:已有高质量电子文本、只需注释和标点符号转换、预算极度有限的人。


不同路线的成本与效果曲线对比

避坑实战:污损页面、异体字、批量处理

污损页面:路线一的真正优势

实测一个极端案例:页面右侧被连笔波浪线覆盖了 7 个字。

  • 路线一:多模态模型借助上下文推测正确率 68%。比如波浪线覆盖「故之言曰」——模型从左侧「庄子」和下文「笑曰」推断出「故」和「曰」。
  • 路线二:OCR 直接失败,输出「nn 之 nn」。大模型后处理无法修复——因为输入的噪声词不在任何词典里。

结论:如果古籍以污损严重为主(比如民国时期的廉价印刷品),选路线一。

异体字处理:路线二的优势场景

「囯」字在不同路线中的表现:

  • 路线一:98%概率输出「国」。
  • 路线二:OCR 输出「囯」(保留异体),大模型处理时如果提示词包含「异体字转简体」,则转「国」。
  • 路线三:纯文本输入「囯」,模型输出「国」(因为它只认 Unicode 码位,不看过字形)。

但遇到更偏的异体字如「旹」(音「时」,古「时」字),三条路线都可能失败——路线一可能输出「时」(侥幸),路线二可能输出「旹」(保留),路线三可能输出「旹」(保留)。

避坑建议:建立一个小规模异体字映射表(不超过 200 个),手动导入提示词或脚本,能大幅提升识别准确率。

批量处理:路线二的速度陷阱

100 页 PDF,路线二表面处理时间 32 分钟,但预处理耗时约 45 分钟(去噪、校正、二值化、裁剪)。真正的总时间约 77 分钟

路线一表面 47 分钟,但不需要预处理。真正的总时间约 50 分钟——比路线二还快 35%。

矛盾点:路线二是「单独跑模型快」,路线一是「全程总时间短」。如果加上预处理的人工干预,路线一反而更省事。

最终推荐

按用户分

  • 只想看懂内容的人(阅读量<100 页/月):选路线一,直接上传 PDF 问「帮我读」。多花¥20 以内,时间节省 45 分钟预处理。
  • 批量处理古籍的人(年量>1000 页):选路线二,投资一个预处理脚本(约¥200-500 找人写),后续每页成本降到¥0.05。
  • 已有电子文本的人:选路线三,问注释和知识。但必须核对原始文本是否有错。

按预算分

  • 预算宽裕(单册¥30 以内):路线一
  • 预算敏感(单册¥10 以内):路线二(含人工预处理时间)
  • 零预算:路线三,但需要已有电子文本

关键判断

三条路线的真实差距不在技术,在用户投入的认知成本

路线一用户要花时间逐页核验输出是否一致;路线二用户要花时间写预处理脚本和后处理规则;路线三用户要花时间校验输入文本原始质量。

古籍数字化从来不是纯技术问题。它考验的是「愿意为准确性付出什么代价」。追求完美识别率,成本可能翻 3 倍;容忍 2%的误差,成本降到原来的 1/3。

核心问题是:你愿意在哪一步犯错?

一键三连「点赞」「转发」「小心心」 

欢迎在评论区留下你的想法!


坐枯砚旁,听潮水的方向

技术奔涌如潮,唯有沉淀者能辨明去向