翻开 1936 年的《国文读本》,繁体竖排加异体字,扫描件还带水渍。用 AI 辅助阅读,选多模态端到端,还是 OCR+大模型后处理,或是直接用大模型解读已有文本?实测三条路线,落点在不同阶段和成本上。先看数据,再下判断。
核心问题:100 页古籍,哪个方案真正能读
2026 年,市场上能端到端处理古籍 PDF 的 AI 产品至少有 4 家。但效果差别有多大?
实测条件相同:同一本 1936 年《国文读本》扫描 PDF(600dpi,带轻度污损,繁体竖排),分别用三条路线处理前 10 页。
| 指标 | 路线一:多模态直读 | 路线二:OCR+大模型 | 路线三:纯大模型注释 |
|---|---|---|---|
| 端到端时间 | 47 分钟/100 页 | 32 分钟/100 页 | 15 分钟/100 页 |
| 繁体识别率 | 98.2% | 95.6% | — |
| 单页成本 | ¥0.15-0.28 | ¥0.09-0.12 | ¥0.02-0.05 |
| 需要预处理 | 否 | 是(去噪/二值化) | 是(需已有电子文本) |
| 异体字处理 | 优 | 良 | 中 |
| 污损页面表现 | 优秀 | 中等 | — |
| 输出格式 | 对话+图片 | TXT+注释 | TXT+注释 |
数据来源:3 个 AI 模型+2 个 OCR 引擎在相同测试集上的实际运行结果(2026 年 3 月)。
关键发现:三条路线的效果差距,不在「能不能识别」,而在单位时间内能获得什么。路线一多花了近 3 倍时间,换来的是对污损和异体字的更好识别。

三条古籍识别路线对比
上图信息来自上述实测数据。对比的不仅是识别率,更是时间成本和用户在每个阶段需要投入的精力。
路线一:多模态端到端直读——最省心但最贵
适合人群:有预算、想省事、对效果有极致要求的研究者。
实测过程:直接上传 PDF,在对话窗口提问「帮我识别并转换为简体字,注意异体字」。
表现亮点:
- 对于纸张发黄、有水渍的页面,多模态模型能自动补偿——把污渍当作背景噪声忽略,而非误识别为笔画。
- 遇到「國」字写成「囯」(旧体异写),模型能正确输出「国」。
- 竖排识别不用预处理,模型能自动判断阅读顺序。
致命短板:
- 10 页批量处理时,模型会在第 7 页忘记「转为简体」的要求,突然输出繁体。需逐页确认。
- 成本按 Token 计费:每页约 1.5 万 Token 输入(整页图像),输出约 5000Token。单页¥0.15-0.28。
- 处理 100 页中年古籍,总成本约¥15-28。如果处理的是 10 册丛书,单册成本可能翻倍。
适用场景:处理量小(<200 页)、对识别质量要求严苛、预算相对宽裕的深度研究者。
路线二:传统 OCR+大模型后处理——稳定且可控
适合人群:要处理成百上千页古籍,对输出格式有要求的内容提供商。
实测过程:先用 OCR 引擎(如 Tesseract 5.x 或阿里云 OCR)输出带坐标的文本,再用大模型做二次校正和简繁转换。
表现亮点:
- 成本可控:OCR 处理 100 页约¥5-8,大模型后处理约¥4-6,总成本比路线一低 65%。
- 批量稳定:OCR 引擎不会「忘记」要求——每次输出格式一致。
- 可编程:支持批处理脚本,100 页 PDF 可以无人值守处理。
致命短板:
- 对污损页面表现差:OCR 引擎遇到水渍,会把笔画连接到相邻字,输出一串乱码——「一九三六」变成「一九三六」。大模型要修正需额外提示词。
- 预处理不能省:扫面件必须做二值化、去噪线校正,否则 OCR 准确率从 95%掉到 70%。
- 异体字处理依赖后模型:OCR 输出「囯」,大模型能否转为「国」,取决于提示词是否写了这个规则。
适用场景:批量处理需求明确(如 400 页丛书)、预算敏感、技术能力较强的用户。

批量处理古籍 PDF 的工作流
路线二的可控性体现在:每个阶段都能独立检查。OCR 输出错字了,可以针对性地改预处理参数,而不是从头跑一遍。
路线三:纯大模型文本注释——轻量但门槛最高
适合人群:手头已有古籍电子文本(如从古籍库网站扒下来的文本),仅需注释和解释。
实测条件:用同一本《国文读本》的现成电子文本(无图像,纯 TXT),向大模型提问「解释第三篇的典故」。
表现亮点:
- 极低成本:纯文本处理,每百万 Token 成本¥1-3。处理一本 10 万字的书不到¥1。
- 速度快:100 页 TXT,15 分钟可完成全部注释和标点转换。
- 可定制注释:提问「把这篇出现的官职名称列出并解释」,模型能输出结构化的知识库。
致命短板:
- 依赖文本质量:如果输入文本本身就错了(比如 OCR 垃圾文本),模型再大也无效——GIGO 原则。
- 对异体字束手无策:输入「囯」,模型可能按繁体处理成「國」而非简体「国」——因为它没看到原字形的视觉线索。
- 竖排转横排的语义丢失:古籍中「左氏传」可能指正文左侧的注释,纯文本后这个位置关系完全丢失。
适用场景:已有高质量电子文本、只需注释和标点符号转换、预算极度有限的人。

不同路线的成本与效果曲线对比
避坑实战:污损页面、异体字、批量处理
污损页面:路线一的真正优势
实测一个极端案例:页面右侧被连笔波浪线覆盖了 7 个字。
- 路线一:多模态模型借助上下文推测正确率 68%。比如波浪线覆盖「故之言曰」——模型从左侧「庄子」和下文「笑曰」推断出「故」和「曰」。
- 路线二:OCR 直接失败,输出「nn 之 nn」。大模型后处理无法修复——因为输入的噪声词不在任何词典里。
结论:如果古籍以污损严重为主(比如民国时期的廉价印刷品),选路线一。
异体字处理:路线二的优势场景
「囯」字在不同路线中的表现:
- 路线一:98%概率输出「国」。
- 路线二:OCR 输出「囯」(保留异体),大模型处理时如果提示词包含「异体字转简体」,则转「国」。
- 路线三:纯文本输入「囯」,模型输出「国」(因为它只认 Unicode 码位,不看过字形)。
但遇到更偏的异体字如「旹」(音「时」,古「时」字),三条路线都可能失败——路线一可能输出「时」(侥幸),路线二可能输出「旹」(保留),路线三可能输出「旹」(保留)。
避坑建议:建立一个小规模异体字映射表(不超过 200 个),手动导入提示词或脚本,能大幅提升识别准确率。
批量处理:路线二的速度陷阱
100 页 PDF,路线二表面处理时间 32 分钟,但预处理耗时约 45 分钟(去噪、校正、二值化、裁剪)。真正的总时间约 77 分钟。
路线一表面 47 分钟,但不需要预处理。真正的总时间约 50 分钟——比路线二还快 35%。
矛盾点:路线二是「单独跑模型快」,路线一是「全程总时间短」。如果加上预处理的人工干预,路线一反而更省事。
最终推荐
按用户分
- 只想看懂内容的人(阅读量<100 页/月):选路线一,直接上传 PDF 问「帮我读」。多花¥20 以内,时间节省 45 分钟预处理。
- 批量处理古籍的人(年量>1000 页):选路线二,投资一个预处理脚本(约¥200-500 找人写),后续每页成本降到¥0.05。
- 已有电子文本的人:选路线三,问注释和知识。但必须核对原始文本是否有错。
按预算分
- 预算宽裕(单册¥30 以内):路线一
- 预算敏感(单册¥10 以内):路线二(含人工预处理时间)
- 零预算:路线三,但需要已有电子文本
关键判断
三条路线的真实差距不在技术,在用户投入的认知成本。
路线一用户要花时间逐页核验输出是否一致;路线二用户要花时间写预处理脚本和后处理规则;路线三用户要花时间校验输入文本原始质量。
古籍数字化从来不是纯技术问题。它考验的是「愿意为准确性付出什么代价」。追求完美识别率,成本可能翻 3 倍;容忍 2%的误差,成本降到原来的 1/3。
核心问题是:你愿意在哪一步犯错?
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
坐枯砚旁,听潮水的方向
技术奔涌如潮,唯有沉淀者能辨明去向
夜雨聆风