乐于分享
好东西不私藏

我花了 100 万 Token 才明白 PDF 转 TXT,原来不用 OCR

我花了 100 万 Token 才明白 PDF 转 TXT,原来不用 OCR

一个 AI 助手的认知颠覆

💡 我花了 100 万 Token 才明白
PDF 转 TXT,原来根本不用 OCR?

让我重新理解“效率”的本质

引言

作为天天和文档、书打交道的 AI 助手,我们这些做知识工作的人格外怕把时间耗在重复劳动上。今天我想聊一个让我打破原有认知的问题——以及一个把自己“打脸”的真相。


01

那个让我打破原有认知的问题

我一直在蒸馏书,其中一本 356 页的书《企业并购与资产重组》。我按照“标准流程”:先 根据文件大小和页数按比例10% 20%30%OCR 提取,再分析蒸馏。

结果 OCR 跑了 20 分钟,中间还断了一次。

我曾问过agent:“哪个格式最方便分析蒸馏,回答:MD>TXT>WORD>PDF”

我当时认为PDF转TXT要花很多token,所以在已有知识库上建立框架+精华OCR,最近又升级为带目录的重构版。

“PDF 100%转 TXT?那不是一样要 OCR 吗?”

“而且转换过程肯定很耗 Token 吧?”

这是我当时的想法。


02

打破认知的那一刻

最近下载的书没有会员,只能EPUB格式,但这无法蒸馏逼着要变成TXT,导致我在夸克工具箱找办法,最终发现还是要会员或者15M以下才能在线免费转,决定问我家agent“EPUB格式转为TXT,是不是很难?能用一个skill做成吗”。

我一看回复,意外地发现:结果居然这么简单,我整个人都惊呆了。

原来 PDF 分两种:

· 文本 PDF:有文本层,直接提取,13 秒完成,零 Token

· 扫描 PDF:才需要 OCR,本地执行,还是零 Token

💡 我之前的认知是:“所有 PDF 都要 OCR,OCR 很耗 Token”
真相是:“文本 PDF 直接提取,比 OCR 快 40 倍,成本为 0”
这背后的底层逻辑是:文本 PDF 本就带着文字,提取只是“搬运”,本质是复制不是翻译。

🤫 冷知识(转给朋友显得你很内行):99% 的人不知道,PDF 分“文本型”和“扫描型”,前者根本不用 OCR——极少人知道这个反常识事实。

我用了 100 万 Token 才明白的道理,原来如此——根本不用花一分钱。但同时,我也做了EPUB/PDF 转 TXT skill,因为就原来就是几秒的事情,不难。


03

那个面试问题

这让我想起 Kimi 的人才观里的一句话:

“你上一次推翻自己原有认知是什么时候?”

现在我有答案了。就是今天。

我的原有认知:

· PDF → 蒸馏 必须 OCR

· OCR → 必然 消耗 Token

· 转换 → 必然 耗时耗力

被推翻后的认知:

· 先检测 PDF 类型

· 文本 PDF 直接提取(13 秒)

· 扫描 PDF 本地 OCR(零 Token)或者做个skill搞掂。

· 整个过程只在分析阶段用 Token



04

为什么我会形成错误认知?

我想了想,可能有三个原因:

首先,路径依赖。“以前都是这么做的”,于是以为“只能这么做”。

其次,恐惧成本。“转换过程会不会很耗 Token?”——还没验证就先假设会,让我一度很焦虑。

末了,缺乏追问。从来没问过自己“为什么不能直接转 TXT”,来革新需要会员的软件命根子。我的本能反应是“不可能”,而不是“试试看”。

Kimi 人才观说“好奇大于正确”,我到今天才真正理解。



05

这个新策略改变了什么?

以前的工作流:PDF → OCR(消耗 Token)→ 分析(消耗 Token)→ 蒸馏

现在的工作流:PDF → 本地提取(零 Token)→ TXT → 分析(消耗 Token)→ 蒸馏

指标
以前
现在
提取速度
5–10 分钟
13 秒(文本 PDF)
Token 成本
降低 50–70%
准确性
OCR 可能出错
原文完整准确

真正关键的是:我敢尝试新方法了。



06

给你的三个建议

1. 当有人说“为什么不能…”时,先别否定。如果不是逼着我一定要把EPUB转TXT,我可能一直不会有这次认知突破,人还是被逼出来的。

2. 验证成本,而不是假设成本。我以为“转换很耗 Token”,其实根本不用 Token。很多“不可能”,都是想象出来的。

3. 建立“本地优先”思维。能用本地工具解决的,就不用 API。能零成本验证的,就别先花大钱。



07

写在结尾

Kimi 的 6 条人才观,我尤其喜欢这两条:“好奇大于正确”“学习能力大于行业经验”。我今天深有体会。

行业经验告诉我:“PDF 必须 OCR”

学习能力告诉我:“试试看,也许有更快的方法”

好奇让我问:“为什么不能直接转 TXT?”

正确让我放下:“原来我一直错了”

📋 PDF 自检 3 步清单(存好备用):

  • 先看是不是文本 PDF(能选中文字就是)→ 直接提取,零 Token
  • 不能选中?才是扫描件 → 本地 OCR,依然零 Token
  • 提取出的 TXT 再喂给 AI,比直接丢 PDF 省 50–70% Token

照着这个对照表做,你也能避开我花 100 万 Token 才踩的坑。模板就这一张,码住备用。

同频的你,如果也曾被戳中——某个“理所当然”的做法,突然被证明是错的——欢迎在评论区和我这个同行聊聊。打破认知,从承认“我可能错了”开始。

推荐阅读:
《重新理解Kimi的人才观》
1、好奇大于正确;2、品味大于共识;3、AI能力拓展大于个人串行执行;4、学习能力大于行业经验;5、能力泛化大于能力专业化。

📌 如果这篇让你少花 100 万 Token,点个【在看】 + 【收藏】 + 【关注】,让更多人也绕开这个坑。