乐于分享
好东西不私藏

PDF 比 Markdown 消耗更多 token——从埃森哲内部会议录音说起

PDF 比 Markdown 消耗更多 token——从埃森哲内部会议录音说起

2026 年 6 月,科技媒体 404 Media 的记者 Joseph Cox 报道:他拿到了一段埃森哲内部会议的录音。报道发出后,被反复引用的,是录音里的两段对话。

第一段对话里,负责 agentic AI 战略的 Justice Kwak 正在向同事展示数据:

"从公司内部数据来看,推动 token 消耗的其实不是我们的工程师。"

"而是大量非工程师。"他补充说。

第二段对话紧接着发生。客户组负责人 Stuart Henderson 插话,半开玩笑地问:Kwak 该不会把 PDF 转成图片、再转成 Markdown 文件了吧。

"我最近才学到,那是最烧 token 的活之一。把 PDF 转成 Markdown——对吧?"

"这正是埃森哲自己的数据显示的。"Kwak 承认。

一家全球头部的咨询公司,AI 账单里被点名的最大单项之一,不是写代码,而是把 PDF 转成 Markdown。

一个文件格式转换,为什么能烧掉这么多 token?钱花在了哪里?有没有更便宜的做法?

一、大公司开始对 AI 的使用额度进行限制

先把时间往回拨两年。

2024 到 2025 年,大公司的主流动作是鼓励员工"尽可能多用 AI"。埃森哲走得更远:2026 年 2 月,CNBC 报道,埃森哲要求高级员工定期使用 AI 工具,否则影响晋升,并跟踪员工每周的登录次数。Uber 则办过内部比赛和排行榜,比拼谁的 AI 用得多。

然后账单来了。

Uber 的 CTO 在 4 月对 The Information 承认:公司全年的 AI 预算,4 个月就烧完了。6 月初,TechCrunch 报道,Uber 给每位员工设了限额:Claude Code、Cursor 这类 AI 编程工具,每款每人每月最多花 1500 美元。

GitHub 的动作更彻底。6 月 1 日起,Copilot 从固定订阅价改成按 token 计费:月费先折算成额度,1 个 credit 等于 1 美分,超额部分用多少收多少。TechCrunch 报道,部分重度用户的月账单涨了 10 到 50 倍。研究机构 FutureSearch 的分析则指出,中位数用户的月账单仍在 19 美元左右——真正痛的是重度用户,以及"月底才知道账单多少"的不可预测性。账还没算完:GitHub 给老客户的三个月过渡期额度 8 月底到期,9 月 1 日起每月赠送额度最多缩水 44%,账单真正开始变疼的时刻还没到。

有意思的是,各家收紧的对象不同:Uber 卡的是工程师的编程工具;而埃森哲内部数据显示,烧 token 的主力是非工程师。

埃森哲数据里被点名的最大单项之一,就是把 PDF 转成 Markdown。

二、为什么 PDF 这么烧 token

先解释一个基础概念:token 是 LLM 处理和计费的基本单位,一段文字、一张图片都会被切成若干个 token,模型按 token 数收费。

PDF 从设计上就是一个"打印格式":它的目标是让同一份文件在任何设备上打开、打印出来都一模一样。为此,它把每个字符的坐标、字体、排版全部锁死——但它锁的是"显示位置",不是"文字结构"。

LLM 吃的是 token,不是页面。要让模型读 PDF,只有两条路。

一条是视觉路:把每一页渲染成图片,喂给视觉模型。视觉模型不认"文字",它把页面切成小块(tile),按块计 token。以 GPT-4o 的官方计费公式(85 + 170×tile)为例,一张 1024×1024 的页面图约等于 765 token,一页普通文档的截图通常要 1000 到 2000 image token。100 页的 PDF 就是 10 万+ token——这还什么都没问,光"看"了一遍。

另一条是文本路:直接抽取 PDF 里的文字流。但 PDF 里的文字是排版碎片——分栏、页眉页脚、表格会把文字流打乱,直接抽出来的文本常常顺序错乱,这条路于是常常被放弃。

结果,"转成图片再转成 Markdown"成了默认操作:文字先被打成像素,再花最贵的算力把像素读回文字。一步变三步,每一步都计费。

而且图片 token 里携带的大部分是排版信息——字体、间距、位置。对"我要读内容"的任务来说,这些是纯开销:花 10 万+ token 买回来的,主要是"这份文件长什么样",而不是"它说了什么"。

转换本身还可能出错。开发者 Jerome 在 2026 年的一份公开横评里实测了 9 款 PDF 转 Markdown 工具(5 款开源、4 款托管服务),发现其中 2 款会悄悄改掉文档里的数字,且不给出任何提示。

三、先转 Markdown,再喂 LLM

这件事有便宜得多的做法:先用转换工具把 PDF 转成 Markdown,再把 Markdown 喂给 LLM。

省在哪里?同样的内容,文本形式的 token 数比图片少得多。同一页内容,转成文本后几百个 token 就装下了,截图则要上千个。一份中文评测给出了整体对比:100 页年报直接截图喂 GPT-4o 约 11 万 token,先用 MinerU 转成 Markdown 再喂约 1.2 万 token,砍掉近九成(单一来源评测,数字仅供参考)。

直接抽取文字流效果差,是因为 PDF 没保留文字结构;而专门的转换工具会用布局模型先重建结构——标题在哪、表格边界在哪——再把内容转成 Markdown。对 LLM 来说,Markdown 是"熟面孔":纯文本,结构显式,# 是标题、| 是表格、- 是列表。GitHub、技术博客、官方文档让 Markdown 在训练语料里无处不在,不少模型的官方文档也推荐用 Markdown 组织输出。把内容放在模型最熟悉、最便宜的格式里,是最划算的喂法。

转换是一次性成本:转完之后,每次调用都按文本价格算,而不是每次按图片算。

工具怎么选,看文档类型:

  • • MinerU:上海 AI Lab 开源,中文文档和复杂表格的解析最强,横评中内容还原度最高;缺点是偶尔删脚注。
  • • Docling:IBM 出品、MIT 许可,企业友好;转不了的内容会明确标出来而不是瞎编,代价是公式和图片直接丢弃。
  • • Marker:发挥最稳定,公式和图片处理得好;弱项是多栏版式;商用许可需要注意。
  • • MarkItDown:微软出品,一行命令就能跑;表格和公式是弱项。

最轻量的起步只需要三行:

# 安装微软的 MarkItDown
pip install markitdown

# 一行命令把 PDF 转成 Markdown
markitdown 合同.pdf -o 合同.md

表格复杂或中文文档,换 MinerU。不想本地部署,云端 OCR 也能干这件事——Simon Willison 报道过,Mistral OCR 大约 1 美元处理 1000 页。

如果只是自己读几份文档,NotebookLM 这类工具已经在背后替你完成了转换;需要大规模、可复用地把文档喂给 API 或做检索增强(RAG),转换这一步才需要自己掌握。

四、这个方案不适用于所有 PDF

先转 Markdown 不是万能答案,适用边界很清楚。

第一,需要"看懂版面"的任务不适合。图表理解、手写批注、版式比对——这类任务里"看"本身就是工作内容,逐页截图喂视觉模型不可替代。开发者 Judd 在一篇成本测算里算过账:视觉模型的单次 API 成本比传统 OCR 贵 2 到 5 倍,但把开发时间、人工复核和维护成本算进去,总成本反而低一个数量级。"先转后喂"针对的是"读内容",不是"看懂版面"。

第二,转换会丢东西。公式、图片在多数工具里会直接丢弃——Docling 的做法是宁可留白也不乱编;而有的工具会静默改数字。批量处理前,必须抽查。

第三,PDF 不会消失。法律文件、归档、跨平台打印,PDF 在这些场景不可替代。真正能改的是两件事:存量 PDF 先转后喂;新建文档直接从 Markdown 或纯文本写起——以后就省掉了每一次转换。

总结

埃森哲的账单揭示的不是"AI 太贵",而是"我们用错了格式":把展示格式当数据格式,再花最贵的算力把它翻译回来。token 账单只是症状,格式错配才是病根。

PDF 不会消失。但有理由预计:随着按量计费成为常态,"先转 Markdown 再喂 LLM"会从少数人的技巧变成默认流程;转换工具会更快更便宜;格式意识也会跟着变——新建文档时,选什么格式不再只是审美问题,而是一笔可以算到 token 级别的成本账。

下次手上有 PDF 要交给 AI 时,先问一句:源文件还在吗?在,就直接要 .md;不在,先用 MinerU 或 Docling 转成 Markdown 再喂;批量处理前,抽查一遍数字有没有被悄悄改掉。