摘要
--disable_ocr 两档能纯 CPU 跑。换句话说,Marker 2 把“要质量”和“要省硬件”拆成了不同档位让你按情况挑,而不是一个模式包打天下。🗣️ 说人话:以前把 PDF 转成可用的纯文本不是慢就是错,Marker 2 的 balanced 模式把速度和准确率都往上提了一档;没显卡时还有 fast 和纯 CPU 档能顶上,只是准确率会相应下降。
🗣️ 说人话:你可以把 Marker 2 理解成一个“文档格式解码器”——把各种格式的原始文档解析成结构化的 Markdown 或纯文本,方便大模型和 RAG 系统直接消费,一次性给了三档(极速扫描、平衡、精解)。
3.1 Balanced 模式:GPU 上的最高质量档位 这是 Marker 2 的门面模式,使用 Surya OCR 2 的完整视觉能力,在 olmOCR‑bench 综合得分为 76.0%,2.9 页/秒的吞吐在本轮官方自测的参测开源方案里,同时取得了最高综合分与最快吞吐(注意:这是 olmOCR-bench 单一基准、单一硬件下的成绩,未必代表你自己的文档)。该模式下,Marker 会先读取 PDF 自带的文本层,只在表格检测置信度低、遇到扫描图片或者公式密集的区域才调用 VLM 级 OCR 引擎进行补强——也就是后文要说的“选择性 OCR”。
如果你的服务器或开发机上有 GPU(哪怕是一张消费级显卡),处理的文档大多是扫描版合同、学术论文、图表密集的研报,而且对最终 Markdown 的版面还原要求很高,那 balanced 就是首选。用白话讲,它给你的是“在 bench 测试下版面还原质量很高、能直接当喂给大模型的高质量初稿”的级别——但 76% 意味着还有约四分之一的偏差,关键业务场景仍建议加一道人工抽检。
🗣️ 说人话:有显卡、文档烂、要求高——选 balanced。这是 Marker 2 最能打的模式。
3.2 Fast 模式:CPU/GPU 通吃的性价比甜点 fast 模式总分为 66.6%,但它在 GPU 和 CPU 上都能跑,不需要专门的推理服务。对于版面还原要求不极致、以纯文本召回为主的内部报告或说明书,fast 可能在成本和效果之间提供一个可接受的折中——不过 66.6% 意味着约三分之一的版面信息可能有偏差,要求高的场景还是要回到 balanced。
🗣️ 说人话:你的文档不是太变态、预算也确实紧张,fast 模式就是那个“够用且不贵”的甜点方案。
3.3 纯 CPU 无 OCR 模式:速度狂魔 当你在没有任何推理服务(也不打算装)的纯 CPU 环境下,只要加上 --disable_ocr,Marker 2 可以直接跳过所有模型调用,只靠 pdftext 提取文本层和布局信息,吞吐量飙升到 23.7 页/秒,虽然总分降到 43.6%,但对于 born‑digital 的纯文字 PDF(比如导出的 Word 文档、数字化报告),这类文档本就不含扫描图、无需 OCR 介入,反而能让你用极低的算力处理海量文档(注意:如果文件里夹了扫描页或嵌入图片,这个模式会直接跳过视觉内容,用之前先确认文档构成)。
🗣️ 说人话:如果你有一大堆本来就是电子版、没有扫描图的 PDF,这个模式能让一台普通服务器每秒处理近 24 页,纯 CPU 批量预处理海量文档绰绰有余。
如果把视线抬高到付费 VLM 方案:基于 Chandra VLM 的 pipeline 得分 85.8%,Gemini Flash 3.5 得分 76.4%——比 Marker 2 的 balanced 只高了 0.4 个百分点,但前者要按页付费。一个开源、可本地部署、一次部署即可持续运行的项目,能在准确率总分上和按调用次数计费的头部 VLM(如 Gemini Flash 3.5)几乎打平,这种表现说明它在官方测试条件下的解析精度已经逼近头部 VLM;再叠加本地部署的固定成本和可控延迟,综合性价比在不少场景下相当能打。不过要把这个分数差距完全归因于“选择性 OCR”架构,目前还缺消融实验和第三方独立复现来坐实——架构选型是合理推断,但不是已被证明的因果。
🗣️ 说人话:同场竞技,Marker 2 比 MinerU 快 5 倍还更准,比 Docling 准一大截,比付费 VLM 也只差了一根头发的分数,但不用按页刷卡。
🗣️ 说人话:它不是把大模型整页整页地喂,而是只把最难啃的部分(比如糊掉的扫描页、公式)交给 OCR 模型,其他部分直接读文本层——所以同一块 GPU 能并行啃更多文档,算力花在了真正需要的地方。
pip install marker-pdf。 单文件转换:marker_single /path/to/file.pdf /path/to/output,默认走 balanced。想切成 fast 模式只需要 --mode fast。纯 CPU 无 OCR 则是 --disable_ocr。 批量处理:marker /path/to/input_dir /path/to/output_dir --workers 4。 尤其对 RAG 用户友好的是 --output_format chunks,它可以直接把解析结果切成语义块喂给向量数据库或大模型,把“转 Markdown”和“分块”合并成一步,减少了中间的手工处理(复杂排版仍建议抽检,并没有完全省掉人工)。 如果对表格或特殊领域有更高要求,还能通过 --use_llm 引入外部 LLM(官方支持 Gemini、Claude、OpenAI 兼容、Ollama 等,比如本地部署的 Qwen 或线上的商业大模型)对关键区域做二次校对,相当于给 Marker 2 的外壳再加一层可配置的外部 LLM 后处理校对。🗣️ 说人话:三行命令就能把一整批 PDF 变成结构化文本,而且能直接出 RAG 用的 chunk,有望明显减少手工转格式和分块的重复劳动。
🗣️ 说人话:代码可以白嫖,但模型权重在小有规模的公司就要掏钱——别等产品上线了才发现许可证卡脖子。
--output_format chunks 和可选的 --use_llm,Marker 2 几乎能把整个文档预处理 pipeline 收回到一个命令行工具里。🗣️ 说人话:以前转 PDF 像开盲盒,现在 Marker 2 给你三个档位自己拧——要质量有质量、要省钱能省钱,而且上手就三行命令。
关注「AI 效能派」,我们专注把 AI 工具讲成你能用的东西,不讲黑话、不画大饼。
源码地址:https://github.com/datalab-to/marker/releases/tag/v2.0.0
数据来源:Datalab 官方博客、Marktechpost 解读、Marker v2.0.0 Release Notes、olmOCR‑bench (Ai2)。
夜雨聆风