
Shadow:不知不觉,已经迭代到4个系列,每个系列所要解决的问题都是不一样的,建立一家Agentic公司没这么容易,但是有方法和框架可以帮到你一步步建立。
今天分享我们在Agentic Working里的实践案例。
PDF作为我们日常大量使用的文件格式,经常会碰到需要对里面信息进行提取处理的情况,同时其他各种文档也经常需要进一步分类整理后才能使用。
有了Agent,知识库已经从笔记进化成可以被检索复用的知识资产。

从 PDF 制作知识库:让散落文档变成结构化知识资产
企业里散落着大量PDF、PPT、Word文档,它们承载着宝贵知识,却难以检索和复用。
本案例展示了一条完整的处理流水线:原始文件 → 格式转换 → 布局检测 → 语义理解 → 结构化输出。
技术选型上,我们用 PyMuPDF 将PDF导出为图片,Pandoc 将DOCX/PPTX转为Markdown,PaddleOCR PP-StructureV3 做像素级布局检测(精确到每个文本框的坐标),Gemma-4-12B(通过LM Studio本地推理)理解各区域的内容语义,最后由 Claude Code 整合坐标与语义,输出带元数据的Markdown文档。
这套方案的核心价值在于:
不仅“读”懂了文档内容,更“看”清了文档结构。
处理后的知识资产保留了标题、段落、表格、图片等区块的坐标信息,可直接用于RAG向量库预处理、企业知识库建设或项目文档自动归档,让沉睡的文档真正变成可检索、可利用的知识。
关于OCR的最新进展
前面提到用到了PaddleOCR。最近,百度提出了 Unlimited OCR 模型,通过创新的 R-SWA(参考滑动窗口注意力机制),彻底改变了处理长文档的技术难题,不仅实现了“一次性全书解析”,还为长时域解析任务树立了新的标杆。

一、形象理解:从“强迫症抄书员”到“高效速记员”
为了理解Unlimited OCR的原理,我们可以将OCR模型处理文档的过程比作一个抄书员的工作。
1. 传统模型的痛点:强迫症抄书员
传统的端到端OCR模型就像一个“强迫症抄书员”:他每往纸上写一个字,都要回头把书的前面所有内容从头到尾重读一遍,以确保逻辑连贯。
后果:随着书页的增加,他需要回顾的“记忆负担”线性增长,显存很快就会被撑爆。为了不崩溃,模型只能采用“分页处理”——写完一页就清空大脑,然后再开始写下一页。这种“分段”方式人为地切断了文档的连续性。
2. Unlimited OCR的创新:高效速记员
Unlimited OCR则模仿了人类真正高效抄书的模式,采用了 R-SWA机制:
- 全局参考(Reference)
:他始终把原书放在桌角,每写一个字都抬头看一眼原始图像,确保内容不跑偏。 - 滑动窗口(Sliding Window)
:他不需要记住之前写下的所有内容,只需要盯着自己最近写下的128个字(窗口大小)。这几行上下文足以支撑他写出下一行。 - “软遗忘”艺术
:这种设计实现了“软遗忘”,通过只保留最核心的参考信息和最新的局部上下文,他的工作内存开销被严格限制在一个固定的大小内。
简单来说,无论书有多厚,Unlimited OCR永远只需要那么多“工作记忆”,从而实现了真正意义上的“一次性完整解析”。
二、为什么比DeepSeek OCR更好?
作为以DeepSeek OCR为基线改进而来的模型,Unlimited OCR并非简单的优化,而是在架构底层实现了“范式转移”。
其核心优势可以归纳为三点:
1. 恒定的内存开销(最核心优势)
DeepSeek OCR在处理长序列时,显存占用会随输出长度增加而线性增长,导致模型在处理长文档时非常吃力。而Unlimited OCR通过R-SWA,将KV Cache(键值缓存)保持在常数级别。这意味着,它不会因为任务变得“更长”而变慢或变卡,这种“无压力的长程解析”是传统全注意力机制无法比拟的。
2. 更高的解析精度
数据显示,Unlimited OCR在OmniDocBench v1.5基准测试中,整体评分达到了 93.23,大幅超越DeepSeek OCR的 87.01。
公式识别准确率提升近10% 表格结构提取提升约6%
这种提升证明了R-SWA在处理复杂布局(如公式、表格、多列排版)时,通过聚焦“原始视觉信息”和“局部上下文”,比全注意力机制更不容易产生偏移。
3. 更高的推理效率
Unlimited OCR不仅更准,还更“轻”。在OmniDocBench测试中,其吞吐量(TPS)比DeepSeek OCR提升了 12.7%。当输出序列越长,这种速度优势会表现得越发明显。
总结
Unlimited OCR的出现,标志着端到端OCR从“碎片化处理”向“长程解析时代”的跨越。
它不仅解决了长文档处理的显存焦虑,更通过架构创新,在不牺牲精度的情况下实现了推理效率的显著提升。
对于需要处理大量书籍、长篇报告或复杂文档的企业和开发者而言,这无疑是一个能够大幅降低算力成本、提升自动化解析上限的“免费午餐”。
如果你对这项技术感兴趣,可以访问其 论文获取更多细节。
arxiv.org/html/2606.23050v1
夜雨聆风