空白也要算力买单?
砍掉一半视觉 token
OCR 质量几乎不变
LayoutLite · 即插即用模块 · 视觉 token 压缩 · 文档 OCR 加速
LayoutLite 技术解读
📦 6 Parts + Conclusion
👉 滑动
PART 01
核心发现
LOCAL TOKEN
PART 02
旧方案短板
WHY NOT
PART 03
打分机制
SCORING
PART ///
写在最后
TAKEAWAY
这篇论文最值得记住的一句话
空白区域不该继续占用昂贵的视觉 token。

你有没有想过,当你把一份扫描文档丢给 AI做文字识别时,AI 在背后到底干了什么?
以目前最先进的视觉语言模型(VLM)为例,它会先把你的文档图片切成无数个小方格,每个方格对应一个视觉 token,然后逐一分析这些 token 里有没有文字、公式、表格。但问题是——一份典型的文档里,空白区域、页边距、段落间距可能占了三分之一甚至一半的面积。这些空白区域也被老老实实地编码成了视觉 token,白白浪费了大量计算资源。
来自元理科技和北京师范大学的研究团队发现了一个简单却关键的现象,并据此提出了一个叫做 LayoutLite 的方案,论文已于 2026 年 7 月在 arXiv 上公开,代码也已开源。
01
PART
一个显而易见却被长期忽视的发现
DISCOVERY · 局部信息
研究团队做了一个很有意思的实验。他们将文档图片中某些区域的视觉 token 直接删除,然后观察 OCR 模型会输出什么。
结果非常直观:如果把空白区域的 token 删掉,模型照常输出完整结果,毫发无损;但如果把覆盖数字区域的 token 删掉,模型就会老老实实地跳过那几个数字——删掉哪块就漏掉哪块,绝对诚实。
视觉 token 在 OCR 模型里主要编码的是局部信息。
一个 token 管的就是图片上对应的那一小块区域。
这个看似简单的现象背后隐藏着一个重要洞察:视觉 token 在 OCR 模型里主要编码的是局部信息,一个 token 管的就是图片上对应的那一小块区域。这意味着,如果我们能精准识别出哪些 token 对应的是空白和无用区域,就能大刀阔斧地砍掉它们,而不会伤及文字识别质量。
02
PART
现有方案为什么不够好?
WHY NOT · 三类短板
当前的文档 OCR 主流方案有三类,但没有一个真正解决了视觉 token 冗余的问题。
动态分辨率
只看大小,不看内容
两阶段流水线
依赖版面检测
固定分辨率
空白也被编码
第一类采用动态分辨率编码器,比如 FireRed-OCR、HunyuanOCR,它们根据图片分辨率来分配 token 数量。图片越大,token 越多,但并不关心这些 token 覆盖的区域到底有没有料。
第二类走的是两阶段流水线,如 PaddleOCR-VL、MinerU,先做版面检测把文字区域框出来,再分别识别。但这种方法高度依赖版面检测的准确性,一旦遇到复杂版面或者倾斜文档,就容易出错。
第三类则干脆用固定分辨率编码器,把每张图都缩放到预设尺寸再处理,可想而知,空白区域全都白白编码进去了。
还有一些通用的视觉 token 压缩方法,比如 FastV、PixelPrune,它们在通用视觉任务上表现不错,但直接用到 OCR 上就水土不服了——要么识别精度大幅下降,要么面对复杂文档背景力不从心。
03
PART
LayoutLite 的巧妙之处:不做检测,只做评分
SCORING · FILTER

LayoutLite 的设计哲学很清晰:与其先检测版面区域再决定保留哪些 token,不如直接给每个 token 打一个重要性分数——分数高说明这块区域有内容、值得保留,分数低说明大概率是空白或冗余区域,可以安全删掉。
编码器
生成全部 token
LayoutLite
逐个评分筛选
解码器
只读高分 token
被剔除的 token 不进语言解码器,保留下来的 token 仍保留原始空间位置信息。
整个模块被插在视觉编码器和语言解码器之间,像一个过滤器。视觉编码器照常处理完整图片,生成所有视觉 token;LayoutLite 对每个 token 评完分以后,只把高分 token 放进语言解码器做真正的文字识别。被剔除的 token 虽然不进解码器,但留下来的 token 完整保留了原始的空间位置信息,所以文档的空间结构不会被破坏。
那 LayoutLite 是怎么给 token 打分的呢?它巧妙地把视觉编码器不同层次的中间特征都用了起来。研究发现,有内容的 token 和没内容的 token,在编码器各层之间的演化轨迹完全不同——有内容的 token 随着网络逐层聚合信息,特征会逐步生长、变化丰富;而空白区域的 token 基本没什么邻居信息可以吸收,特征在各层之间几乎不变。
LayoutLite 用一个轻量的一维卷积网络捕捉这种跨层变化模式,再加上两层全连接和一个 Sigmoid 函数,最终输出每个 token 的分数(0 到 1 之间)。
参数量约 1900 万,在 Qwen3-VL-2B 上仅约原模型 1%
小身材,大能量
在推理阶段,LayoutLite 不会用固定阈值一刀切。它会对每张图的分数做 K-means 聚类(分成高分组和低分组两类),再在两组之间拉一条阈值线。这样做的好处是每张图都能根据自身的内容分布定制压缩力度,远比全局统一阈值更灵活、更可靠。
04
PART
训练也很巧妙:强化学习 + 版面辅助
TRAINING · RL + LAYOUT
打分的标准从哪来?人类的直觉是:文字区域分数高、空白区域分数低。但问题是,并没有现成的标注告诉模型哪些 token 该保留、哪些该丢弃。
研究团队的做法是:把这个问题变成一个强化学习问题。让模型反复尝试不同的 token 保留方案,每次尝试后看 OCR 输出和原始完整输出对比有多接近(用编辑距离衡量),越接近说明砍得越好,就给高分;偏离太多就给低分。通过这种试错加奖励的方式,模型逐渐学会该怎么打分。
!训练陷阱 🕳
如果只追求 OCR 输出越接近越好,模型会偷懒地保留所有 token——这样当然最接近,但压缩率就是零。
为此,奖励函数里还加入了一个压缩率惩罚项:实际丢弃比例和目标压缩率差得越多,扣分越重。这样模型就被逼着在保住识别精度和达到压缩目标之间找到最优平衡。
训练还有一个加速外挂:引入了一个现成的版面检测模型 PP-DocLayoutV3。自动生成的版面检测框会告诉 LayoutLite,框里的 token 大概率重要,框外的大概率不重要,作为一个辅助监督信号。
注意,这只是辅助信号,LayoutLite 并不会死板地复制版面检测的输出——强化学习的主目标始终是让 OCR 输出和原始输出保持一致,版面监督只是帮助训练更快收敛、更稳定。消融实验也证明了这一点:加上版面监督后,50% 压缩率下的得分从 85.86 大幅提升到 91.43,提升幅度高达 5.57 分。
整套训练非常高效:仅需约 600 张无标注文档图片,在一块 A100 GPU 上占用约 20GB 显存,训练一个 epoch 只需几小时。
05
PART
效果有多惊艳?
RESULTS · 50% COMPRESSION
实验在文档解析权威基准 OmniDocBench v1.7 上进行,共有 1651 张真实场景文档。

主实验(基于 FireRed-OCR 模型)的结果令人印象深刻:
压缩率 20% 以下:整体得分不仅没降,反而略有提升(从 92.75 到 92.81)。论文分析,这可能是因为去掉了部分冗余 token 后,模型不再在一些空白区域纠结,减少了重复生成的问题。
压缩率 50%:也就是直接砍掉一半视觉 token,整体得分仍有 91.43,仅下降了 1.32 分。其中文本识别编辑距离仅从 0.044 微增至 0.056,公式识别 CDM 从 94.32 降到 93.05,表格识别 TEDS 从 88.34 降到 86.84——所有子指标都极其稳健。
压缩率超过 55%:性能开始出现明显下滑,说明这时候大部分真正的冗余信息已经移除了,再砍就要伤及有内容的区域了。
延迟
123.7ms → 68.2ms
FLOPs
21.26T → 12.19T
KV 缓存
512MB → 284MB
效率提升方面同样亮眼。在 50% 压缩率下,预填充延迟从 123.7 毫秒降到 68.2 毫秒,FLOPs 从 21.26 TFLOPs 降到 12.19 TFLOPs,KV 缓存内存从 512MB 降到 284MB——三项指标均减少超过 40%,而且 LayoutLite 自身引入的延迟仅约 2 毫秒、FLOPs 仅约 0.06 TFLOPs,几乎可以忽略不计。
可视化对比也直观展现了 LayoutLite 的优势。在同样的 50% 平均压缩率下,FastV 产生的热力图比较粗糙,很难清晰地区分背景和内容区域;PixelPrune 在简单文档上还行,但遇到复杂背景就吃力了。而 LayoutLite 生成的重要性热力图结构清晰、边界准确,白色空白区域和文字密集区域被泾渭分明地分开了,几乎所有低分 token 都精准落在了页边距、段落间隙和空白背景上。
跨架构泛化能力也得到了验证。在另一个 OCR 模型 Logics-Parsing-V2 上,50% 压缩率下 OmniDocBench 得分从 92.82 降到 90.61,仅损失约 2.2 分,各项效率指标同样大幅下降。
///
LAST
一个值得关注的方向
SUMMARY · 做减法的智慧
LayoutLite 最大的意义在于,它展示了一种新的思路:不需要大动干戈地改造模型架构,也不需要海量的标注数据,只需一个轻巧的即插即用模块,配合巧妙的训练策略,就能在几乎不牺牲精度的情况下大幅压缩计算成本。论文相关代码已在 github.com/dpxudong/LayoutLite 开源。
当然,这项工作也并非完美。当压缩率超过 55% 后性能明显下滑,说明极端压缩场景仍有改进空间;目前实验主要在英文文档环境下,多语言和更复杂版面的适用性还有待验证;训练过程中对外部版面检测模型的依赖,也带来了微弱的耦合关系。
但无论如何,对于正在面临视觉 token 爆炸问题的 VLM 文档 OCR 系统来说,LayoutLite 提供了一个低成本、高收益的解决方案。在一个算力仍然昂贵、效率越来越被重视的时代,这种做减法的智慧,或许比做加法更有价值。
我是秋刀鱼,和你分享最前沿的论文和最新的AI故事,我们下期再见啦。
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。
THANKS FOR READING
夜雨聆风