放弃大模型后,文档解析反而更快更准
ECCV 2026刚公布的入选论文里,百度PaddleOCR团队的RT-DocLayout让我看了好几遍。
33M参数。132.1 FPS。版面分析SOTA。
以前用VLM做文档解析有个死穴:遇到拍照的弯纸、歪光、透视变形,定位就不准。框表格不是多了就是少了。
RT-DocLayout换了个思路:不用边界框,用像素级分割,每个元素精确到像素。还专门做了物理空间数据增强,把纸张弯曲和拍摄角度变化直接在训练阶段喂给模型。
我的判断:文档解析的未来不是大模型通吃一切,是专用小模型做定位 + VLM做理解的组合拳。
#ECCV2026 #ECCV #百度 #PaddleOCR #百度OCR #文心#文心大模型
其它金额
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
收录于Agent
北京,57分钟前,
夜雨聆风