ARTICLE · 1158412
他不想再照着PDF抄数字了
他不想再照着PDF抄数字了
设想小周盯着一页PDF,左边是两栏文字,右边是图片,底下还有一张图表。他只想把里面的数字放进表格,却已经在两个窗口之间来回切了十几次。刚抄完一行,他又发现自己把表头看串了。
麻烦在于,这页文件不是一段从上读到下的文字。标题、说明、图和数字各有位置;如果只把字认出来,再混成一长串,他还得自己把内容重新拼回去。
LightOn在10月8日发布的LightOnOCR-3,就把文字转录和版面理解放进同一套模型里。它可以标出文档区域的位置和类型,描述图片,并把图表里的数据提取成表格。OCR可以理解成让电脑认纸上的字,而这里还多了一步:知道这些内容在页面上怎样摆放。
这套模型有0.8B、1B和4B三个版本,已提供模型和代码。对小周这样的文档使用者来说,能减少哪一步手工整理,要看接入它的软件和具体材料;模型公开,不等于手边所有PDF工具都已经有了这项功能。
于是,在这个假设场景里,他先让工具识别页面,再对照原图检查提取结果。小字、旧扫描和复杂图表都可能认错,尤其是准备写进表格的数字、单位和表头,不能看见一份整齐输出就直接交出去。
小周把原PDF固定在屏幕一边,提取的表格放在另一边。他圈出那行容易看串的表头,确认数字属于哪一列,再填进自己的文件。这回,他留在桌上的任务是核对,而不是从第一页开始逐个抄字。
#人工智能 #OCR #文档处理 #LightOnOCR #国风漫画
广东,36分钟前,