乐于分享
好东西不私藏

工具软件:MyOCRTool文字与表格识别(2026.8)

工具软件:MyOCRTool文字与表格识别(2026.8)
去年发布了一个文字识别工具(见工具软件更新:RapidOCR文字快速识别),能够快速提取图片和PDF文件中的文字内容,只是不能理解文档版面结构、无法提取表格。
为解决这两个问题,用新学的python重写了个文字(表格)识别工具:MyOcrTool。这是基于百度2026年6月开源的PP-OCRv6及PP-STRUCTUREv3 (CPU版)开发的,适用于widnows10及以上的64位操作系统,内存8G及以上(建议16G以上)。主要特点:
支持:批量识别图片、PDF文件中的文字和表格;
(可输出Word、TXT格式文件。输出WORD格式时基本能理解复杂版面布局,提取的文字比较符合原文顺序、结构,还能提取表格内容。)
  • 支持:批量拆分PDF文件为图片;
    (输出PNG格式图片 )
  • 支持:自适应不同内存容量的电脑。
    (小内存电脑识别精度、速度稍低。建议内存16G及以上)
  • 支持:完全离线运行,不需联网;(已内含各推理模型文件,不用联网就能使用。因此安装文件也就比较大(约1.9G))
    示例:(因字很小,个别文字识别还有误。)
原图
识别结果

新华社记者

康庄大道山海偕行

30年。习近平同志在是国宁协作福建工作期间亲自谋划、亲自推动这一伟大实践,创造了“干沙滩”变“金沙滩”的人间奇迹,开辟了东西部协作的新机制。

6月,习近平总书记对常态化做好东西部协作工作作出重要指示强调,“要总结运用闽宁协作等有益经验”不断增强区城发展协调性,推动全体人民共同富裕迈出坚实步伐”。股股托,山海回响。30年来,闽宁协作蹬出的这条康庄大道,正从贺兰山脚下延伸向广神州大地,为东西部协作的广阔实践提供经验。

山海情缘:“干沙滩”变“金沙滩”

随着一阵低沉的号子声,移民队伍沿着“之”字形山路,一步步迈向新家.这是7月1日正式开园的“看见闽宁·戏

(...略...)


需要的朋友可从此下载:
百度网盘:https://pan.baidu.com/s/1cHINUlrYnHmBwde6MjA42w?pwd=43u3
(安装文件名为:Setup_MyOcrTool20260801(文字表格识别工具).exe)
或扫描二维码(长按下图识别二维码)
操作界面:

My OCR Tool(文字/表格识别工具) 操作说明


1. 工具介绍

MyOcrTool是一个基于百度2026年6月开源的PP-OCRv6、PP-STRUCTUREv3 (CPU版)开发、用于识别提取图片或PDF文件中的文字、表格内容的工具。

  • 支持:批量识别图片、PDF文件中的文字和表格;
    (可输出Word、TXT格式文件)
  • 支持:批量拆分PDF文件为图片;
    (输出PNG格式图片 )
  • 支持:自适应不同内存容量的电脑。
    (小内存电脑识别精度、速度稍低。建议内存16G及以上)
  • 支持:完全离线运行,不需联网;
  • 操作系统环境要求:
    widnows10及以上的64位操作系统,内存8G及以上(建议16G以上)。
  • 附:PaddleOCR简介
  • PP-OCRv6介绍
    : 2026年6月,PaddleOCR 发布 PP-OCRv6,作为 PP-OCR 系列的最新版本。 PP-OCRv6 基于全新设计的 PPLCNetV4 统一骨干网络,提供 tiny/small/medium 三档模型(1.5M~34.5M 参数)。在精度方面,medium 档相比 PP-OCRv5_server 识别精度提升 5.1%、检测精度提升 4.6%,以仅 34.5M 参数的规模超越 Qwen3-VL-235B、GPT-5.5 等大型视觉语言模型。在多语种方面,单一模型统一支持中文、英文、日文及 46 种拉丁语系共 50 种语言,无需为不同语种切换模型。在场景覆盖方面,PP-OCRv6 大幅提升了数码管、点阵字符、轮胎印字、工业字符等传统 VLM 难以覆盖的专业场景识别能力。在速度方面,PP-OCRv6_medium 在 Intel Xeon CPU OpenVINO 下相比 PP-OCRv5_server 加速 5.2×(1.40s vs 7.30s),tiny 档在纯前端浏览器环境的极低算力下,直接轰出了单图 97ms 的惊人成绩。
  • PP-StructureV3介绍
    : PP-StructureV3 能够将文档图像和 PDF 文件高效转换为结构化内容(如 Markdown 格式),并具备版面区域检测、表格识别、公式识别、图表理解以及多栏阅读顺序恢复等强大功能。该工具在多种文档类型下均表现优异,能够处理复杂的文档数据。

2. 基本操作

操作流程:添加要识别的图片或PDF文件,设置参数,点击“开始识别”即可,识别结束后,结果存放在“输出目录”中。

  • 添加文件
    :点击“📂 添加文件”可添加单个文件(支持图片和PDF文件)。
  • 添加目录
    :点击“📁 添加目录”可添加该目录下的所有图片和PDF文件。
  • 清空列表
    :点击“🗑 清空列表”可全部清空"待处理文件列表",选中“待处理文件列表”中的项目,按“DEL”键可清除单个项目。
  • 查看文件
    :双击列表中的文件名,可使用系统默认应用打开预览。
  • 调整顺序
    :用鼠标拖动"待处理文件列表"中的文件项目,可调整前后顺序。
  • 开始识别
    :点击“🚀 开始识别”,将开始批量识别“待处理文件列表”中的文件,识别结果保存在“输出目录”中。在识别过程中可按“⏹️ 停止识别”或按ESC 键中止操作。
  • 拆分PDF 
    :点击“✂拆分PDF”可将"待处理文件列表"中的PDF文件按页拆分为一张张图片。
  • 重置引擎
    :点击“♻️重置引擎”可关闭已初始化的识别引擎,以便启用新的参数来识别内容。
  • 帮助
    :点击“❓ 帮助”可打开查看本帮助说明。

3.参数设置

设置输出目录、输出格式(引擎类型)、引擎参数:

  • 输出目录
    :设置识别结果文件的存放位置。默认为当前用户“我的文档”下的“MyOcr_out”目录。点击“重选输出目录...”可设置为其他目录;点击“打开输出目录”可浏览查看该目录中的文件。
  • 输出格式
    :可选择 Docx(Word文件) 或 TXT文本文件 格式
    • DOCX
      :使用 PP-StructureV3 引擎(根据当前电脑的内存大小自动适配基础参数)。输出保存为word文件(docx格式)。保留原文档排版、表格。适合需要格式还原的场景。
      • 引擎参数:
      • 预处理
        :如果图片或PDF内容比较规范、清晰,可不选此项以加快速度;如果图片或PDF内容歪斜、模糊、变形等可开启此项以提高识别率。
      • 提取表格
        :如果原文件中没有表格,可不选此项可大幅提速。
      • 保留原始分行、段落结构
        :不选此项则自动合并同区块的零散文字、去除多余换行空格,输出规整文本。
      • 识别数学公式
        :通常的文档、报表可不选。
    • TXT
      :使用 PP-OCRv6引擎。输出保存为TXT文件(纯文本)。仅提取纯文本文字,速度较快。适合只需要文字内容的场景。
      • 引擎参数:
      • 小模型
        :选中此项,则启用小模型(small),速度更快,但精度略低,否则使用medium模型;
      • 启用文档方向分类模型
        :自动校正文档图像的朝向。若图片或PDF文档比较规范,不用选中此项;
      • 启用文本图像校正
        :自动校正文本区域的形变(褶皱、弯曲、倾斜等)。若图片或PDF文档中文本区域比较规范,不用选中此项;
  • 所有识别结果合并为一个文件
    :选中此项,则将“待处理文件列表”的识别结果合并存放到一个文件( MyOCR_Merged_Output.docx或txt)中,否则识别结果与原文件名一一对应,分别存放为:原文件名.docx(或Txt)

4. 常见问题

  • 内存不足
    :如果提示内存不足,可关闭一些其他软件,释放部分内存后再试。
  • 无法读取图片
    :可能原因:1.图片文件损坏,检查一下图片是否正常;2.图片文件太大可能导致内存不足,建议最长边长不超过4000。
  • 设置的引擎参数不起作用
    :更改引擎参数后,可点击“重置引擎”,以便再次识别时用新的参数启动引擎。
  • 保存配置失败:
     [Errno 13] Permission denied: 'MyOcr_config.json'。原因:当前运行本工具的权限不足,无法保存设置文件。解决方法:用鼠标右击本工具的桌面图标,在“属性”-》“兼容性”页勾选“以管理员身份运行此程序”即可。

5.高级设置

  • 本工具基于开源的PaddleOCR(PP-OCRv6/PP-StructureV3)开发,而PaddleOCR的模型参数众多,有经验的用户可自行设置配置文件,以满足自己的识别需求(识别精度、可信度、速度等)。调用的配置文件有:(配置文件可用记事本等文本编辑软件打开修改。)
  • PP-StructureV3.yaml
     :当电脑内存不小于16G、输出Docx格式时的配置文件(PP-StructureV3引擎)。(本工具会根据内存容量自动检测调用)
  • PP-StructureV3_smallMemory.yaml
     :当电脑内存小于16G、输出Docx格式时的配置文件(PP-StructureV3引擎)。(本工具会根据内存容量自动检测调用)
  • MyOcr_small.yaml
     :当选择 输出TXT格式、“small”模式时的配置文件(PP-OCR V6引擎)
  • MyOcr.yaml
     :当选择 输出TXT格式、不选“small”模式时的配置文件(PP-OCR V6引擎)

部分参数含义

  • use_doc_preprocessor
     :是否启用文档预处理
  • use_textline_orientation
     :是否启用文本行方向分类模型
  • use_doc_unwarping
     :是否启用文本图像矫正
  • model_name
     :模型名称
  • model_dir
     :本地模型文件所在目录位置
  • limit_side_len
     :图像最短边强制缩放到的像素值;图片小于此值会上采样
  • limit_type
     :短边缩放策略。min 或max
  • max_side_limit
     :图像长边最大限制值,超大图为缩小,防止显存溢出。
  • thresh
     :文本像素分类的置信度阈值;调大可减少误检,调小易检出小字。
  • unclip_ratio
     :文本检测框的膨胀系数。用来将文字轮廓适当放大,避免文字裁切。
  • batch_size: 
    :一次性并行推理个数
  • score_thresh
     :识别结果置信度过滤阀值。0.0不丢弃任何识别结果;其他值则丢弃置信度低于该值的识别结果。

各推理模型文件说明

  • Model文件位置(模型名称)
     :识别引擎的模型文件存放在本工具所在目录的“ocr_models”目录中。
  • PP-LCNet_x1_0_doc_ori
     :文档方向分类
  • UVDoc
     :文档展平
  • PP-DocBlockLayout
     :文档分块版面分析
  • PP-DocLayout_plus-L
     :高级版面分析
  • PP-LCNet_x1_0_textline_ori
     :文本行方向分类
  • PP-OCRv5_server_det
     :文本检测
  • PP-OCRv5_server_rec
     :文本识别
  • PP-LCNet_x1_0_table_cls
     : 表格分类
  • SLANeXt_wired
     :有线表格结构识别
  • SLANet_plus
     :表格结构识别(无线/通用)
  • RT-DETR-L_wired_table_cell_det
     :有线表格单元格检测
  • RT-DETR-L_wireless_table_cell_det
     :无线表格单元格检测
  • PP-FormulaNet_plus-L
     :公式识别
  • PP-OCRv4_server_seal_det
     :图章识别模型
  • PP-OCRv5_server_det
     :det检测模型
  • PP-OCRv5_server_rec
     :rec识别模型
  • PP-OCRv6_medium_det
     :最新V6版的det检测模型(medium档)
  • PP-OCRv6_medium_rec
     :最新V6版的rec识别模型(medium档)
  • PP-OCRv6_small_det
     : 最新V6版的det检测模型(small档)
  • PP-OCRv6_small_rec
     : 最新V6版的rec识别模型(small档)

其他工具软件
工具软件:iWillFindYou
工具软件更新:MyRapidTTS(文本转语音工具)
工具软件:照片、视频等Exif信息处理
工具软件更新:RapidOCR文字快速识别
QzjTools工具软件(2022.11)

相关学习资料