- 支持:批量拆分PDF文件为图片;
(输出PNG格式图片 ) - 支持:自适应不同内存容量的电脑。
(小内存电脑识别精度、速度稍低。建议内存16G及以上) - 支持:完全离线运行,不需联网;(已内含各推理模型文件,不用联网就能使用。因此安装文件也就比较大(约1.9G))
示例:(因字很小,个别文字识别还有误。)
![]() | 新华社记者 康庄大道山海偕行 30年。习近平同志在是国宁协作福建工作期间亲自谋划、亲自推动这一伟大实践,创造了“干沙滩”变“金沙滩”的人间奇迹,开辟了东西部协作的新机制。 6月,习近平总书记对常态化做好东西部协作工作作出重要指示强调,“要总结运用闽宁协作等有益经验”不断增强区城发展协调性,推动全体人民共同富裕迈出坚实步伐”。股股托,山海回响。30年来,闽宁协作蹬出的这条康庄大道,正从贺兰山脚下延伸向广神州大地,为东西部协作的广阔实践提供经验。 山海情缘:“干沙滩”变“金沙滩” 随着一阵低沉的号子声,移民队伍沿着“之”字形山路,一步步迈向新家.这是7月1日正式开园的“看见闽宁·戏 (...略...) |


My OCR Tool(文字/表格识别工具) 操作说明
1. 工具介绍
MyOcrTool是一个基于百度2026年6月开源的PP-OCRv6、PP-STRUCTUREv3 (CPU版)开发、用于识别提取图片或PDF文件中的文字、表格内容的工具。
- 支持:批量识别图片、PDF文件中的文字和表格;
(可输出Word、TXT格式文件) - 支持:批量拆分PDF文件为图片;
(输出PNG格式图片 ) - 支持:自适应不同内存容量的电脑。
(小内存电脑识别精度、速度稍低。建议内存16G及以上) - 支持:完全离线运行,不需联网;
- 操作系统环境要求:
widnows10及以上的64位操作系统,内存8G及以上(建议16G以上)。
附:PaddleOCR简介 - PP-OCRv6介绍
: 2026年6月,PaddleOCR 发布 PP-OCRv6,作为 PP-OCR 系列的最新版本。 PP-OCRv6 基于全新设计的 PPLCNetV4 统一骨干网络,提供 tiny/small/medium 三档模型(1.5M~34.5M 参数)。在精度方面,medium 档相比 PP-OCRv5_server 识别精度提升 5.1%、检测精度提升 4.6%,以仅 34.5M 参数的规模超越 Qwen3-VL-235B、GPT-5.5 等大型视觉语言模型。在多语种方面,单一模型统一支持中文、英文、日文及 46 种拉丁语系共 50 种语言,无需为不同语种切换模型。在场景覆盖方面,PP-OCRv6 大幅提升了数码管、点阵字符、轮胎印字、工业字符等传统 VLM 难以覆盖的专业场景识别能力。在速度方面,PP-OCRv6_medium 在 Intel Xeon CPU OpenVINO 下相比 PP-OCRv5_server 加速 5.2×(1.40s vs 7.30s),tiny 档在纯前端浏览器环境的极低算力下,直接轰出了单图 97ms 的惊人成绩。 - PP-StructureV3介绍
: PP-StructureV3 能够将文档图像和 PDF 文件高效转换为结构化内容(如 Markdown 格式),并具备版面区域检测、表格识别、公式识别、图表理解以及多栏阅读顺序恢复等强大功能。该工具在多种文档类型下均表现优异,能够处理复杂的文档数据。
2. 基本操作
操作流程:添加要识别的图片或PDF文件,设置参数,点击“开始识别”即可,识别结束后,结果存放在“输出目录”中。
- 添加文件
:点击“📂 添加文件”可添加单个文件(支持图片和PDF文件)。 - 添加目录
:点击“📁 添加目录”可添加该目录下的所有图片和PDF文件。 - 清空列表
:点击“🗑 清空列表”可全部清空"待处理文件列表",选中“待处理文件列表”中的项目,按“DEL”键可清除单个项目。 - 查看文件
:双击列表中的文件名,可使用系统默认应用打开预览。 - 调整顺序
:用鼠标拖动"待处理文件列表"中的文件项目,可调整前后顺序。 - 开始识别
:点击“🚀 开始识别”,将开始批量识别“待处理文件列表”中的文件,识别结果保存在“输出目录”中。在识别过程中可按“⏹️ 停止识别”或按ESC 键中止操作。 - 拆分PDF
:点击“✂拆分PDF”可将"待处理文件列表"中的PDF文件按页拆分为一张张图片。 - 重置引擎
:点击“♻️重置引擎”可关闭已初始化的识别引擎,以便启用新的参数来识别内容。 - 帮助
:点击“❓ 帮助”可打开查看本帮助说明。
3.参数设置
设置输出目录、输出格式(引擎类型)、引擎参数:
- 输出目录
:设置识别结果文件的存放位置。默认为当前用户“我的文档”下的“MyOcr_out”目录。点击“重选输出目录...”可设置为其他目录;点击“打开输出目录”可浏览查看该目录中的文件。 - 输出格式
:可选择 Docx(Word文件) 或 TXT文本文件 格式 - DOCX
:使用 PP-StructureV3 引擎(根据当前电脑的内存大小自动适配基础参数)。输出保存为word文件(docx格式)。保留原文档排版、表格。适合需要格式还原的场景。 引擎参数: - 预处理
:如果图片或PDF内容比较规范、清晰,可不选此项以加快速度;如果图片或PDF内容歪斜、模糊、变形等可开启此项以提高识别率。 - 提取表格
:如果原文件中没有表格,可不选此项可大幅提速。 - 保留原始分行、段落结构
:不选此项则自动合并同区块的零散文字、去除多余换行空格,输出规整文本。 - 识别数学公式
:通常的文档、报表可不选。 - TXT
:使用 PP-OCRv6引擎。输出保存为TXT文件(纯文本)。仅提取纯文本文字,速度较快。适合只需要文字内容的场景。 引擎参数: - 小模型
:选中此项,则启用小模型(small),速度更快,但精度略低,否则使用medium模型; - 启用文档方向分类模型
:自动校正文档图像的朝向。若图片或PDF文档比较规范,不用选中此项; - 启用文本图像校正
:自动校正文本区域的形变(褶皱、弯曲、倾斜等)。若图片或PDF文档中文本区域比较规范,不用选中此项; - 所有识别结果合并为一个文件
:选中此项,则将“待处理文件列表”的识别结果合并存放到一个文件( MyOCR_Merged_Output.docx或txt)中,否则识别结果与原文件名一一对应,分别存放为:原文件名.docx(或Txt)
4. 常见问题
- 内存不足
:如果提示内存不足,可关闭一些其他软件,释放部分内存后再试。 - 无法读取图片
:可能原因:1.图片文件损坏,检查一下图片是否正常;2.图片文件太大可能导致内存不足,建议最长边长不超过4000。 - 设置的引擎参数不起作用
:更改引擎参数后,可点击“重置引擎”,以便再次识别时用新的参数启动引擎。 - 保存配置失败:
[Errno 13] Permission denied: 'MyOcr_config.json'。原因:当前运行本工具的权限不足,无法保存设置文件。解决方法:用鼠标右击本工具的桌面图标,在“属性”-》“兼容性”页勾选“以管理员身份运行此程序”即可。
5.高级设置
本工具基于开源的PaddleOCR(PP-OCRv6/PP-StructureV3)开发,而PaddleOCR的模型参数众多,有经验的用户可自行设置配置文件,以满足自己的识别需求(识别精度、可信度、速度等)。调用的配置文件有:(配置文件可用记事本等文本编辑软件打开修改。) - PP-StructureV3.yaml
:当电脑内存不小于16G、输出Docx格式时的配置文件(PP-StructureV3引擎)。(本工具会根据内存容量自动检测调用) - PP-StructureV3_smallMemory.yaml
:当电脑内存小于16G、输出Docx格式时的配置文件(PP-StructureV3引擎)。(本工具会根据内存容量自动检测调用) - MyOcr_small.yaml
:当选择 输出TXT格式、“small”模式时的配置文件(PP-OCR V6引擎) - MyOcr.yaml
:当选择 输出TXT格式、不选“small”模式时的配置文件(PP-OCR V6引擎)
部分参数含义
- use_doc_preprocessor
:是否启用文档预处理 - use_textline_orientation
:是否启用文本行方向分类模型 - use_doc_unwarping
:是否启用文本图像矫正 - model_name
:模型名称 - model_dir
:本地模型文件所在目录位置 - limit_side_len
:图像最短边强制缩放到的像素值;图片小于此值会上采样 - limit_type
:短边缩放策略。min 或max - max_side_limit
:图像长边最大限制值,超大图为缩小,防止显存溢出。 - thresh
:文本像素分类的置信度阈值;调大可减少误检,调小易检出小字。 - unclip_ratio
:文本检测框的膨胀系数。用来将文字轮廓适当放大,避免文字裁切。 - batch_size:
:一次性并行推理个数 - score_thresh
:识别结果置信度过滤阀值。0.0不丢弃任何识别结果;其他值则丢弃置信度低于该值的识别结果。
各推理模型文件说明
- Model文件位置(模型名称)
:识别引擎的模型文件存放在本工具所在目录的“ocr_models”目录中。 - PP-LCNet_x1_0_doc_ori
:文档方向分类 - UVDoc
:文档展平 - PP-DocBlockLayout
:文档分块版面分析 - PP-DocLayout_plus-L
:高级版面分析 - PP-LCNet_x1_0_textline_ori
:文本行方向分类 - PP-OCRv5_server_det
:文本检测 - PP-OCRv5_server_rec
:文本识别 - PP-LCNet_x1_0_table_cls
: 表格分类 - SLANeXt_wired
:有线表格结构识别 - SLANet_plus
:表格结构识别(无线/通用) - RT-DETR-L_wired_table_cell_det
:有线表格单元格检测 - RT-DETR-L_wireless_table_cell_det
:无线表格单元格检测 - PP-FormulaNet_plus-L
:公式识别 - PP-OCRv4_server_seal_det
:图章识别模型 - PP-OCRv5_server_det
:det检测模型 - PP-OCRv5_server_rec
:rec识别模型 - PP-OCRv6_medium_det
:最新V6版的det检测模型(medium档) - PP-OCRv6_medium_rec
:最新V6版的rec识别模型(medium档) - PP-OCRv6_small_det
: 最新V6版的det检测模型(small档) - PP-OCRv6_small_rec
: 最新V6版的rec识别模型(small档)
夜雨聆风