一、背景与痛点
随着大语言模型(LLM)和AI智能体的普及,越来越多用户开始使用AI助手处理各类文档。然而,当输入包含扫描版PDF、图片等非文本格式时,AI智能体往往需要对每张图片进行视觉理解,导致:
Token消耗巨大:一页扫描版PDF图片可能消耗数千甚至上万个token
响应速度慢:图片理解比文本处理耗时数倍
成本居高不下:无论是API调用还是本地模型推理,图片处理都显著增加了计算成本
隐私风险:将文档图片上传至云端进行OCR,可能存在信息泄露风险
二、解决方案:本地OCR扩展包
本安装包基于开源项目 Umi-OCR(由hiroi-sora开发,GitHub: https://github.com/hiroi-sora/Umi-OCR),为AI智能体提供了一套完整的本地OCR能力扩展方案。
通过将图片/扫描版PDF预先进行本地OCR文字识别,将非文本格式转换为纯文本,从而:
零Token消耗:识别后的文本直接输入AI助手,无需视觉理解
响应速度提升:文本处理远比图片处理高效
完全离线运行:所有OCR计算均在本地完成,无需联网
隐私安全:文档内容不出本地,杜绝信息泄露风险
三、核心功能
3.1 图片OCR
支持所有常见图片格式(JPG、PNG、BMP、GIF等),可批量导入,自动识别其中的文字内容。
3.2 PDF文档识别
专为扫描版PDF设计,可指定页码范围进行识别,支持排除页眉页脚、水印等干扰内容。
3.3 批量处理
支持批量导入图片或PDF文件,自动逐一处理,适合大规模文档转换场景。
3.4 HTTP API接口
内置HTTP API服务(默认端口1224),支持外部程序(包括AI智能体)通过HTTP请求调用OCR能力,实现无缝集成。
3.5 多引擎支持
RapidOCR引擎:无需AVX指令集,兼容老旧CPU
PaddleOCR引擎:高精度识别,适合高性能机器
四、技术架构
本扩展包基于以下开源技术构建:
| 组件 | 说明 |
|---|---|
| Umi-OCR | 核心OCR引擎,由hiroi-sora开发,基于PaddleOCR/RapidOCR |
| PaddleOCR | 百度开源OCR引擎,支持多国语言识别 |
| RapidOCR | 基于ONNX Runtime的高性能OCR引擎 |
| HTTP API | 提供RESTful接口,支持跨进程、跨平台调用 |
项目地址:
GitHub: https://github.com/hiroi-sora/Umi-OCR
开源协议:MIT License
作者:hiroi-sora
五、安装与使用
5.1 安装步骤
解压本安装包到任意目录(建议路径不含中文和空格)
运行
启动.bat启动Umi-OCR服务服务启动后,HTTP API将自动监听
http://127.0.0.1:1224
5.2 与AI智能体集成
本扩展包已预配置为WorkBuddy用户级技能,安装后AI助手将自动识别需要使用OCR的场景,并调用本地算力完成识别。
手动调用示例(通过HTTP API):
importrequests# 上传图片进行OCRwithopen('image.png', 'rb') asf:response=requests.post('http://127.0.0.1:1224/api/ocr',files={'image': f})text=response.json()['text']
5.3 与常见智能体平台对接
WorkBuddy:已内置技能
umi-ocr-local,自动调用其他平台:通过HTTP API接口,任何支持HTTP请求的平台均可集成
六、典型应用场景
| 场景 | 说明 |
|---|---|
| 学术文献处理 | 将扫描版论文PDF转换为文本,供AI助手分析总结 |
| 合同文档审查 | 识别扫描版合同,提取关键条款 |
| 书籍数字化 | 将扫描版电子书转换为EPUB等格式 |
| 批量文档处理 | 企业批量处理历史扫描文档,提取文字内容 |
| 隐私敏感场景 | 医疗记录、法律文书等不便上传云端的文档 |
七、效果对比
| 指标 | 使用云端视觉模型 | 使用本地下OCR扩展包 |
|---|---|---|
| Token消耗 | 每页数千~数万 | 0 |
| 处理速度 | 慢(需上传+推理) | 快(本地推理) |
| 隐私安全 | 文档上传云端 | 完全离线 |
| 成本 | 高(按token计费) | 免费 |
八、开源共建
本扩展包基于 Umi-OCR 开源项目构建,遵循开源协议。我们鼓励用户:
访问Umi-OCR的GitHub仓库(https://github.com/hiroi-sora/Umi-OCR)了解项目详情
为Umi-OCR项目点亮Star,支持开源开发者
反馈使用问题,共同改进扩展包
基于本扩展包进行二次开发,定制符合自身需求的功能
九、总结
本地OCR扩展包通过引入成熟的本地OCR能力,有效解决了AI智能体处理图片/扫描版PDF时的无效算力消耗问题。基于开源项目Umi-OCR构建,兼具高性能、零成本、隐私安全等多重优势,是AI智能体用户降本增效的必备扩展。
相关链接:
Umi-OCR GitHub: https://github.com/hiroi-sora/Umi-OCR
Umi-OCR 官网: https://umi-ocr.com/zh-CN
我用夸克网盘给你分享了「OCR SKILL」,点击链接或复制整段内容,打开「夸克APP」即可获取。
/~58153ZDSIW~:/
链接:https://pan.quark.cn/s/74b46ab55081
提取码:cCn8
夜雨聆风