ARTICLE · 1154198
给 Claude 和 OpenClaw 装上"火眼金睛":OCR 部署实操手册
你有没有试过把一份扫描版 PDF 丢给 Claude,结果它老老实实回你一句:"抱歉,我无法读取图片内容"?
或者更现实一点的场景:你用 OpenClaw 跑了个自动回单机器人,结果客户发来一张发票截图,机器人回了一句"请发送文字消息"——订单就这么黄了。
这件事本质上是个老问题:现在的 AI 默认是个"文字动物"。LLM 训练时主要吃的是纯文本,能"看"图是因为另外接了视觉模型,但即便是最强多模态模型,遇到下面三类东西也容易翻车:
OCR(光学字符识别)就是给 AI 装上"眼睛"。装上之后,Claude 能直接读扫描版 PDF,OpenClaw 能自动解析客户截图,整本法律卷宗一次性转 Markdown——你不再需要手动敲一遍。
这篇文章就把"装眼睛"这件事彻底讲清楚:为什么装、装完能干什么、怎么装、有哪些坑。不管你用的是 Claude Desktop 还是 OpenClaw,看完都能照着做。
一、OCR + AI 的想象空间
先说价值,因为不是所有人都清楚"OCR 接 AI"这件事的想象空间。5 类典型场景:
🔍 扫 PDF 直接问答 — 丢一份扫描版合同给 Claude,直接问"违约条款在哪一页?" 📱 截图自动识别 — OpenClaw 自动把客户发来的发票转成结构化数据入库 🖼️ 批量处理图片 — 一次给 50 张产品图,自动提取 SKU 和价格 📚 整本专著解析 — 一本 500 页的法律卷宗一次性转 Markdown 🔎 跨模态检索 — 把所有历史截图建索引,让 AI"记起"任何一张图里的内容
一句话总结:OCR 不只是"识别文字",它是把 AI 从文字工作者变成全模态助理的关键拼图。
二、两个 OCR 引擎怎么选?
OCR 后端不是装一个就行——选错了等会白忙活。两个主流选项定位完全不同:
💡 选型建议:90% 的场景用 PaddleOCR 就够了;只有遇到"几百页连续扫描的卷宗"才需要上 Unlimited-OCR。
下面重点讲 PaddleOCR 的部署(覆盖 90% 场景),Unlimited-OCR 放在最后一节作为高阶选项。
三、部署 PaddleOCR:两种最常用姿势
PaddleOCR 提供三种部署方式,我们只讲最常用的两种——HTTP 自托管和 Claude Desktop 的 MCP 插件。
姿势 A:本地起一个 HTTP 服务(推荐,所有平台通用)
一行命令起服务:
pip install paddlex paddlex --install servingpaddlex --serve --pipeline PaddleOCR-VL-1.6跑起来之后,访问服务就能看到 API 文档。
不同场景选不同 pipeline:
💡 小白建议:先跑 PaddleOCR-VL-1.6,啥场景都适用;慢了再换轻量版。 🔥 GPU 加速:机器有显卡就加
--device gpu,速度快 5-10 倍。
姿势 B:直接装 MCP 插件(Claude Desktop 用户最快)
如果你只用 Claude Desktop、不打算接 OpenClaw,这是 5 分钟搞定的方案:
pip install paddleocr-mcp然后编辑 Claude Desktop 配置文件(重启 Claude 生效):
macOS: ~/Library/Application Support/Claude/claude_desktop_config.jsonWindows: %APPDATA%\Claude\claude_desktop_config.jsonLinux: ~/.config/Claude/claude_desktop_config.json
最简配置(用百度 AI Studio 官方 API,零部署):
{"mcpServers":{"paddleocr":{"command":"paddleocr_mcp","args":[],"env":{"PADDLEOCR_MCP_MODEL":"PaddleOCR-VL-1.6","PADDLEOCR_MCP_PPOCR_SOURCE":"aistudio","PADDLEOCR_MCP_AISTUDIO_ACCESS_TOKEN":"<你的-token>"}}}}token 去百度 AI Studio 申请,免费的额度日常够用。
接本地自托管服务(数据隐私 / 批量处理用):
{"mcpServers":{"paddleocr":{"command":"uvx","args":["--from","paddleocr-mcp","paddleocr_mcp"],"env":{"PADDLEOCR_MCP_MODEL":"PaddleOCR-VL-1.6","PADDLEOCR_MCP_PPOCR_SOURCE":"self_hosted","PADDLEOCR_MCP_SELF_HOSTED_BASE_URL":"本机服务地址"}}}}重启 Claude Desktop,对话框里说"用 OCR 工具把这份 PDF 转成 Markdown",OCR 工具会自动出现在工具列表里。
四、让 OpenClaw 也能用 OCR
OpenClaw 通过 ~/.openclaw/workspace/skills/<name>/SKILL.md 注册技能(skill)。装一个 OCR skill 只需要写一个文件。
第一步:先按姿势 A 起好 PaddleOCR 服务
paddlex --serve --pipeline PP-StructureV3 --port 8080(保持后台运行,或用 tmux / screen 挂起)
第二步:写一个 skill
mkdir -p ~/.openclaw/workspace/skills/paddleocr-ocr新建文件 ~/.openclaw/workspace/skills/paddleocr-ocr/SKILL.md:
name: paddleocr-ocrdescription: 调用本地 PaddleOCR 服务对图片/PDF 做 OCR 或版面解析metadata: openclaw: requires: bins: [curl, jq] env: [PADDLEOCR_BASE_URL] primaryEnv: PADDLEOCR_BASE_URL调用本机 PaddleOCR 服务。## 用法- 把图片/PDF base64 编码- POST 到 /predict/ocr_system- 返回 Markdown / JSON 结果第三步:让 OpenClaw 加载它
openclaw doctor # 验证配置重启后,OpenClaw 对话里直接说"用 paddleocr-ocr 解析这张扫描件"就会自动触发。
五、高阶场景:整本专著用什么?
如果你的场景是"几百页扫描 PDF 一次性转 Markdown"(法律卷宗、古籍数字化、学术专著),PaddleOCR 会比较慢,这时候上 Unlimited-OCR。
它没有 MCP,需要起 vLLM 或 SGLang 暴露 OpenAI 兼容 API,然后用 OpenClaw skill 包一层。
启动 Unlimited-OCR(vLLM)
docker pull vllm/vllm-openai:unlimited-ocrdocker run -dp 8000:8000 vllm/vllm-openai:unlimited-ocr \ --model baidu/Unlimited-OCR --port 8000 \ --enable-custom-logit-processorOpenClaw skill(节选)
~/.openclaw/workspace/skills/unlimited-ocr/SKILL.md:
name: unlimited-ocrdescription: 调用本地 Unlimited-OCR 服务做长文档一次性解析调用本机 Unlimited-OCR 服务。## 注意- 长 PDF 用提示词 "Multi page parsing."- 显存:≥24GB,Hopper(A100/H100)体验最佳⚠️ 坑提醒:启 vLLM 时务必保留
--enable-custom-logit-processor,否则长文档会出现"无限循环重复"的乱码。
六、常见坑 FAQ
Q1:装完 paddleocr-mcp,Claude 工具列表里没出现? A:检查 JSON 格式(逗号、引号),然后完全退出 Claude Desktop 再开(不是关窗口,要从菜单退出)。
Q2:报错 Connection refused? A:PaddleX 服务没起来。重新跑服务,确认能看到正常运行字样。
Q3:识别中文乱码? A:模型换成 PP-OCRv5 系列,别用 PP-OCRv5-latin(只支持拉丁字母)。
Q4:扫 PDF 转出来版式全乱了? A:换成 PP-StructureV3 或 PaddleOCR-VL-1.6 pipeline,这两个专门处理版面。
Q5:Unlimited-OCR 跑得慢 / 重复? A:显存不够;或漏了 --enable-custom-logit-processor。
Q6:OpenClaw skill 不生效? A:跑 openclaw doctor 看诊断;检查 SKILL.md 路径是否在正确目录下;完全重启 OpenClaw daemon。
七、选型速查表
写在最后
OCR 不只是"识别文字"那么简单——它是把 AI 从"文字工作者"变成"全模态助理"的关键拼图。
装上之后,你会发现很多以前得手动做的事突然自动化了:扫描件直接问答、截图自动入库,长文档一次性消化。Claude + OpenClaw 加 OCR,等于给你的 AI 工作流装上眼睛。
下一步建议:
先按第三节起好 PaddleOCR 服务(5 分钟) 再装 paddleocr-mcp 或写 OpenClaw skill(10 分钟) 找个真实场景试一下——把最近的一份扫描 PDF 丢给 Claude