乐于分享
好东西不私藏

PDF和图片文字提取Skill

PDF和图片文字提取Skill
工作中最浪费时间的事是什么?把图片里的文字一个字一个字敲出来。把扫描版PDF里的内容复制粘贴重排版。听起来不难,但遇到几十页文档、上百张图,分分钟想哭。今天推荐一个能彻底解决这个问题的小工具——PDF和图片文字提取 Skill。

一、它是干嘛的?

一句话:上传图片或 PDF,自动识别并提取其中的文字内容,保留原文结构与排版,输出清晰易读的结果。

它能解决这些场景:

·老板发来一张会议白板照,要整理成会议纪要;

·手头有一份扫描版 PDF,需要编辑或引用;

·看到一份外文报告截图,想复制下来翻译;

·学生试卷、合同截图、发票照片,都要变可编辑文本。

本质上,它把"人眼看 + 人手抄"这件事,变成了"机器读 + 结构化输出"。

二、能识别哪些格式?

·图片:PNG、JPG、JPEG、GIF、WebP、BMP 等常见格式都支持;

·文档:PDF,包括文字版(可复制那种)和扫描版(图片那种)。

SkillHub 技能详情页:可以直接复制 prompt 安装

三、怎么安装和使用?

第一步:注册并获取 API Key

这个 Skill 来自 SkillHub,需要先到官网注册账号,然后申请一个 API Key 才能用。整个过程很简单:

注意:API Key 是身份凭证,不要发给别人或截图发群。

登录 skillhub.cn → 进入个人中心 → 点击 API 密钥 → 创建 API key

第二步:把这句话发给 ClawAI

复制下面的 prompt 发给 ClawAI,它会自动安装:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_5f9c21aa/pdf-image-text-extractor

 ClawAI 对话框中粘贴安装 prompt

安装成功后,ClawAI 会给出该 Skill 的详情说明:

Skill 安装完成后的功能说明

第三步:上传文件,让它干活

安装完成后,就可以直接使用了。比如把一份 PDF 试卷丢给它:

上传 PDF 文件,自动识别并提取第一页内容

它会按 Markdown 格式输出,保留原文的标题层级和段落结构。比如上面的试卷,正确识别了选择题、选项 A/B/C/D、数学公式(∠BAC=100° 等)。

PDF 第二页继续提取:填空题、解答题都完整保留

四、它有哪些核心能力?

1. 图片文字提取

通过视觉模型识别图片中所有文字,包括标题、正文、注释、水印等。对一些复杂场景做了特殊处理:

·对数字、手写等复杂场景特殊处理,确保手写体、订单号、金额等关键数字准确;

·存疑字符会用"?"标记并给出备选,避免乱猜。

2. PDF 文字提取

通过 pypdf 脚本自动解析所有页面,主要能力包括:

·保留原排版结构和标题层级;

·输出 Markdown 格式,多页之间用 --- 分隔;

·支持文字版和扫描版 PDF。

五、相比手动录入,它快在哪?

实测一份 2 页的数学试卷 PDF,识别 + 整理用时不到 30 秒。换成手动录入,至少要 15 分钟,而且容易漏字、看错。

如果是几十页的报告、上百张会议照片,那节省的时间更夸张——基本就是一杯咖啡 vs 一下午的区别。

六、谁最需要这个 Skill?

·办公室文员:把扫描件、照片变成可编辑文档;

·老师/教研员:整理试卷、教案、参考资料;

·学生/研究者:从 PDF 论文、报告中提取关键内容;

·财务/审计:处理发票、合同、扫描版单据;

·自媒体/运营:把不能复制的图片内容变成可二次编辑的文本。

七、写在最后

工具好不好用,关键看它能不能从根上把一件烦人的事变简单。

PDF 和图片文字提取这件事,过去要么靠人海战术(雇人抄),要么靠专业 OCR 软件(还得学怎么用)。现在一个 Skill 就能搞定,门槛低、速度快、效果也不错。

如果你身边也有这种"看似不难、但真做起来很烦"的活,不妨先看看有没有现成 Skill 可以用。

告别抄录,从这一个 Skill 开始。