一、它是干嘛的?
一句话:上传图片或 PDF,自动识别并提取其中的文字内容,保留原文结构与排版,输出清晰易读的结果。
它能解决这些场景:
·老板发来一张会议白板照,要整理成会议纪要;
·手头有一份扫描版 PDF,需要编辑或引用;
·看到一份外文报告截图,想复制下来翻译;
·学生试卷、合同截图、发票照片,都要变可编辑文本。
本质上,它把"人眼看 + 人手抄"这件事,变成了"机器读 + 结构化输出"。
二、能识别哪些格式?
·图片:PNG、JPG、JPEG、GIF、WebP、BMP 等常见格式都支持;
·文档:PDF,包括文字版(可复制那种)和扫描版(图片那种)。

三、怎么安装和使用?
第一步:注册并获取 API Key
这个 Skill 来自 SkillHub,需要先到官网注册账号,然后申请一个 API Key 才能用。整个过程很简单:

登录 skillhub.cn → 进入个人中心 → 点击 API 密钥 → 创建 API key
第二步:把这句话发给 ClawAI
复制下面的 prompt 发给 ClawAI,它会自动安装:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_5f9c21aa/pdf-image-text-extractor

在 ClawAI 对话框中粘贴安装 prompt
安装成功后,ClawAI 会给出该 Skill 的详情说明:

Skill 安装完成后的功能说明
第三步:上传文件,让它干活
安装完成后,就可以直接使用了。比如把一份 PDF 试卷丢给它:

上传 PDF 文件,自动识别并提取第一页内容
它会按 Markdown 格式输出,保留原文的标题层级和段落结构。比如上面的试卷,正确识别了选择题、选项 A/B/C/D、数学公式(∠BAC=100° 等)。

PDF 第二页继续提取:填空题、解答题都完整保留
四、它有哪些核心能力?
1. 图片文字提取
通过视觉模型识别图片中所有文字,包括标题、正文、注释、水印等。对一些复杂场景做了特殊处理:
·对数字、手写等复杂场景特殊处理,确保手写体、订单号、金额等关键数字准确;
·存疑字符会用"?"标记并给出备选,避免乱猜。
2. PDF 文字提取
通过 pypdf 脚本自动解析所有页面,主要能力包括:
·保留原排版结构和标题层级;
·输出 Markdown 格式,多页之间用 --- 分隔;
·支持文字版和扫描版 PDF。
五、相比手动录入,它快在哪?
实测一份 2 页的数学试卷 PDF,识别 + 整理用时不到 30 秒。换成手动录入,至少要 15 分钟,而且容易漏字、看错。
如果是几十页的报告、上百张会议照片,那节省的时间更夸张——基本就是一杯咖啡 vs 一下午的区别。
六、谁最需要这个 Skill?
·办公室文员:把扫描件、照片变成可编辑文档;
·老师/教研员:整理试卷、教案、参考资料;
·学生/研究者:从 PDF 论文、报告中提取关键内容;
·财务/审计:处理发票、合同、扫描版单据;
·自媒体/运营:把不能复制的图片内容变成可二次编辑的文本。
七、写在最后
工具好不好用,关键看它能不能从根上把一件烦人的事变简单。
PDF 和图片文字提取这件事,过去要么靠人海战术(雇人抄),要么靠专业 OCR 软件(还得学怎么用)。现在一个 Skill 就能搞定,门槛低、速度快、效果也不错。
如果你身边也有这种"看似不难、但真做起来很烦"的活,不妨先看看有没有现成 Skill 可以用。
夜雨聆风