乐于分享
好东西不私藏

别再手动上传文档啦!我做了一个让 Codex 批量读懂文献库的 Skills

别再手动上传文档啦!我做了一个让 Codex 批量读懂文献库的 Skills
相信大家一定遇到过这样一个问题:
怎么样可以更好地让AI读懂我的「知识库」文件?
比如,我zotero里面有一大批需要快速让AI帮忙总结的文献,以便撰写文献综述而不是虚假引用不存在的文献
再者,你遇到过文件夹里大量存在的excel、word。扫描件PDF、PNG图像等等需要做文字提取,表格批量提取的情况
那怎么办?最好的方法必然是写批量处理的脚本通过编程的方式实现
但是,我不会编程啊?虽然我知道有doc2x、MinerU网页可以上传进行文档转换,但是这样一个个文件上传太麻烦了
所以我想到了借助AI帮我调用MinerU、markidown进行文档转换,统一将文件全部转换成markidown格式
为什么是markdown?

因为Markdown是一种人类和AI都能够轻易读懂的纯文本文档格式,仅包含极少的标记或格式,但仍能有效呈现文档的重要结构。

最重要的一点——省token💰

而且你写文献综述和文献引用最重要的是什么?

段落文本的精确匹对和文献可溯源

这时候markdown特有的功能就体现在这里,Codex,Claude Code对markdown文件理解最容易,可以一次性吃好几篇markdown文件,并真真正正使用原文表述来辅助你写文献综述部分和做文献引用,不会出现“幻觉”和虚构的情况

于是,我就想到了构建一个文档解析skills,通过封装markidown和MinerU文档解析的脚本和工作流步骤,让Codex能够自动调用解析文档

skills我已经上传到我的GitHub公开仓库:

https://github.com/luffysolution-svg/research-skills-collection

这个skills有以下功能:
这个skills也照顾到小白体验,会自动检查依赖完整性和环境配置:
然后我经过多轮到测试和修改,总算做出了完整的skills
现在我拿我自己的几篇文献做测试,效果还是比较明显,耗费时间不长,token消耗也不多
而且这个skills不只是单纯解析文档就完事了,还会进行复核,检查文档的表格、公式、图片是否完整和有误,方便复查细节
当然不只是docx、excel、HTML、pdf,包括MP4等各种类型的文件都支持,只要配置好OCR(可以使用第三方openai兼容带有识图能力的模型)
做音视频的音频解析也是不错的,不过肯定没有专业的Python库或者其他开源项目好使
但是日常使用足够了,毕竟免费啊!
可以使用低成本的模型DeepSeek进行调用使用
解析100份文件总花费都不超过1元
下面展示完整解析效果👇:
已关注
关注
重播 分享
在vscode上面搭配下面这几个插件后预览的效果:
已关注
关注
重播 分享
怎么样?
看着还行吧,后面我还打算再增加一个图片重命名和zotero文献数据库关联功能
就是让AI根据markdown上下文和自己的识图能力来进行重命名,这样以后图片引用也方便,自己也方便定位查看
同时直接调用本地zotero条目和附件信息读取,直接批量解析zotero附件
这样以后zotero和Obsidian之间的桥梁就算彻底打通了
我之前还写过一篇文章,专门介绍一款开发的Codex插件实现zotero和Obsidian联动我做了一款Codex桌面版插件,彻底打通zotero-MinerU-Obsidian,构建个人知识图谱
现在加上这个skills配合使用会更加方便
写在最后——
我希望这个skills能帮助到大家,我自己在文档解析的时候,也试过各类工具,包括pandoc、utools的一些插件、各类文档解析网页版等等
不是说这些工具不行,而是我觉得有一种可以不用人去重复执行的工作可以使用skills交给AI去完成,把更重要的事情留给人本身
工具——是为了解放劳动力
因此,何妨不尝试一下呢?
现在就去跟Codex或者Claude Code说:
帮我安装https://github.com/luffysolution-svg/research-skills-collection里面的convert-documents-to-markdown这个skills

然后直接拿自己的文献试试吧,反正用不了多少时间哈哈哈

那么,写到这儿,感谢能读到这儿的您

我是三木,专注于科研工具开发的博主

咱们都是讲究礼仪的中国人,各位看官不要吝啬你们的点赞和💗推荐啊——哈哈哈!

然后我这个GitHub项目还包括我自己整理的几个科研专用skills/plugin集合,拟补了上期文章剩下未完成的工作

最后最后!!有问题欢迎大家在评论区留言讨论,博主有空捏会及时回复喵

那么,我们下期再见。