AI学习琐记:如何将word, pdf, pptx, xlsx转markdown为啥要转:其实要为了让AI省token, 在token越来越贵,连deepseek也涨价的时代,精打细算用token就是省钱,毕竟目前AI还没有给我赚钱,到处都是用AI花钱的工具,动不动几十上百个月的plan,还是省着点钱,毕竟老板还没有因为我用AI给我涨工资,也没有用AI赚到钱。都省token吗:理论上word, pdf(非扫描版),pptx都是省token的。至于xlsx, 如果不是规范的,有很多空行或无意义的na等内容是需要先清理后再转的,如果非常干净后也是能省token能省多少:估计20-50%,现在经验不多,但每个文件转一下,累积就多了,还是非常值得的。怎么转:powershell上安装markitdown, pip install "markitdown[all]"然后运行:python -m markitdown "文件名.xlsx" -o "文件名.md"pdf, pptx, docx 都行,只要上面把xlsx替换一下即可,当然你的powershell上把执行文件夹转到你文件所在的文件夹,用 cd 命令即可。成功了吗:都成功了,除了xlsx实际转时有时会非常大,其他的都没有什么问题,平时的几百块的临床试验方案大约几秒钟就转成功了。pptx也是很快。有啥缺点吗:如果里面有图的,是转不出来的,如果图很多,很重要,考虑别的。如果是扫描版的PDF,大概率搞不出来。----------犯懒了一段时间,重新折腾起来累,但有收获。不累,也累。