本文全程真实记录,无充值,无广告,只有肝。

起因:一个简单的需求
事情是这样的。
我手头有一套12本的《中国历朝通俗演义》,纯文字PDF,蔡东藩写的,从秦汉一路写到民国,浩浩荡荡六百多万字。最近想把它整理成结构化的知识库——每回单独一个Markdown文件,文里的小字批注变斜体,篇末的评诗变引用格式。顺手还想把书里几千号人物都拎出来,每人写段简介。
听起来不难,对吧?
就是量大、格式细、重复劳动多——12本书,每本几十回,每回几千字,光拆分+格式化这一项,手动做的话,估计得我头发白一半。
正好,我电脑上装了四款AI桌面工具:
- ChatGPT 桌面版 (OpenAI 亲儿子,名气最大,月费20刀)
- Kimi Work(国产新锐,K-3 模型,长文本是它的招牌)
- 腾讯 WorkBuddy(腾讯出品,这几天还有混元3模型的免费羊毛薅)
- TRAE Work 国际版(字节跳动的海外产品,主打编程,但也能聊天)
我想着,反正都要干,不如让它们同台竞技。同样的任务,不同的选手,看看谁是真的生产力,谁是PPT生产力。
结果?跟我预想的完全不一样。
第一轮:PDF转Markdown,两个大佬直接出局
任务很明确:把PDF按回目拆成Markdown文件,正文中穿插的小字批注变斜体,成段的小字变引用。

四款工具,各领一本小说,原始格式一模一样,输出要求一字不差。
先说第一个翻车的——ChatGPT桌面版。
这大概是很多人心目中的最强AI吧?我满怀期待地把文件扔进去,等了半天,它吐出来了。
一看,格式全崩了。
问题出在中文斜体上。Markdown的斜体靠星号包裹,英文单词之间有空格,星号识别很稳;但中文字符之间没空格,ChatGPT直接把星号和汉字混在一起,结果通篇错乱——该斜体的地方没斜,不该斜的地方全斜了,有些地方星号甚至直接当正文输出。
我指出来让它改。它说好的,我改。
改了一遍,还是乱的。又改了一遍,更乱了。第三遍,我已经不想数它错了多少处了。
20刀一个月的地表最强,在中文排版面前,败得一塌涂地。
第二个出局的,是TRAE国际版(也就是TRAE Work)。
它的翻车方式更离谱——根本没听懂指令。
我把要求写得明明白白:文中穿插的小字批注变斜体,成段的小字变引用。它倒好,把所有小字一股脑全改成了引用格式,分段跟原文完全对不上。我翻开输出文件一看,满屏的 > 引用符号,像个失控的引用块瀑布。
后来想想也能理解:国际版的产品,训练数据里中文排版的比例本来就更少,批注变斜体、评诗变引用这种中式文档处理的精细要求,它可能这辈子都没见过几次。
第一轮下来,四进二。ChatGPT和TRAE,双双淘汰。
剩下来的,只有Kimi和WorkBuddy。
说实话,这时候我有点意外——我一直以为ChatGPT会是最稳的那个。现在看来,名气大不等于能干细活,尤其是在中文场景下。
第二轮:提取3000+历史人物,最贵的那个差点把我薅破产
第二轮任务更硬核:从小说里找出关键人物,每人写一段简介,单独存成Markdown文件,还要在原文里加上跳转链接。
这活儿,既要阅读理解能力,又要信息提取能力,还要代码能力——因为你不可能让AI一个字一个字给你敲,它得写脚本批量处理。
先上场的是Kimi。
用的是最新的K-3模型。不得不承认,输出质量是真的漂亮——人物抓得准,简介写得有模有样,文学性和准确性都在线,链接也规规矩矩加上了。
我正想夸它,手贱点开了token消耗页面。
差点没背过气去。
就这么一本小说的人物提取,我这个月的token额度,烧掉了80%多,直逼90%。

我翻了一下它的思考过程:它确实是通过写Python脚本来做的,但问题出在思考阶段——每处理一段文本,它都要反复推理、验证、修正,来来回回消耗了巨量token。输出确实精致,但这个成本,精致得让人心疼。
我悟了:Kimi就像一个顶级米其林大厨,菜是真好,但做一碗蛋炒饭也给你整出分子料理的阵仗,账单看得你想报警。
然后上场的是腾讯WorkBuddy。
说实话,我一开始对它是有些偏见的。之前用过几次混元大模型,感觉一般般,没有留下什么深刻印象。这次因为有免费羊毛,算是勉强给它个机会。
结果,它成了全场最大的黑马。
第一是快。同样一本小说,Kimi还在那儿反复推理的时候,WorkBuddy已经跑完了。
第二是准。人物抓得同样准,简介写得虽然没Kimi那么华丽,但信息点全在,该说的都说了。
第三是省。它的思路和Kimi完全不一样——大部分工作交给本地Python脚本去做,真正需要调用大模型的,只有判断这是不是一个关键人物和写简介这两个环节。批量处理、文件读写、链接生成,全部本地解决。
我之前的偏见,被这一顿操作直接打碎了。
WorkBuddy给我的感觉,就像一个经验丰富的老工程师:不炫技,不废话,能用脚本解决的绝不动用模型,能用规则处理的绝不浪费推理。效率,才是第一性原理。
免费的羊毛,薅到一半被腾讯掐了网线
既然WorkBuddy表现这么好,我理所当然地准备乘胜追击——剩下10部小说,全部交给它,一口气跑完。
当时是周六下午,正好要带孩子去补习班。我想着这一趟回来,3000+历史人物应该就齐活了,心里还有点小激动。
补习班下课,回家,兴冲冲打开屏幕——
停了。
进度条卡在中间,一动不动。我让它继续,它跑了没几分钟,弹出一个提示:

额度已用完。

我愣了几秒,然后笑出声来。
免费是免费,但腾讯也不是做慈善的。 你想把人家服务器薅秃?人家直接把你网线拔了。
冷静下来算了算:我已经用它跑了2本完整的人物提取,外加若干次测试和调试,免费额度确实扛不住这种工业化级别的批量作业。
好在,额度是每天恢复的。那天晚上10点半,系统自动重置,我第一时间重新开工,一台电脑、一杯咖啡、一个孤独的打工人,从10点半干到凌晨两点多,12部小说,全部跑完。
最终成果:3000多个中国历史人物,每人一段简介,整整齐齐躺在我的文件夹里。
我随手翻了翻,质量确实可以——从秦始皇到袁世凯,每个人物的关键事迹、历史评价,基本都能说到点上。美中不足的是,原文加跳转链接那一步实在太耗时间,我主动放弃了,先把人物库搭起来再说。
没有最强AI,只有最对的工具
这次折腾完,我最大的感受是:
没有什么最强AI工具,只有最适合你场景的工具。
- ChatGPT 名气最大,但中文细粒度排版是它的盲区,贵不代表万能;
- TRAE Work 国际版 在编程场景或许很强,但中式文档处理的理解力明显不够;
- Kimi 输出质量顶尖,长文本能力也确实强,但高成本让它更适合精品小批量,而不是工业化大批量;
- WorkBuddy 一开始最不被我看好的那个,反而用最务实的方式赢了——本地脚本为主、大模型为辅,把成本压到最低,把效率拉到最高。
这件事对我自己的启发也很大:
很多人用AI的第一反应是——找个最牛的模型,把所有活儿都扔给它。但真相是,真正省钱的姿势,不是选一个最强的模型,而是想清楚哪些活儿能让脚本干,哪些活儿才需要模型出手。
这两者之间的效率和成本差距,可能是十倍,甚至更多。
如果你也有类似的批量文档处理需求,我的建议是:
先拆分任务——哪些是纯格式化、纯提取,可以规则化解决; 把能规则化的部分,用脚本或本地工具跑掉; 只把真正需要理解和判断的部分,交给大模型; 最后,别迷信任何一款工具的名气,适合自己的才是最好的。
本文所有测试基于2026年7月各工具最新版本,产品迭代快,体验可能随时变化,仅供参考。
☝️欢迎关注、点赞、评论、转发!
夜雨聆风