
anydoc宣称能把14种文件转成Markdown,适合交给AI继续搜索和分析。我用4个小型办公文件做了本地测试:PDF、Word和PPT的主要结构都还在,Excel却把公式和计算结果一起丢了。
转换速度确实很快,但一份表格只剩标题和单元格文本,未必还能承担原来的工作。文件转换是否可用,首先要看关键内容有没有保住。
我怎样测试这4种文件
测试文件都是本地生成的小样本。PDF放了标题和段落,Word加入多级标题与表格,PPT包含文字和表格,Excel则同时放入原始数字、求和公式和计算结果。
每种格式预热后调用25次并记录耗时。这些数字只代表小文件,不能推算百页报告或大型工作簿。
其余10种格式及扫描件、复杂图表、批注和宏都没有测试。
四种文件的单次中位耗时都低于3毫秒。PDF约0.282毫秒,Word约2.706毫秒;Excel约0.088毫秒,PPT约0.383毫秒。
PDF和Word的标题、段落与表格结构保留较好。PPT的文字和表格也能进入Markdown,适合后续做内容检索或摘要。
Excel虽然用时最短,输出里却没有公式,也没有公式算出的值。若原表里“总收入”由几十行数据计算得出,转换后可能只剩输入项,最关键的结论反而消失。
Excel遗漏会带来什么问题
给AI做知识检索时,文字和表头通常已经有价值;但在财务、经营和数据分析任务里,公式就是业务逻辑。公式丢失后,AI无法知道总数如何得出,也无法检查口径是否正确。
更危险的是,转换过程没有明显报错。下游系统看到一个格式正常的Markdown文件,可能默认它内容完整,继续生成报告,直到有人发现数字对不上。
因此,表格转换后至少要核对工作表数量、公式数量、关键计算值和合计行。任何一项减少,都不能把Markdown当作原文件的等价副本。
哪些场景可以直接用
如果目标是把普通PDF、Word或PPT放进知识库,anydoc提供了很轻的本地预处理方式。内容不出本机,转换后也容易被文本工具读取。
扫描版或纯图片PDF仍需要OCR,也就是先把图片里的文字识别出来。复杂Excel、带宏文件和需要审计的数据表,则应保留原文件解析结果,并把公式与计算值单独导出。
这次只证明4个小样本。支持14种格式是能力清单,上线前仍要用自己的文件验收:速度过关后,还要看信息是否完整。
夜雨聆风