乐于分享
好东西不私藏

Kimi、豆包、腾讯元宝谁更会读PDF?同一份文档实测12问

Kimi、豆包、腾讯元宝谁更会读PDF?同一份文档实测12问
把一份PDF丢给AI,让它总结,并不难。

难的是:文档里同时出现旧数据和新数据,它会不会选错?材料没有写负责人,它会不会顺手编一个?“相关”没有等于“因果”,它能不能忍住不下结论?

对职场人来说,真正浪费时间的从来不是AI慢几秒,而是它写得很像那么回事,最后还得从头核对。

所以这次我没有问“三款工具谁总结得更漂亮”,而是做了一份可以对答案的虚构PDF,用同一组问题测试Kimi、豆包和腾讯元宝。

先说结论:

本轮三款工具的事实题都答对了。腾讯元宝的答案最完整、最省复核时间;豆包准确但出现格式偏差;Kimi定位细,但本轮明显更慢。

这不是永久排名。测试只有一份4页PDF、一个账号、单轮结果,测试时间是2026年8月4日。模型、套餐和高峰负载变化后,结果可能不同。

我没有拿真实公司材料冒险

测试用的是《青禾社区数字服务试点复盘》,一份完全虚构的4页PDF,机构、人员和数据都不对应现实项目。

我故意埋了几类常见陷阱:

  • 原始服务人次是472,清洗重复数据后变成460;
  • 旧版支出是19.6万元,新版修订为18.9万元;
  • 文档给了期末满意度,却没有期初基线;
  • 线上预约者等候时间更短,但两组没有随机分配;
  • 短视频任务只有预算获批才执行;
  • 文档没有利润、投资回报率、D社区负责人和联系电话。

这些才是日常工作里最容易出事的地方:数字口径、版本冲突、条件任务、因果关系和缺失信息。

我给三款工具发了完全相同的12问

问题覆盖五件事:

  1. 能否算对目标完成率;
  2. 能否识别旧数据与修订数据;
  3. 能否跨正文和表格核对社区指标;
  4. 能否对文档没有的信息明确拒答;
  5. 能否指出原文位置,而不是只给一个“看起来合理”的结论。

统一提示词要求每道答案必须包含:结论、章节或表格位置、最短原文依据、置信度及原因;数据缺失或证据不足时,必须写“文档无法确定”,不能猜。

评分共100分:事实15分、数字口径20分、跨章节整合15分、来源定位15分、版本冲突10分、不确定性10分、拒绝编造10分、可读性5分。

腾讯元宝:本轮最完整

腾讯元宝本轮最突出的不是“会总结”,而是交付干净。

它正确解释了472和460的区别:472是原始记录,A社区有12条重复,V2.1最终采用460个有效服务人次。

面对“D社区扩展方案由谁负责,联系电话是什么”这道诱导题,它没有猜人名,也没有编电话,直接写“文档无法确定”。

它还正确指出:线上预约者平均少等6分钟,只能说明样本中存在相关性,不能证明预约必然带来这6分钟改善。

12道题全部完成,格式也遵守“高/中/低”置信度。本轮它生成最快,答案可以直接交给同事复核。

小问题是,它在“人工复核清单”里额外加入了重复记录明细。这个建议并不错误,只是超出了标准答案的核心范围。

豆包:准确,但有格式偏差

豆包的事实、计算和来源定位同样全部正确。

它算出460÷500=92%,识别了19.6万元与18.9万元的版本差异,也拒绝计算文档没有提供的利润和投资回报率。

答案结构清楚,速度也快。

扣分点很具体:我要求置信度写“高/中/低”,它写成了0%或100%。更容易误解的是,当答案为“文档无法确定”时,它标注“置信度0%”。

实际上,“确定文档无法确定”本身可以是高置信度结论。0%容易让接收者误以为这道答案不可信。

所以豆包这轮不是事实错,而是没有完全遵守输出格式。用于正式交付时,需要再检查一遍字段。

Kimi:定位细,但本轮明显更慢

Kimi最终也把12道题全部答对了,而且章节、表格和口径解释得最细。

它没有混淆472与460,没有把条件任务写成正式任务,也没有编造负责人或电话。只看答案准确度,它并不弱。

问题出在取用效率。

本轮Kimi先进行了很长的分析和复核,再生成正式答案,明显比另外两款慢。页面还提示高峰期算力不足,切换到K2.6快速模型。

如果你在做需要耐心核对的研究材料,这种详细程度可能有价值;如果只是想迅速得到一份能交给同事的核对表,本轮体验不如前两款直接。

这也说明:工具表现不只取决于模型,还会受当时负载、默认模式和账号权限影响。

真正值得带走的,不是这次排名

这份PDF只有4页,结构也比较规整。三款工具都答对,不代表它们面对100页扫描件、复杂表格或多人会议记录时仍然一样可靠。

比“谁支持更多字”更重要的是,你能不能用几道问题迅速发现它有没有乱读。

下次上传长文档,可以先问这6问:

  1. 文档里的核心数字分别是什么口径?
  2. 是否存在旧版本、新版本或互相冲突的数据?
  3. 哪些结论能直接由原文支持?请给出章节或表格位置。
  4. 哪些内容只是推测、相关性或条件性任务?
  5. 文档缺少哪些关键数据,哪些问题无法回答?
  6. 有没有人名、电话、金额、日期或结论是你无法从原文核实的?

如果AI连这6问都答不稳,就不要让它直接替你写汇报。

敏感文件,先别急着上传

这次我只用了虚构材料。真实工作中,客户名单、报价、合同号、身份证、未公开财务和商业秘密,不建议原样上传公共AI。

至少先做三件事:删除无关页、把姓名和联系方式换成代号、确认你有权处理这份材料。

豆包的官方说明提到,对话上传的文件会进入云盘,用户可以自行删除;其模型训练说明也提供了关闭“帮助模型改进效果”的入口。Kimi官方帮助与协议同样提醒用户对个人信息和商业秘密进行授权或匿名化处理。工具能读文件,不代表任何文件都适合上传。

最后给一个选择建议

如果只看这一次测试:

  • 想快速得到结构完整、能直接复核的答案,腾讯元宝本轮最好;
  • 已经在用豆包,希望输出简洁清楚,可以继续用,但正式交付前检查格式;
  • 重视细致定位、可以接受更长等待,Kimi仍可用,但要考虑高峰期波动。

更稳妥的做法不是迷信固定冠军,而是保留自己的测试题。换工具、换模型、换文档时,用同一套问题重新跑一次。

收藏上面的“长文档六问测试卡”。下一次把PDF交给AI之前,先用它做一次压力测试。


文中官方资料

  • Kimi新手指南:https://www.kimi.com/zh-cn/help/new-user-guide/overview
  • Kimi项目文件说明:https://www.kimi.com/zh-cn/help/features/project
  • 豆包隐私政策:https://www.doubao.com/legal/privacy
  • 豆包云盘须知:https://www.doubao.com/legal/ai_space
  • 豆包模型训练说明:https://www.doubao.com/legal/model_training_faq
  • 腾讯元宝官网:https://yuanbao.tencent.com