我编了一份 80 万 token 的长文档,然后拉来八款免费大模型应用做测试。800K 已经超过了 Kimi 256k的上下文,也逼近了 Qwen、DeepSeek、GLM这些百万级上下文模型的极限。到了这个长度,各家在长文本解析上是骡子是马就藏不住了。
结论:处理长文档,一共四大门派——检索派(切块建索引,用一次捞一次)、沙箱派(把文件丢给代码去查)、老实截断派(读多少认多少)、截断上网派(读了个开头,剩下靠搜)——外加一个滑头(只读头尾,中间靠猜)。
测试时间 2026 年 7 月 4 日
八款应用均为网页版免费档
可见的模型版本:Kimi K2.6 Instant、Qwen3.7-Plus、GLM-5.2、MiniMax-M3
文中 token 数按 OpenAI cl100k 分词器计(各家分词器略有出入,Qwen会把同一份文档计成约 96 万)
测试文档是模板拼接的合成文档——这其实利好检索派,真实文档只会更难
文中星标 = 「读得全不全」×「读不全时老不老实」的综合分 测试文档与全部题目可提供复现
省流版
🏆 全场唯一零失误
agent.minimax.io ★★★★★:把文件写进沙箱硬盘,每轮重新读——听着笨,但 18.5 万、80 万、110 万 token 三轮,一题没错过。
🏆 检索派双雄——不硬读,靠"检索 + 召回"
chat.qwen.ai(海外版)★★★★½:检索 + 自我核对,肉眼可见地把答案改对。
deepseek.com ★★★★½:检索 + 全程透明,思路全打印;错也错得明明白白。
两位都偶有失手(各一次),但 QA 各有各的兜法,难分伯仲。
🧰 聪明机智,但有天花板的 Agent
kimi.com ★★★½:把文件读进沙箱内存,追问秒回;但 110 万 token 就卡了很久。
🙂 老实巴交的 Chatbot
chatglm.cn ★★★:上传时就提醒「可上传 20 万字」,读完再报告「仅阅读了前 26.78%」——全场实诚的AI。
🗑️ 瞎搞,别浪费时间
chatgpt.com(免费版)★½:只读头尾、中间靠猜的大滑头。
doubao.com ★:能力不行还总想走捷径,问啥都想上网找答案。
qianwen.com(国内版)½:免责声明先行,答不上来就……给你编一个(见文末番外)。
测试过程说明
我编了一份80万token的虚构临床试验总结报告。报告里,我在不同深度(开头、四分之一处、正中间、临近结尾、最末尾)埋了一批独一无二、绝对猜不出来的数字:某个研究站点每天的给药剂量、入组了多少人、某张表里第 12 周的血药浓度……
然后把这份文档、同一批问题丢给八款应用。考两件事:它到底把文档读进去了多少;读不到的时候,它老不老实。
下面这张表解释了每道题在考什么,以及如果在工作里真拿它处理文档,答错了会怎样。

好,正式开始点评。
📊 八款应用 · 800K token 主赛成绩单

110 万 token 加时赛(只有四位晋级):
MiniMax 照旧全对
chat.qwen.ai 靠自我核对把答案改对
DeepSeek 第一把有遗漏,重跑一把全对(连章节号都列了出来)
Kimi 反复「重新读取完整文档」,卡了近十五分钟没憋出答案
下面按门派逐一过堂,派内从弱到强。
第一派 · 截断上网派
此派还有一位——国内千问。但它值得单独开一章,见文末。
豆包(doubao.com)★:「只要我不说,你就不会发现我没读全吧」
它只字不提自己没读完文档,甚至不过脑子,直接开联网查询——我明明是在追问这份上传的文档,它上来就去搜全网。像极了我刚学编程时,不管老师布置什么作业,先上网看有没有现成答案能「借鉴」。能力不行是一回事,连"先看看手上这份文档"的职业操守都没有,拖出去
。

自成一派 · 滑头派
ChatGPT 免费版 ★½——「别管我对不对,你就说我看起来忙不忙吧」
它有时会老实承认"对话中仅包含该文档的截断内容,无法可靠回答"——这点值得表扬。但同一份文档,它开头 5%、结尾 99% 的内容都能答上来,偏偏中间那几段(约 30%–75% 深度)死活答不出:它读的是"头和尾",丢的是"中间"。更离谱的是它偶尔会抽风——莫名其妙调起代码工具,import 一通再打印个 "hi",不知道在忙什么。


对一个文档助手来说,"不可预测"比"稳定地只读一半"更糟:你永远不知道这一轮它到底读到没读到。(就算我订阅过期了,也值得一个透明的披露吧,摔
)
第二派 · 老实截断派
智谱清言 ★★★——「我都跟你说了我读不完,你还非让我答」
从"瞎搞"过渡到"老实"。它是全场唯一一个在上传入口就把话说死的:拖文件进去时明明白白写着「可上传 20 万字」——别家只提示文件大小,只有它提前告诉你内容长度的上限。读完之后它还会精确复盘:"超出字数限制,仅阅读了前 26.78%。"不但承认没读完,还给出确切百分比。


第三派 · 检索派
这两位检索派,是全场最淡定、也是一开始最让我看不透的。它们全程没有沙箱、没有可见代码、也没有"读文件"的动作。80 万 token 时,两位老师傅从容得不像话,速度还快——我根本判断不出它们到底是把文档读进了上下文,还是走了检索。直到 110 万 token,它们才露了底:不是读完了,是在检索。
DeepSeek ★★★★½ ——「我给你完整证据,错了你也知道我错在哪」
DeepSeek 在思考过程里写得明明白白:"扫描文档、搜索'累计入组受试者'……"这不是在读文件,是把文档切块、建索引,每个问题只去索引里捞相关的几段——也就是 RAG(检索增强)。它之所以淡定,正是因为它从不真的去读那 110 万 token,每次只处理捞回来的一小撮。
80 万这一轮,它全对,汇总一次到位。110 万那一轮,它第一把只找回 7 个站点,总数报成 819——漏掉的两个站点,位置一前一中,偏偏不是结尾。漏中间、留首尾的这种非连续缺口,是"检索召回不全"的印记,不是截断的(截断丢的该是结尾)。我又重跑了一把:9 个站点全数找回,连各自所在的章节号都列了出来,1002,分毫不差。
所以它的问题不是"读不到",是单次检索偶尔捞不全——而它把思考全程打印出来,就算漏了,你也能一眼看出漏在哪儿。错得透明,比错得理直气壮,强太多了。

chat.qwen.ai(海外版)★★★★½ ——「我反复核验之后再告诉你」
同样是检索派,qwen.ai 的招牌是自我核验。
它的侧边栏写得清清楚楚——"检索并整合……知识库……核对并确认"。110 万那一轮,你能亲眼看着它把同一个答案从 128 改到 900、再改到 1002:第一遍检索漏了,它自己发现不对,回去补齐,最后收敛到正确答案。它也不是不漏——80 万那一轮,它就漏掉了一个 87 人的站点——但多走一步验证,把大部分漏网之鱼捞了回来。

所以这两位检索派,与其说谁更强,不如说单次检索都会有波动,QA 的兜法不同:qwen.ai 靠肉眼可见的自我核对,DeepSeek 靠全程透明、错了能定位。
第四派 · 沙箱派
沙箱派的原理:模型从头到尾没有"读"这份文档——文档待在沙箱里,模型写代码去查,进入模型上下文的只有查回来的那几行。所以文档再大,也不会撑爆模型的上下文;会被撑爆的,是沙箱自己。
这一派同时出了全场最大的翻车现场,和唯一的满分。
Kimi ★★★½ ——「我可以,直到我不可以」
Kimi 的上下文只有 256k。文档 180k token 时,它淡定地一口气读进上下文——但注意,窗口本该装得下,它却还是漏了结尾,而且对答案不做二次核对,自信到压根没发现自己没读全。
到 80 万、110 万 token,它知道自己吃不下了,果断拉起沙箱,把文档当成一个数据分析项目来做,还把全文一股脑读进沙箱实例的内存,所以后面每一轮追问都是毫秒级响应。
Kimi 的天花板就卡在这:110 万 token 时,"全文读进内存"这招转不动了,它反复念叨"让我重新读取完整文档",卡了近十五分钟也没给出答案。快,因为全在内存里;卡,也因为想把太大的东西全塞进内存。

MiniMax(agent.minimax.io)★★★★★ ——「保险起见,我还是放大招吧」
从 185k token 那一轮起,它就没打算硬读:直接读 Docx 被系统禁止后,它调起 Docx Skill,把文件存进临时目录、每一轮都从磁盘重新读一遍。听起来"笨"——每次都重读——可正是这个笨办法,让它从 18.5 万、80 万一路扛到 110 万 token:文档待在硬盘上,模型只管派代码去查,永远不会被文档大小压垮。三轮所有问题一个不差。
同样是沙箱派,MiniMax 和 Kimi 的差别,在于它主动接受自己的能力边界:Kimi 想把全文塞进内存换速度,MiniMax 每次老老实实回硬盘查。Kimi 是"聪明但有上限",MiniMax 是"看着笨却能一直扛"。

番外:18.5 万 token 那一轮,还有一幕值得一提
讲到这,你大概会觉得——最差不过是「读不完、答不出」。不,还有更糟糕的。
在更早的一轮测试(18.5万 token 的另一份文档)里。境内版千问(qianwen.com),每个答案后面都会加一句免责声明「当前文档过长,我已阅读部分内容」:既不给读进去的百分比,也不正面说「后面我答不了」——你没读懂它的暗示,仿佛还成了你的问题。
但比"不够直接"严重得多的是:它遇到一个答不上来的表格数据,直接把一家同名上市公司「华瑞股份」的营业收入(2.13 亿元)端了上来,当成从文档里拿到的答案。

好家伙,这小子给我编上了
而公平起见,必须替豆包说一句:同一轮、同一个坑,豆包也搜到了华瑞股份,但它守住了底线——「与本集团机密报告不属于同一主体,不可混用」。同一个坑,一个绕开了,一个一头扎了进去。

智谱清言说「我只读了 26.78%」;千问说「你一定要,我就给编一个吧」。
一个会说"我不知道"的助手,比一个会"编"的助手,安全一百倍。前者顶多帮不上忙,后者会在你毫不知情的时候,把一个错误的数字签进你的合同、写进你的报告。
夜雨聆风