digest: 用了三周,长文档惊艳代码平庸
用 Kimi 大概三周了,网页版为主,偶尔切到 App。这三周正好赶上 K3 开源刷屏、公司改制冲 IPO 的档口,我没管这些噪音,就当一个普通工具在用——每天投喂它论文、代码、招标文件,然后看它到底能干活到什么程度。
先说结论
长文档理解目前中文场景第一档,AI 搜索凑合,代码辅助明显落后于 Claude 和 GPT。愿意为"一次塞进去 200 页 PDF 直接问细节"付费的人,可以直接用;如果你日常主要是写代码 / 做 Agent 开发,它不该是你的主力。
测试场景
一、长文档理解。我把一份 187 页的行业招标文件(PDF,含表格和扫描页混排)扔进去,问 12 个具体问题,比如"第 4 章第 3 节里对投标保证金的退还时限具体怎么规定的"、"附录 B 表 2 里 XX 指标的加权系数是多少"。这类问题的特点是——答案确实在文里,但用 Ctrl+F 找不到,因为表述可能是"投标截止后三十日内予以无息退还"这种散在正文的表达。
二、AI 搜索 + 事实核查。写公众号前我会先用 AI 搜索把某个技术事件的时间线拉一遍,比如"MCP 协议从公布到主流厂商适配的完整时间轴",然后我自己去核实每一条。
三、代码辅助。让它读我一个 Python 项目里的 8 个文件(约 2400 行),定位一个偶发的异步竞态 bug,再让它改一版单元测试。这个测试同一份代码我也丢给了 Claude Sonnet 4.5 和 GPT-4o 做横评。
优点
长文档是真能打。187 页招标文件的 12 个问题,Kimi 答对 10 个,另外 2 个答"该文档中未明确规定"——我核对了原文,确实没写,它没有幻觉出一个数字来糊弄我。对比我之前拿同一份文档跑 GPT-4o(需要先切 chunk 再 RAG),Kimi 是直接吞进去的整段理解,跨章节交叉引用(比如"这个条款和第 6 章那个条款是否冲突")答得比 RAG 方案自然得多。这个体验差异不是"好一点点",是"能用"和"能省半天时间"的差别。
中文语料的语感非常正。这一点在写作辅助里很明显。让它帮我润色一段公众号草稿,它不会像某些海外模型那样把"这波操作有点上头"改成"这个操作让人非常惊讶"——中文的口语、行话、微妙的贬义褒义,Kimi 拿捏得比同价位模型都稳。写中文商务邮件、给合同挑毛病、把技术文档翻成人话,这三件事我现在默认走 Kimi。
免费额度实在。网页版不登录就能用长文档,登录后配额也大方,我这三周没花过钱,测试量约等于我 Claude 每月消耗额度的三分之一。对于想让团队里非技术同学用起来的场景,这个门槛低得不像话。
劣势
代码这块和头部模型差距肉眼可见。那个异步竞态 bug,Claude Sonnet 4.5 一次定位到 asyncio 的 task cancellation 时序问题并给出正确修复;GPT-4o 定位方向对但修复方案有小 bug;Kimi 给了三个"可能的方向",其中两个是错的(怀疑到了 event loop policy 上),最后我按它的思路调了 40 分钟没修好,切回 Claude 十分钟解决。生成的单元测试也偏浅,只覆盖 happy path,异常分支基本不测。K3 开源版基准跑分好看,但网页产品里跑的具体是哪个 checkpoint、有没有做代码专项微调,我从产品端看不出来,实际体验就是——代码不是它现在的强项。
AI 搜索的信息源偏内网。做 MCP 时间线核查时,Kimi 引用的来源大量来自国内技术媒体的转述稿,同一件事的一手英文来源(Anthropic 官方公告、GitHub Discussions 里的原始讨论)常常刷不出来。做中文话题够用,做全球技术前沿追踪就得配合 Perplexity 一起用,不能单靠它。
多轮对话的上下文会莫名"轻量化"。同一个长文档会话里聊到第 7、8 轮,我明显感觉它对前面文档的引用变懒了,会给出更泛化的回答,追问一句"请再看一下文档第 X 页"才拉回来。不确定是不是显式的 context 压缩策略,用户视角就是"聊久了变笨"。
适合谁用
强烈推荐:法务、财务、投研、咨询——每天要读长报告、翻合同、做尽调的岗位,Kimi 就是为你们做的。产品经理和运营,中文写作场景直接用它当主力。
可以试试:技术团队里做资料调研、写文档、翻译 spec 的场景,Kimi 加上其他工具组合用挺舒服。学生党写论文、做文献综述,免费额度够用。
别指望:把它当主力编码助手,或者拿来做严肃的英文技术前沿追踪。这两件事目前它还给不了你想要的。
一句话总结
Kimi 是"一份 200 页文档直接问细节"这个场景里我目前用过最顺手的产品,但除此之外的战线都有更好的对手,把它放在工具箱里,别放在 C 位。
夜雨聆风