乐于分享
好东西不私藏

AI编程工具横评:上下文才是胜负手

AI编程工具横评:上下文才是胜负手

北京时间2026年7月20日19:20:10,Ars Technica发出一篇关于AI coding harness的访谈,Augment Code的Vinay Perneti把争议点摆到台面上:Claude Code、Codex、OpenCode、Cursor、Augment这些工具,真正拉开差距的未必是底层模型,而是模型外面那层“上下文系统”。

图1:Ars Technica在2026年7月20日发布访谈,发布时间明确落在本次24小时窗口内

1 这次争议不是“谁的模型更强”

过去半年,AI编程工具的讨论基本围着Claude Code、Codex、Cursor、OpenCode、Augment Code转。用户问的是同一个问题:同样是Claude Opus、GPT、Gemini,为什么一个工具能改完整个模块,另一个工具连入口文件都找错?

Ars这篇访谈给了一个更具体的答案:harness。它不是模型本身,而是模型外面的执行层,决定模型能看见哪些文件、怎么检索代码、何时调用终端、如何写补丁、怎样保留任务状态、失败后如何重试。Anthropic产品团队此前偏向“lean harness”,少加结构化代码导航,更多相信模型自己探索;Augment Code站在另一边,强调语义检索和Context Engine,先把代码库映射成结构化上下文,再把任务需要的部分喂给agent。

这不是理论分歧。Perneti在采访中说,Augment内部在Terminal-Bench上用同一模型对比Claude Code和Augment Code,完成率接近,但Augment的token使用低了33%。换成工程账本,意味着同样一批复杂任务,账单少三分之一,失败排查也少一截。

图2:Augment官方页面把Context Engine定位为“更少token、同等质量”的代码上下文层

2 AI编程工具怎么横评

只看“能不能写代码”已经不够了。现在更接近真实开发的测试,至少要拆成六项:

维度 该看什么
上下文能力 能否理解多仓库、历史提交、文档、配置和测试
修改稳定性 是否会大面积误改、重复补丁、丢失已有约束
终端集成 能否跑测试、读日志、修环境、处理失败
成本控制 同一任务的token、重试次数、模型路由策略
IDE/CLI体验 Cursor偏IDE,Claude Code/Codex/OpenCode偏终端,Augment两边都押
团队治理 是否支持审计、权限、BYOK、企业策略、数据边界

如果你是独立开发者,前四项更重要:一次任务跑五轮,每轮都把整个仓库扫一遍,模型再强也会烧钱。如果你在公司里推AI编程工具,后两项会直接决定能不能进采购流程:代码是否被训练、日志留多久、谁能让agent改生产配置、PR必须经过谁确认。

3 Augment这次押的是“语义上下文”

Augment官方文档把Context Services拆成三块:Context Engine MCP、Context Engine SDK、Context Connectors。MCP用来接Claude Code、Codex、Gemini CLI等agent;SDK给自研应用接入TypeScript或Python;Context Connectors是开源库,用于索引GitHub、GitLab、Bitbucket、网站、runbook、本地文件系统,索引可以放本地,也可以放S3,通过CLI、MCP或HTTP查询。

这套设计的关键不是“把更多文件塞进上下文窗口”,而是相反:少塞、准塞、可复用地塞。传统grep式agent通常先搜关键词,搜不到就扩大范围,再读更多文件;语义检索先根据任务意图找结构相关的代码块、接口、调用链和文档片段。差别在大仓库里会被放大。十万行代码里找一个函数,grep够用;五十万文件、多个服务、共享schema、旧迁移脚本混在一起,grep会把agent拖进噪音里。

图3:Augment从个人补全工具转向组织级agent平台,核心卖点是代码库上下文和治理

4 Claude Code、Codex、OpenCode不一定输

Lean harness也有合理性。Anthropic的思路是,模型进步太快,过度设计的检索、计划、记忆和规则层,可能把强模型绑死在旧流程里。Claude Code这类工具的优点是直接、可塑性强,工程师可以用CLAUDE.md、自定义命令、MCP服务器、测试脚本搭出自己的工作流。Codex CLI也类似,强项在终端原生、补丁可审、和本地仓库协作。

OpenCode这类开源替代的价值在可控:能换模型、能看实现、能接本地Ollama或企业网关,缺点是团队要自己维护harness质量。Cursor适合IDE内连续编辑和上下文切换,价格、闭源、企业策略是另一组约束。

所以结论不是“谁彻底赢了”。小项目、短任务、个人开发,lean harness往往更快;大仓库、跨服务改造、迁移、代码审查、故障排查,语义上下文和可观测执行链会更有优势。

5 一个可复用的实测流程

不要用“帮我写个登录页”测试AI编程工具。这个任务太短,任何模型都能过。更有区分度的是下面这组:

# 1. 给一个真实issue:带复现步骤、失败日志、期望行为
# 2. 要求agent先定位影响面,不许直接改代码
# 3. 让它给出计划和要读的文件列表
# 4. 执行修改后跑最小测试集
# 5. 让另一个agent审查diff
# 6. 统计总token、总耗时、测试通过率、人工返工行数

记录时不要只看最终能不能跑通。更该看它读了多少无关文件、有没有错过关键配置、是否理解历史兼容逻辑、失败后是缩小问题还是继续重试。很多AI编程工具第一次看起来很聪明,第三轮开始就暴露上下文污染、重复修改、过度自信。

6 避坑清单

第一,别把整个仓库无脑塞给模型。上下文窗口越大,注意力越贵,错误引用越难发现。

第二,给agent固定入口:README、架构图、测试命令、代码规范、禁止修改目录,写进AGENTS.mdCLAUDE.md或工具自己的规则文件。

第三,所有大改动先让agent输出“影响面清单”,再允许写代码。清单里没有测试、迁移、配置、权限边界,就别让它动手。

第四,成本要按任务算,不按月费算。一次长任务跑掉几十万token,Cursor、Claude Code、Codex、Augment、OpenCode的真实价格差距才会出现。

第五,团队里不要只买工具,要建设harness:检索、权限、测试、审计、回滚、人工确认,这些东西比换一个更强模型更稳定。

图4:Anthropic此前也强调harness design,分歧在于这层系统应该多厚、该不该内置语义上下文

7 给不同人的选择

独立开发者:Claude Code、Codex、OpenCode先够用,配好规则文件和测试脚本,重点控制token和回滚。

中小团队:Cursor适合IDE协作,Claude Code/Codex适合终端自动化,代码库超过几十万行后再评估Augment这类上下文引擎。

企业研发:重点不是补全体验,而是BYOK、审计日志、权限、数据边界、跨仓库检索和PR质量门禁。工具能不能“接进现有工程系统”,比模型榜单更重要。

这次Ars采访把一个行业事实说透了:AI编程工具已经从“模型包装器”变成“工程系统”。下一轮竞争不会只发生在Claude、GPT、Gemini之间,也会发生在谁更懂代码库、谁更省token、谁更能把agent放进团队流程里。

如果你已经在用Cursor、Claude Code、Codex或OpenCode,可以把这篇转给团队里负责工程效率的人。评论区也可以说说:你遇到的最大问题是模型不够强,还是它根本找不到正确上下文?

信息来源与时间验证

  • Ars Technica: Beyond grep: The case for a context-rich AI coding harness,发布时间 2026-07-20T11:20:10+00:00,北京时间 2026-07-20 19:20:10,晚于截止线。
  • Augment Code Context Engine官方页:说明Context Engine、33% token成本差异、组织级AI编程平台定位。
  • Augment Docs Context Services: 说明Context Engine MCP、SDK、Context Connectors、CLI/MCP/HTTP、本地或S3索引。
  • Anthropic Engineering: Harness design for long-running application development,作为harness设计背景资料。