北京时间2026年7月20日19:20:10,Ars Technica发出一篇关于AI coding harness的访谈,Augment Code的Vinay Perneti把争议点摆到台面上:Claude Code、Codex、OpenCode、Cursor、Augment这些工具,真正拉开差距的未必是底层模型,而是模型外面那层“上下文系统”。
图1:Ars Technica在2026年7月20日发布访谈,发布时间明确落在本次24小时窗口内
1 这次争议不是“谁的模型更强”
过去半年,AI编程工具的讨论基本围着Claude Code、Codex、Cursor、OpenCode、Augment Code转。用户问的是同一个问题:同样是Claude Opus、GPT、Gemini,为什么一个工具能改完整个模块,另一个工具连入口文件都找错?
Ars这篇访谈给了一个更具体的答案:harness。它不是模型本身,而是模型外面的执行层,决定模型能看见哪些文件、怎么检索代码、何时调用终端、如何写补丁、怎样保留任务状态、失败后如何重试。Anthropic产品团队此前偏向“lean harness”,少加结构化代码导航,更多相信模型自己探索;Augment Code站在另一边,强调语义检索和Context Engine,先把代码库映射成结构化上下文,再把任务需要的部分喂给agent。
这不是理论分歧。Perneti在采访中说,Augment内部在Terminal-Bench上用同一模型对比Claude Code和Augment Code,完成率接近,但Augment的token使用低了33%。换成工程账本,意味着同样一批复杂任务,账单少三分之一,失败排查也少一截。
图2:Augment官方页面把Context Engine定位为“更少token、同等质量”的代码上下文层
2 AI编程工具怎么横评
只看“能不能写代码”已经不够了。现在更接近真实开发的测试,至少要拆成六项:
| 维度 | 该看什么 |
|---|---|
| 上下文能力 | 能否理解多仓库、历史提交、文档、配置和测试 |
| 修改稳定性 | 是否会大面积误改、重复补丁、丢失已有约束 |
| 终端集成 | 能否跑测试、读日志、修环境、处理失败 |
| 成本控制 | 同一任务的token、重试次数、模型路由策略 |
| IDE/CLI体验 | Cursor偏IDE,Claude Code/Codex/OpenCode偏终端,Augment两边都押 |
| 团队治理 | 是否支持审计、权限、BYOK、企业策略、数据边界 |
如果你是独立开发者,前四项更重要:一次任务跑五轮,每轮都把整个仓库扫一遍,模型再强也会烧钱。如果你在公司里推AI编程工具,后两项会直接决定能不能进采购流程:代码是否被训练、日志留多久、谁能让agent改生产配置、PR必须经过谁确认。
3 Augment这次押的是“语义上下文”
Augment官方文档把Context Services拆成三块:Context Engine MCP、Context Engine SDK、Context Connectors。MCP用来接Claude Code、Codex、Gemini CLI等agent;SDK给自研应用接入TypeScript或Python;Context Connectors是开源库,用于索引GitHub、GitLab、Bitbucket、网站、runbook、本地文件系统,索引可以放本地,也可以放S3,通过CLI、MCP或HTTP查询。
这套设计的关键不是“把更多文件塞进上下文窗口”,而是相反:少塞、准塞、可复用地塞。传统grep式agent通常先搜关键词,搜不到就扩大范围,再读更多文件;语义检索先根据任务意图找结构相关的代码块、接口、调用链和文档片段。差别在大仓库里会被放大。十万行代码里找一个函数,grep够用;五十万文件、多个服务、共享schema、旧迁移脚本混在一起,grep会把agent拖进噪音里。
图3:Augment从个人补全工具转向组织级agent平台,核心卖点是代码库上下文和治理
4 Claude Code、Codex、OpenCode不一定输
Lean harness也有合理性。Anthropic的思路是,模型进步太快,过度设计的检索、计划、记忆和规则层,可能把强模型绑死在旧流程里。Claude Code这类工具的优点是直接、可塑性强,工程师可以用CLAUDE.md、自定义命令、MCP服务器、测试脚本搭出自己的工作流。Codex CLI也类似,强项在终端原生、补丁可审、和本地仓库协作。
OpenCode这类开源替代的价值在可控:能换模型、能看实现、能接本地Ollama或企业网关,缺点是团队要自己维护harness质量。Cursor适合IDE内连续编辑和上下文切换,价格、闭源、企业策略是另一组约束。
所以结论不是“谁彻底赢了”。小项目、短任务、个人开发,lean harness往往更快;大仓库、跨服务改造、迁移、代码审查、故障排查,语义上下文和可观测执行链会更有优势。
5 一个可复用的实测流程
不要用“帮我写个登录页”测试AI编程工具。这个任务太短,任何模型都能过。更有区分度的是下面这组:
# 1. 给一个真实issue:带复现步骤、失败日志、期望行为
# 2. 要求agent先定位影响面,不许直接改代码
# 3. 让它给出计划和要读的文件列表
# 4. 执行修改后跑最小测试集
# 5. 让另一个agent审查diff
# 6. 统计总token、总耗时、测试通过率、人工返工行数
记录时不要只看最终能不能跑通。更该看它读了多少无关文件、有没有错过关键配置、是否理解历史兼容逻辑、失败后是缩小问题还是继续重试。很多AI编程工具第一次看起来很聪明,第三轮开始就暴露上下文污染、重复修改、过度自信。
6 避坑清单
第一,别把整个仓库无脑塞给模型。上下文窗口越大,注意力越贵,错误引用越难发现。
第二,给agent固定入口:README、架构图、测试命令、代码规范、禁止修改目录,写进AGENTS.md、CLAUDE.md或工具自己的规则文件。
第三,所有大改动先让agent输出“影响面清单”,再允许写代码。清单里没有测试、迁移、配置、权限边界,就别让它动手。
第四,成本要按任务算,不按月费算。一次长任务跑掉几十万token,Cursor、Claude Code、Codex、Augment、OpenCode的真实价格差距才会出现。
第五,团队里不要只买工具,要建设harness:检索、权限、测试、审计、回滚、人工确认,这些东西比换一个更强模型更稳定。
图4:Anthropic此前也强调harness design,分歧在于这层系统应该多厚、该不该内置语义上下文
7 给不同人的选择
独立开发者:Claude Code、Codex、OpenCode先够用,配好规则文件和测试脚本,重点控制token和回滚。
中小团队:Cursor适合IDE协作,Claude Code/Codex适合终端自动化,代码库超过几十万行后再评估Augment这类上下文引擎。
企业研发:重点不是补全体验,而是BYOK、审计日志、权限、数据边界、跨仓库检索和PR质量门禁。工具能不能“接进现有工程系统”,比模型榜单更重要。
这次Ars采访把一个行业事实说透了:AI编程工具已经从“模型包装器”变成“工程系统”。下一轮竞争不会只发生在Claude、GPT、Gemini之间,也会发生在谁更懂代码库、谁更省token、谁更能把agent放进团队流程里。
如果你已经在用Cursor、Claude Code、Codex或OpenCode,可以把这篇转给团队里负责工程效率的人。评论区也可以说说:你遇到的最大问题是模型不够强,还是它根本找不到正确上下文?
信息来源与时间验证
Ars Technica: Beyond grep: The case for a context-rich AI coding harness,发布时间 2026-07-20T11:20:10+00:00,北京时间2026-07-20 19:20:10,晚于截止线。Augment Code Context Engine官方页:说明Context Engine、33% token成本差异、组织级AI编程平台定位。 Augment Docs Context Services: 说明Context Engine MCP、SDK、Context Connectors、CLI/MCP/HTTP、本地或S3索引。 Anthropic Engineering: Harness design for long-running application development,作为harness设计背景资料。
夜雨聆风