七月初开始,AI编程赛道像被按下了快进键。
六周时间里,从OpenAI到Anthropic,从Meta到DeepSeek,几乎每周都有重磅发布。如果说去年大家还在比谁的模型更聪明,那今年比的已经是——谁能造出一个真正的AI工程师。
7月9日,OpenAI发布GPT-5.6系列。
7月16日,Kimi K3发布,前端编程榜单超越所有闭源模型。
7月24日,Anthropic发布Claude Opus 5,SWE-bench直接拉到79.2%。
7月30日,OpenAI宣布Codex全线降价,最低一档砍掉80%。
7月31日,DeepSeek V4-Flash发布,推理成本只有海外旗舰的九十分之一。
8月5日,Meta Muse Code公开Beta,贡献者版输出每百万Token只要0.2美元——Claude Sonnet 5的五十分之一。
短短六周,AI编程赛道经历了一次剧烈的重新洗牌。
这背后有一个更深层的变化:竞争的主战场,已经从「谁的模型更聪明」,变成了「谁能让AI真正像一个工程师一样工作」。
这就是今天我想和你聊的事。
——————
从「补全一行代码」到「独立完成一个PR」
去年这个时候,程序员讨论AI编程,话题还集中在「哪个模型生成的代码更准确」。那时候大家比的是代码补全的正确率、单轮对话的质量。
今天已经完全不一样了。
举一个真实的场景。一个开发者早上打开终端,对Claude Code说:「把支付模块的重试机制重构一下,加上指数退避,覆盖所有异常路径,写测试,跑通之后把diff给我。」
然后他去做别的事了。
回来的时候,Claude Code已经读了整个支付模块的代码,规划了重构方案,改了6个文件,写了23个单元测试,跑了3轮自修复——最后把一个干净的分支推到他面前,等他review。
这不是科幻。这是2026年8月,一个普通开发者周二的日常。
这就是本篇文章想讲的核心问题:当市面上同时出现六七款这样的工具,你该怎么选?
我基于截至2026年8月8日的最新公开数据,把当前六大主流AI编程工具做了横向拆解。不讲概念,不画大饼。我们一个一个来。
——————
第一个阵营:终端Agent的标杆对决
Claude Code + Opus 5
如果要给现在的AI编程工具找一个基准线,一定是Claude Code。
它不是IDE插件。你从终端启动它,给它一个工程任务——跨文件重构、写测试、迭代修改、遇到bug自己修——它像一个终端里的工程师一样工作。
关键数据:
· SWE-bench Pro:79.2%,比上一代Opus 4.8的69.2%整整涨了10个百分点
· 上下文窗口100万Token,默认就是上限,不像某些产品要买了高级套餐才能解锁
· 定价输入$5/百万Token、输出$25/百万Token,和Opus 4.8持平,没有提价
有一个特别容易被忽视的细节:Opus 5的安全分类器触发频率比Anthropic的旗舰模型Fable 5低了大约85%。
为什么这个细节重要?因为Agent是自动运行的。你让它重构一个模块,它每一步都要判断「我能不能做这个操作」。如果安全分类器太敏感,每一步都弹警告,你的Agent任务会被频繁中断。85%的触发频率下降,意味着少了85%的中断——这对工程体验的影响,比benchmark多几分要大得多。
Claude Code的定位很清晰:不是Anthropic最强的模型(那是Fable 5),但是「接近最强的智能,一半的价格」。日常开发的最优解。
OpenAI Codex + GPT-5.6
如果说Claude Code是一把锋利的单刀,Codex就是一个编制完整的军团。
更关键的是产品形态的变化。Codex并入了ChatGPT桌面端。你在Codex里重构代码,退出来就能用ChatGPT分析需求文档——同一个模型,同一个上下文。这对习惯了「编程和思考混着来」的开发者来说,是一个实实在在的效率提升。
这两个怎么选?
一个简单的判断标准:如果你是终端控,喜欢在命令行里完成一切,Claude Code是你的默认答案。如果你需要灵活控制成本、经常在编程和分析之间切换,Codex的三档模型和桌面端整合更适合你。
——————
第二个阵营:IDE的革命——Cursor 3和它的Agent军团
Cursor做了一件很多工具想做但没做到的事:把多Agent协作做成了一个可视化体验。
什么意思?
你在Cursor 3里打开Agents Window,同时跑三个Agent:一个重构数据库层,一个写前端组件,一个补单元测试。你能实时看到每个Agent改了什么文件、进度到哪了,改完的diff平行展开,你逐个review、逐个merge。
更巧妙的是Git Worktree隔离机制。每个Agent在自己的独立worktree里工作,彼此不会踩对方的文件。不会出现「Agent A在第3行加了代码,Agent B在第3行删了代码」这种地狱场景。你像合并分支一样逐个merge回来。
Cursor的定价:Pro每月$20,Pro+每月$60,Ultra每月$200。自研的Composer 2模型单独计费,输入$0.50/百万Token、输出$2.50/百万Token。
Cursor的策略是「自研模型搞日常,前沿模型攻坚」。Composer 2的性能不如Opus 5或Sol,但它够快、够便宜。而且Cursor允许你随时切到Claude、GPT、Gemini——不像Copilot锁死在自研模型上。
Cursor还有一个对前端开发者特别实用的功能叫Design Mode。在内置浏览器里点选UI元素,直接标注修改意图——「这个按钮往右移10px」,「这个卡片的圆角再大一点」——Agent帮你翻译成代码。比「描述第三行第二个按钮的样式」高效太多。
年化收入超过20亿美元,说明市场用真金白银投了票。
——————
第三个阵营:两个新变量
Meta Muse Code:价格屠夫
8月5日,Meta发布了Muse Code的公开Beta。这个时间点很有意思——正好处在前面几款产品降价潮的尾声。
Muse Code的定价是颠覆性的:
标准版:输入$1.25/百万Token,输出$4.25/百万Token。数据私有,不用于训练。
贡献者版:输入$0.10/百万Token,输出$0.20/百万Token。允许Meta使用你的数据训练未来模型。
贡献者版的输出价格是Claude Sonnet 5的五十分之一。
五十分之一是什么概念?如果你一个月在Claude Code上花了500美元的API费用,切到Muse Code贡献者版,理论上只要10美元。
但有两个前提条件:第一,你要愿意把代码和prompt交给Meta训练模型;第二,Muse Code目前只支持macOS和Linux,没有Windows版。而且它还在Beta阶段,厂商自报的Terminal-Bench 2.1跑分82.9%虽然亮眼,但没有经过独立验证。
Muse Code有两个架构设计值得关注:
一是持久化背景Agent。不是给每个子任务开新Agent,而是保持Agent在整个session中存活。上下文不会频繁重置,Agent对代码库的理解随session加深。这更像「一个持续工作的同事」,而不是「每次重新分配的外包」。
二是崩溃恢复。每个操作先记录到本地事件日志再执行。机器崩溃、终端关闭、网络断开,Agent能从中断点精确恢复。对24小时运行、1000步以上工具调用的长周期任务来说,这不是锦上添花,是基本要求。
Google Antigravity:最「平台化」的选手
Antigravity是唯一一个把Agent做成完整平台的工具。
它有四个产品形态:桌面App、CLI、IDE、SDK。桌面App是一个独立的Agent指挥中心,CLI支持终端和CI工作流,IDE提供熟悉的编码界面,SDK让你把Agent能力嵌入自己的工具链。
最有意思的功能是定时任务。你可以让Agent按cron表达式自动执行——每天早上自动跑一轮代码审查,每周自动更新依赖并创建PR。这已经接近自动化运维,而不只是写代码。
Antigravity免费可用,基础功能不收费。对预算有限的个人开发者来说,吸引力显而易见。
但它的问题也很明显:依赖Google生态。如果你不在Google Cloud、Firebase、Android的技术栈里,很多整合优势你享受不到。而且Gemini模型在编程benchmark上整体弱于Claude和GPT-5.6系列。
——————
怎么选?三个场景的答案
个人开发者
预算敏感、做开源项目的话,Muse Code贡献者版是首选。$0.20/百万Token几乎等于免费。但前提是接受数据共享条款,而且只在macOS/Linux上可用。
习惯VS Code、不太想折腾的话,Copilot或Cursor 3都是零迁移成本的选择。Copilot稳定,Cursor更灵活。两者的差距在缩小,但Cursor的多Agent可视化体验目前独一无二。
追求最优效果、习惯终端的开发者,Claude Code仍然是终端Agent的默认答案。
什么都想试试、不想花钱的话,Antigravity免费可用,功能完整。
创业团队
技术栈偏Google的团队,Antigravity的生态整合是天然优势。Firebase、Android、Chrome的打通,别的工具做不到。
技术栈偏微软的团队,Copilot的团队管理和合规扫描器是企业级刚需。但如果团队对模型选择自由度要求高,Cursor 3的「日常自研+攻坚前沿」策略更灵活。
已有OpenAI使用习惯的团队,Codex的三档模型是按任务复杂度控制成本的最佳实践。
大中型企业
安全合规第一,Copilot企业版是当前唯一做全了Compliance Scanner、隔离沙箱、审计日志的方案。
私有部署需求,Claude Code的API接入方式配合Opus 5的无数据保留政策,满足严格的数据安全要求。
多语言代码库,Claude Code和Codex的100万+上下文窗口加上强推理能力,是目前处理大规模跨语言重构最可靠的选择。
——————
三个信号,比选哪个工具更重要
说完六款工具,我想跳出产品对比,说三个正在发生的趋势。这三个趋势比「选哪个工具」更根本。
信号一:模型在降价,Agent在涨价。
底层模型的推理成本在以10倍甚至90倍的速度下降。但真正产生价值的不是模型本身,而是Agent工程层的打磨。
从Loop Engineering到Graph Engineering,工程范式迭代只用了六周。未来六个月,我们可能看到更多概念被快速发明、快速过时、快速迭代。这意味着工具选型要看的不只是今天的跑分,更是背后的工程迭代速度。
信号二:垂直整合是巨头必答题。
微软自研Polaris+Maia,Meta自研Muse Spark,Google用Gemini+TPU——每一家都在追求全链路自控。这对开发者的实际含义是:选工具等于选生态的程度,会比以往任何时候都更深。
信号三:「写代码」不再是程序员最值钱的能力。
当Agent能独立完成1000步以上的工具调用、24小时不间断工作时,程序员的价值从「写代码」转向三件事:
系统设计——定义架构、约束和边界,这件事AI还做不好。
Agent编排——怎么把一个大任务拆成多个Agent能并行处理的小任务,怎么管理它们之间的依赖和顺序。
质量审查——AI产出速度提上来之后,验证比生成更重要。Review能力会变成程序员的护城河。
——————
最后的话
工具会变,模型会迭代,价格会波动。但有一件事不会变:
决定效率差距的,不是你选了Claude Code还是Cursor,而是你有没有围绕AI Agent重新设计你的工作流。
一个优秀的开发者今天的日常可能是这样的:用ChatGPT整理项目上下文,用Cursor并行启动多个Agent处理独立模块,用Claude Code处理最复杂的跨文件重构,用Muse Code跑自动化回归测试,最后人工review所有diff,merge,部署。
工具是手段。工作流才是生产力。
这篇横评写于2026年8月8日。数据主要来自厂商官方发布,部分未经独立第三方验证。希望一个月后回头看的时候,你的工作流已经发生了变化。
夜雨聆风