
选编程工具的时候,我发现大家张口第一句几乎都是同一个问题:「它接的是哪个模型?」
这么问,潜台词是——模型决定一切。接了 Claude 就强,接了 GPT 就强,接了个国产小模型就弱。
但你只要真的把这些工具都装一遍就会发现,这个假设站不住脚。
因为现在主流的编程 agent,模型几乎都能换。Cursor 里能切 Claude、GPT、它自己的 Composer;Cline 干脆让你自带 key,三十多家模型随便接;连国产的腾讯 CodeBuddy,内置的模型列表里混元、DeepSeek、GLM、Claude、GPT、Gemini 全都有,你想用哪个用哪个。
模型这一层,正在被拉平。
那问题就来了:如果大家用的脑子都差不多,为什么 Claude Code 和 Cursor 用起来是两种完全不同的东西?为什么同样接 Claude,有的工具像个靠谱的同事,有的像个会帮倒忙的实习生?
我把市面上能叫得上名字的编程 agent——Claude Code、Codex、Cursor、Google 的 Antigravity、Windsurf、开源的 Cline,加上国内字节 Trae、阿里通义灵码、腾讯 CodeBuddy——都翻了一遍,想搞清楚:抛开模型,它们到底差在哪。
先说结论里我自己最意外的一点:模型本身的差距,其实没大多数人想的那么大。

这是几个前沿模型在 SWE-Bench Pro(一个专门测真实编程任务的榜)上的得分。最强的 Claude Fable 5 是 80.3,最弱的 Gemini 3.1 Pro 是 54.2,最强和最弱之间差了 26 分。听着不少,但你得知道,这是「最强」和「还不错」之间的差距,不是「能用」和「不能用」的差距。日常写代码,这几个模型给你的体验,没有数量级的区别。
(多说一句:Fable 5 是 Anthropic 6 月初放出来的最强模型,结果几天后就因为出口管制被叫停了,现在 Claude Code 实际跑的是 Opus 4.8。这事本身也说明,模型这层变动太快,绑死一个模型的产品反而被动。)
脑子差不多。那产品凭什么差这么多?
我把它拆成五块来看。先给你一张全局的总表,下面再一块一块讲。

这张表你先扫一眼有个印象就行,下面五个维度,我挑每一块里差异最大的地方讲给你听。
一、它怎么把你的代码喂给模型
这是第一个、也是最被低估的分水岭。
模型的上下文窗口再大,也装不下你一个几十万行的项目。所以每个工具都得解决一个问题:用户问一句话,我该把哪些代码塞给模型?
这里分成两条路。
一条路是「提前建索引」。Cursor、Windsurf、还有大部分国产工具走的是这条。它们会把你整个仓库切碎、做成向量索引(就是 RAG),你一提问,它先去索引里捞出最相关的几段代码,再喂给模型。好处是快,坏处是它捞的不一定准——它是按「语义相似」捞的,不是按真的理解你代码结构去捞的。
另一条路是「让 agent 自己去翻」。Claude Code 和 Codex 走的是这条。它们不预先建索引,而是像个真人程序员一样,现场 grep、读文件、顺着调用链一层层翻。慢一点,但翻出来的东西往往更对路,因为它是带着你的具体问题去找的。
Antigravity 在这件事上更激进,它干脆把传统的文件树都弱化了,让你以「任务」而不是「文件」为中心去工作,底层靠 agent 自己组织上下文。这是个挺大胆的设计,我自己用下来,习惯了文件树的人前几天会很难受,但它确实代表了一种新思路。
哪条路更好?我想了挺久,没有标准答案。索引快但糙,自己翻准但慢。这恰恰是同样接一个模型、体验天差地别的第一个原因——喂进去的料不一样,模型再聪明也白搭。
二、给它什么手,给它多大权限
模型本身只会出字。能不能改文件、能不能跑命令、能不能开浏览器自己测——这些「手」是工具给的,不是模型给的。
这块的差异也很大。
Cline 的做法是最克制的:它分 Plan 和 Act 两个模式,先让你看它打算怎么干(Plan),你点头了它才动手(Act),而且每一步都要你批准。这对不放心 AI 乱改代码的人很友好,代价是慢、要一直盯着。
Antigravity 和 Cursor 给了 agent 一个内置浏览器,它写完前端能自己打开页面看效果、截图、甚至录屏给你看它验证过了。这一步很关键——它把「写完」和「验证写得对不对」连起来了。
Codex 和腾讯 CodeBuddy 都强调隔离沙箱:agent 在一个隔离环境里跑命令,跑坏了也不影响你本机。这是把 agent 往「敢放手让它自己干」的方向推。
你看,同样一个模型,有的工具只让它出字让你自己粘,有的工具给它配了终端、浏览器、沙箱,让它自己写自己测自己改。后者当然像个能干活的人,前者就只是个高级补全。差距不在脑子,在你给不给它手。
三、它怎么组队(我认为这是最深的一道坎)
到这块,差异就不只是体验问题了,是架构问题。
一个 agent 干不完的活,就得多个 agent 一起上。怎么「一起上」,每家的做法不一样,而且分成了两种根本不同的结构。

第一种是星形。Codex、Cursor、Antigravity 基本都是这个路子:一个主 agent 当主管,把任务拆开,派给一堆子 agent,每个子 agent 在自己隔离的环境里干(Cursor 用 Git worktree 隔离,最多能开 8 个并行;Antigravity 的 Manager 最多 5 个),干完把结果交回给主管。子 agent 之间互相不说话,谁也不知道别人在干嘛。
这种结构的好处是干净、不冲突、好控制。坏处是子 agent 之间没法商量——A 发现的问题没法直接告诉 B,所有信息都得绕一圈回到主管那。
第二种是网状。这是 Claude Code 的 Agent Teams 最近在做的,路子明显不一样:它有一个 team lead,但底下的「队友」不是隔离的子 agent,而是各自有完整上下文、能直接互相通信、还共享同一张任务清单的协作者。一个队友改了任务清单,别人立刻看得到;A 有疑问可以直接问 B,不用绕回 lead。
这两种结构,对应的是两种完全不同的协作哲学。星形像流水线——拆好、分发、汇总,适合那种能干净切开的活。网状像一个真的小团队——边干边沟通边调整,适合那种你也说不清该怎么拆、需要边做边对齐的活。
这是我认为这一波工具里差异最深的一层。它不是 UI 好不好看的问题,是底层怎么组织多个 agent 的问题,而这个,模型给不了你,只能靠工程去搭。
(顺带说一句,Claude Code 的 Agent Teams 现在还是实验功能,得手动开个环境变量才能用。但方向是清楚的。)
四、它长成什么样
形态听起来是表面的事,其实决定了一个工具的能力边界。
现在主要三种形态。
CLI(命令行):Claude Code、Codex 是代表。它活在终端里,没有花哨界面,但正因为这样,它能无缝接进你的脚本、CI、各种自动化流程里。终端党的最爱。
IDE(自己做一个编辑器,通常是改 VS Code):Cursor、Antigravity、字节 Trae 走这条。好处是它能看到你在编辑器里的一切——你光标在哪、开了哪些文件、刚改了什么,上下文最丰富,交互最直观。
插件(装在现有编辑器里):Cline、通义灵码、腾讯 CodeBuddy(CodeBuddy 三种形态都做了)。门槛最低,你不用换工具,但它能拿到的权限和上下文,受宿主编辑器限制。
形态不是越重越好。CLI 最轻但最灵活,IDE 最重但上下文最全,插件最方便但受限。它决定的是:这个 agent 能看到多少、能动多少。
五、它绑在谁的生态上
最后一层,也是最容易被忽略、但长期最重要的一层。

把九个工具按「自主程度」和「开放程度」摆到一张图上,能看出几个明显的派别。
最开放的是 Cline。纯 BYOK,开源,三十多家模型随便接,能部署在你自己的内网甚至断网环境里。它不绑任何人,代价是你得自己折腾配置。对有数据合规要求的团队,这点几乎无可替代。
绑得最紧的是各家自己的工具。Codex 绑 OpenAI,Claude Code 绑 Anthropic 的计费体系,国产的字节 Trae、通义灵码、腾讯 CodeBuddy 各自绑着字节、阿里、腾讯云。绑生态不是坏事——绑得紧往往意味着体验更顺、和自家云服务打通得更好。但你得想清楚,你是在选一个工具,还是在选一个长期供应商。
Antigravity 是个特例。它背靠 Google,但选择免费开放、还支持接 Claude 这些竞品模型。这是 Google 在用「免费」换市场——它赌的是模型这层迟早会被拉平(跟我开头说的判断一样),价值在平台和生态,不在模型本身。
那到底怎么选
讲完五层,落到你具体怎么选。
如果你是终端党、要做自动化、要把 AI 接进 CI:Claude Code 或 Codex,CLI 形态天生适合。
如果你要多个 agent 真协作、活儿又不好拆:试试 Claude Code 的 Agent Teams,网状结构这块它走得最前。
如果你重视「写完能自己验证」、喜欢可视化盯着 agent 干活:Cursor 或 Antigravity,内置浏览器和并行视图很顺手。
如果你有数据合规要求、不想被任何厂商锁定:Cline,开源加 BYOK 加能内网部署,这条几乎没有替代品。
如果你是企业、Java、重中文场景:通义灵码在企业级和中文上做得最扎实。
如果你想白嫖、想一句话出原型:字节 Trae 的 SOLO 模式和 Antigravity 都免费,门槛最低。
(顺便提一句,国产工具的市场份额我查到字节 Trae 领先、阿里通义灵码第二,但来源是社区测评不是权威机构,你就当个大致参考。)
最后
回到开头那个问题:同一个模型,工具为什么差这么多。
转了一圈,我的判断是这样——模型给的是脑子,但脑子之外的所有东西,怎么喂上下文、给什么手、怎么组队、长成什么形态、绑在谁身上,全是工程,全是各家自己搭出来的。
而且越往后,模型这层会越趋同。今天还能靠「我接了最强模型」拉开差距,等明天大家都能接最强模型的时候,能拉开差距的,就只剩工程了。
所以你下次选编程工具,别只问它接什么模型。多问几句:它怎么理解我的项目,它敢不敢自己动手,它能不能几个 agent 一起干,它会不会把我绑死。
这些问题的答案,才决定了它好不好用。

夜雨聆风