5天内,4家AI编程工具同时把人类踢出了决策循环
如果你跟我一样,每天早上习惯打开Cursor、看一眼Claude Code有没有更新,那上周可能有点恍神。
7月18日到7月23日,五天。Cursor、GitHub Copilot、Claude Code和Windsurf,四家头部AI编程工具几乎在同一时间窗口推出了同一件事——它们不再等着你告诉它"用哪个模型""修哪个bug""这代码对不对",而是自己开始做决策了。
这不是某个模型又刷新了SWE-bench分数。这是AI编程工具的"自动驾驶"时刻。
···

一、Cursor Router:你以后不用选模型了
7月22日,Cursor Router全面上线。
说人话就是:Cursor的Auto模式现在由Router驱动。你输入一个请求,Router分析它的复杂度、上下文和领域,然后自动送到最合适的模型。不是"你选一个模型",而是"系统替你做选择"。
Router有三个档位:
| 模式 | 做的事 | 适用场景 |
|---|---|---|
| Cost | 最大化Token效率,常规任务够用 | 重复性工作、简单重构 |
| Balance | 日常主力,质量对标日常可用前沿模型 | 大部分开发工作 |
| Intelligence | 强制使用前沿级模型 | 复杂架构设计、最难的调试 |
Balance和Intelligence按路由到的模型费率计费。Cost优化Token支出。
这件事的意义比听起来大得多。过去两年,程序员和AI工具的交互模式是"我先选个模型,再发指令"。模型选重了,成本爆炸;选轻了,能力不够。Router把这个决策从用户手里接过去了——你只需要关心"我要做什么",至于"用什么模型做",系统替你定。
更重要的是,Cursor Router是一个可管理的工程决策,不是魔法。管理员可以按团队或群组启用,限制可用的优化模式,设置默认模式,允许或屏蔽底层模型。这意味着企业第一次可以对"谁用什么模型"做治理,而不是靠开发者自己判断。
···
二、GitHub Copilot Cloud Agent for Linear:修Bug这事,它自己干了
同一天(7月23日),GitHub Copilot的Cloud Agent for Linear正式GA。
过去的AI编程是一问一答:你告诉它修什么bug,它读代码、改代码、提交PR,然后等你Review。Cloud Agent for Linear把这个流程倒过来了——你把一个Linear Issue分配给Copilot,它自己完成从头到尾的工作。
具体流程是这样的:Cloud Agent读取Issue描述→自动拉起GitHub Actions的沙箱环境→分析需求→编写代码→跑测试→打开Draft PR→在Linear时间线里更新进度→最后@你来看PR。
在整个过程中,你是"被通知"的那个人,不是"下指令"的那个人。
更关键的是,这个流程是可配置的。团队可以设定:用什么模型、用什么分支、给Agent什么系统指令。Copilot在开工前还会先提交一个计划,让你有时间介入调整方向。它不是黑箱,是一个可治理的自主系统。
这就是Boris Cherny(Claude Code的建造者)上周提出的"Coding-Agent Adoption Ladder"里的第3级——"工程化工作流"的雏形。第0级是自动补全,第1级是单次Agent任务,第2级是配置好的Agent,第3级就是这个:人不再盯屏幕,而是看PR。
···

三、Windsurf Devin Review:AI写的代码,AI自己审
7月20日,Windsurf(现在叫Devin Desktop)把所有付费用户的订阅里加入了Devin Review和Quick Review。
Devin Review是一个深度代码审查Agent:它不按文件顺序读PR,而是按"逻辑变更"分组阅读。同一个功能的修改分散在三个文件里?它会归到一起看,然后找出真正的逻辑问题,并给出解释。
Quick Review是轻量版,跑在本地的SWE-check模型上,速度据称是深度审查的10倍——你在提交前就能知道有没有明显的bug。
这两件事合在一起意味着什么?AI写的代码越来越多,人工Review跟不上,于是AI开始自己Review自己。
这不是替换人工审查。Cognition的设计是:Quick Review做第一轮快速扫描,过滤掉低级的逻辑错误和明显的幻觉;Devin Review做第二轮深度分析,把需要人工判断的地方高亮出来。人工审查员的角色从"一行行读代码"变成了"在AI标注的重点区域做判断"。
但这依然是一个决策权的转移。过去你需要自己发现"这段代码可能有问题";现在AI替你发现,你做最终确认。从"搜索"到"审阅",人又往后退了一步。
···

四、Claude Code v2.1.217:护栏比你想象的更深
其他三家在"放手让Agent干活",Claude Code在做另一件事:在这个放手的过程中,怎么保证不出事。
v2.1.217(7月21日发布)是Anthropic"护栏六连环"的第六环。表面上它只加了三件事:并发子Agent上限20、嵌套生成默认封堵、预算到了也停掉正在跑的后台子Agent。
但仔细看,这三件事的逻辑是一致的:在Agent越来越自主的同时,把"失控的边界"一圈圈收紧。
并发上限:一个Session最多同时跑20个子Agent。之前的版本里,你可以一口气启动50个子Agent去查50个文件,系统不管。现在管了。
嵌套封堵:子Agent生成子Agent?默认不行。需要你明确开权限。这是为了防止"委托链"无限传下去——Agent A委托Agent B,Agent B委托Agent C,三分钟后你发现Token账单爆炸了。
预算闭环:之前--max-budget-usd达到上限后只阻止新的任务,已经在跑的后台子Agent照样继续烧钱。v2.1.217把这个漏洞堵上了。
三件事加起来,是一个信号:Anthropic不是在阻止Agent变强,而是在确保"变强"的同时,人始终握着一个可控的"停止"按钮。这个设计哲学和Cursor、Copilot的"放手让Agent跑"形成了有趣的对立。
···
五、决策权转移:从"用什么模型"到"信任什么系统"
把这四件事放在一起看,7月第三周给AI编程画了一条分界线:
| 决策 | 过去 | 现在 |
|---|---|---|
| 用哪个模型 | 你手动选 | Cursor Router替你选 |
| 谁修这个Bug | 你把Issue转成Prompt | Copilot Cloud Agent自己接 |
| 代码对不对 | 你一行行Review | Windsurf Devin Review先审一遍 |
| 安全边界 | 凭直觉设 | Claude Code六连环护栏体系 |
分界线之前,AI编程工具是"更强的模型"。
分界线之后,AI编程工具是"更聪明的系统"。
这不是模型能力的进步,是工程能力的进步。Cursor Router背后不是训练了一个新模型,而是写了一个请求级分类器和路由逻辑。Copilot Cloud Agent背后不是发明了新算法,而是把GitHub Actions、Linear API和Codex CLI串成了一个闭环流水线。
这条分界线的名字叫Harness(缰绳/挽具)——不是给模型套缰绳,而是给整个AI编程工作流套缰绳。
而Harness时代的到来,意味着一个有点残酷的事实:未来AI编程工具的好坏,越来越不取决于底层模型是谁,而取决于谁能设计出更好的Harness。模型可以换,Harness不能。
···

今日技能卡片
核心技能:学会在AI编程工具中配置"自动决策"模式,把人从重复性操作决策中解放出来。
工具/资源:
• Cursor(Pro/Teams/Enterprise):开启Auto → Router → 选Balance模式
• GitHub Copilot:Business/Enterprise计划中启用Cloud Agent,配置Linear集成
• Claude Code:export CLAUDECODEMAXCONCURRENTSUBAGENTS=20 和 CLAUDECODEMAXSUBAGENTSPAWN_DEPTH=1 配置护栏
• Windsurf/Devin Desktop:Pro计划自带Devin Review,无需额外配置
实操步骤:
1. 打开Cursor,将模型选为Auto,Router自动激活
2. 在Cursor Settings → Agents → Approvals 中查看Cloud Agent hooks配置
3. 如果你的团队用Linear + GitHub,在Copilot设置中开启Cloud Agent集成
4. 在Claude Code中运行 claude --max-budget-usd 10.00 设置预算上限
5. 给Windsurf安装最新版本(2026.5.26+),开一个PR,让Devin Review自动跑
时间投入:15分钟完成配置,之后每次开发自动受益。
···
总结
7月第三周,四家AI编程工具不约而同地把同一种能力推到了前台:在不问你的情况下,替你做决策。
这件事有多大?我打个比方:如果你的车从"定速巡航"升级到了"自适应巡航"——它开始自己判断要不要减速、要不要变道——那你要做的就不是"更频繁地踩油门",而是重新理解"开车"这件事本身。你的角色从"操作员"变成了"监督员"。
AI编程工具正在经历同一个转变。从"我告诉它做什么",到"我告诉它目标是什么,它自己决定怎么做"。
而这个转变最有趣的地方在于:它不依赖模型变强。Cursor Router不需要GPT-6,Copilot Cloud Agent不需要Claude Fable 6。它们用现有的模型,靠更好的工程,做到了"更聪明"。
如果你还在纠结"下个月换哪个模型",可能要换个思路了——问题是:你的Harness够不够好。
···
下期预告:我会用一个真实项目跑一趟"全自动流水线"——从Linear Issue到PR Review,全程不写一行代码。看看这四家工具的Harness,到底谁的更靠谱。你最想看哪个环节?评论区告诉我。
夜雨聆风