乐于分享
好东西不私藏

5天内,4家AI编程工具同时把人类踢出了决策循环

5天内,4家AI编程工具同时把人类踢出了决策循环

5天内,4家AI编程工具同时把人类踢出了决策循环

如果你跟我一样,每天早上习惯打开Cursor、看一眼Claude Code有没有更新,那上周可能有点恍神。

7月18日到7月23日,五天。Cursor、GitHub Copilot、Claude Code和Windsurf,四家头部AI编程工具几乎在同一时间窗口推出了同一件事——它们不再等着你告诉它"用哪个模型""修哪个bug""这代码对不对",而是自己开始做决策了。

这不是某个模型又刷新了SWE-bench分数。这是AI编程工具的"自动驾驶"时刻。

···

一、Cursor Router:你以后不用选模型了

7月22日,Cursor Router全面上线。

说人话就是:Cursor的Auto模式现在由Router驱动。你输入一个请求,Router分析它的复杂度、上下文和领域,然后自动送到最合适的模型。不是"你选一个模型",而是"系统替你做选择"。

Router有三个档位:

模式做的事适用场景
Cost最大化Token效率,常规任务够用重复性工作、简单重构
Balance日常主力,质量对标日常可用前沿模型大部分开发工作
Intelligence强制使用前沿级模型复杂架构设计、最难的调试

Balance和Intelligence按路由到的模型费率计费。Cost优化Token支出。

这件事的意义比听起来大得多。过去两年,程序员和AI工具的交互模式是"我先选个模型,再发指令"。模型选重了,成本爆炸;选轻了,能力不够。Router把这个决策从用户手里接过去了——你只需要关心"我要做什么",至于"用什么模型做",系统替你定。

更重要的是,Cursor Router是一个可管理的工程决策,不是魔法。管理员可以按团队或群组启用,限制可用的优化模式,设置默认模式,允许或屏蔽底层模型。这意味着企业第一次可以对"谁用什么模型"做治理,而不是靠开发者自己判断。

···

二、GitHub Copilot Cloud Agent for Linear:修Bug这事,它自己干了

同一天(7月23日),GitHub Copilot的Cloud Agent for Linear正式GA。

过去的AI编程是一问一答:你告诉它修什么bug,它读代码、改代码、提交PR,然后等你Review。Cloud Agent for Linear把这个流程倒过来了——你把一个Linear Issue分配给Copilot,它自己完成从头到尾的工作。

具体流程是这样的:Cloud Agent读取Issue描述→自动拉起GitHub Actions的沙箱环境→分析需求→编写代码→跑测试→打开Draft PR→在Linear时间线里更新进度→最后@你来看PR。

在整个过程中,你是"被通知"的那个人,不是"下指令"的那个人。

更关键的是,这个流程是可配置的。团队可以设定:用什么模型、用什么分支、给Agent什么系统指令。Copilot在开工前还会先提交一个计划,让你有时间介入调整方向。它不是黑箱,是一个可治理的自主系统。

这就是Boris Cherny(Claude Code的建造者)上周提出的"Coding-Agent Adoption Ladder"里的第3级——"工程化工作流"的雏形。第0级是自动补全,第1级是单次Agent任务,第2级是配置好的Agent,第3级就是这个:人不再盯屏幕,而是看PR。

···

三、Windsurf Devin Review:AI写的代码,AI自己审

7月20日,Windsurf(现在叫Devin Desktop)把所有付费用户的订阅里加入了Devin Review和Quick Review。

Devin Review是一个深度代码审查Agent:它不按文件顺序读PR,而是按"逻辑变更"分组阅读。同一个功能的修改分散在三个文件里?它会归到一起看,然后找出真正的逻辑问题,并给出解释。

Quick Review是轻量版,跑在本地的SWE-check模型上,速度据称是深度审查的10倍——你在提交前就能知道有没有明显的bug。

这两件事合在一起意味着什么?AI写的代码越来越多,人工Review跟不上,于是AI开始自己Review自己。

这不是替换人工审查。Cognition的设计是:Quick Review做第一轮快速扫描,过滤掉低级的逻辑错误和明显的幻觉;Devin Review做第二轮深度分析,把需要人工判断的地方高亮出来。人工审查员的角色从"一行行读代码"变成了"在AI标注的重点区域做判断"。

但这依然是一个决策权的转移。过去你需要自己发现"这段代码可能有问题";现在AI替你发现,你做最终确认。从"搜索"到"审阅",人又往后退了一步。

···

四、Claude Code v2.1.217:护栏比你想象的更深

其他三家在"放手让Agent干活",Claude Code在做另一件事:在这个放手的过程中,怎么保证不出事。

v2.1.217(7月21日发布)是Anthropic"护栏六连环"的第六环。表面上它只加了三件事:并发子Agent上限20、嵌套生成默认封堵、预算到了也停掉正在跑的后台子Agent。

但仔细看,这三件事的逻辑是一致的:在Agent越来越自主的同时,把"失控的边界"一圈圈收紧。

并发上限:一个Session最多同时跑20个子Agent。之前的版本里,你可以一口气启动50个子Agent去查50个文件,系统不管。现在管了。

嵌套封堵:子Agent生成子Agent?默认不行。需要你明确开权限。这是为了防止"委托链"无限传下去——Agent A委托Agent B,Agent B委托Agent C,三分钟后你发现Token账单爆炸了。

预算闭环:之前--max-budget-usd达到上限后只阻止新的任务,已经在跑的后台子Agent照样继续烧钱。v2.1.217把这个漏洞堵上了。

三件事加起来,是一个信号:Anthropic不是在阻止Agent变强,而是在确保"变强"的同时,人始终握着一个可控的"停止"按钮。这个设计哲学和Cursor、Copilot的"放手让Agent跑"形成了有趣的对立。

···

五、决策权转移:从"用什么模型"到"信任什么系统"

把这四件事放在一起看,7月第三周给AI编程画了一条分界线:

决策过去现在
用哪个模型你手动选Cursor Router替你选
谁修这个Bug你把Issue转成PromptCopilot Cloud Agent自己接
代码对不对你一行行ReviewWindsurf Devin Review先审一遍
安全边界凭直觉设Claude Code六连环护栏体系

分界线之前,AI编程工具是"更强的模型"。

分界线之后,AI编程工具是"更聪明的系统"。

这不是模型能力的进步,是工程能力的进步。Cursor Router背后不是训练了一个新模型,而是写了一个请求级分类器和路由逻辑。Copilot Cloud Agent背后不是发明了新算法,而是把GitHub Actions、Linear API和Codex CLI串成了一个闭环流水线。

这条分界线的名字叫Harness(缰绳/挽具)——不是给模型套缰绳,而是给整个AI编程工作流套缰绳。

而Harness时代的到来,意味着一个有点残酷的事实:未来AI编程工具的好坏,越来越不取决于底层模型是谁,而取决于谁能设计出更好的Harness。模型可以换,Harness不能。

···

今日技能卡片

核心技能:学会在AI编程工具中配置"自动决策"模式,把人从重复性操作决策中解放出来。

工具/资源

• Cursor(Pro/Teams/Enterprise):开启Auto → Router → 选Balance模式

• GitHub Copilot:Business/Enterprise计划中启用Cloud Agent,配置Linear集成

• Claude Code:export CLAUDECODEMAXCONCURRENTSUBAGENTS=20CLAUDECODEMAXSUBAGENTSPAWN_DEPTH=1 配置护栏

• Windsurf/Devin Desktop:Pro计划自带Devin Review,无需额外配置

实操步骤

1. 打开Cursor,将模型选为Auto,Router自动激活

2. 在Cursor Settings → Agents → Approvals 中查看Cloud Agent hooks配置

3. 如果你的团队用Linear + GitHub,在Copilot设置中开启Cloud Agent集成

4. 在Claude Code中运行 claude --max-budget-usd 10.00 设置预算上限

5. 给Windsurf安装最新版本(2026.5.26+),开一个PR,让Devin Review自动跑

时间投入:15分钟完成配置,之后每次开发自动受益。

···

总结

7月第三周,四家AI编程工具不约而同地把同一种能力推到了前台:在不问你的情况下,替你做决策。

这件事有多大?我打个比方:如果你的车从"定速巡航"升级到了"自适应巡航"——它开始自己判断要不要减速、要不要变道——那你要做的就不是"更频繁地踩油门",而是重新理解"开车"这件事本身。你的角色从"操作员"变成了"监督员"。

AI编程工具正在经历同一个转变。从"我告诉它做什么",到"我告诉它目标是什么,它自己决定怎么做"。

而这个转变最有趣的地方在于:它不依赖模型变强。Cursor Router不需要GPT-6,Copilot Cloud Agent不需要Claude Fable 6。它们用现有的模型,靠更好的工程,做到了"更聪明"。

如果你还在纠结"下个月换哪个模型",可能要换个思路了——问题是:你的Harness够不够好。

···

下期预告:我会用一个真实项目跑一趟"全自动流水线"——从Linear Issue到PR Review,全程不写一行代码。看看这四家工具的Harness,到底谁的更靠谱。你最想看哪个环节?评论区告诉我。