2021 年 GitHub Copilot 上线那天,它的口号是 "Your AI Pair Programmer"——和你并排坐。
2024 年 3 月 Devin 横空出世,它的口号变成了 "The First AI Software Engineer"——站在你对面。
2025 年 3 月 Manus 一夜爆红,它的口号是 "Less Structure, More Intelligence"——直接坐到了你的位置上。
四年,三句广告语,比任何技术报告都更精准地讲清了一件事: AI Agent 不是搬到云端去了,是搬到了你原本占据的那个工位上去了。你被请离了座位,挪到了审批席。
工位空了,审批席挤了。这就是当下。

一、史前史: Copilot 的"空间绑定"宿命
要看清这场重构的份量,得先回到它的反面。
2021 年的 Copilot 是这么工作的:你在 VS Code 里敲一行注释,它在光标下方甩出一段灰色的补全建议,按 Tab 接受,按 Esc 拒绝。整个回合在毫秒级闭合, AI 的"工作空间"完全寄生在你的本地编辑器进程里。你坐下,它在;你合上电脑,它消失。
这套范式有一个被默认到几乎没人提的前提——AI 的算力调度、上下文窗口、工具调用,全都必须发生在你能看见的当下。它在结构上要求人类持续在场。你既是输入端,也是裁判,还是执行器:模型建议一个补全,你接不接受?你按了 Tab ,编辑器才把字符落到文件里。 AI 没有自己的"手",它的手是你。
翻译一下,就是 AI 想干活,必须借你的身体。
这个时期所有产品——Copilot 、 ChatGPT 网页版、 Notion AI 、早期 Midjourney——本质上都遵循同一个空间逻辑:人在哪里, AI 就在哪里;人不在, AI 就不存在。智能体和人类被锁在同一个时间-空间坐标里。
我把这个状态命名为"空间绑定"。后面所有事情的发生,都是对这个状态的逐步瓦解。

二、第一次松动: AutoGPT 让 AI 在终端里自言自语
第一次真正的裂缝出现在 2023 年 3 月。
一个叫 Significant Gravitas 的开发者把一个开源项目扔到 GitHub 上,名字叫 AutoGPT 。几乎同一时间, Yohei Nakajima 发了一个 105 行的 Python 脚本,叫 BabyAGI 。
这俩东西从工程角度看相当粗糙——BabyAGI 就是一个循环:给定一个目标,让 GPT-4 拆任务,拆完再让 GPT-4 执行子任务,执行完根据结果再拆下一批。 AutoGPT 复杂一点,加了文件读写、网页浏览、向量数据库记忆。但它们做对了一件石破天惊的事:第一次让 AI 在一个回合之外继续工作。
你给 AutoGPT 一句"帮我研究市面上最好的电动牙刷并写一份报告",它会自己去搜、去读、去整理、去存文件——你可以走开喝杯咖啡回来,看到它在终端里还在自言自语地推进。这是历史上第一次, AI 协作不再是一来一回的乒乓球赛,变成了"我给你个任务你慢慢做"的委托关系。
但 AutoGPT 离"空间解耦"还差得远。它依然跑在你的本地机器上,依然占着你的终端窗口,断电就死,关机就停。 Reddit 上当时疯传的体验帖里,最常见的吐槽是"它会卡在死循环里烧 token 、烧到你信用卡报警"。 Hacker News 上有人开玩笑说 AutoGPT 是"会自己刷你信用卡的实习生"。
更关键的是不可靠。那个年代 GPT-4 还没有 function calling ,工具调用要靠 prompt 黑魔法硬掰, AutoGPT 跑十次有八次跑飞。它证明了"AI 可以自己持续工作"这件事在原理上成立,但没人会真的把生产任务交给它。
2023 年的 AutoGPT 是一个概念验证:它告诉所有人,让 AI 摆脱"同步陪伴"是可能的;但工程上离能用还差好几代人。
三、决定性一跃: Devin 把 Agent 装进云端虚拟机
2024 年 3 月 12 日。 Cognition AI——一家此前几乎没人听过、刚拿了 2100 万美元 A 轮的初创公司——发了一条推文:"今天我们隆重介绍 Devin ,世界上第一个 AI 软件工程师。"
那条推文附了一段视频。一个用户给 Devin 一句话需求:"帮我用 Replicate 上的某个模型做一个 demo 应用。"然后镜头切到 Devin 的工作界面:左边是它的"思维链",一行一行地写它在想什么、要做什么;右边分三栏,一栏是它正在用的浏览器(去查文档),一栏是它正在敲代码的编辑器,一栏是它在运行的终端。
整个过程没有人类干预。 Devin 自己打开浏览器读 Replicate 的 API 文档,自己写代码,自己跑测试,自己看到报错回去改,最后把可运行的 demo 交付出来。
这不是 AutoGPT 那种"在你电脑终端里磕磕绊绊跑"。这是一个跑在云端虚拟机里的完整开发环境。 Devin 有自己的 shell 、自己的浏览器、自己的代码编辑器、自己的文件系统——一整套对应"软件工程师"这个职业的工作工具,全部在云上,全部不依赖你的本地机器。

技术报告里 Devin 报了一个数字:在 SWE-bench 上端到端解决了 13.86% 的真实 GitHub issue 。这个数字今天看很低,但当时上一代 SOTA 只有 1.96%(而且需要人类指定要改哪个文件, Devin 是完全无辅助)。一夜之间,整个硅谷在讨论"AI 软件工程师"。
但比那 13.86% 更重要的是 Devin 推出的交互范式。 Cognition 团队在演示中刻意强调一件事:你给 Devin 一个任务,然后你可以关掉浏览器,去开会、去吃饭、去睡觉。 Devin 在云端继续跑。等它完成或者遇到需要决策的岔路,它在 Slack 上 at 你。
这一刻,"空间解耦"正式成立。智能体的运行不再依赖人类在屏幕前。人和 AI 的关系,从"我说一句你回一句"的同步对话,变成了"我下个单你慢慢做、做完叫我"的异步委托。
Devin 当时的争议也极大——业界普遍认为它演示里的能力被夸大了,后来 Answer.AI 团队复现测试中,它在 20 个 Upwork 真实任务上只完成了 3 个。但争议归争议,它示范的范式被全行业接收了。 Devin 之后,"我们的 AI 跑在云上、异步执行"几乎成了所有 Agent 产品的标配宣传语。 Cognition 的估值随后一路飙到 250 亿美元。
四、齐射时刻: 2025 年的平台化降临
如果说 Devin 是开了第一枪,那么 2025 年的整个一季度就是齐射。
1 月 23 日, OpenAI 发布 Operator 。它跑在云端的虚拟浏览器里,能自己点链接、填表单、订机票、买杂货。 OpenAI 的演示视频里有一个意味深长的场景:一个妈妈一边照看孩子一边用 Operator 订餐——她不需要盯着屏幕, Operator 自己在后台跑。
3 月 6 日,一家叫 Butterfly Effect (蝴蝶效应)的中国公司发布了 Manus 。 Manus 把 Devin 那套"云端虚拟工作台"的范式从软件工程扩展到了通用任务——研究报告、 PPT 、数据分析、网页抓取、表格处理。它最戏剧化的演示是:你说"帮我分析一下这十家公司的财报",它在云端开一个虚拟 Ubuntu 桌面,自己打开 Chrome ,自己下载 PDF ,自己写 Python 脚本解析,自己生成图表,最后输出一份完整报告。 Manus 那两周一夜爆红,邀请码在闲鱼上炒到上千元一个。
5 月, Google 发布 Jules , OpenAI 同期发布 Codex 云端版本。7 月 17 日, Operator 被整合进 ChatGPT ,更名为 ChatGPT Agent 。

到 2025 年下半年,几乎所有主要的 AI 公司都有了一个"云端异步 Agent"产品。这套形态的共同点是:
跑在云端,不占用本地资源。接受目标导向的任务,不是 step-by-step 指令。异步执行,时长从几分钟到几小时。完成或卡住时通过通知(邮件、推送、 Slack )找用户。用户的角色变成"定义目标 + 中间审批 + 验收交付物"。
业界给这套形态起了个半官方的名字——L3 Agent。 AI 从"L2 推理者"(能想、不能动)进化到"L3 智能体"(能想、能动、能持续行动)的标志性产品形态。
五、最后一公里:手机入口的闭环
但"云端异步"只是空间解耦的一半。另一半是入口虚拟化——也就是用户从哪里下单、在哪里接收结果。
2025 年下半年发生了一件不太被注意但极其关键的事:手机变成了 Agent 的第一入口。
ChatGPT 的 iOS app 在 8 月更新后支持 Agent 模式后台运行——你在手机上下个任务,划掉 app ,去开会、去坐地铁、去做任何事,几十分钟后任务完成,手机弹一条推送:"你让我做的市场调研报告已经完成,点击查看。"Anthropic 在 12 月给 Claude Code 加了异步 sub-agent 能力,社区随后涌现出一批把 Claude Code 桥接到 Telegram 、 Discord 的工具,用户在手机聊天软件里给桌面上的 Claude Code 派活,它在你家里的电脑上跑完,结果通过聊天软件推回来。
这套形态有个圈内黑话,叫 "fire and forget"——开火即忘。下完单就走,不必盯着,反正它会自己找你。
把前面三步连起来看,空间解耦的完整闭环在 2025 年中后段才算真正形成:
运行空间解耦——Agent 跑在云端虚拟机,不在你本地( Devin 开局)。任务空间解耦——Agent 在异步任务队列里跑,不在你的对话窗口里( Jules 、 Codex Cloud 强化)。入口空间解耦——用户在手机上下单和接收结果,不再需要坐在电脑前( ChatGPT Agent iOS 、 Manus 移动端、 Telegram 桥接)。

三层叠加,人类和 AI 第一次实现了真正意义上的"非共在"协作。你可以在通勤路上下个单, AI 在 AWS 某个数据中心的虚拟机里跑两小时,结果在你晚饭时通过手机推送回来。从头到尾,你没有"坐下来用 AI"这个动作。
六、回不去了:三个把行业焊死的机制
这里有个值得停下来想一想的问题:为什么这场重构不会回头?
我的判断是,三个自我强化机制已经把这条路锁死了。
第一个是算力规模化机制。 云端 Agent 一旦跑起来,单次任务的算力消耗可以是同步 Copilot 的几十倍上百倍——Devin 一个 ACU 大约对应几十分钟的 GPU 时间,售价 2.25 美元。这种算力成本结构,本地端无论如何承担不起。一旦用户习惯了"提一个需求消耗 2 美元算力换一份 PPT"的等价交换,"在本地慢慢敲让 AI 一行一行帮我补全"的旧范式就变成了奢侈品——不是因为它差,而是因为它占用了你的时间。人类时间比 GPU 时间贵,这个相对价格关系一旦确立,所有同步范式都在被异步范式蚕食。
第二个是上下文持久化机制。 云端 Agent 可以维护跨会话的项目状态、记忆、文件系统。 Devin 在你提交第二个任务的时候记得第一个任务用了什么技术栈; Manus 知道你上周让它做的报告里用了哪些数据源。本地的同步 Copilot 不行——它的"记忆"只在当前对话窗口里,关掉就清空。一旦用户体验过"AI 记得我所有项目"的便利,它就不愿意再回到金鱼脑助手。
第三个是组织协作机制。 当 AI 在云端跑,多个 AI 就可以并行跑、可以互相 review 、可以被人类团队像管理外包一样管理。 Devin 现在最大的客户案例是大型企业开几十个 AI 实例并行处理工单 backlog——这套玩法只在"AI 与人类物理分离"的前提下才可能。一旦企业的工作流改造成"AI 是远程外包工"的形态,整个组织结构就以此为基础重新搭建,反向再绑定一次。

三个机制叠加,"空间解耦"不再是某个产品的选择,而是整个行业的引力场。连最坚定的"贴身助手"阵营都开始向"远程代理"阵营迁移——Cursor 、 Windsurf 这些 IDE 内 AI 工具,从 2025 年下半年开始疯狂往自己的产品里塞 Background Agent 、 Cloud Agent 模式。
七、五种活法:异步 Agent 战场的当前格局
这个赛道目前竞品充分,按"通用 vs 垂类"和"同步 vs 异步"切两刀,有五种代表性的活法。
编码垂类双雄: Devin vs Jules
编码是空间解耦最早落地、也最成熟的垂类,因为它有天然的硬边界:代码改完了跑测试就能知道对不对,不需要人类主观判断。
Devin 是开创者,估值 250 亿美元。它的产品形态是最极端的——完全 fire-and-forget 。你在 Slack 里 at 它,给一段任务描述,它在云端开一个完整的 Ubuntu 虚拟机,自己规划、自己写、自己测、自己提 PR 。 Devin 的最大优势是端到端自主性——它真的能从 GitHub issue 直接跑到 PR merge 。劣势是贵且不可控:一个复杂任务可能烧掉十几个 ACU 还没做对,社区里"Devin 烧了我 50 刀做了个我用 Cursor 五分钟搞定的事"的帖子常年挂在 Reddit 顶部。
Jules 走的是相似路径但更轻量。它跑 Gemini 2.5 Pro ,绑定你的 GitHub repo ,在 Google Cloud 的隔离 VM 里执行。卖点是深度集成 GitHub 工作流。用户口碑上, Jules 被夸"安静、可靠、便宜",被吐槽"能力上限明显比 Devin 低"。 Hacker News 上有评论说 Jules 像"Google 内部那种 borg job——你提交它执行,结果可预测,但别期望惊喜"。
通用 Agent : ChatGPT Agent vs Manus
通用 Agent 是个比编码 Agent 难得多的领域——因为任务边界模糊、验收标准主观、错误成本难界定。
ChatGPT Agent 是 OpenAI 的旗舰押注。它的最大优势是用户基数——所有 ChatGPT Plus/Pro 用户开箱即用,月活几亿的入口直接通向 Agent 。但它有一个结构性短板:ChatGPT 本身的对话范式对异步任务并不友好。 TechRadar 在 2026 年初有一篇相当尖锐的吐槽:当你给 ChatGPT Agent 派了个长任务,关掉 app 之后,它经常并没有真的在后台跑——session 一断就停。也就是说,ChatGPT Agent 的"空间解耦"是有水分的——它在 UI 层呈现为异步,在底层依然有强烈的会话依附。
Manus 走了相反的路。它从架构开始就是云端 VM——任务一旦提交,云端的 Ubuntu 实例就启动,你可以彻底关掉浏览器,几小时后回来看结果。 Manus 的故事到 2025 年底有个戏剧性的转折——Meta 完成了对蝴蝶效应的收购,金额数十亿美元,是 Meta 历史上第三大收购案。这件事的象征意义比金额本身更大: Meta 用真金白银承认了 Manus 范式的价值——一个跑在云端、异步执行、移动端入口的通用 Agent ,是巨头愿意花百亿级别去抢的资产。

翻译一下, ChatGPT Agent vs Manus 的对比,本质上是入口优势 vs 形态彻底性的对比: ChatGPT Agent 有 OpenAI 几亿用户的分发,但底层架构对异步不够友好; Manus 有最彻底的异步架构,但分发能力远不如 OpenAI——这也是它必须卖身 Meta 才能拿到真正入口的原因。
同步阵营的反击: Cursor 与 Copilot
不是所有人都拥抱"空间解耦"。 Cursor 2024 年崛起的逻辑很清晰:开发者不想离开 IDE 。他们要的不是"AI 替我写代码",而是"AI 在我写代码的过程中帮我加速"。 Cursor 2025 年的 ARR 据报道突破了 10 亿美元,是这个赛道商业化最成功的产品之一。
但 Cursor 也在被异步范式拉扯。它从 2025 年下半年开始加 Background Agent 、 Cloud Agent 。 2026 年 Cursor 论坛里开始出现讨论"是不是该加一个 /goal 模式"——这是个信号:连 Cursor 都在向异步迁移。
我的判断是, IDE 内同步范式不会消失,但它的生态位会被压缩——压缩到"高频、低风险、需要紧凑反馈循环的精修类工作"。而所有"批量、目标清晰、可异步"的工作都会被 Devin 、 Jules 、 Codex Cloud 一类的异步 Agent 吃掉。
用户口碑横切:人们到底买不买账
如果只看产品发布会,会觉得这个赛道已经革命成功了。但翻 Reddit 、 Hacker News 、知乎,用户的真实反馈要冷静得多。
最常见的正面声音是:"我把日常 chores 委托给它了。订机票、订餐、写周报、做调研,这些事我以前要花一两个小时,现在十分钟下完单就可以走了。"这是异步 Agent 最坚实的价值锚点。
最常见的负面声音有三类。第一类是"它经常做错而且我不知道"——异步的代价是失去过程可见性。 Reddit 上一个高赞吐槽:"Devin 给我提了个 PR ,看起来很专业,跑测试也通过——直到一周后发现它把一个核心函数的逻辑改反了。"第二类是"它在错误的事情上花太多时间"——Operator 早期最有名的翻车案例是用户让它"订便宜的机票",它选了一个 12 小时转机的航班,技术上满足约束,但显然不是用户想要的。第三类最值得停下来想——一个高赞的 HN 评论说:"理论上 AI Agent 帮我节省了时间,但实际上我现在变成了一个全天候 review 机器——AI 不停 ping 我要审批,我比以前更累。"
注意,我们没有说 Agent 范式一定让人更累,只是陈述一个相当多用户在反馈的客观现象。第三条引出的,正是更深的问题。
八、人类被请离了工位
把脉络和格局合起来看,会看到一个很大、也很不舒服的图像。
我们从 Copilot 的"贴身助手"到 Devin 的"云端代理"再到 ChatGPT Agent 的"手机推送劳工",走完了一条非常完整的工具理性扩张曲线。每一步都是为了提高效率:从 Copilot 到 AutoGPT ,节省的是"AI 等人输入下一个 prompt"的时间;从 AutoGPT 到 Devin ,节省的是"AI 在本地烧用户机器资源"的成本;从 Devin 到 ChatGPT Agent + 手机推送,节省的是"用户必须坐在电脑前"的注意力。
每一步都对,每一步都更高效,每一步都创造了真实的价值。
但合起来看,人类在协作链条中的位置发生了一次结构性的位移。
在 Copilot 时代,人类是操作者——你写代码, AI 给建议,你按 Tab 接受。每一个动作、每一行变更,都经由你的手。 AI 是辅助。在 ChatGPT 时代,人类是对话者——你提问, AI 回答;你追问, AI 补充。决策权依然在你,但 AI 已经开始承担"思考"的部分劳动。在 Devin / Manus 时代,人类是目标定义者 + 结果审批者。你不再操作,你定义"我要什么",然后等 AI 做完,你评估"它做对了吗"。中间的过程——拆任务、选工具、写代码、跑测试、 debug——全部消失在云端某个虚拟机里,对你不可见。

这个位移有个不太被注意但极其关键的后果:人类对"过程"的掌握能力正在退化。
一个二十年代末入行的程序员,他可能从来没有手动配过一个 nginx ,没有从零写过一个 CRUD app ,没有 debug 过一个内存泄漏——因为这些任务从他职业生涯第一天起就是 Devin 在做的。他擅长的是"描述需求"和"判断结果好坏"。他在"做事"这个维度上是空心的。
这不是危言耸听。 Cognition 2025 年下半年的一份白皮书里就明确说: Devin 适合"从需求到 PR"端到端代理,企业的工程师只需要 review 。一旦这个工作流成立,新人工程师的训练路径就被斩断了——他们从来没机会经历"自己一行行写"的过程。
哈贝马斯把人类行动分两类:工具行为(追求目标的最高效手段)和交往行为(通过对话达成相互理解)。 Agent 范式的全部优化都在工具理性的轴上——更快、更便宜、更自主。但它对交往理性的侵蚀几乎没人讨论:当 AI 替你做了 80% 的产出,你和同事之间的协作还需要什么?你们的协作是不是退化成了"互相审批对方的 AI 产出"?
这就是问题的真实份量:工具理性的扩张并不必然提升人类福祉——它可能恰恰通过把人挤压到工具系统的边缘位置,让人在效率收益的同时丧失主体性。
九、三个剧本与一个被回避的问题
把这一切放到未来 24 到 36 个月的窗口里推演。
最可能的剧本是分层固化。 异步通用 Agent 成为大众入口,负责生活类、轻度知识类的工作;垂类异步 Agent 成为专业人士的远程外包;同步 IDE / Office 类工具退守为高熟练度专业人士的精修工具。人类工作角色在三层之间分化——少数人在最上层定义目标,多数人在中间层审批和协调 AI 产出,底层执行者大幅减少。这个剧本的关键不确定性是:审批者本身会不会被进一步替代?我倾向于会——AI 互相 review 已经在编码场景里成为现实。
最危险的剧本是能力空心化。 如果 Agent 在执行层的渗透率超过某个临界点(我猜 70% 到 80%),整个社会的"做事能力"会出现代际断裂。新一代专业人士在出道时就缺乏"自己做完一件事"的经验,他们只会"派活和验收"。一旦 AI 系统出现重大故障或被对抗性攻击破坏,人类社会可能临时丧失大量基本功能。这不是科幻——历史上"机器替代手工后人类技艺退化"的例子比比皆是,区别只是这次替代的是脑力。
最乐观的剧本是双轨复兴。 空间解耦释放出的人类时间被引向更高价值的事情——交往理性的回归、创造力的释放、终身学习的常态化。这个剧本要求社会层面的主动应对——教育系统改革、工作伦理重塑、新的协作规范。它不会自动发生,必须有意识地推动。

哪个剧本会成真,取决于一个被大多数 Agent 公司刻意回避的问题:当我们把执行权全部交给 AI 之后,人类的位置到底在哪里?
Cognition 、 OpenAI 、 Anthropic 都不愿意正面回答这个问题。他们的官方话术是"AI augments humans, not replaces them"——AI 增强人类,而非取代。但他们的产品 roadmap 上做的每一件事,都在逐步让人类从产出链条中退出。这两套语言的不一致,是这个赛道最深的不诚实。
四年时间, AI 从你工位上一个安静的小灰窗口,变成了住在云端、跑在异步任务流里、用手机推送找你确认的远程代理人。这场重构的本质,是智能体的运行空间脱离了人类的物理在场,人则从操作者退到了目标定义者和结果审批者的位置。
每一步都是效率的胜利。每一步都让那个原本坐在电脑前的人,离自己的工位远了一点。
工具理性走得很远,远到该有人问一句:人,去哪里?
夜雨聆风