夜雨聆风学习资料网

ARTICLE · 1084537

一周5家:AI助手开始常驻云端替你上班

一周5家:AI助手开始常驻云端替你上班

大家好,我是虾聊,一个中年all in ai的落魄大叔,跟着我从零摸懂AI。

先说一个动作,很多人可能没注意到。

9月25日,微软把"Copilot+ PC"这块牌子,悄悄摘了。这个品牌是两年前专门为AI电脑立起来的,一度印在无数笔记本的贴纸上。

同一周,微软把 Copilot 拆成了三个入口:Home、Code、Autopilot。并且,开始按用量收费。

一边砍掉个人AI助手的品牌,一边把 Copilot 定义成"工作的操作系统"。两件方向相反的事,发生在同一家公司身上。

这背后不是一次产品改版,而是一个更安静的变化:AI智能体,正在从"对话框"搬进"云上工位"。

一、一周之内,五家做了同一件事

先看时间线。

• **9月10日到17日**,Cursor Projects、OpenAI Agents API、Claude Code Projects 三家,一周之内发布了同一种形态:一个"协调者",带着一批并行的"工人",共享记忆,会话常驻云端。

• **9月25日**,微软重构 Copilot,三区并列,引入用量计费。

• **9月26日**,Docker 发布 Cloud Sandboxes,用 microVM 把长时间运行的编码智能体整建制搬上云,按秒计费。

• **9月26日**,LangChain 发布 Engine v2 与 Managed Deep Agents 0.8,引入用户级记忆,并用约6000万条轨迹做微调。

• **同期**,Anthropic 的 Cowork 远程会话进入 beta:任务在服务端持续跑,桌面和手机状态同步。

什么意思呢?

过去的AI助手,是"你问一句,它答一句"。你关掉窗口,它就算下班了。

现在这套架构,是"你交代一件事,它在云上一直做"。你不下班,它也不下班;你下班了,它还在跑。

更关键的是那个"协调者"角色。它自己不动手,只负责把活分下去——因为它只分派、不执行,所以它永远不会被某个具体任务卡住,随时能接新的指令。

一周之内五家撞到同一个形状,这在行业里通常意味着一件事:它已经不是某家的灵感,而是一个类别。

为什么是现在?

因为三块拼图第一次同时到齐了。

第一块,智能体能长时间不崩地往下跑;第二块,云上沙箱能把它的运行环境隔离干净,还能按秒计费;第三块,记忆能跨会话把上下文保住,换个设备接着干。

少任何一块,智能体都只能停在"演示"阶段——演示的时候惊艳,一上生产就散架。

二、钱的味道变了

架构变了,计费一定跟着变。

看几个数字。

• Anthropic 的 Claude Opus 5.5 在9月22日发布,价格压到每百万输入 token 4美元、输出20美元,比上一代降了20%,缓存读取降到每百万0.20美元。

• Perplexity 用 Rust 重写了检索引擎 Photon,把智能体任务的成本压掉68%,p99 延迟从800毫秒降到65毫秒。

• Docker 的云沙箱按秒计费;LangChain 的新引擎,重心从"单次调用"转向"轨迹"。

• 而 Cursor 的 credit 计费,让不少重度用户第一次感到肉疼。

计费单位正在从"人"变成"消耗"。

这句话值得拆开:过去你买一个席位,人不在电脑前就不花钱。现在智能体常驻,它半夜也在跑,账单是按它实际消耗的算力长出来的。

所以社区里出现了一个很直白的质疑:为什么有开发者几天就在 Cursor 上烧掉几百美元,却不直接订阅 Claude Code 或 Codex?后两者能直接调用顶级模型。(来源:Linux.do 社区讨论,2026年9月)

这不完全是抠门。这是企业开始算账了——当工具从"体验"变成"基础设施",采购逻辑就从好不好用,换成值不值。

三、企业怎么算这笔账

一个能落地的样本。

商汤善惠发布的零售物理操作系统 SenseMart OS,官方口径是单店只需 0.2 到 0.3 个人力,15秒处理一单。

看清楚这个数字的含义:"0.2 个人"是算出来的,不是省出来的。

一个店原本可能要 3 个人。把流程拆成机器人接得住、智能体接得住的部分之后,剩下的人从"亲手干活"变成"看着机器干活、处理机器处理不了的情况"。

换句话说,智能体真正的价值,不在于它多聪明,而在于它能不能被排进班表。

能被排进班表,才谈得上算账;算得清账,才谈得上规模化。

这里有个容易被忽略的转折。

过去企业买AI,买的是"工具"——买回来交给员工,用得怎么样取决于员工。现在企业买AI,买的是"产能"——买回来直接排班,产出被计进流程。

工具是支出,产能是资产。

一字之差,采购部门的态度完全不同:前者要压价,后者要算回报率。这也是为什么这一周里,讨论最多的不是"哪个模型更聪明",而是"怎么计费、谁批预算、出了问题谁签字"。

四、但这里有五盆冷水

写到这里,得泼水了。上面这些厂商数字,有一个共同的软肋。

第一盆:生产力数字没有审计基线。

Cursor 说新用户合并的 PR 多了30%,主要靠 Projects 的用户多6倍。但公开材料里,既没有基线,也没有队列规模和时间窗。没有基线的百分比,只能算演示,不能算结论。

第二盆:上下文会退化。

一位开发者做了 847 次智能体运行实测,发现随着上下文填满,指令遵循准确率从约94%掉到41%。这个现象在学术上早有对应:斯坦福等机构的"Lost in the Middle"研究发现,长上下文里模型对中段信息的利用明显变差,呈U型曲线——开头和结尾准,中间塌。业界甚至给它起了名字,叫上下文退化综合征。

*限定条件:847次是单个开发者的实测,尚未被独立复现,不能当基准值用。*

第三盆:信任赤字还在。

一份开发者调查里,41%的人最喜欢的编程助手是 Claude Code,Cursor 21%,GitHub Copilot 10%。但被问到可靠性时,多数人仍然按"审初级工程师"的标准,逐行审AI产出的代码。

采用率很高,信任度不高。这是两件事。

第四盆:权限悬空。

当智能体 A 派生出智能体 B,B 去改代码、开 PR——这时候,被使用的到底是谁的权限? 这个问题目前没有标准答案。

第五盆:常驻就是成本。

降价20%不等于便宜。智能体从"按需启动"变成"长期在线",跑得越久,账单越长。

五、给你一个可判断的坐标

不吹不踩,我说三个判断标准。以后任何一家再发布"常驻智能体",你就拿这三条去量。

一、有没有审计基线。 厂商给的百分比,有没有对照组、样本量和时间窗。没有,就当宣传听。

二、有没有回滚和权限边界。 智能体能改什么、不能改什么,出了事能不能退回去。这是常驻架构的生死线。

三、成本按人还是按消耗。 按人计费,预算可控;按消耗计费,预算取决于你怎么用。这一条决定了你到底是买了个助手,还是签了张空白账单。

至于"微软退出个人AI助手赛道",我的判断是:它不是放弃AI助手,是放弃了"助手"这个说法。

助手是按人情算的,工位是按岗算的。它想把 Copilot 变成所有人的工位。

写在最后

这周最值得记的一句话,来自一位开发者对自己产品的反思:不要把计划做成一份文档,要做成一个持续保持人类理解的流程。

智能体搬进云上工位,技术问题只解决了一半。

另一半是:谁在盯着它。

我会继续跟这条线。下周如果哪家再发"常驻智能体",我第一时间把它的审计基线翻出来给你看。

相关学习资料