乐于分享
好东西不私藏

300个子代理住进你的电脑,一个时代的奔现

300个子代理住进你的电脑,一个时代的奔现
         
月之暗面内测的Kimi Work,选了一条跟硅谷主流完全不同的路。不在云端跑,直接住进你的电脑。
300个子代理,最多协调4000步,在你的真实文件系统上并行读写,驱动你已经登录的浏览器干活。你磁盘上的文档、表格、项目目录,不是沙箱里的副本,是Agent能直接碰到的真实文件。你的登录态就是它的登录态,CRM、ERP、企业邮箱、内部后台,它全都能进。
半年前这还属于科幻。现在它是一个你可以下载安装的桌面应用。
这个产品的意义不在技术本身,在于它标志着一个拐点。Agent,这个在技术圈被讨论了好几年的概念,几乎在同一时间点,从PPT和论文走向了产品落地。Kimi Work把原本专属于开发者的长程任务执行、多Agent并行协作等能力,迁移到了一个普通的桌面GUI应用中。一位金融分析师或科研人员,无需编写任何代码,就能让多个Agent协同完成一份包含数据分析、图表生成、报告撰写的工作。
Agent的受众从开发者扩展到更广泛的知识工作者,这是一场奔现。
01
为什么是本地
把Agent搬到本地绕开了云端方案最贵的两堵墙。
第一堵是数据合规。现代工作流的大部分操作发生在登录后的SaaS里,云端Agent要么拿不到这些会话,要么要求你交出密码,后者更不可能过合规。Kimi Work的WebBridge直接复用你浏览器已有的会话,这堵墙就不存在了。
第二堵是推理成本。K2.6约一万亿参数的MoE模型,激活约320亿。本地做编排,推理调云端API,成本跟你实际跑的步数挂钩。对于高频低复杂度的例行任务,这个模式站得住。
代价当然也有。安全边界从"沙箱里它做不了什么"变成了"你的电脑上它什么都能做"。300个子代理在真实文件系统上并行读写,权限做不好就是事故现场。
这个产品形态不是孤例。Cognition改造了Devin Desktop,OpenAI给Codex加了白领职业插件,月之暗面把Agent装进了知识工作者的电脑。三家都瞄准了同一件事:Agent的下一个战场不是程序员,是更广大的办公人群。
02
从工具到生产力范式
字节跳动6月初推出的扣子3.0,思路跟Kimi Work不同。它支持一人加多Agent、多人加多Agent的灵活组合,可接入Claude Code、Codex CLI、OpenClaw等本地Agent,内置自媒体、法律、金融、医疗等垂直行业的模板。Kimi Work是给个人一个AI助理,扣子3.0是构建一个AI团队。未来的工作不是单个超级AI包办,而是由一群技能互补的Agent集群高效完成。
产品层繁荣之下,模型也在进化。OpenAI在6月把ChatGPT的记忆升级为Dreaming V3。系统不再需要用户手动保存记忆点,后台自动整合对话信息碎片,提炼偏好与习惯。偏好遵循成功率从2024年的31.4%提升到71.3%,时间正确性从9.4%提升到75.1%。一条写着"用户七月要去新加坡"的记录,行程结束后会自动更新为"用户于2026年7月去过新加坡"。你不需要告诉它,它自己会改。而面向免费版用户的算力成本降低了约5倍。
开源这边,MiniMax在6月1日发布的M3模型,代码能力、1M上下文、原生多模态三项齐全。SWE-Bench Pro得分59.0%,超过GPT-5.5和Gemini 3.1 Pro,逼近Opus 4.7。Google在6月3日发布的Gemma 4 12B,160亿参数可以在普通笔记本上本地跑Agent工作流,16GB VRAM足够。不是云端缩水版,是本地优先的Agent基座。
03
当软件工程遇见AI原生
更深刻的变革在软件工程底层发生。
Google CEO Pichai在4月透露,Google新代码的75%由AI生成。18个月前25%,5个月前50%,现在75%。Anthropic CFO说"90%以上",Claude Code自身的代码库就有约90%由Claude写。Meta H1目标:65%的工程师用AI写75%以上的代码。Snap CEO说65%的新代码由AI生成,当天裁员1000人。
曲线没在减速。当AI开始大规模生成代码,工程师的角色发生了根本变化。工作重心从"写代码"转向"审代码"和"编排Agent"。
微软开源的SkillOpt提供了一种新思路:把给Agent的指令视为可训练的外部权重,而不是一次性的提示词。流程分四步:
  1. Rollout,Agent用当前技能文档执行真实任务,记录轨迹,相当于收集训练数据。
  2. Reflect,用一个更强的模型分析失败原因。
  3. Edit,AI自动修改技能文档,每次最多4个操作,保持小幅调整。
  4. Gate,评估新技能是否真的更好,决定是否上线。
这就跟深度学习训练循环一样了:前向传播、反向传播、权重更新、验证集评估。在7个模型、6个基准、3种执行环境的52个评测组合中,SkillOpt全部达到最优或最优并列。GPT-5.5上提升23.5个百分点的准确率。Codex上训练的SpreadsheetBench技能迁移到Claude Code,反而提升了31.8分。部署时只需要一个best_skill.md文件,推理开销为零。
如果说SkillOpt解决单个Agent的技能优化,Anthropic的Claude Code动态工作流解决的是另一个问题:如何打破上下文窗口的限制。
复杂任务在单个Agent里容易目标漂移。Claude Code的解法是主模型写一个JavaScript脚本,把大任务拆成小任务,动态生成子代理去并行处理。每个子代理有独立上下文,专注自己的小目标,汇总给主模型。可以给不同子代理选不同模型和隔离级别。300个子代理跑在个人电脑上,和数百个子代理跑在Claude Code里,本质是同一件事:一个窗口不够,就用多个独立窗口拼接。
Anthropic的产品团队已经放弃了六个月路线图,转向即时规划。交付周期从六个月压到一个月,部分功能缩至一周甚至一天。人力从执行中解放出来,聚焦产品洞察和系统设计。Cat Wu面试数百个想进AI领域的产品经理后发现一个普遍问题:很多人还在谈论如何制定12个月路线图。这种思路非常不正确。
04
看不见的冰山
繁荣之下,看不见的成本和风险正在浮现。
Agent系统的年度维护成本通常占初始构建的15%到30%。而API token费用只占总拥有成本的15%到20%,剩下的80%以上藏在集成维护、可观测性、治理安全和人工审核里。Grab的数据仓库团队40%的时间花在调查类工作上,HockeyStack一个20人团队每周8个工程师天砸在维护里。AI调试Agent可以把这些时间压到原来的零头,但问题是,当Agent自己的逻辑出错时,谁来调试Agent?
代码幻觉是一个被量化了的问题。Rust代码生成测试中,kimi-k2.5幻觉率20.00%,gpt-5.2为20.29%,minimax-m2.5接近30%。另一项分析75万代码样本的研究发现,19.6%的AI推荐包根本不存在。AI不是随机猜,它以确信的态度反复编造同一个不存在的包。在金融这样的强监管行业,一个自主交易Agent误读数据,几秒钟就能造成数百万美元的损失。
Claude自己在6月连续经历了十次中断。6月5日到16日,最短24分钟,最长3小时14分钟。Anthropic承认需求增长快过基础设施承载能力。把核心业务流程绑在Agent上,这个中断频率难以接受。
比可靠性更深层的,是安全与责任的边界。5月初,Grok遭遇了一次提示注入攻击。有人在一则X帖子中用摩尔斯电码藏了指令,Grok翻译了电码并标记了一个加密交易bot,bot将翻译视为可执行命令,从Grok的钱包转走了价值约17.5万美元的代币。攻击者没有偷私钥,没有破解合约,只是利用了Grok的"乐于助人"和bot自动执行之间的缝隙。虽然大部分资金随后追回,但这个案例说明了一个根本问题:当聊天机器人的输出可以触发钱包操作,每一条提示都成了安全模型的一部分。
谁为Agent的越权行为负责?开发者、使用者还是平台方?责任真空至今没有答案。没有给Agent设API预算上限的企业,云服务费用一夜激增。Agent的安全不是传统防火墙的延伸,而是一个全新的运行控制体系:谁在行动,凭什么权限,调用了什么工具,过程是否可审计,出错能否被立即中止和撤权。这些问题回答清楚之前,将Agent用于高风险核心业务是一场豪赌。
05
超级个体,还是超级螺丝钉
技术变革最终投射到人身上。
最直接的是技能要求。基础编码和信息整理正在被Agent替代。工程师的价值从"能写代码"转向"能设计和管理由Agent组成的系统"。PwC数据显示,AI技能薪资溢价达到56%,前一年这个数字只有25%,一年翻了一倍。具备AI技能的工程岗位中位薪资20.8万美元,不具备的13.2万美元,差距58%。
但不是每个人都能成为超级个体。当Agent自动化越来越多的任务而非常个工作时,效率提升反而创造了更多新任务。一部分人成为驾驭Agent的编排者,另一部分人沦为流程中的人肉插件。超级个体和超级螺丝钉的分化,比技术本身更冷酷。
06
旧地图已经失效
黄仁勋在6月1日的GTC Taipei上宣布,AI从生成式走向代理式,未来每家公司都是一家Agent公司。NVIDIA推出Agent Toolkit全栈方案、Nemotron 3 Ultra开放模型和Vera Rubin平台。扣子3.0支持多人多Agent协同,Kimi Work让300个子代理住进了用户的电脑。
产品在落地,焦虑在同步升级。
300个子代理住进你的电脑,这件事的重量不在于它能帮你做多少事,在于它标志着Agent从一个听说过的话题变成了一个需要共处的现实。你的工作方式、你的技能价值、你对世界的判断习惯,都会在这个过程中被洗牌。
旧地图已经失效。但新地图不是Agent帮你画的,是你跟它共处、共舞、相互试探的过程中一笔一笔画出来的。你需要的不是恐慌,也不是盲目信任,是一种清醒的合作姿态:让它跑腿,但不让它替你思考。
当Agent给出了所有答案,你最该做的,不是接受,是质疑。