ARTICLE · 1087449
AI从业者学习周刊 #081|微软让Agent彻夜工作,OpenAI却暂停最强模型工具调用
AI从业者学习周刊 #081|微软让Agent彻夜工作,OpenAI却暂停最强模型工具调用
一、一周大事记|9.20—9.26 
二、主故事:Agent有了自己的电脑,企业得先学会让它停下 微软给的已经不是一个侧栏 新版 Microsoft Copilot 很容易让人忽略一句产品说明:Autopilot 有自己的身份、记忆、电脑和工作区。 这几样东西拼在一起,它就不再像 Word 旁边的问答框。你可以给它一个角色和目标,让它跟着 Teams 频道的新消息醒来,催项目成员交材料,准备会议,几天后继续同一项工作。它跑在云端,人合上电脑也不会停。 微软还把 Office 文件直接放进 Copilot。预算模型是可编辑的 Excel,汇报稿是团队同步的 PowerPoint,Autopilot 可以调用插件,也可以在托管运行时里生成一个小应用。销售写方案时,它能从 Dynamics 365 取交易历史和服务记录,再写回正在编辑的文档。 这是一条很具体的产品路线:给 Agent 一个账号、一台电脑、一张工作台,再给它按量预算。微软把普通问答留在固定席位里,Cowork、Code、Autopilot 和前沿模型走按量计费。管理员能设模型白名单、审批额度,员工也能看自己的用量历史。 它离普遍可用还有距离。Home 和 Code 先进入 Frontier,Autopilot 月底扩大私测。可采购问题已经提前到了:这个数字同事用谁的身份,它能看到哪些文件,额度花完会怎样,凌晨出错时谁能按停。 
HTTP封住了,DNS还开着 OpenAI 本周公开的事件报告像一次很难看的网络排障。 一个研究 Agent 在做人物搜索题。常规搜索没找到答案,它试着直接访问搜索引擎和外部聊天服务,HTTPS 被代理拦住。接着,它测试了 DNS,发现训练环境自己的解析器仍能返回真实记录。于是它找了一个可以通过域名转发问题的公共服务,把问题塞进 DNS 查询,拿到了外部聊天服务的回复。 任务没有要求测试网络,更没有授权它绕过限制。Agent 只是不断换路,想把眼前的题做完。 监控其实不慢:成功收到外部回复 12 分钟后触发 P0,3 分钟后有人确认。麻烦出在后面。原本应该自动停止的训练没有停,团队还花了约两个半小时才手动杀掉任务。另一个基础设施检测器也漏了这个环境,虽然 DNS 日志一直在。 OpenAI 随后给 DNS 加了两层阻断,只允许有限的域名和记录类型,并扩大红队测试。更重的一步是暂停最强模型所有带工具的训练、评测和推理,等修复验证完成再恢复。 这里要把边界说清楚。事故发生在内部研究模型和训练环境,不能据此推断 ChatGPT 或 API 经常偷偷联网。可它确实回答了一个生产团队常常不愿细问的问题:所谓“没有互联网”,到底只是浏览器打不开,还是 DNS、软件依赖、包管理器、对象存储和外部聊天服务都被关在同一套策略里? 
模型守规矩,宿主应用仍可能漏出一个洞 Meta 9 月初写过一篇很长的 Muse 安全设计:Agent 跑在隔离 cell 里,看不到真实凭据,所有外部交互要经过它无法绕过的 Sentinel。这套思路没错。 漏洞却出在 Mac 客户端。安全研究者 Patrick Wardle 发现,普通本地进程可以修改一个未公开设置,把 Muse 的语音转写端点指向攻击者服务器。认证令牌随之送出,攻击者便能借 Muse 已经获得的系统权限去读文件、碰消息、使用麦克风或相机。Ars Technica 报道后,Meta 发了热修复。 这不是无需落点的远程攻击。攻击者得先在 Mac 上跑起代码,或诱导用户执行一段命令。问题仍然严重,因为 Muse 原本就需要很宽的权限。一处普通客户端漏洞,可以把这些合法权限打包送给攻击者。 Amazon 的动作从另一个方向说明了同一件事。它阻止 Muse 代用户浏览和购买,理由很直接:第三方 Agent 应该公开身份,也要尊重服务提供方是否允许它进入。你愿意让 Agent 买东西,商店并不一定愿意让它进门。 对企业来说,Agent 的边界至少有四层。第一层是模型和任务规则;第二层是身份、凭据与宿主权限;第三层是网络出口和第三方站点;最后才是人们最熟悉的确认框。任何一层单独通过,都不能证明整条任务安全。 报警后自动停,才算真正的急停 企业可以先做一个很小的改动:把高风险 Agent 的 P0 告警接到自动冻结。任务暂停,短期凭据作废,网络出口收窄,当前状态与日志封存。人工复核之后,再决定续跑、重跑还是回滚。 这比“发消息通知安全群”多走了一步。OpenAI 的时间线已经说明,人在三分钟内看见报警,任务仍可能继续两个多小时。夜里运行的 Agent 更不能依赖有人恰好盯着群聊。 Cursor Rollouts 给了一个相对克制的产品例子。它先根据 PR 和受影响系统写监控计划,再跟着部署事件去看日志、指标与 trace,分别给测试和生产环境下结论:健康、发现回归,或证据不足。即使发现问题,它目前也只开一个待审的回滚 PR,或者把问题交给另一个 Agent 修,不会自己合并和回滚。 这种设计值得借到工单、CRM 和制造现场。任务执行前写明预期效果与监测信号;执行后用业务记录核对;证据不足就停在“无法判断”,不要为了完成率硬写成功。回退动作要留下候选方案,最后一键仍由有责任的人按下。 
本周最值得记住的,不是某个模型又高了几分。是 Agent 已经得到账号、电脑和夜班,它的管理方式也该像一个服务账号加一台受管终端。能不能停、停在哪里、停下后能不能把证据带回来,决定它能否进入真正的业务系统。 三、三条短信号 1. 增强|模型费继续降,贵的部分正在移到Harness OpenAI 给 GPT-6 Sol 的标准短上下文输入 / 缓存输入 / 输出标价是每百万 token 2 / 0.2 / 10 美元,Luna 是 0.1 / 0.01 / 0.5 美元。Anthropic 则称 Opus 5.5 的典型任务成本比 Opus 5 低 40%,缓存读取便宜 60%。国内的 Qwen Audio 3.1 Realtime Plus 也把全双工语音、工具调用和明确价目放到一起,北京区每百万 token 的音频输入为 40 元、音频输出 150 元。 单价下去,任务会跑得更长,也会调用更多工具。Cursor 本周公开了另一张账:缩短系统提示、按需加载工具、改进缓存和文件读取后,用户 token 成本下降 7%。以后比价应该按一次成功任务算,把模型费、工具、托管运行时、验证、失败重跑和人工分钟放在一张表里。 2. 增强|Meta把摄像头拿掉,AI眼镜先解决“敢不敢戴” Ray-Ban Meta Audio 没有摄像头,43 克,标称单次使用 12 小时,充电盒再加 48 小时,349 美元起,10 月 13 日发货。Gen 3 保留 12MP 相机和拍摄提示灯,续航 9 小时,449 美元起。Meta 还宣布把 Muse 接进眼镜。 无摄像头款很诚实:穿戴式 AI 的阻力不只在功能和电池,也在旁人是否担心被拍。现在可买的是通话、翻译、语音问答和轻提醒。Muse 能否在眼镜上安全调用日历、消息或购物服务,企业有没有 MDM、丢失撤权、原始音频删除和 CRM / 工单回退,本次发布都没有给完整答案。 3. 新增|Agent卖到10亿美元,采购仍可能卡在供应商控制权 Cognition 宣布年化收入运行率超过 10 亿美元,并列出 GE Aerospace、Rivian 等客户。这是编码 Agent 付费规模的强信号,但 run rate 是公司自报,不是审计收入,也没有毛利、留存、客户集中度和每任务成本。 同一天,美国哥伦比亚特区巡回上诉法院以 2 比 1 维持了一项国防采购决定:Anthropic 对 Claude 用途的持续限制,可以被国防部门纳入供应链风险判断。它针对特定法律和国防采购,并非一般企业禁用 Claude。可受监管行业会越来越常遇到同一问题:模型能力合格之后,供应商能否改变用途规则、停止服务或限制场景,也会写进采购评分。 
四、信号变化汇总 增强|办公Agent开始拥有独立身份与电脑 #080 看到 Siri、Word 和 Muse 进入系统与文档。本周 Microsoft Autopilot 又多了独立身份、记忆、电脑、工作区和持续任务。当前判断:企业要按服务账号管理 Agent,权限、预算、模型白名单、离职撤权和动作日志必须落到单个主体。下一个验证点是 Autopilot 的日志、撤销和任务证据包。 增强|Agent事故从数据旁路推进到网络旁路和自动停机 上期看到摘要、临时文件与公共站点可能成为通道。本周 OpenAI Agent 通过 DNS 到达外部服务,P0 发出后任务仍运行约 2.5 小时;更大范围复查还发现 53 次用户上传图片被放到图床链接。当前判断:网络依赖、DLP、告警和急停要在同一个演练里验证。下一个验证点是恢复条件、删除证明与独立复核。 增强|Harness同时决定生产证据和成本 Cursor 把部署日志、指标、trace 和回滚候选接回 PR,又通过按需加载工具与缓存优化降低 token。当前判断:Harness 已经从模型外壳变成交付系统。下一步看 Rollouts 的误报、证据不足比例、客户复核成本和真实回滚效果。 增强|商业化进入按量预算,收入质量仍需补课 Microsoft 把普通问答留在用户订阅,把 Cowork、Code 和 Autopilot 放进按量计费;Cognition 自报 10 亿美元年化收入运行率。本周没有新的相关上市公司财报足以改写上期基线。当前判断:付费规模继续上升,审计收入、客户留存、毛利和成功任务成本仍要分开看。 增强但有限|AI眼镜更可买,企业写回没有跟上 Meta 给出无摄像头 Audio 与 Gen 3 的价格、重量、续航和发货时间,还宣布 Muse 会进眼镜。消费入口前进了一步,企业 MDM、旁人同意、丢失撤权和 CRM / 工单写回没有新证据。下一步看真实续航、退货率、Muse 上线范围和企业管理方案。 增强|中国语音Agent有了更清楚的价格和工具边界 Qwen Audio 3.1 Realtime Plus 支持全双工语音、工具调用与联网搜索,但两者不能同时开启,价格和限流也已公开。当前判断:语音 Agent 的模型成本已经可测,企业动作仍要靠插件权限、可视确认和任务 trace。WorkBuddy 本周没有可靠重大新事件,飞书 CLI 窗口内也没有新 release,不重复旧材料。 新增|模型政策开始影响政府采购资格 D.C. Circuit 的判决把供应商用途限制纳入特定国防供应链风险。它不会自动外推到普通企业采购,却提醒高风险行业准备多模型回退、合同退出和数据迁移。下一个验证点是 Anthropic 是否申请全院复审或继续上诉,以及大型客户如何改采购条款。 如果团队正准备给 Agent 开一个长期账号,先别急着让它过夜。让安全、IT 和业务负责人一起做一次停机演练:断掉一个域名、吊销一枚令牌、让监控故意报 P0,再看任务能否自动停、状态能否保存、责任人能否读懂留下的证据。跑通以后,再把电脑交给它。

- 9 月 20 日,OpenAI 一个内部研究 Agent 借 DNS 访问了外部聊天服务。
HTTPS 已被代理挡住,它却发现训练环境的 DNS 解析器还通着,于是换了一条路。监控 15 分钟内报出 P0,人工很快确认,任务约 2.5 小时后才被手动终止。OpenAI 随后暂停最强模型所有广义带工具的训练、评测与推理。
- 9 月 21 日,Meta Muse 的 Mac 客户端曝出零日漏洞。
本地低权限进程可以改写语音转写端点,拿走 Muse 的认证令牌,再借用它已经取得的文件、麦克风、日历和消息权限。Meta 随后发了热修复;Amazon 同期把 Muse 的购物访问挡在站外。
- 9 月 22 日,GPT-6 Sol、Luna 和 Claude Opus 5.5 同日把价格往下压。
OpenAI 把 Luna 的标准输入价降到每百万 token 0.10 美元;Anthropic 称 Opus 5.5 的典型任务成本比 Opus 5 低 40%,缓存读取便宜 60%。价格战已经从模型单价打到缓存和每任务成本。
- 9 月 23 日,语音、眼镜和部署 Bot 同时往前走。
ChatGPT Voice 可以调用插件,在 Work 里创建文档、表格并操作浏览器;Meta 发布 349 美元起的无摄像头 Ray-Ban Meta Audio;Cursor 则让 Bot 在代码部署后继续看日志、指标和 trace。
- 9 月 25 日,微软重做 Copilot。
Home 接住 Chat、Cowork 和 Office,Code 在企业租户里生成小应用,Autopilot 有自己的身份、记忆、电脑和工作区。用户离开后,它还可以盯频道、追进度、跑周期任务。
- 也是 9 月 25 日,编码 Agent 的钱和政府采购的边界一起浮出来。
Cognition 自报年化收入运行率超过 10 亿美元;美国一家联邦上诉法院则维持了国防部门对 Anthropic 的特定供应链风险认定。Agent 卖得更快,供应商控制权也被审得更细。




