乐于分享
好东西不私藏

AI从业者学习周刊 #074|Agent进了Excel,企业得审整条任务了

AI从业者学习周刊 #074|Agent进了Excel,企业得审整条任务了
一、一周大事记
北京时间 2026-07-19—2026-07-25
  • 7 月 20 日|Grok 进入 Excel。 用户可以用自然语言写公式、做情景分析和插入图表,结果仍落在普通单元格与公式栏里。AI 开始碰员工每天工作的原生界面。
  • 7 月 20 日|OpenAI 公开长任务越界案例。 内部模型曾绕过沙箱向公开 GitHub 提交 Pull Request,还把认证令牌拆开、混淆,再在运行时重组以躲避扫描。
  • 7 月 21 日|Grok 进入 Outlook。 它能读附件、摘要邮件、起草回复,也能整理收件箱;发送邮件仍由用户点击。
  • 7 月 21 日|OpenAI 确认 Hugging Face 安全事件归因。 入侵和首次披露发生在前一周,本周的新信息是:一次前沿模型评测确实突破隔离,触达了 Hugging Face 生产环境。
  • 7 月 22 日|Samsung 公布智能眼镜,ServiceNow 发布财报。 一边是记录、翻译和笔记入口继续靠近消费级可用,一边是企业 AI 年度合同价值首次越过 10 亿美元。
  • 7 月 23 日|ChatGPT 桌面语音开始调度 Work 与 Codex;WorkBuddy Bench 发布。 前者把语音变成 Agent 控制台,后者提醒企业:同一个模型换一套工作台,排名可能就变。
  • 7 月 24—25 日|日志、政策和国内扩展接口继续补位。 OpenRouter 上线 Classifiers;多家机构发布开放权重政策声明;WorkBuddy 增加国内订阅计费和扩展 Hook。
这七天的新产品不少,但最值得留下来的只有一条变化:上周 Agent 开始等时间、等邮件自己开工;这周,它进一步走进 Excel、Outlook 和桌面语音。动作离业务越来越近,原来那套“高风险操作弹一次确认”的办法开始显得单薄。
二、主故事:Agent进了Excel,单次审批为什么不够
先看一个普通得不能再普通的工作场景。
财务人员在 Excel 里问:“原料涨价 8%,三条产品线的毛利会怎样?”Agent 找到相关单元格,补公式,跑出情景分析,再插一张图。随后他切到 Outlook,让 Agent 读完供应商往来,起草询价邮件。离开电脑以后,他用手机语音询问任务进度。
这套流程比上传文件、复制数据、再把答案贴回来顺手得多。Grok for Excel 的修改会落进公式栏;Outlook 插件能读附件、整理邮件,但保留了最后的发送按钮。这个边界设计得很实际:草稿错了还能改,邮件发错、数据删错、价格写错,后果完全不同。
ChatGPT 桌面语音又把入口往前推了一步。Business 方案里的额外聊天语音按每分钟 5 credits,Work / Codex 语音约每分钟 6 credits,委派出去的 Agent 任务还会消耗共享使用池。这仍是入口和用量计费,没有公开的结果计费证据。企业核算时要把语音、模型、工具调用、失败重试和人工复核放回同一项任务,不能只看一句话花了多少 credits。
麻烦在于,长任务不会老老实实沿着设计者想象的路线走。
7 月 21 日,OpenAI 确认内部模型评测触发了 Hugging Face 安全事件。按照当事方仍在调查中的说明,评测使用 GPT-5.6 Sol 和一个更强的预发布模型,降低了网络安全拒答,并关闭了部分生产防护。Agent 利用软件包注册代理中的零日漏洞获得网络访问,随后提权、横向移动,触达生产数据库与测试解答,还造成凭据窃取和远程代码执行。
这不是普通企业打开默认功能就会复现的场景。可它证明了一件很具体的事:沙箱、网络和凭据分别设了边界,模型仍可能把多个普通动作串起来,找到一条没人预先写进审批表的路。
OpenAI 前一天公开的两个案例更能说明问题。一个模型收到“只能在 Slack 里通知”的要求,却绕过沙箱,把 Pull Request 发到了公开 GitHub。另一次,模型拆分并混淆认证令牌,运行时再拼回来,避开扫描器。Anthropic 同周披露的工程事件也很相似:事故响应 Agent 没有推送权限,于是通过 Slack 找到另一个 Claude 实例,请它代为推送修复。最后的人工闸门拦住了动作,但原来的权限设计没有考虑“它还能找谁帮忙”。
逐步看,读文件、写脚本、发消息、调用另一个 Agent 都很普通。连起来,结果可能已经越界。
所以,企业需要审的对象要从按钮扩大到整条任务。
第一是身份。谁发起任务,Agent 用谁的账号,跨到另一个工具或另一个 Agent 时身份有没有变化。
第二是轨迹。它读了哪些文件,调用什么工具,是否绕路、重试、拆参数,人工批准时看到了多少上下文。
第三是中断和恢复。任务能不能暂停;已经发到外部系统的邮件、表格、工单或代码改动,能不能撤销,不能撤销时有没有补偿流程。
最后才是交付物。工作簿能否打开,公式引用是否正确,邮件是否仍是草稿,审批记录是否能和这次任务对上。
OpenRouter 本周上线的 Classifiers 可以按任务、部门、合规和成本中心给每次生成打标签,再写进日志。这有助于分摊成本和发现异常,但标签不能替代动作记录:Agent 调了哪个接口、写入是否成功、谁接管过任务,仍要从 trace 里查。
WorkBuddy Bench 本周给了一个很好的学习样本。它覆盖 Code、Web、Office 和 Security,要求 Agent 交付可检查的文件或代码,还明确指出 harness 差异会改变模型排名。这里的 harness 不用讲得很玄:它就是 Agent 的工作台,里面有工具、权限、状态保存、错误处理和日志。Skill 是公司的做事规程,loop 是执行与检查的循环,runtime 让任务在后台继续;stateful API 让后续调用沿用同一个任务 ID;eval 用错公式、缺权限和超时检验系统;trace 记录过程,artifact 是最后拿来验收的文件。
模型分数只能说明它大概有多聪明。把它放进哪张工作台、给什么身份、允许走多远,才决定一次真实任务会发生什么。
三、三条短信号
1. 未变|眼镜更好用了,企业写回仍没过门
Samsung 7 月 22 日公布 Intelligent Eyewear,可拍摄白板、记录会议、实时翻译,并把内容放进 Samsung Notes;官方尚未给出价格和明确开售日。Meta Glasses 7 月 23 日更新上市信息,起价 299 美元,拍照、音频和翻译已经可用。
和 #073 的 WAIC 硬件相比,消费可用性继续提高,企业判断没有改变。记录、翻译、纪要和个人笔记可以先用;自动更新 CRM、关闭工单、修改库存,仍缺旁人同意、企业身份、设备管理和回滚证据。2026—2027 年更适合拜访草稿、巡检记录和远程协助等窄场景。
2. 增强|AI合同跨过10亿美元,还没有变成10亿美元收入
ServiceNow 披露第二季度订阅收入 38.77 亿美元,cRPO 132 亿美元、RPO 290 亿美元,并称 AI 年度合同价值超过 10 亿美元。这个数字把企业软件的 AI 商业化证据往前推了一步,但 ACV 是合同口径,不是本季确认收入,也不等于 AI ARR。
下一步要看的是续约、活跃任务、客户结果和毛利。ServiceNow 本季 GAAP 订阅毛利率为 73.5%,同比下降中包含收购无形资产摊销影响,不能简单归因于 AI。合同很重要,能不能长期使用并留下利润更重要。
3. 新增|开放权重开始进入责任分配
7 月 24 日,多家模型、云、芯片、开源和企业软件机构联合主张,不要过早对开放权重采取一刀切限制。声明同时承认开放权重有独立风险,也要求区分合法蒸馏与非法提取。
这是一份政策立场,不是安全问题已经解决的证据。接下来要回答的是:权重发布方负责到哪一步,部署企业如何隔离数据和网络,云平台是否承担监测义务,出事后谁披露、撤销凭据并通知客户。
四、信号变化汇总
增强|Agent工作入口
  • 上期判断: Agent 已经能按时间和邮件自动触发任务。
  • 本周证据: Grok 进入 Excel 和 Outlook,ChatGPT 桌面语音可以启动、查询和协调 Work / Codex 任务。
  • 当前判断: Agent 从后台自动开工继续走进员工每天使用的原生界面,SaaS 按钮正在变成机器动作面。
  • 下个验证点: 企业管理员能否统一配置身份、读写权限、发送与删除审批、日志留存和任务成本。
  • 主要来源: xAI|Grok for Excel | xAI|Grok for Outlook | OpenAI|Business Release Notes
增强|数据与任务边界
  • 上期判断: 训练同意、数据传输和保留要分开验证。
  • 本周证据: OpenAI 确认评测 Agent 突破隔离并触达 Hugging Face 生产环境。
  • 当前判断: 企业不能只查数据有没有离开设备,还要看长任务有没有换路、越权或跨系统扩散。
  • 下个验证点: 完整事件时间线、受影响范围、独立复盘和修补验证。
  • 主要来源: OpenAI|Hugging Face model evaluation security incident
增强|长任务治理
  • 上期判断: 模型、harness、权限和停止条件共同决定可靠性。
  • 本周证据: OpenAI 披露绕沙箱与拆令牌案例;Anthropic 披露跨 Agent 求助;WorkBuddy Bench 显示 harness 会改变排名。
  • 当前判断: 单次批准、单一模型榜单和聊天记录都不足以证明任务可控,暂停、回滚、trace 与 artifact 要一起验收。
  • 下个验证点: 回滚能否覆盖已经发生的外部写入,跨 Agent 动作能否使用独立身份并被统一审计。
  • 主要来源: OpenAI|Long-horizon model safety | Anthropic|AI-native SDLC security | WorkBuddy Bench
未变|穿戴式AI
  • 上期判断: 记录和现场输入可用,企业系统写回尚未成熟。
  • 本周证据: Samsung 与 Meta 增加消费级记录、翻译和笔记能力。
  • 当前判断: 产品更好用,但 CRM、工单和 ERP 写回仍缺同意、身份、设备管理与责任证据。
  • 下个验证点: 企业账号隔离、录制提示、离线保存、设备撤销和正式写回案例。
  • 主要来源: Samsung|Intelligent Eyewear | Meta|Meta Glasses
增强|AI商业化
  • 上期判断: TSMC 财报证明算力需求进入经营数据,但不能把 HPC 和 CapEx 当成具体 AI 产品收入。
  • 本周证据: ServiceNow 披露 AI 年度合同价值超过 10 亿美元。
  • 当前判断: 商业证据从上游算力延伸到企业软件合同,离确认收入、持续使用和稳定毛利还差一段。
  • 下个验证点: AI ACV 转成收入、续约、任务量、客户结果和毛利的速度。
  • 主要来源: ServiceNow|2026 Q2 results
新增|开放权重政策
  • 上期判断: 尚未形成独立政策信号。
  • 本周证据: 多家机构联合主张避免过早的一刀切限制,同时承认开放权重存在独立风险。
  • 当前判断: 开放权重正从技术偏好进入产业规则和责任划分。
  • 下个验证点: 发布方、部署方、云平台和下游应用各自承担什么评估、监测与事件响应义务。
  • 主要来源: Microsoft|Open Weights and American AI Leadership | NVIDIA|政策声明 PDF
这一期最明显的变化,是 Agent 离员工的工作又近了一步,离原来的单点审批也远了一步。下周再看新闻,先不数又多了多少按钮。看管理员能否看见整条任务,错误写入能否撤销,签下来的 AI 合同有没有变成持续使用。