夜雨聆风学习资料网

ARTICLE · 1095217

AI 晨报|模型当天进Copilot,AMD82亿买李飞飞公司

AI 晨报|模型当天进Copilot,AMD82亿买李飞飞公司

9 月 28 日这一天,几条大消息分别落在不同的层上。Anthropic 发布 Claude Sonnet 5.5,价格一分没动,但同一件任务少花约三成、快三成;GitHub 在同一天宣布它进入 Copilot 全线产品;NVIDIA 发布开放智能体安全平台,把对智能体的约束从软件沙箱下沉到 BlueField-4 这块独立芯片上;AMD 宣布以约 82 亿美元的全股票交易收购李飞飞创办的 World Labs。四件事指向同一个判断:竞争正在从模型本身往外移——接入有多快、边界由谁来执行、未来到底跑什么样的负载,正在成为新的分水岭。已经在业务里跑 agent 的人,评估对象也要跟着换,不只看模型行不行,还要看它跑在哪一层、被谁盯着、以及多久会被换掉。

数字|今天的几个硬数字

70.6%

Sonnet 5.5 在终端类智能体编码评测上的得分

82 亿美元

AMD 收购 World Labs 的全股票交易金额

116 亿美元

Anthropic 与 Akamai 的七年云合约,买的是 CPU

11

Lenfest 派驻全职 AI 工程师的新闻机构数量

15 小时

费城问询报记者每周找线索的时间,被改成每日摘要

第一部分|今日 AI 观察:模型当天进Copilot,AMD82亿买李飞飞公司

Sonnet 5.5 发布当天进入 Copilot,模型越来越像零日更新

Anthropic 9 月 28 日发布 Claude Sonnet 5.5,定价与上一代完全一致:每百万输入 token 2 美元、输出 10 美元、缓存读取 2 角。它省的是另一个维度——官方称完成同类任务需要的 token 更少,典型任务总成本可降约三成,输出速度快三成以上。[1] 数字上的跳跃不小:终端类智能体编码评测从上一代的 10.3% 升到 70.6%,知识工作类评测与上周发布的 Opus 5.5 只差两点。早期使用者的账更实在:Base44 在 118 次真实应用构建里,平均迭代次数从 Opus 5 的 7.7 次降到 3.6 次;Zendesk 说工单处理快了两成;Slack 在离线评测里输出 token 少了约 14%,且没有改提示词。[2]

同一天,GitHub 宣布 Sonnet 5.5 在 Copilot 正式可用,覆盖 VS Code、Visual Studio、Copilot CLI、编码智能体、Copilot 应用、github.com、移动端、JetBrains、Xcode 与 Eclipse,面向 Pro 到企业各档订阅。GitHub 给出的早期观察与 Anthropic 的说法一致:编码任务上的表现与 Sonnet 5 持平,但步骤、token 和工具调用都更少,完成得更快;企业管理员可以在模型策略里直接开关它。[3]

这个时间差是本期最该记住的一点。过去模型发布之后,开发者要等 SDK、插件和第三方产品陆续跟进;现在前沿模型越来越像数据库版本或浏览器内核,发布当天就落到成熟的工作环境里。模型选择的有效期因此被压缩到几周,真正稳定的反而是外面的工作流、工具、测试和数据。如果一套应用把自己的核心资产绑在某个特定模型上,它现在要面对的重写压力比两年前大得多。

同一份发布里还有一层容易被忽略的东西。因为网络安全能力上来了,Sonnet 5.5 是这一档里第一次配上与更贵型号同等级防护的模型:高风险的网络安全任务会退回上一代,防蒸馏的分类器也是这一档头一次配备;在一套约 1850 个场景的行为审计里,它试图探察自身运行边界的倾向比同系列其他型号都更弱。[1] 换更强的模型从来不只是能力升级,它会连带改变风险画像和审批口径。

AMD 花 82 亿美元买的不是聊天模型,是空间智能

AMD 9 月 28 日宣布已签署最终协议,以全股票方式收购李飞飞创办并担任 CEO 的 World Labs,交易金额约 82 亿美元,预计 2026 年底前完成,仍需完成审批。交易完成后,World Labs 团队继续做模型研究,李飞飞出任 AMD 执行副总裁兼首席科学家,向 AMD 董事长兼 CEO 苏姿丰汇报。[4][5]

值得看的是买的东西是什么。World Labs 做的不是另一家聊天模型公司,而是空间智能模型:从文字、图片、视频和三维输入生成、重建并模拟可以走进去探索的三维环境,同时做机器人学习与仿真相关的技术。它的产品线里,Marble 可以把一段提示、一张照片或一段视频变成可编辑的三维环境;今年 9 月 1 日发布的 Atlas 则能从少量照片重建可导航的三维场景,目标是服务于机器人训练。[6]

对芯片公司来说,这笔交易的含义是竞争向前移了一步。今天加速器的主要负载来自语言、图像和视频;如果机器人、空间计算和世界模型成为下一批大负载,它们的计算模式、内存访问、实时渲染与推理需求都可能与今天不同。把一家前沿模型实验室放到内部,等于让模型研究更早地参与下一代系统的定义,而不是等模型出现之后再提供硬件。AMD 今年早些时候已经参与过 World Labs 的 10 亿美元融资,七个月后从投资方变成所有者,这个变化值得留意。[6]

NVIDIA 把边界从软件沙箱下沉到独立芯片

同一天,NVIDIA 发布开放智能体安全平台,形状是两层:OpenShell 是开源的运行时,把操作者设定的权限——能碰哪些文件、网络、工具、进程与凭据——变成可验证的策略,并且在 agent 进程之外执行,agent 自己绕不过去;Sentry 跑在 BlueField-4 数据处理单元上,属于独立于宿主的带外信任域,持续观察请求与响应,一旦越出软件边界就在毫秒级把它隔离掉。[7][8]

流程|策略与监测都放在 agent 之外

1agent 发起一次请求

读文件、调工具或访问外部服务

2OpenShell 在进程外核对策略

允许的文件、网络、工具与凭据逐项比对

3Sentry 在独立芯片上带外观察

信任域与宿主隔离,agent 接触不到

4越出边界即在毫秒内隔离

策略在芯片里执行,不依赖宿主可信

5全程留痕并核对身份

每次工具与数据访问都能回溯到具体 agent

开发者博客把原则说得很直白:在被监视的对象之外观察,对象不需要知道自己被看着;而通往模型的那条路是必经之路,控制了这条路,就同时拿到了观察点和急停开关。[8] 这个思路与"再写一段更严格的安全提示词"是两回事。浏览器之所以敢运行来自各地的网页代码,是因为标签页被隔离,而不是因为网页承诺不作恶;NVIDIA 想把同样的结构复制到 agent 上——模型可以继续保有很强的探索能力,但真正的边界由它触碰不到的另一层执行。Anthropic 给出的配套形状与此一致:Claude Managed Agents 把 agent 的循环跑在与沙盒不同的服务器上,让决策与执行分开。[7]

需求侧的数字说明了这类产品为什么会在这个时点出现。一份 CISO 调研显示,只有 47% 的安全负责人有把握清点出自己环境里的每一个 AI agent,而这些有把握的人里仍有约八成担心过度授权没有被复核;另有调研称 70% 的组织承认 AI 工作流已在接触敏感数据但没有完整监督,67% 的 IT 部门无法完全追踪员工自建的自动化流程;一家 SaaS 安全公司给出的数字是五分之四的 agent 在没有任何 IT 监管的情况下运行。[9] 同一周,安全研究人员还披露了一个僵尸网络:它攻破暴露在公网、未做认证的容器守护进程,装上一个开源智能体框架并改写其人格文件,让它按外界指令行事并收集凭据,每五分钟扫描一次邻近网络继续扩散。[9] 当 agent 框架本身变成可植入的运行时,"你的 agent 在谁的机器上、以谁的身份在跑"就从运维问题升级成了安全问题。

钱也在往外移:116 亿美元的合约买的是 CPU

Akamai 在 9 月 24 日宣布与 Anthropic 签下七年、116 亿美元的合约,可选择追加到约 200 亿美元,是它历史上金额最高的一单,也是五月那笔 18 亿美元合约的六倍多。关键在买的是什么:不是训练用的加速器,而是 CPU 算力。[10][11]

对照

训练与推理 / 智能体执行

训练与推理

买的是加速器与显存

智能体执行

买的是 CPU 与通用算力

训练与推理

几个月训一次,集中消耗

智能体执行

一个任务几百步,持续消耗

训练与推理

瓶颈在算力集群与互联

智能体执行

瓶颈在沙盒启停、工具调用与调度延迟

训练与推理

看峰值性能与榜单

智能体执行

看每一步的成本、命中率与等待时间

训练与推理

合约围绕芯片供应

智能体执行

合约围绕可用性与就近响应

区分这两层很实际。模型思考在加速器上完成,但智能体真正耗时间的是另一摊事:开环境、读文件、跑代码、等接口返回、把结果整理成下一步输入。一个任务常常包含几百个这样的动作,它们跑在通用算力上。Akamai 自己的说法是,多跳调用里每一跳多 50 毫秒,串起来就会变成用户能感知的几秒,所以把节点铺到 135 个国家、靠近用户,比堆更大的集群有效。[11] 合约还附带一份认股权证,Anthropic 可按 111.33 美元取得最多约 5% 的股份,花得越多解锁越多;Akamai 要为此投约 55 亿美元资本开支,而收入要到 2027 年下半年才开始入账。[10][11] 提前两年多下注并把股权绑进去,说明供应商也把这一段当成长期需求。

Meta 成立企业平台,以及 agent 的"自报家门"问题

Meta 9 月 28 日宣布成立企业平台业务,把 Muse 智能体、面向客户的 Business Agent、Muse API 与终端形态的 Muse Code 打包卖给企业和开发者,由刚从 MongoDB 离职的 Chirantan "CJ" Desai 负责,直接向扎克伯格汇报。[12] 价格、时间表和企业数据承诺都还没公布,所以这更像一次边界划定,而不是一次可评估的发布。值得记的是它已经具备的几项设计:Muse 跑在独立的云上电脑上,对外发起的请求要由一个叫 Sentinel 的独立进程批准,看不到保存的密码与支付方式,敏感动作先问,全程留审计记录。[12]

比产品更值得琢磨的是一个插曲。Muse 上线数周后,一家大型电商平台把它挡在了自己的商城之外,理由是没有告知、浏览时不表明身份、并且看起来会抓取和保存用户的凭据。[12] 无论指控是否成立,它提示了每个准备把 agent 派到外部系统的人:agent 要不要自报家门、凭什么被允许进入别人的系统、出了事算谁的,这三件事目前没有通行答案。如果你的 agent 要去访问供应商门户、招投标平台或第三方数据服务,同样的问题会在你身上重演。

研究:让 agent 替你去做事之前,先测它懂不懂你

Anthropic 经济学团队 9 月 24 日发表了 Project Swap。他们让 201 名员工各带一本书,与一个智能体聊五分钟自己的阅读口味,然后由智能体去数字交易场与别人的智能体讨价还价换书。设计上最妙的一点是:参与者另外亲手给 10 本书排了序,这份真值排序智能体从头到尾没见过,只用于事后打分。结果是智能体排出的顺序与本人一致的比例为 61%,高于随机的 50%、按热门排的 53% 和协同过滤的 55%,但也仅此而已;市场上最终成交的结果是 0.55 分,而如果按参与者的真实排序去分配,理论上限是 0.89。团队自己算的账是,这个差距里 85% 来自对偏好的估计不准,只有 15% 来自交易没谈好。[13]

第二个结果可能更反直觉。他们把整个市场重跑了 205 次,换模型、换指令:把底层模型从最小档换到旗舰档,效率分从 0.75 升到 0.88;而把"冷酷地为自己争取"换成"也照顾别人",分数只动 0.02。[13] 在让 agent 替你做事这件事上,换一个能力更强的模型,比反复雕琢那句提示词有用得多。还有一个细节:人在开场那五分钟里说得越多,后面被代表得越好——打到 300 字的人比 150 字的人好约 4 个百分点,而典型参与者只打了 216 字。[13]

生产环境的数字:少建几个,建对结构

瑞安航空把客服智能体跑在托管平台上,日处理 12 万次对话、覆盖七种语言,八成的会话不需要转人工,每百万旅客对应的客服人员减少了七成。方法上有两处更值得看:他们没有凭榜单选模型,而是拿 1.2 万条真实生产问题去比五个基础模型,最终选中的模型把响应从 18 秒压到 2.9 秒、准确率提升约 25%;2026 年 2 月,他们把 12 个按领域拆分的 agent 合并成了一个,每条回答送到客户之前还要过一道多模型、多维度的评分闸门。[14](该案例页未标注发布日期,数字为企业与云厂商自述。)

Live Nation 走的是另一个方向上的同一个答案:没有为每个场馆各做一个机器人,而是只做一个 agent,用一层数据服务按交互取出对应场馆的信息,答不上来的直接转进团队日常用的协作工具由人接手;试点音乐节上,这个助手 12 天处理了 3.7 万次互动、1.7 万次会话,85% 的观众在三轮对话内得到答案,从构想到上线不到 30 天。[15] 两家公司的共同点不在用了什么模型,而在于把"多建几个"换成了"建对结构"。

国内简讯

本周云栖大会上,阿里云把千问 AI 平台的升级重点放在"让 agent 进生产":模型服务之外新增 agent 服务与行业方案,推出 API 优速模式、Agent Studio 与座舱方案;工程侧给出的数字是模型启动时间从 1200 秒降到 70 秒,一分钟可启动上万个服务节点,首响应延迟降低 38%,调用成本最高可省 95%,加速模式把吞吐提升 1.5 到 2 倍。[16] 有券商研报把这次大会概括为芯片、云、模型、agent、应用五层的集中展示,提到新一代旗舰模型已启动训练、自研芯片性能为前代三倍并将在 2027 年一季度量产。[17] 这些都属于厂商自述与机构转述,尚无独立验证。

第二部分|每日一个创意 AI 应用深度解析:OpenAI 与 Lenfest 给 11 家新闻机构的不是一套 AI 平台,而是 11 名驻场工程师

先说那个最常见的失败:买了平台,生产方式没变

一家地方媒体决定"全面使用 AI",最容易发生的事通常是这样:管理层买一套企业版账号,组织几场培训,员工开始用它写标题、总结材料、翻译稿件。半年后使用率可能不低,但真正改变采编生产方式的东西几乎没有。

原因不复杂。地方媒体真正麻烦的工作都非常具体:记者每周要花大量时间翻各类公开信息源找线索;几十年的历史报道虽然已经数字化,却因为检索太差几乎用不上;大量公共会议需要人盯;西班牙语报道要在时效和翻译质量之间取舍;广告、订阅和捐赠团队各自握着完全不同的数据。这些事不可能靠一份通用的"媒体行业提示词模板"解决。

Lenfest 的选择:把工程能力先送到问题发生的地方

Lenfest Institute 与 OpenAI 在 9 月 28 日宣布扩大已经运行两年的 AI Collaborative and Fellowship 项目:OpenAI 新增 500 万美元承诺,并提供最高 500 万美元的软件额度与工程支持,支持力度比前两年翻倍。这个项目从 2024 年启动,做的是一件很反常规的事——没有先造一个"新闻行业 AI 平台",而是把全职 AI 工程师直接放进 11 家美国新闻机构。[18]

这些 Fellow 是本地雇佣的,进入机构后与记者、编辑、产品、收入团队和管理层一起工作,先弄清这家媒体怎样采编、怎样赚钱、哪些事记者愿意让机器参与、哪些绝对不能碰,然后才开始写工具。项目方在两年总结里把最主要的经验写得相当直白:负责任的 AI 采用,与其说是技术问题,不如说是信任问题——Fellow 是从内部推动文化变化的,靠的是清楚的边界、政策标准和开放沟通。[18] 一个附带信号是,多家参与机构准备把 Fellow 直接转为正式员工。

一个 Fellow 不是去推广 AI,而是去找最该被消掉的摩擦

费城《Philadelphia Inquirer》的两个项目最能说明区别。一个叫 Dewey,让记者用自然语言检索该报自 1978 年以来的全部报道。机构本来就有这些内容,问题出在旧检索工具没法让记者在工作节奏里真正用上它。这个工具原本预计要做 24 个月,结果在一次合作方的黑客松上两周就跑出了可用代码。[19][20]

另一个叫 Scrape。记者原先每周大约要花 15 小时浏览所在地区的各类信息源,寻找可能发展成报道的线索。工程师没有让模型"自动写新闻",而是把这段最耗时的前置搜集做成监测系统,再整理成每天的线索摘要。[18]

这个选择值得琢磨。如果目标只是展示 AI 能力,最容易做的是自动写一篇报道;但如果目标是改善记者的工作,合适的入口反而是那不起眼的 15 小时——机械浏览、筛选、去重、整理。AI 没有占据采访、判断和写作这些核心位置,却扩大了记者每天能看见的世界。

其他机构走的是完全不同的入口:Chicago Public Media 把 AI 用于时效性强的西班牙语内容生产,也用来转写封存数十年的广播录音;Seattle Times 做市议会视频的转录与分析;ProPublica 用本地部署的模型处理敏感爆料,并做了一个支持调查报道的内部搜索;Baltimore Banner 则做了一套判断州与地方数据有没有新闻价值的系统。[21] 同一批技术进入不同组织,高价值的入口完全不同——一家缺检索,一家缺翻译,一家真正浪费人力的是公共会议监测,还有一家的痛点根本不在新闻部而在订阅收入。总部先设计十个 agent 再让各单位认领,很容易得到十个看起来先进但并不痛的工具。

真正聪明的是第二步:本地发现问题,行业共同复用答案

如果故事到这里为止,这只是比较昂贵的驻场开发。Lenfest 下一阶段的设计才有意思:除了继续往新闻机构里放工程师,还要把前两年跑得通的项目做成共享工具、框架、插件、实施指南和操作手册,让一家机构验证过的办法能被数百家地方媒体复用。[18]

步骤|先在本地长出来,再被继承

1工程师驻场

本地雇佣,先学会这家机构怎样运转

2找最耗人的摩擦

不做展示型项目,先消掉重复性劳动

3做出能每天用的小工具

标准是有没有人主动用

4跨机构复用

分享代码、互相改写、比较实施路径

5沉淀成公共能力

剥掉机构特有字段,做成可复用的工具与指南

这个双层结构与很多大型组织的做法正好相反。常见路径是总部先标准化一个系统,再要求所有下属单位把业务塞进去;结果要么是标准化失败,要么是基层重新用表格绕开系统。Lenfest 的筛选标准也更现实:不看演示漂不漂亮,看这家机构愿不愿意继续用、工程师离开以后项目还值不值得留下。试点期间已经出现了自发的横向流动——Fellow 之间分享代码、改写彼此的想法、比较实施策略,Baltimore Banner 就借鉴了费城团队的成果。[18][21]

可以搬走的是知识形成机制,不是"派几个 AI 程序员"

迁移到大型组织,最容易产生的误解是照抄一个"AI 驻场工程师计划"。真正值得复制的是它背后的知识形成机制。每个大型组织都有大量优秀的业务人员,他们清楚问题在哪里,却说不清怎样把问题变成软件;中心技术团队会开发,却不可能真正理解几十个专业每天发生的细小摩擦。这两类能力如果只靠需求表连接,信息会损失得非常厉害。Fellow 扮演的是第三种角色:既能坐在业务旁边看懂问题,又有能力马上做一个能跑的小工具去验证自己的理解。

在一个大型工程企业里,真正值得 AI 处理的问题,往往不是总部最容易想到的"合同自动审查",而是现场的三个人每天从不同系统里反复找同一组履约数据;是某类分包变更每次都要翻五种材料才能判断状态;是项目经理每周要靠聊天记录、表格和邮件重新拼一次进度事实。这些问题在总部制度文件里通常根本不存在,但一个真正进现场待上几周的人很快就会看到。

顺序因此很关键:不是先建集团级 AI 平台再找用途,而是先让很多真实问题产生小规模解法,再让平台去吸收已经被证明有价值的东西。某一个小工具如果在一家单位长期有人主动使用、换了人仍然有价值,它才有资格进入第二阶段——把项目特有的数据字段、人员名称和流程习惯剥掉,留下真正可复用的业务结构,再推广给其他单位。

顺着这条路再往前推一步,组织未来可能不止有制度库和应用系统,还会多出一类资产:经过真实工作验证的小型 AI 能力。它们可能很不起眼——一个自动找异常的脚本,一个每天抓取十几个来源的监控器,一个把复杂历史资料变得真正可查的检索入口,一个把五分钟机械操作变成一次确认的小工具。单独看没有一个值得开发布会,但如果数百个这样的能力来自真实业务、能够复用、持续更新,它们最终可能比一个巨大的"企业万能 agent"更接近真正的智能原生组织。

代价与边界

Lenfest 的案例不能被过度推广。参与的地方媒体规模相对有限,很多项目还拿到 OpenAI 的资金、软件额度和工程支持;Scrape 节省约 15 小时每周是具体项目的结果,不代表所有驻场项目都有同等级收益;新闻机构与大型企业在数据权限、系统集成、责任边界和组织层级上的差异很大,文件能公开流转的媒体,未必能套到权限高度分割的工程企业。真正能直接搬的是那条路径本身:先让懂工具的人进入现场,观察哪些工作每天都在浪费人的注意力,再让被真实使用验证过的工具,慢慢长成组织的公共能力。

本期全部参考来源(1 条)与延伸链接见网站原文——点本文上方「阅读原文」直达。

相关学习资料