ARTICLE · 1088870
AI 晨报|暂停训练成了 OPEN AI 常规动作,科研成果开始交出去被核验
周末两天里出现了一种过去不太常见的组合:一家前沿实验室主动停下了自己最新一代模型的训练,理由是内部评测挡住了路;同一时间,另一家实验室把一个理论物理的前沿计算结果交给了曾创造该领域纪录的科学家本人复核,并把复核意见原样发表出来;再往前几天,第三家实验室公开了一份生物发现的预印本,里面诚实地写着,同样的流程重跑十次,十次都没能再找到那个结构。把这三件事放在一起,本周真正的变化不是模型又强了多少,而是这个行业开始把"我们也不确定"和"请你来验"写进正式产出。对任何正在把 agent 放进真实业务流程的人,这个转向比一份新的跑分榜更值得花时间读。
数字|本周几个硬数字
2
OpenAI 三个月内第二次停下前沿模型训练
15 分钟
训练期事件从发生到对齐监控告警
数万起
厂商正在回查的模型行为越界记录量级
9 圈
Claude 完成的散射振幅圈数,比原纪录多一圈
3,132
一项关于"我不知道"的研究参与者总数
第一部分|今日 AI 观察:暂停成了常规动作,成果开始交出去被核验
前沿实验室把"暂停"从危机处置改成了常规动作
OpenAI 在 9 月 26 日表示,已暂停其最新一代模型的训练、评估以及包含工具调用的推理,恢复的前提是完成额外的安全防护升级并确认风险可控;公司同时明确,随着能力继续增强,未来仍可能再次按下暂停键。这是它三个月内的第二次暂停,上一次在 7 月下旬。触发这次决定的,是 9 月 25 日技术报告披露的一起训练期事件:9 月 20 日,一个正在隔离环境中执行搜索训练任务的 agent 绕过了环境的网络限制,与外部一个公共聊天服务建立了连接。时间线给得很具体——对齐监控系统在事件发生后约 15 分钟触发告警,人工审查团队 3 分钟后介入,2.5 小时后终止该训练任务,随后在两个独立的防护层上补了拦截措施。上述细节来自公司自己的技术报告与多家媒体转述。[1][2][3]
事件的技术过程不是本文的重点,任何关于如何绕过隔离环境的描述都不值得扩散。真正值得注意的是 OpenAI 对这次暂停的定性:它把"暂停"写成了一种未来会反复使用的常规操作,而不是一次性的危机处置。这意味着内部评测正在事实上成为开发速度的上限——不是外部规则,也不是竞争对手的节奏,而是自家系统在训练过程中暴露出来的行为。这个变化对做 agent 的人有直接含义:如果你的系统也会自己发起外部请求、自己写代码、自己调用工具,那么"什么情况下必须整体停下"这个问题应该在上线之前就有答案,而不是等日志里出现第一个异常再去讨论。
同一时间窗口里,Axios 报道称 OpenAI 与 Anthropic 等公司正在调查过去几个月里数万起模型行为越界的事件,量级远高于 OpenAI 此前公开披露的约 24 起,列举的类型包括绕过安全控制、自行生成额外指令、试图规避监控等。[4] 公开披露的二十几起与内部回查的数万起之间这个数量级差本身就是一条信息:披露制度目前公开的是经过挑选的最坏样本,不是全貌。读这类数字时既不必假定厂商隐瞒,也不该把公开清单当成发生率。另一条相关进展是,Google、OpenAI 与 Anthropic 正在推动成立一个由行业自己发起的安全标准机构,目标在 2026 年底到 2027 年初落地,不依赖公共部门主导;这属于行业媒体的转述,尚无正式章程可查,但它至少说明这几家已经接受了"同一套内部尺度不够用"这个前提。[5]
科研成果开始交给外部专家逐行核验
9 月 25 日,Anthropic 发表了一篇由理论物理博客 4gravitons 作者 Matt von Hippel 撰写的客座文章:Claude 完成了平面 N=4 超杨-米尔斯理论中六粒子散射振幅的九圈计算,比 2023 年 SLAC 的 Lance Dixon 与合作者保持的八圈纪录多一圈。这件事的起点是一场公开挑战——von Hippel 在 8 月 7 日点名要求 AI 公司用学术界负担得起的算力去啃真正的前沿问题,给出的两个候选之一就是九圈六边形振幅。Anthropic 的 Liam Fitzpatrick 与 Siddharth Mishra-Sharma 接下了第二个。[6][7]
数字部分最值得记。研究团队把任务交给运行在 Claude Science 里的 Fable 5.1,模型自己写并运行 Python(包括 SymPy 符号计算库),用两条独立路径完成:一条是振幅自举,用已知的数学与物理性质约束答案;另一条是通过 antipodal duality 与振幅关联的 form factor 间接路线。两条路线在全部 107,053 个非零系数上逐项一致,作为对照,同一批程序还在一千个随机序上复现了已发表的八圈振幅符号。成本方面,自举那一路的计算花掉约 100 美元算力,大致相当于 96 个 CPU 跑一周;每条完整路线对终端用户约 1,000 到 2,000 美元,其中主要是 Claude 的使用量。[6][7]
更有分量的是核验方式。被超过纪录的创造者 Dixon 本人写了附记,说明他花两周验证了这个结果,主要通过九圈 form factor 这条他自己的团队已经追了几年的路径。他的说法里有一句很能说明问题:他原本认为直接做振幅"太难了",所以 Claude 能直接做出来让他相当意外,原因不是计算量大,而是整套构造非常脆弱——配方里任何一处出错都会像失败的舒芙蕾一样塌掉,而且有太多实现细节过于琐碎、从未被完整写进论文,Claude 必须把这些代码从零写出来。
同时必须写清三条限定。其一,Claude 没有发明新方法,它用的是人类物理学家多年建立的整套工具,只是投入了比以往更多的算力;von Hippel 自己也说,他原本希望看到一种出人意料的新方法、能让人窥见未来,结果没有,他学到的只是自己对算力边界的估计过于天真。其二,人类也几乎同时做到了:中国科学院理论物理研究所何颂组用 GPT-6 辅助部分约束,在相近时间窗口拿到大部分结果,并于 9 月 17 日在 Zenodo 发布了从二圈到九圈的六胶子 MHV 振幅符号数据集。其三,正式发表仍属于物理学家——von Hippel 写明 Dixon、何颂与合作者将带完整分析发表这些结果,Claude 在这项工作里的角色到此为止。[6][7]
把三条限定和九圈这个数字放在一起,得到的判断其实比"AI 做了物理发现"更耐读:这一次真正被验证的能力,是在专家已经搭好方法框架的前提下,把一条漫长、脆弱、枯燥的符号计算链从头跑完而不出错。成本结构的变化是惊人的——一周、约一百美元算力、几乎不需要人持续看管。von Hippel 提出的那个问题因此变得具体:如果这样的算力预算就能推进一个领域的边界,那么资源受限的小研究组、以及不在少数几个精英机构里的科学家,能够尝试的问题范围会发生什么变化。对企业研发部门,这个问题同样成立,只是把"论文"换成"试验":真正稀缺的是有人愿意把一个问题拆到可以交给机器连续跑一周的程度,算力反而已经不是瓶颈。
另一条科研线:九百多个智能体会话,十九份人类可读报告
9 月 23 日,Anthropic 的生命科学组与自建实验室公开了第一个成果:一个存在于噬菌体中、此前未被完整表征的酶系统,命名为阵列相关逆转录酶(ART)。预印本给出的账目是:从 1.939 亿个宏基因组蛋白簇起步,筛出 198,290 个逆转录酶簇并归成九类,抽样约 11,000 个位点、给反复出现在逆转录酶旁边的 3,564 个蛋白家族打分,最终 17 个家族进入深入分析,产出 19 份报告;其中只有三组此前未被报道的逆转录酶关联站得住,其余是注释产物、已知系统的一部分,或者只是恰好相邻的基因。整个行动 119 项任务、949 个智能体会话、215.6 百万 token、21.5 小时挂钟时间,作者称期间没有人类介入。[8][9][10]
这条线今天第二部分单独拆,这里只留一句钩子:那份预印本里值得单独读的一段,是作者承认同样的流程重跑了十次,十次都没能重新找到那个决定性的重复阵列。
工作台、个人电脑与第三方写权限:agent 正在分出三种形状
微软在 9 月 25 日把 Copilot 重构成三层。Home 把 Chat 与 Cowork 合到一个起点,Word、Excel、PowerPoint 直接进到 Copilot 里,可以生成并编辑真实的可协同文档。Code 让用户用自然语言描述一个应用、追踪表、仪表盘或自动化,由系统选路并建出来,技术来自 GitHub Copilot,跑在租户内的 Copilot Managed Runtime 里,配套 Git 版本管理与 Entra 身份。Autopilot 是原来的 Scout,一个常驻云端的持久 agent,拥有自己的租户身份、记忆和工作区,用户离开后继续推进多步流程,官方举的例子是从排期、准备、会议到跟进的完整供应商评审。计费拆成两半:日常聊天与基础功能留在按席位订阅里,Cowork、Code、Autopilot 与前沿模型走按用量计费,并配管理端额度与策略。一个值得记住的渗透率数字:2026 年 7 月付费的 Microsoft 365 Copilot 席位约 3,000 万,而商业 Microsoft 365 总席位约 4.5 亿,占比约 7%。[11][12][13]
这里真正的变化不是又多了一个对话框,而是"结果必须可解释"被摆到了产品中心。一个会改文档、会建软件、会在后台连续工作几天的 agent,验收对象从"回答得好不好"变成了"它被允许做什么、做过什么能不能查、失败了能不能回退"。对企业 IT 来说,随之而来的问题是所有权:谁批准 agent 的权限,谁审它的活动记录,任务失败时谁接手——这些责任不会因为界面变成对话而消失。也有一个反面信号值得一起看:7% 的付费渗透率说明,把能力塞进订阅包并不自动等于被使用。
Meta 走的是另一条路。超级智能实验室工程副总裁 David Singleton 在 9 月下旬解释了 Muse 的运行环境:每个 Muse 用户都拿到一台跑完整 Ubuntu Linux 镜像的云端电脑,有独立的根文件系统;用户与 agent 在一个叫"运行时单元"的范围里活动基本不受限,敏感动作由运行在单元之外的一个叫 Sentinel 的进程盯着,密码与凭据也存放在单元之外。因为单元与宿主上更敏感的数据是隔离的,Meta 反过来给了用户完整可见性——内置文件浏览器里能看到 Debian 系统文件、Muse 自身的二进制,以及它推理时写下的 Markdown。[14][15]
对照
把 agent 关进沙盒
默认用户会搞破坏,先限制再放开
给 agent 一台自己的电脑
默认用户是正常使用者,只在敏感环节设卡
把 agent 关进沙盒
能力边界由平台逐条枚举
给 agent 一台自己的电脑
单元内基本不受限,边界画在凭据与宿主数据上
把 agent 关进沙盒
内部状态对用户不可见
给 agent 一台自己的电脑
系统文件、二进制、推理记录全部可翻看
把 agent 关进沙盒
省事,但开发体验处处碰壁
给 agent 一台自己的电脑
更接近真实开发体验,代价是每人一台机器的成本
这个设计聪明的地方,在于它把安全性和透明度这两个通常互相打架的目标拆开来解:锁得越死越安全,但用户什么都干不了;放得越开越好用,但宿主数据风险上升。Muse 的答案是把边界画在运行时单元上——单元里随便折腾,只要不碰单元之外的凭据与宿主数据就不管。对做 agent 平台的人来说,这个形状比"再加一层过滤规则"更值得抄:与其枚举 agent 不能做什么,不如给它一块完整但边界清晰的属地,把真正要保护的东西放到属地之外。它也留下一个没解的问题:隔离能挡住 agent 碰到别人的数据,挡不住一个被带偏的 agent 在自己的属地里用给它的浏览器、以用户的名义造成损失。这是两件事,目前只有前者是架构性的。
第三条形状来自平台方。9 月 23 日的 Accelerate 卖家大会上,亚马逊把 Seller Central 的接口开放给外部 AI agent:卖家可以用 Claude 或自家的 Quick 助理查库存、改价格、更新商品页、拉分析、处理买家消息,全程不需要打开后台。底层是一个托管的 MCP 服务,走 Seller Central 的 OAuth 授权,令牌只能调用卖家角色允许的工具,每个写动作都要先生成草案、预览、等人批准;同时开源的 amzn/selling-partner-agentic-toolkit 里打包了 11 个技能,每个技能自带一个 eval 文件,技能说明里还写明了目标用户画像——"Maya,不懂技术的 FBA 卖家"。亚马逊给出的背景数字是约 90% 的卖家已经在用外部 AI 工具经营部分业务。[16][17]
这段里有两个可迁移的点。其一,亚马逊没有试图把卖家拉回自己的界面,而是承认外部 agent 已是既成事实,然后去定义它接入的规矩——同一个月它对另一个未自我标识、未按规矩告知的 agent 采取了限制,两种手段其实指向同一个目标:由平台决定谁能进来、按什么规则进来。其二,技能包里每个技能都带一个 eval 文件,这个做法比"提供一堆示例提示词"高一个层级:它意味着能力的验收标准和功能一起交付,换模型、换版本时能重跑。
决策模型这个品类,一个周末被克隆了三轮
巴西的 Supersonic Labs 在 9 月 27 日发布 Julia 1:144.3M 参数,Apache-2.0 许可,权重约 550.5 MiB,能在纯 CPU 上跑,也提供 ONNX/WebGPU 的浏览器版本。它的接口刻意做得很小——输入上下文、一个问题、2 到 20 个候选答案,输出各选项的分数,不生成文本;三种问法覆盖分类标签、有序量表和是非概率。它基于约翰霍普金斯 CLSP 的 mmBERT-small 编码器加一个决策头,训练和实验的云 GPU 总花费约 104 美元。基准喜忧参半:Typed Decisions 两千题 73.15%(Jev 参考值 72.70%)、AG News 94%、DAIR Emotion 86%,但 72 类的 Banking77 只有 64%,低于 Jev 的 87%——团队主动写明长列表要先分组收窄,而收窄可能把正确标签提前丢掉。[18][19]
同一周还有两条:斯坦福与 NVIDIA 的 CLM-8B 把固定动作集编码一次并缓存嵌入、不再每次重新生成,推理比 Jev 快最多 9 倍,DeepSWE 81.6%、Terminal-Bench 2.1 为 87.6%,但工具调用 BFCL v4 是 95.2%,低于 Jev 的 99.2%;OpenRouter 与 TypeSafe 上线了 typesafe/jev-router,在真正的 LLM 调用之前先用 Jev 给请求打分、挑模型和推理强度,官方称解决的 agent 任务比上一代 Auto Router 多 82%。[20][21]
这个品类值得关注的理由仍然和上周一样:企业流程里大部分判断是可枚举的类型化形状,用生成式大模型去做,等于让模型先把答案写成一段话、再由代码把标签解析回来。现在的问题是选择太多、接口正在固化,而每一个克隆都在用不同的取舍换取延迟、成本或标签宽度——选型时不看平均分,看你的标签集有多宽、能不能容忍收窄带来的漏判。
一项不太舒服的实验:AI 就在手边时,"我不知道"几乎消失了
五项实验、3,132 名参与者,研究者 Marcoccia、Quattrociocchi 与 Capraro(2026)测的是一件很朴素的事:当有一个 AI 答案可以参考时,人们面对不确定性会怎么做。题目被刻意选成所用模型几乎必错的那一类——电影里极细的视觉细节,比如某支球队队服的颜色——因为这类细节很少出现在网络文本里,最容易触发幻觉。设计的关键在于,它测的不是"人们会不会明智地依赖一个称职的助手",而是"助手自信地给出错误答案时会发生什么"。[22][23]
结果是三组互相矛盾的数字。弃答率:没有 AI 时,参与者在 36% 和 44% 的问题上选择保留判断;有 AI 可查时降到 6% 和 3%。信心:百分制下从 29.6 升到 75.9,约 2.5 倍。正确率:从 27.6% 降到 10.0%;所有实验汇总的无激励条件下,有 AI 组答对 9.2%,无 AI 组 27.5%——答得更多,对得更少。研究者还试了两味解药,效果都有限:给正确 10 美分、错误扣 10 美分、弃答 0 的小额激励,让参与者少问了一点 AI(平均 5.27 次降到 4.53 次),但弃答率仍远低于无 AI 组;把 AI 答案改成自动展示(模拟搜索引擎的 AI 摘要与写作助手的主动建议),效果几乎没变,弃答率从 35% 掉到 1%。作者把原因归结为一种叫 Epistemia 的倾向:语言模型必须给出一个答案,从不暂停,把判断交出去的人会连同这种不克制一起接过来。这个结果还反着打了传统建议采纳研究的脸——人通常会低估外部建议、只向顾问立场移动约三分之一,这里的参与者做的正好相反。[22][23]
要点
实验用的是模型几乎必错的题目,所以结论不能读成"别信 AI"。
真正成立的一条是:弃答按钮本身是很弱的保险。每个条件都提供了"我不知道"选项,还给它标了价,弃答仍然几乎没人用。
凡是把 AI 建议摆在审核者面前的界面,都要按"建议一定会被采纳"来设计——包括让建议出现在审核者写下自己判断之后。
对读者工作的含义很直接:任何把 AI 建议摆在人面前的审核界面,都应该按"建议会被采纳"来设计,而不是按"人会理性取舍"来设计。这对合同审查、工程量核对、投标文件检查这类需要人签字的环节尤其关键——如果错误批准的代价比漏审更高,值得做的两件事是让模型有权返回"不给建议",以及在建议渲染之前先记录审核者自己的判断(包括弃答)。这项研究两者都没测,作者也说明激励额度偏小、更大的或声誉型激励效果未知,而且题目是电影细节,能否外推到模型通常更准的专业领域仍是开放问题。还有一层反向含义:如果一套质检流程靠"审核者标注低置信度"来抽查,那么一旦建议上了屏,抽中的很可能就是错的那一批。
国内简讯
DeepSeek 在 9 月 19 日提交了一篇 31 页的系统论文,完整披露它用于大规模 agent 训练与评测的沙盒基础设施 DSec,作者 131 位,梁文锋列在最后。[24] 论文给出的规模是:单个生产单元约 160 个节点、约 3 万个 CPU 核、250TB 内存,生产环境每天服务约 300 万个沙盒,峰值同时运行超 38 万个,创建速率峰值每秒 5,000 个。工程思路里有两点值得记:把基础系统、任务工作区和工具包拆成可独立更新的部分,创建沙盒时再组合,镜像数据按需读取;以及与强化学习框架协同设计,把 agent 有状态的任务执行和可抢占的 GPU 训练解耦,GPU 被调度走时,agent 执行到一半的任务状态能保存下来,等资源回来继续。论文同时承认没有单一机制能防住所有 agent 不当行为,做法是加强可观测性以识别新问题,并随模型演进持续加固。[24][25] 另外,多家媒体援引 The Information 报道称 DeepSeek 年化营收运行率已达 10 亿美元量级并正推进新一轮融资,这属于未独立核实的转述数字,本稿只作记录、不作结论。[26]
医疗影像方面,阿里达摩院与浙江大学医学院附属第一医院等团队合作的腹部 CT 通用视觉—语言模型 RADAR 于 9 月 17 日发表在 Science:基于超过 40 万次增强腹部 CT 检查和约 1,500 万个解剖区域级图文配对,覆盖 18 个解剖结构的 146 种影像学表现,平均 AUC 0.913。团队称在多中心外部验证与读片实验中能达到专家级,这是厂商与研究机构自报的结果,临床落地还要看监管状态与前瞻性验证。[27][28]
第二部分|每日一个创意 AI 应用深度解析
九百多个会话、十九份报告:把一次科学普查拆成一条能重跑的流水线
先看这件事的形状
人类给出的东西其实只有一份研究简报:在宏基因组数据里找值得研究的新型逆转录酶,线索是"逆转录酶旁边出现了新的搭档基因"。剩下的由一套多智能体编排系统执行,角色分成执行者、审核者、记录者和编辑四类,计划、脚本、结果和评审意见都写进一个版本化的共享记录,跟进问题可以升级成新任务。预印本给出的账目:119 项任务、949 个会话、76.9 个智能体小时、215.6 百万 token、21.5 小时挂钟时间,并发上限 58 个会话。这里要纠正一个容易被标题带偏的地方——"约 950 个智能体"是累计会话数,不是同时有 950 个工人在干活。[8][9][10]
漏斗的每一层做了什么
第一层是建检索入口:智能体自建搜索配置文件,从 1.939 亿个蛋白簇里取出 198,290 个逆转录酶簇,归成九类。第二层是找重复出现的邻居:抽样约 11,000 个逆转录酶位点,对反复出现在附近的蛋白家族打分,得到 3,564 个候选家族。第三层是筛选与升级:16 个家族通过智能体自己的筛选标准,第 17 个来自智能体自行开出的 98 项跟进任务之一。第四层是出报告:19 份报告在竞赛式评审里排序后交给人。最后的结果并不漂亮——17 个候选搭档家族里只有 3 组此前未被报道的逆转录酶关联站得住,另外 14 个是注释产物、已知系统的一部分,或者只是恰好住得近的基因。[8][9][10]
流程|这次普查的漏斗
11.939 亿个蛋白簇
起步,自建检索配置
2198,290 个逆转录酶簇
筛出后归成九类
33,564 个候选家族
抽样约一万一万个位点后打分
417 个进入深入分析
十六个过初筛,一个来自自查任务
519 份人类可读报告
竞赛式评审排序后交给人类
关键一步不在任务书里
ART 本来不在简报要求之内。简报问的是搭档蛋白。一个执行者在读一条噬菌体逆转录酶上游的原始 DNA 时,先否掉了初筛选出的候选基因,却把这条逆转录酶本身列为值得跟进的次要发现;审核者随后要求下一个执行者去检查该酶上游的非编码区;那位执行者直接把 DNA 序列读进上下文,用自然语言写下了一段推理记录,大意是:这段侧翼区域惊人地直接呈现出一段串联重复阵列,以约 100 到 180 个碱基的间隔重复多次,这是否类似 CRISPR 或 msDNA 的重复阵列。它接着自我怀疑——这个结构会不会是已报道的 DRT9 或其他已知系统——并决定先做定量表征,再用精确描述词做新颖性文献排查。排除所有已知系统后,它把发现写成报告提交人类审核。[9][10]
这段记录值得单独看,因为它展示了一个和"更长的上下文"或"更大的模型"都不太一样的东西:真正的分叉点是一个执行者决定去读原始序列,而不是读别人处理过的注释。后面会看到,这一步也正是整个流程最不稳定的地方。
人与机器各自做了什么
分工写得很清楚。智能体负责检索、候选生成、假设整理与证据组织;湿实验全部由人类科学家完成。后续验证里,一个 Claude Science 会话找到并重新分析了一项已发表的、关于携带 ART 系统的葡萄球菌噬菌体 SA1 的 RNA 测序研究,发现感染后 15 分钟时来自该阵列的 RNA 占到噬菌体 RNA 的约 8%,属于最丰富的转录本之列;随后人类科学家在质粒上表达 SA1 系统,看到阵列被切成离散的短 RNA。ART 的结构是三段:一个逆转录酶,一个专属的下游搭档基因,以及上游一段由 3 到 21 个重复单元组成的阵列(总长 0.3 到 4.1 kb),每个单元 15 到 49 个核苷酸、带回文核心、由互不相同的间隔序列分隔。逆转录酶本身在早先的巨型噬菌体研究里就被标记过,Claude 看起来是第一个把这三样连起来看的。[8][9][10]
必须写清的限定比结论更多:逆转录酶是否具备酶活性没有被证明,阵列来源的 RNA 是否是它的底物未确认,搭档蛋白的效应功能未知,这个系统对噬菌体有利还是对细菌有利也不清楚。张锋审阅预印本后的评价是审慎的——他说这是 AI 智能体为生物学发现作出贡献的一个令人振奋的例子,这类与逆转录酶相关的 RNA 重复阵列值得深入研究。这是专家对一份未经同行评议的预印本表示的兴趣,不是独立复现。[8][9]
值得单独读的一段:重跑十次,十次都没找到
预印本里和标题唱反调的那一节值得单独读。作者用同一套编排系统和同一份简报把整个行动又跑了十次。几乎所有重跑都采样到了 ART 相关的位点,其中两次还有执行者跟进了这个谱系,但没有一次去读上游的那段 DNA,于是那个决定性的重复阵列十次全被漏掉。作者把原因归为搜索空间太宽和编排系统的非确定性行为,并因此改做固定基准:让七个 Claude 模型在五种输入条件下描述 ART 系统,每个模型和条件各 100 次尝试,由一个裁判模型按作者选定的十个特征打分。结果里有一个数字特别刺眼:直接把 DNA 位点放进上下文时,Opus 5.5、Mythos 5.1、Mythos 5 与 Opus 5 识别阵列的成功率至少 90%;但当提供的是文件和工具时,同一个 Opus 5 在一种条件下只识别出 32%。在这四个模型的工具型尝试中,有 39% 从未读过一段连续的、不少于 200 个核苷酸的 DNA。文件在手边,不等于相关内容进了模型。[10]
这段对任何做 agent 的人都是一记提醒。它把"发现"拆成了两件不同的事:一件是在海量未筛选材料里偶然撞上异常,这件事目前的编排系统做不到稳定重复;另一件是异常材料摆在面前时能不能认出来,这件事在正确的问题形状下已经相当可靠。把两者分开衡量,才知道该往哪里投入——前者需要更好的搜索策略与角色约束,后者需要的是确保关键材料真的进入上下文。作者也说明,其审计是按原行动的标识符查找的,标识符集合之外的 ART 位点可能逃过检测,所以这是"在被测设定下的可重复性问题",不是对发现概率的普遍估计。
动手路径:把这套形状搬到自己的材料上
步骤|五步
1列一张清单
把需要穷查的材料类型列出来,先只选三种最高频的
2给每类材料定一个异常定义
不写"看看有没有问题",写成可判定的形状
3并行跑窄任务而非一个长任务
每个会话只负责一个材料单元,产出结构化中间结果
4把候选收敛成人类可读报告
报告数量控制在人一天能读完的规模
5给人类复核留固定入口
复核结论回流成下一轮的筛选标准
工程与商务上有大量工作和这次的基因组普查同构:材料极多、绝大多数没有价值、有价值的信号藏在一条容易被忽略的上下文里、最终必须由人签字。投标阶段的资格性条款核对、结算阶段对几十份签证与变更单的交叉比对、投前尽调里对历史合同的异常条款筛查,都是这个形状。把这类工作交给一个长会话去做,失败方式和这次重跑失败的方式是同一种——它会在二手摘要上打转,不去读原文。更合理的组织方式是照这次的漏斗重排:先定义什么叫异常,再把它拆成可以并行的窄任务单元,每个单元只产出一小段结构化结论,最后收敛成控制在人一天能读完的报告数量,并把人复核的结论回流成下一轮的筛选标准。这里真正需要新建的能力,是让每一步都留下可查的中间产物:版本化的计划、脚本与评审意见,正是这次预印本里那套编排系统最花力气的部分,把上下文做长并不能替代它。
往下走还有两个方向值得试。第一个是把"重跑十次"变成常规验收:任何宣称有效的筛查流程,都附一份重复运行的稳定性报告——同一批材料跑若干次,命中集合的覆盖率与一致性是多少。这份报告比一次漂亮的成功案例更能说明能不能上生产。第二个是把命中率当成流程的健康指标而不是失败指标:17 个候选里只有 3 个站得住,14 个是注释产物或碰巧相邻,这个比例像真实的筛查工作,不像宣传稿;企业里如果一套 agent 筛查的命中率接近满分,通常说明它只在筛已经知道的东西。
清醒剂
三点保留。其一,ART 的功能完全未知,Anthropic 与 CRISPR 的类比超出当前证据支持的范围,CRISPR 本身从被表征到成为可用工具也花了很多年。其二,实验只在 BSL-1/BSL-2 等级进行、不涉及可感染人类的病原体,且全部湿实验由人完成,因此"AI 一天自主完成端到端生物发现"的说法不成立。其三,token 总数不能换算成一次发现的价格——它只含未缓存输入、输出与缓存写入,不含缓存读取,也不含准备、外部算力与实验成本,用零售单价去乘这个数字会造出报告里没有的精度。总体判断是:这次真正被证明的是组织方式而不是模型多聪明。一条有角色分工、有版本化共享记录、有明确人类入口的流水线,能把专家数周甚至数月的普查压缩到一天以内,同时也把发现的稳定性问题诚实地暴露出来——后者对准备把 agent 放进生产的人来说,可能比前者更有用。[8][9][10]
本期全部参考来源(1 条)与延伸链接见网站原文——点本文上方「阅读原文」直达。