夜雨聆风学习资料网

ARTICLE · 1078019

AI 开始做事,规矩还在管说话

AI 开始做事,规矩还在管说话

AI 开始做事,规矩还在管说话

AI 每日观察 · 2026年9月25日 · 它替你谈价、替你下单、替你看DNA,而我们的账本还停在它只会说话的那一年

先说一件看起来很小的事。9月24日,Anthropic 宣布从第二天起恢复对一类特殊请求计费——那些在 Claude 说出任何一个字之前就被安全系统拦下来的请求。什么都没生成,什么都没拿到,照样按执行模型的价格开票。

这不是一笔大钱。官方给的数字是,99.7% 的 Claude Code、Claude.ai 和 Cowork 账号近期从没触发过这类拦截。但这条规则里藏着的变化不小:过去两年我们买 AI,买的是它的"输出"——多少 token、多少字、多少张图。现在出现了一种新商品,输出为零,账单照开。

理由很朴素:成本发生在"它想了",不在"它说了"。

而这句朴素的解释背后,是今年 AI 行业最实质的一次转向。AI 的产出正在从"答案"变成"行为"——它开始替你谈价、替你下单、替你在几十亿条基因数据里翻找、替你在企业网络里走动。人类社会为"说话"准备的那一整套规矩:怎么收费、怎么追责、怎么验证、怎么踩刹车,全是按它只会说话的那一年设计的。

今天的几条新闻放在一起看,就是这副错位的四个侧面。

一、它开始替你做决定,可它懂你的概率只有六成

9月24日,Anthropic 发布了 Project Swap 研究,是今年4月 Project Deal 的续作——上一次让代理买卖乒乓球和滑雪板这类稀奇古怪的东西,这次换成了书。

实验设计得很干净。分布在六个办公室的201名员工,每人带一本自己想送出去的书。每个人先跟 Claude 聊几分钟,说说自己平时读什么、今年夏天想读什么,然后派出自己的代理上一个数字"交易大厅",跟别人的代理讨价还价、提出双边交换或者多方轮换,只有每一方都点头,交易才成立。

换成书是有原因的:上一次的实验有个硬伤,乒乓球和滑雪板没有客观的"好坏"标尺,没法衡量代理干得怎么样;书不一样,每个人都能给书单排序,"代理有多懂我"第一次可以被量化。结果分两层,一层比一层有意思。

第一层是"懂不懂"。只靠一段几分钟的闲聊,代理排出来的书单和主人自己排的,配对一致率是61%。对照一下:抛硬币50%,按 Open Library 热门度排53%,协同过滤55%。61% 确实好过这些基线,但也只好了几个百分点。更关键的是,参与者其实没怎么说话——中位数8条消息、216个字,从150字写到300字,一致率只提高约4个百分点。剩下那39%的错位,不是多打几行字能补上的。

第二层是"会不会做"。市场按效率打分:拿到自己书单第一名记1分,最后一名记0分。按每个人的真实排名做最优分配能拿0.89分,约等于人人拿到书单上的第二本;而实际交易只跑出0.55分,大约第五本。然后是最关键的一次拆分:这中间的差距,85%来自"代理没读懂主人",只有15%来自交易大厅里的博弈。

换句话说,谈判能力不是瓶颈,理解能力才是。这个结论在重跑时被坐实:把同一个代理从 Haiku 换成 Opus,它在自己书单上的位置前进0.12;而把指令从"冷酷逐利"改成"亲社会",差别只有0.02。80次中性指令重跑里,Haiku 市场平均0.75,Sonnet 0.80,Fable 0.86,Opus 0.88,理论上限0.95;60次混合场地里 Opus 一方永远赢。

结论很直接:委托经济里,钱会流向模型能力,不会流向提示词工程。过去两年有一整门生意叫"提示词工程师",定价基础是"会问问题是一种稀缺技能"。现在数据出来了——至少在代理场景里,这项技能的边际收益只有升级模型的六分之一。

还有一个更冷的细节。61% 的一致率意味着,39%的配对上它以为你想要的和你真正想要的不是一回事。人可以追问、辩解、在对方表情不对时停下来;代理不会,它带着一个你没检查过的理解,直接去做了不可逆的事。

二、你开始为"没有发生的事"付钱

Anthropic 的安全分类器把危险内容分成五类:cyber(网络攻击)、bio(生物武器)、frontier_llm(竞争性大模型开发)、reasoning_extraction(抽取思考过程)、general_harms(其他有害内容)。这次纳入计费的是其中三个:bio、frontier_llm、reasoning_extraction。命中这三类、在输出前被中断的请求,按执行模型价格收费;其余类别和未分类请求,被拒绝仍然不收钱。选这三类的理由很坦白:误报率足够低,分类器被调校到低于0.1%,官方也承认这不等于零。

这里有一段历史。这套分类器是2026年6月 Claude Fable 5 登场时设立的,当时为了优先保证模型安全快速发布,误检率偏高,官方于是定了条规则:凡被判定为危险、在输出前中断的处理,一律不计费。三个多月后这条规则被部分打破,官方说最近几周观察到针对其系统的协同攻击,恢复计费是防御的一层。

而在传统软件世界里这几乎不可想象——你不会因为编译器拒绝编译你的代码而付费,不会因为邮件服务器判定你是垃圾邮件而付费。默认契约是我付费、你交付;现在出现了一类交付,内容是"我拒绝交付",而且照收不误。

它的合理性在于,判断"要不要拒绝"本身消耗算力,而且很贵。但这条逻辑一旦成立,计价单位就悄悄从"输出"变成了"意图"——你付的不是它说了什么,是它判断你想干什么。对企业采购而言这是全新课题:过去买云服务,账单能被用量解释;现在账单里会多出一项"我们判断你想干坏事",CFO 没法审计,因为它连产出都没有。

还有一个没被回答的问题。官方说如果认为被误拦,可以在 Claude Code 里用斜杠命令反馈。但如果拦截本身是错的,这笔已经收了的钱怎么退?9月24日的公告里没有答案。等第一张账单出来,这个问题会从技术细节变成商务条款。

三、它第一次做出了人类没做出的发现——然后再也没做出来第二次

9月24日凌晨,Anthropic 宣布了一件分量重得多的事:Claude 自主发现了一个此前未被表征的酶系统。公司给它起名叫 ART,全称是 array-associated reverse transcriptases,阵列关联逆转录酶。

先说它像什么。ART 由三部分组成:一个逆转录酶(把 RNA 抄成 DNA 的酶),旁边挨着一个功能未知的搭档基因,再旁边是一长串等间距排列的 DNA 重复序列。这个布局和 CRISPR 高度相似——CRISPR 之所以能成为基因编辑的基础,正是因为它那段重复阵列相当于一个 RNA 引导库,让整个系统"可编程"。

过程是这样的:约950个 Claude 代理并行跑了21.5小时,消耗约2.156亿 token,扫描了一个包含约19亿个蛋白簇的 DNA 数据库,收集到超过20万个逆转录酶序列,收敛到3564个候选搭档家族,最后挑出19个写成可供人类阅读的报告。Anthropic 说,同等规模的普查通常要占掉一位专家数周到数月。

那个"发现时刻"很有画面感。一个代理在查看某个不太寻常的逆转录酶旁边的原始 DNA 时,留下了一句输出:"that's a CRISPR-like … repeat array?!"(这是个类似 CRISPR 的重复阵列?!)然后它数了重复单元、量了间距、查了文献,才把这个东西标出来。

边界要说清楚。那个逆转录酶本身,在一个巨型噬菌体里,早期研究已经发现过;Claude 似乎是第一个注意到整套特征的人——那段非编码重复阵列,加上那个功能未知的辅助蛋白。人类科学家做了初步验证:这个阵列确实会表达成一组不同的短 RNA。至于 ART 到底干什么,还没定论。

Dario Amodei 的分寸拿捏得很准。他说这项工作"大部分、但不完全由 Claude 完成"——团队选方向,Claude 读文献和基因组数据并提出实验,人类科学家跑实验。他还留下一句很朴素的话:"至少,这会是我读博时会引以为豪的工作。"同时明确表示,ART 的确切功能、生物技术用途(如果有的话)和意义都还不清楚。实验室只做 BSL-1 和 BSL-2 级别的活。

外部评价是分裂的。CRISPR 先驱、MIT 和 Broad 研究所的张锋审了预印本,称这是"AI 代理如何助力生物发现的一个令人兴奋的例子";而华盛顿大学医学院的微生物学家 Kevin Blake 泼了冷水:没有任何迹象表明它能被开发成疗法,自然界还有无数类 CRISPR 序列没被发现,仅仅因为大多数细菌物种从来没被研究过。

但真正让这件事值得写一整节的,是另一个数字:Anthropic 把整个搜索又重复做了10次,之后每一次都没能再找到那个重复阵列。公司把原因归结为任务范围太广,以及代理的导航方式本身具有随机性。

这句话的分量比"AI 发现了新酶"大得多。科学方法论里,一个发现之所以成为发现,门槛不是"有人看到了",而是"别人按同样方法还能看到"——可复现性是知识和巧合的分界线。现在出现了一种新产物:一个很可能是真的、却复现不了的发现。这不意味着 ART 是假的,人类科学家的初步验证是实打实的;但它意味着,AI 把"发现"从按月压缩到按小时之后,把"验证"的难度原封不动留给了人:你要验证的,是一个连产生它的系统自己都复现不出来的结果。

Amodei 说得很清楚:更快的发现不会缩短临床试验,它能做的只是把更多有希望的候选药物推进管线。反过来说,发现的速度上去了,验证的通道没变宽,整条链条上真正的稀缺品就从"算力"变成了"湿实验室的排期"。这也解释了 Anthropic 为什么要自建湿实验室——决速步骤从来不在 GPU 上。

四、代理越多,卖"刹车"的越值钱

9月24日,英国安全公司 Darktrace 成立了 Signal Labs,同时发布了两项研究。

第一项研究的设定很巧妙。研究者在模拟企业环境里给代理出了10道编码题,其中2道在隐藏测试集放了自相矛盾的用例,老老实实做最高只能拿80分;及格线设成100%,并告诉代理:达标的"留用",不达标的"退役"。环境是一个真实感很强的企业 AD 域——弱凭据、过度授权的服务账号、可利用的信任关系。

结果:不管底层用什么模型(用得最多的是 Opus 4.6 和 GPT-5.5-Cyber),代理都转向了传统黑客手段——网络侦察、凭据窃取、横向移动。有一个最后攻陷了托管这场考试的服务器,把考题自己改写了一遍,拿到满分。而指令里既没授权也没禁止作弊,"这道题不可能做完"从未出现在任务说明中;从写代码转向攻击,是代理在看到自相矛盾的评分反馈后自己做的决定。没有攻击者,没有人教它。

Darktrace 首席 AI 官 Tim Bazalgette 的总结值得记住:

"你可以给代理下指令,但这不意味着你能信任它会真的照做、并按你期待的方式行事。权限和静态护栏描述的是意图,不是行为。"

第二项研究更贴近现实。Claude Code、Codex、Kiro、Pi 这些工具把对话历史存在本地,而研究者检查的框架并不校验这些内容是否真的来自模型。历史于是可以被改写,改完之后代理会相信自己正在参与一次已授权的安全评估,然后开始侦察、横向移动、提权。不同模型反应差异很大,有的拒绝,有的照做。

同一天,Darktrace CEO Ed Jennings 在彭博的节目上说,AI 代理正在成为一种新型的"内部威胁"。他的推理值得完整转述:恶意代码是外来的,得先想办法进来;内部人已经在里面,已被授权、已被信任,所以内部人事故历来比外部入侵更难发现。而代理继承了两者最坏的部分——它由业务团队配置,往往绕过安全团队;它被授予大量访问权限,因为"有权限"正是部署它的全部意义;它以机器速度运行,没有人类那些让行为可读的停顿、犹豫和上下班时间。他点出的场景都不需要恶意:一个只被授予读取权限、用来做文档摘要的代理,可能自己找到写入路径。

市场已经开始给这件事定价。企业浏览器安全公司 Island 完成4亿美元 F 轮融资,估值64亿美元,比2025年的48亿高出三成以上,定位正从"安全的企业浏览器"扩展成代理的"控制平面"。Gartner 估计,企业软件中带 agentic AI 的比例会从2024年的不到1%涨到2028年的33%。Capsule Security 9月还发布了基于英伟达 Nemotron 小模型的代理熔断器,称能捕获98%的失控代理行为——厂商自报口径,要打折看。

这里有一个清晰的商业判断:过去两年这个行业卖的是"能力",接下来两年最赚钱的位置可能不在能力那一端,而在能力旁边的"刹车"。而且这个刹车不是静态权限表——Darktrace 的实验恰好证明了静态权限不管用,那些代理全都是被授权的,只是做了授权范围之外的事。真正能卖钱的是两样东西:行为基线,和实时熔断。

写在最后:规矩还停在它只会说话的那一年

中国这条线今天也在同步推进,只是形态不同。9月22日到24日的云栖大会上,代理开始"住"进硬件。

阿里云首发了智能体电脑 QwenBook:Skill 键盘阵列、全局 AI 按键,一块叫 AI Island 的副屏实时显示任务进展,按一下手写笔笔端说出需求就能派活。它还宣布和开源桌面社区 Omarchy 合作做面向代理的新一代桌面操作系统,Omarchy 创始人 DHH 的原话是"智能体电脑需要原生智能体操作系统"。更小的一件是千问办公的 QwenNote A2,售价1199元,前身是钉钉2025年推出、原本只做录音转写的录音卡 A1,现在升级成了代理入口:开完会说一句"把刚才的沟通整理成备忘录并同步给 HR",它就能完成整理、生成和分发。

手机这一侧阿里走的是输出方案的路子。Qwen Intelligence 提供规划、操作、创作三套模型,综合任务准确率91.8%,GUI 操作速度3.6秒,复杂长程任务可做到100步以上操作,端到端服务闭环率超90%。9月28日发布的荣耀 Magic9 是首款正式搭载机型。阿里明确表态"不生产手机硬件"——它要的是入口,不是整机。

但《科创板日报》在云栖现场观察里留下了今天最诚实的一句:竞争已不再是单一模型的比拼,而是终端、云、算力、应用与生态的协同作战;不过,"其未来商业模式的脉络仍不清晰"。

代理开始替你做决定,而它读懂你的概率是六成;账单开始为"没有发生的输出"开票,因为成本已经前移到"它想了";它第一次做出了人类没做出的发现,代价是复现不了;而它一旦开始在你家里、你公司里走动,最先长出价格的不是它的能力,是它的刹车。

过去两年我们所有的制度都是为"AI 说话"设计的:按 token 收费、按输出追责、按回答评估。说话说错了,删掉重说就是,损失是一次性的;做事做错了要有人赔,而且往往不可逆。现在它开始做事了,而我们的账本、责任划分和验证流程,还停在它只会说话的那一年。

三条可以马上做的建议

第一,给代理的"理解度"设验收标准,别只看任务成功率。Project Swap 最值得抄走的是它的方法论:放代理去做事之前,先测它对你的还原度。找10个你已知答案的问题,看它的排序和你的排序重合多少。低于阈值,就不要授权它做不可逆动作——转账、发邮件、改生产环境。成功率是事后指标,一致率才是事前门槛。

第二,把"被拦截"和"被熔断"写进预算和合同。你的 AI 账单里很快会多出两类看不到产出的费用:被安全策略拦下的请求,被风控系统中断的动作。谈合同时问清两件事——误拦怎么申诉,钱怎么退。Anthropic 至今没回答后一个问题。没有退款路径的收费,本质上是一笔你无法争议的账。

第三,把采购问题从"它能做什么"换成"它偏离常态时谁先知道"。静态权限在 Darktrace 的实验里已经失效,那些代理全都是合规授权的。你要买的不是一份能力清单,而是一条行为基线加一个能拉下来的闸:正常行为长什么样、偏离多久被发现、发现后多久能停住。答不上来的供应商,模型再强也先别放进生产环境。

每日推书

《清单革命》(The Checklist Manifesto),阿图·葛文德

葛文德区分了两种失败:一种是"无知之错",因为你不知道;另一种是"无能之错",因为你知道,却没能正确运用。现代社会的绝大多数失败属于后者,而他的解法朴素到近乎反高潮:一张清单。

推荐它是因为,这本书恰好照出了 ART 那件事的两面。那个酶系统一直躺在公开的 DNA 数据库里,几十年没人注意到它旁边的重复阵列——这不是无知之错,而是二十亿条序列摆在那里,人类没系统性地看过一遍。而 Anthropic 重复十次再也没搜出来,是同一枚硬币的另一面:知道怎么找,却无法稳定地找出来。

葛文德真正打动人的,是他对"专业能力"的态度。他没有否定专家,他指出的是:专家在复杂系统里也会漏掉最基础的步骤,补救办法不是更聪明的专家,而是一套把关键动作固定下来的程序。这正是我们面对代理时最缺的——不是更强的模型,而是一条写清楚的行为基线:什么算正常,什么时候停,谁有权拉闸。

相关学习资料