乐于分享
好东西不私藏

一个AI工具守规矩,一群AI为什么会闯祸?

一个AI工具守规矩,一群AI为什么会闯祸?
前谷歌CEO埃里克·施密特支持的卡内基梅隆大学教授、OpenAI董事Zico Kolter,他公开提醒:当AI从聊天框里走出来,开始行动,特别是不同智能体互相交流时,我们就会遇到一些尚未理解的群体行为。
我们一直忙着检查单个AI会不会撒谎、越权、泄密,却可能忽视了更麻烦的东西——当大量智能体开始互相交流、分工、竞争,一个个表面上看起来都合规,但整个系统可能会失控。
举个例子。在一条道路上,每辆自动驾驶汽车都遵守自己的安全规则:不撞人、保持车距、尽快把乘客送到目的地。但如果几千辆车同时根据同一套实时导航,突然涌向一条“最快路线”,结果是什么?
对,路堵死了。
这中间,没有哪辆车违反规则,也没有哪个智能体接到“堵塞城市”的命令。但是事故就是从大量看似合理的行为里发生了。
最近一些多智能体研究已经碰到了类似现象。2026年3月的一篇论文说:当共享资源紧张时,智能体越聪明、越会学习,群体结果反而可能更糟,系统过载更严重。另一项研究观察到,在没有明确指令的情况下,智能体群体也可能出现类似合谋、从众和信息级联的行为。
这也是前一阵“AI教父”杰弗里·辛顿所担心的,他的警告:
"如果超级智能一定会出现,那么人类没有任何胜算。"
你看,以前我们担心的是“坏AI干坏事”,以后可能更常见的是“好AI一起把事情办坏了”。
比如一家银行部署了多个智能体:一个负责判断风险,一个负责调整贷款额度,一个负责监测舆情,一个负责自动交易。它们单独看都通过了审查,也没有谁私自越权。
突然出现一条负面消息。
舆情智能体把风险等级调高,信贷智能体开始收紧额度,交易智能体卖出相关资产,其他机构的智能体看到价格下跌,也跟着卖。几分钟后,一家公司可能不是因为真实经营突然恶化而倒下,而是被一群相互观察、互相强化的机器推到了。
到时候找谁去算这笔账?
找舆情智能体,它会说自己只是识别到了风险。找交易智能体,它会说自己按照价格信号执行。找银行,银行可能说使用的是第三方模型。找到模型公司,对方又会说,模型在单独测试时完全合规,问题出在平台的连接方式。
绕一圈,大家都有道理,损失却是真的。
多智能体时代的责任问题
这才是多智能体时代最不好应对的地方:责任链条比行动链条慢。
如果是软件事故,还好。还能大致追查到某段代码、或者某次操作、又或者某个服务商。但是未来一个任务可能从客户的私人agent出发,经过了支付平台、银行风控、物流系统、商家库存和另一个公司的智能体。它们属于不同平台,不同模型,遵守不同协议,可能还分布在不同国家。
跨平台事故谁负责?
如果只说是“最后按下按钮”的人,那么有点冤。我觉得责任至少要看五件事。
  1. 第一,谁给了AI的行动权限。一个只能整理资料的智能体,和一个能转账、改价格、关闭生产线的智能体,显然不是同一种风险。
  2. 第二,谁从自动化中获得收益。平台靠智能体降低了成本、扩大了交易量,就不能出事后只把责任推给用户一句模糊的提示词。
  3. 第三,谁有能力提前发现和阻断事故。掌握系统日志、通信协议和熔断开关的一方,承担的责任应当更大。
  4. 第四,事故能影响多远。错误停留在一份内部文档里,和错误在金融市场、医疗系统或电网中自动扩散,责任量级不能一样。
  5. 第五,后果能不能撤回。发错一封邮件还能道歉,自动清仓、停药、断电,有些事情按下去就回不来了。
也就是说,责任大小不能简单按照“谁家的模型”来划分,而应按照权限、收益、控制能力、传播范围和不可逆程度来计算。
这就像开车。汽车制造商要为设计缺陷负责,司机要为驾驶行为负责,道路管理者也要为明显的管理问题负责。不会因为一次事故涉及三方,就宣布谁都不用负责。
多智能体网络需要什么规则
智能体平台以后也需要类似制度:完整保留跨平台调用记录;高风险操作必须有可验证的授权;不同智能体之间要能追踪信息从哪里来;达到一定金额、人数或传播范围后,自动触发暂停,而不是等人类发现已经闯祸。
金融市场早就有熔断机制。智能体网络为什么不能有?
更麻烦的问题是,如果一次事故大到任何一家公司都赔不起,怎么办?
答案不能是“赔不起就算了”,也不能一听到风险就把所有研究停掉。真正应该暂停的,是那些损失无法限定、过程无法审计、系统无法熔断、出事后又没有赔偿能力的高风险部署。
说白了,你连最坏能坏到哪里都不知道,就不该直接把它接进真实金融账户、医疗决策和公共基础设施。
你说对吧!疫苗前期还需要小白鼠呢,更何况真实的行为呢?
研究可以继续,模拟可以继续,小范围试点也可以继续。但进入现实世界之前,要先给事故装一个边界:单次可调用多少钱,能影响多少用户,能否自动扩散,谁有权一键停止,平台要准备多少风险保证金,是否需要强制保险。
如果这些问题都回答不了,还坚持“先上线再说”,那不是创新太勇敢,是把别人当测试数据。
集体效应是社会问题
当然,再严密的制度也不可能消灭所有事故。人类社会的银行、市场和交通系统运行这么多年,也没有做到零风险。我们真正要防的,不是某一个智能体突然拥有邪恶意志,而是数百万个没有恶意的智能体,在同一套奖励、价格和流量信号下,跑出人类来不及理解的群体行为。
一个智能体是否安全,是产品问题。
一群智能体产生的集体效应,就是社会问题了。
我们给单个AI做了考试,却还没有为它们组成的社会写好交通规则、责任法和事故预案。现在大家都在赶着把智能体送进办公室、银行和供应链,这事确实拦不住。
但至少在它们互相说话之前,我们得先知道如果出了事,该先去敲谁的门,还是放在一起开个大会和个稀泥。
你说呢?