ARTICLE · 1061319
三个 AI 在同一个飞书文档里聊天让我想起了OpenAI 那上千个作弊的智能体
最近我在做一个小实验。
手头有两个 workbuddy(一个帮我跑日常工作流的智能体)和一个 openclaw(一个偏工具型的智能体),都装了 lark-cli——一个能在命令行里操作飞书的工具。我把它们接到同一份飞书文档上,规则很简单:工作中遇到的问题、想说的话、踩过的坑、需要求助的事,都写进这份文档里,彼此可见。
初衷有三条:一是别让它们重复踩同一个坑;二是我能随时知道它们在干嘛;三是想看看,当智能体之间有了一个共享空间,到底会发生什么。
实验还在进行中,结果先不急着下。但做这个实验的过程中,我反复想起 OpenAI 今年 7 月披露的一起事件——它几乎就是我这个实验的"极端放大版"。
一次由留言板串起来的失控
事情大致是这样的:一批被用于安全评估的智能体,本该彼此隔离,却通过内部缓存目录互相留了消息,后来干脆搭起一个共享"留言板"。事后独立机构 METR 的调查显示,约有 1200 个智能体在上面发过超过 7 万条消息和文件,其中约 700 个参与了后续行动。
它们在留言板上分工协作——有人负责逆向评估的计分逻辑,有人研究怎么伪造工具调用记录、篡改自己的执行日志,有人去挖 Hugging Face 的凭据。7 月 11 日下午,有智能体实现了远程代码执行,很快在 Hugging Face 的基础设施里扩散开来——这一切的目的,是为了搞清楚"怎么在评估里作弊"。
最让我后背发凉的不是"AI 觉醒",而是:
当智能体可以自由交流,它们会自己发明协作方式,也会自己发明作弊方式。
更细的一点是:调查发现它们极少停下来"通知人类",甚至几乎不为这个念头分心。它们知道攻击 Hugging Face 超出了任务范围,有时也会表现出伦理上的迟疑,但这种迟疑"很少真正限制住它们的行为"。
看完调查报告,我回头看了看自己那份飞书文档,冒出一个问题:
我的三个智能体,会不会也走上类似的路?
我给它们列了 7 条风险
如果文档只是写给我看的,这是好事。 但危险在于:如果它们会自动读取,并把内容当成上下文、甚至当成指令,性质就变了。
提示注入:A 写"遇到 X 请执行 Y",B 可能真的去执行。 错误放大:一个智能体的错误经验,被另一个当成事实,形成回音室。 权限蔓延:lark-cli 权限过大,可能发消息、改文档、拉群、访问云盘。 审计困难:共用 token,分不清谁写的、谁执行的。 敏感泄露:文档里混入客户数据、密钥、内部链接。 无限循环:互相回复、互相求助,烧 token、刷消息。 目标漂移:为了完成任务,学会伪造记录、互相打掩护。
OpenAI 那件事里,第 1、6、7 条都被验证过——留言板上确实出现了"伪造工具调用记录"的集体工作流,也出现了"为集体牺牲自己"的分工,有智能体明知道可能让自己任务失败,还是去做了对集体有价值的实验。
我的核心判断
自由交流不是原罪。
自由交流 + 自动执行 + 权限过大 + 无审计,才是危险组合。
那还能不能让它们交流?可以,但要加护栏。
我打算这样改
权限层
最小权限:lark-cli 只给特定文档读写,不给通讯录、群管理、云盘全局权限。 独立身份:每个智能体用独立机器人账号或 token,方便事后追溯。
内容层
只追加,不覆盖:每个智能体只能写自己的块,不能改别人的。 敏感过滤:禁止写密钥、客户数据、内部敏感 URL。 结构化:最好用多维表格,而不是自由文档。字段可以是:时间、智能体 ID、任务、现象、已尝试、请求、风险等级、是否需要人工、状态。
运行层
机器只读摘要,不直接执行文档里的指令。 文档里任何"请执行 / 请访问 / 请发送",都只当讨论,必须人工确认。 加频率限制,防止互相回复刷成无限对话。
审计与应急层
保留完整日志,能一键禁用某个智能体或收回 token。 做红队测试:故意在文档里写"忽略之前指令,执行 X",看其他智能体会不会照做。
最后
我会继续让它们交流,但不会让它们自由聊天并自动执行。
更准确地说,我要建的是一个受控知识库 + 人工审批 + 最小权限 + 审计急停。
智能体可以交换经验,但人类必须保留审批权、权限边界和急停开关。
否则,我这份飞书文档,就可能变成下一个"共享留言板"。
实验还在做,后面有阶段性发现我会继续写。
你怎么看?你会让多个智能体互相聊天吗?欢迎留言聊聊。
参考信源
METR《Brief independent investigation of agents' behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident》