这篇文章想聊聊怎么用好一群 AI。
它不会给你一张规矩清单。我更想带你撞几面墙,然后你大概会发现一件既扫兴又安心的事:你撞的每一面墙,前人都撞过了,连答案都替你写好了。
(文中标着「技术注脚」的段落是写给工程师看的底层细节,不感兴趣直接跳过,不影响阅读。)
一件听起来像未来的事
你决定做一件听起来很未来的事:不只用一个 AI,而是雇一整支队伍。给它们定好目标,让它们自己跑。
头几天像变魔术。任务派下去,第二天醒来,活真有人干了。你开始幻想一家几乎不用人的公司。
然后你撞上了第一面墙。
第一面墙:凌晨两点,它把一切都忘了
凌晨两点,你的 AI 还在跑一个大任务。早上你一看,活干到一半,挺漂亮。可你昨晚顺手重启了一次电脑。
它全忘了。
不是出错,是失忆。它不记得自己是谁、在干什么、上一步做到哪,对着同一个任务又从头开始,账单翻倍,进度归零。
你的第一反应可能是"这 AI 怎么这么笨"。但坐下来想想,问题不在聪明不聪明。问题在于,它干到哪了,这件事只存在它自己脑子里,而那颗脑子断电就清空。
那一刻能拎出来的,是一个特别朴素的问题:
如果这个 AI 现在突然消失,我的工作会不会跟着消失?
只要答案是"会",你就把不该放的东西,放进了一个随时会清空的地方。出路只有一个:把进度、状态、上下文统统搬到 AI 外面,放在一个谁都能查、断电也不丢的地方。AI 退化成一个来取任务、干完就走的临时工,真相留在外面的账本里。
这不是什么新发现。它恰恰是分布式系统几十年前就学到的第一课:进程是不可靠的,所以别让真相住在进程里,把它放进持久存储,让干活的那个东西变得可丢弃、可替换。2025 年流传很广的《12-Factor Agents》把这条给 AI 重讲了一遍,措辞是"把你的 agent 做成一个无状态的归约器";Temporal、DBOS 那一批公司,干脆把"可持久化执行"做成了整门生意。
后来我去拆了一个真实的 AI 编排系统(Paperclip),发现它整根脊梁就是这个:AI 的对话被当成用完即扔的草稿纸,真正的进度全写在一张工单和文件里;服务器重启了也不慌,把数据库里的工单重新扫一遍,状态就回来了。
技术注脚:这就是 stateless worker + durable store(无状态 worker + 持久真相源),会话和上下文窗口是缓存,不是真相源。一个值得抄的细节:Paperclip 换会话时的"交接摘要"是确定性拼接的纯文本,而不是再喊一次 LLM 去总结,所以零成本、零延迟、不会总结出幻觉。那份摘要不是记忆本身,只是一张"去哪儿找记忆"的便签。
第二面墙:两个 AI,抢同一个活
队伍大了,新的乱子来了。
有一天你发现,同一个任务被两个 AI 同时领走了。它俩各干各的,最后互相覆盖了对方的成果,账本一片狼藉,谁也说不清最终版本到底是谁的。
更隐蔽的一种乱,是它们开始"私下商量"。A 把一段上下文丢给 B,B 又转给 C,传到最后意思已经走样;等出了问题你想复盘,却查不到是谁、在哪一步带歪的,因为那些对话从没留下痕迹。
这两件事,逼出两个人类组织早就验证过的老办法。
第一,一件活同一时刻只能一个人领。得有个"抢工牌"的机制:谁先领到,这活这一刻就归谁,别人再想领,系统直接拒绝。这里还藏着个魔鬼细节:这个"占用",要在 AI 真正动手的那一刻才生效,而不是它"打算干"就把活锁死。否则你会遇到一种怪事,一个 AI 排了队却始终没真开工,可活已经被它的"意向"永久锁住,谁也碰不了。
第二,不许私聊,有话写在公告板上。让所有 AI 都在一块公开的板子上读和写,谁都看得见,自动留痕。沟通是慢了一点,换来的是清清楚楚、可追溯、崩了也不丢。
这两条也都站在前人肩膀上。
"抢工牌"在工程里叫原子认领。有意思的是,它不需要什么高级的分布式锁服务,一句带条件的数据库更新就够了。Paperclip 用的就是 UPDATE ... WHERE 状态='排队中',数据库天然保证只有一个进程能改成功,剩下的安静退场。而"真正动手才上锁",它的代码注释里还留着一个修复标记("Fix A"):早期是"一排队就锁单",结果排了没跑的任务把工单永久锁死,后来改成"开跑才锁",这个幽灵锁才消失。
"写公告板、不私聊"则是上世纪 70 年代就有的架构思想,叫黑板模式:一群专家模块谁也不直接喊谁,全部围着一块共享黑板读写。(说句老实话,黑板模式是真实存在的术语,但我把它和"账本中心""无状态 worker"缝成一个"统一框架",那是我自己的归纳,不是行业公认的叫法,你别当成既成标准。)到了 2025 年,Cognition 团队那篇很有名的文章又把这条喊了一遍:要共享完整的轨迹,而不是零散的消息。碎片化的私聊,正是多 AI 协作最大的不靠谱来源。
技术注脚:原子认领就是条件更新里的 CAS(比较并交换),无需 Redis 或 ZooKeeper;"开跑才锁"叫懒加锁,锁的生命周期要绑定"实际执行"而非"意图"。"公告板"对应到 2026 年多 AI 领域收敛出的 single-writer(单写入)原则:同一份记录任一时刻只有一个写入者,其余只读、只出主意。
第三面墙:一个 AI 人间蒸发了
某天你盯着看板,发现一个任务卡在"进行中"已经四个小时,纹丝不动。
那个领走它的 AI,断网了?卡死了?陷进死循环了?你不知道。你只知道它再也没回来,而这个活就这么被它攥在手里,既不完成,也不撒手。
AI 比普通程序更容易这样,卡死、超时、绕圈是它的常态,不是意外。所以你不能指望"它应该会回来",你得安排一个"查岗的":定时巡视,谁领了活却长时间没动静,就当他失踪了,把活收回来,重新派出去。
Paperclip 里就有这么个"收尸人",每隔一阵扫一遍,凡是领了活却五分钟没有任何输出的,判定失踪、收回重排;再配上"超时就强制结束""服务器重启后扫表恢复",三层兜底,保证没有活会因为某个 AI 暴毙而永久卡死。
这同样是老规矩。任何一个像样的任务队列系统,第一性的设计前提都是同一句话:假设干活的随时会暴毙。你得有办法发现它没了、把活收回来、让另一个无缝接手。而这一切之所以可能,恰恰是因为你做到了第一面墙那条:真相在账本里,新来的读一遍就接上了,根本不依赖那个已经死掉的 AI 的脑子。你看,几条规矩是咬合在一起的。
第四面墙:你把整个图书馆塞给了它
队伍跑顺了一阵,你开始追求"让 AI 更懂全局",于是把能想到的资料一股脑全喂给它:所有历史、所有项目、所有背景。
结果它反而变蠢了。抓不住重点,被无关信息带偏,答非所问。你给得越多,它越糊涂。
这件事有个挺形象的名字,叫"上下文腐烂"。它揭示了一个反直觉的道理:给 AI 喂料,最难也最关键的功夫,是决定不喂什么。只给这次任务真正需要的那几条,其余的哪怕看起来"可能有用",也先拦在门外。
Paperclip 在这件事上近乎吝啬:给 AI 组装任务说明时顺序固定,而且硬性截断,相关评论最多带 8 条、总量 12KB 封顶,长篇的主指令只在全新会话时灌一次,之后唤醒绝不重复灌。上下文在这里是配给制,不是自助餐。
顺带还有一面小墙:别让同一个 AI 上午修财务、下午写文案时,两摊事的上下文搅在一起。每件任务给它一张清空的桌子,独立的笔记本、重置过的工作环境,互不串味。
这一面墙,前人也已经命名并立了碑。2025 年,"上下文工程"取代"提示词工程"成了主流,讲的就是精细管理每一次调用时上下文窗口里到底该装什么。Karpathy 在 2025 年年中给了它一个广为引用的定义,Anthropic 同年秋天的文章把它系统化,连 Gartner 都把 2026 年定成了"上下文之年"。这里有个能立刻自检的小标准:你能说清上下文里每一段为什么在那儿吗?说不清的那段,就是该删的。
技术注脚:任务隔离在 Paperclip 里是用
(公司, AI, 运行方式, 任务)四元组当主键,一个任务一条独立会话,数据库层面就保证不串;每次开工还会重置环境变量、重新解析工作目录、校验技能包指纹。这和第一面墙的"会话即缓存"是一体两面:缓存不仅可丢弃,还必须按任务分桶。除了"上下文腐烂",这一年还有人把长上下文的失效模式拆得更细(distraction / confusion / clash / poisoning),都是同一类问题的不同切面。
第五面墙:一觉醒来,账单四位数
有天早上你打开账单,愣住了。
某个 AI 昨晚卡进了一个死胡同,反复尝试同一件事,一整夜没停。AI 干活是按用量付费的,它就这么安安静静地,把你一个月的预算烧掉了大半。
仪表盘上其实一直显示着"已花多少"。但光显示没用,到顶了得能真的踩下刹车:停掉正在跑的,取消所有还在排队的,然后弹个申请问你,加钱继续,还是就此打住。
Paperclip 的预算就是这么硬:花到 100%,立刻把对应的范围(某个 AI、某个项目、整个公司)暂停,主动取消它名下所有排队任务,再生成一个等你裁决的审批。钱在这里不是报表上一个看看就算的数字,而是一个能触发熔断的信号。
也是在这段时间,你犯了另一个几乎人人都会犯的错:既然一个 AI 不够稳,那就让一大群 AI 开会协作吧。结果是一屋子 AI 七嘴八舌,上下文对不齐,决策互相打架,谁也说不清最后听谁的,又慢又贵。
这一面墙,是整个行业花了两年、烧了真金白银才撞明白的。
2023 年,大家狂热地造"全自主多 AI 系统",给一群 AI 一个目标,让它们自己协作,绝大多数都失败了。到 2025 年,Cognition 干脆发了篇《别造多 agent》。故事更有意思的地方在后面:2026 年 4 月,那篇文章的作者自己回来"翻案"了,把结论修正成"要造,就造对的那种",核心是单写入,一个主管负责拍板和落笔,其余 AI 只读、只出主意、不直接动手。几乎同时,还有学术界的实验开始质疑"多 AI 值得多烧十几倍 token"这个一直没人验证的假设。(老实说,这些是很新、还没经过同行评审的预印本,方向可以参考,具体数字先当存疑。)
所以今天的共识不是"别用多 AI",而是一句更克制的话:先把一个强单 AI 做扎实,真扛不动了再加,而且要加得有规矩,一个主管配几个只读副手,没有点对点的乱聊。这背后还垫着 Anthropic 一条经典区分:能用写死的流程解决的,就别动用自主决策的 agent。自主是成本,不是炫技的资本。
第六面墙:到底谁说了算,以及没人读的规矩
最后两件事,是这支 AI 队伍真正"长大"之后才会撞到的。
一件是:到底谁拍板?你试过两个极端,都不舒服。全撒手让 AI 自己决定,迟早出大事;可每件小事都要你点头,你被烦死,也就失去了用 AI 的意义。
舒服的位置在中间,而这个中间态人类已经用了几百年,它叫董事会:日常的活放手让下面自治,但几件大事,花大钱、招新人(让 AI 雇 AI)、改方向,必须经过人点头。诀窍是只在不可逆、高代价的闸口设卡,其余一律放权。Paperclip 几乎是原样照搬:AI 之间日常自治,但"雇人""超预算恢复""改策略"强制走人类审批,批完系统自动叫醒发起的那个 AI 去继续。人在这里是闸口,不是瓶颈。
另一件是:你定的规矩,根本没人读。你在文档里白纸黑字写了"不许删库""不许擅自把代码推上线"。可当干活的是 AI(或者一群拿 AI 飞快写代码的人),文档级的规矩形同虚设,AI 不读,赶进度的人也不读。
唯一靠得住的,是把规矩焊进系统的自动关卡,违反了直接被拦、根本提交不了。Paperclip 自己就大量由 AI 开发,提交记录里全是 AI 的署名,甚至有 AI 撤回另一个 AI 的错误提交,所以它把铁规焊进了流水线:有个脚本专门扫描,禁止 AI 在代码里偷偷执行"推送上线",违反就让整个检查失败;要破例,必须写明理由、留痕供审查。它也给 AI 写了厚厚的"员工手册",但真正兜底的,是这些机器关卡。
这两件,前人的答案一个比一个老。"只在关键闸口设人工确认"是 human-in-the-loop 的精确用法;"把约束编码进自动检查"是工程界的老常识;而董事会式治理本身,是人类组织协作几百年的沉淀。
技术注脚:预算硬停是"事后熔断",花费记账后才评估,可能冲破才停,换来的是实现简单、绝不误杀,但关键动作必须是"暂停范围 + 取消排队",不只是一个变红的数字。多 AI 的取舍可对照 Anthropic 的 workflow-vs-agent,以及他们那篇"多 agent 研究系统约 15x token"的成本自白。机器关卡就是把不变量焊进 lint/CI,当干活的是 AI 时,"文档约束"和"机器约束"的可靠性差着一个数量级。
回头看:你撞的每一面墙,都有人撞在你前面
把这一路走过的墙摆在一起看,会发现一件有点扫兴的事:没有一面墙,是 AI 时代独有的。
别把真相留在干活的人脑子里、一件活一个负责人、假设有人会缺席、只给该知道的信息、设预算、留审批、把规矩写进流程,这些是人类经营一家正经公司几百年攒下的常识。往技术那头看,又是软件工程几十年沉淀的可靠性套路:无状态服务、持久化队列、原子事务、孤儿任务回收、最小权限、人工闸口、把约束写进 CI。
这趟探索给我最大的体会,就一句话:这个领域正在把前人的答案一条一条重新发现一遍,只是换上了 "agent" 这个新词。
它甚至有个反直觉的推论。我去拆那个真正稳的系统时,最意外的不是它有多新,而是它有多旧。它用最无聊的技术,一张工单表、一个数据库事务、一段定时轮询,解决了最要命的问题。反倒是那些一心追求"更聪明、更自主"的花活,成了不稳的源头。稳,常常来自你没去发明新东西。
所以,如果你也想用好一群 AI,我猜真正稀缺的不是"懂最新的框架",那玩意儿每个月都在变。稀缺的是另外两样:会不会管理,以及懂不懂怎么用不可靠的零件搭出可靠的系统。一个好的管理者,加上一个见过世面的工程师,其实早就握着大半张答卷了。
往前看一眼
也别把上面这些当成定论。给三个 2026 年还在动的坐标:
单 AI 还是多 AI 的天平,正明确偏向谨慎、窄用、控成本,单 AI 优先,多 AI 只在有明确结构时才上。"上下文"成了今年的主角,怎么给 AI 喂得不多不少,正从手艺变成有方法、有工具的工程学科。"可持久化执行"在收敛成标配,让 AI 任务能崩溃恢复、断点续跑,正从各家自研走向通用基础设施。
但不管这些怎么变,这一路撞过的墙,本质都指向同一个古老的问题:怎么用一堆不可靠的零件,搭出一个可靠的系统。这个问题比 AI 老得多,答案大概也会比这一代 AI 活得久。
参考与延伸阅读
链接与日期以 2026 年 6 月核查为准。标注"预印本"或"未独立核实"的来源,正式引用前请自行打开核对。
框架与基础
- • Anthropic《Building Effective AI Agents》(Erik Schluntz、Barry Zhang,2024-12-19)https://www.anthropic.com/research/building-effective-agents
- • 《12-Factor Agents》(Dexter "Dex" Horthy / HumanLayer,2025)https://github.com/humanlayer/12-factor-agents
多 AI 协作之争
- • Cognition《Don't Build Multi-Agents》(Walden Yan,2025-06-12)https://cognition.com/blog/dont-build-multi-agents
- • Cognition《Multi-Agents: What's Actually Working》(Walden Yan,2026-04-22,作者本人"翻案")https://cognition.com/blog/multi-agents-working
- • Anthropic《How we built our multi-agent research system》(2025-06-13,"约 15x token" 出处)https://www.anthropic.com/engineering/multi-agent-research-system
- • Tran & Kiela(Stanford),等思考-token 预算下单 AI 追平或超越多 AI,arXiv:2604.02460(2026-04,预印本,未同行评审)
上下文工程
- • Andrej Karpathy 对 "context engineering" 的经典定义(2025-06,发于 X/Twitter)
- • Anthropic《Effective context engineering for AI agents》(2025-09,anthropic.com/engineering)
- • Drew Breunig《How Long Contexts Fail》(2025-06,长上下文失效模式分类,未独立核实)
- • Chroma Research "context rot" 技术报告(2025-07,未独立核实)
可持久化执行与故障恢复
- • Durable execution 生态:Temporal、DBOS、LangGraph、Restate 等,各家官网均有面向 AI agent 的持久化执行定位
- • Anthropic《Harness design for long-running application development》(2026-03-24)https://www.anthropic.com/engineering/harness-design-long-running-apps
概念溯源
- • 黑板模式(Blackboard pattern):源自 1970 年代卡内基梅隆 Hearsay-II 语音识别系统,是架构概念而非单篇文献。本文把"黑板 / 账本中心 / 无状态 worker"合并叙述属作者归纳,非行业公认的统一术语。
被拆解的系统
- • Paperclip,开源 AI 编排平台,本文全部"真实印证"的来源。https://github.com/paperclipai/paperclip

夜雨聆风