ARTICLE · 1114627
AI 与 AI 的交互,才是完成复杂任务的关键
AI 与 AI 的交互,才是完成复杂任务的关键
引子:2026 年的项目组长什么样?
数十万年以来,人类与人类的合作构成了人类社会的全部连接,引领着人类从动物走向智人,但到了现在这个关键节点,AI 的加入改变了这一切,先看一幅图:

2026 年 10 月,一个真实的项目组是这样的:一个组里坐着 5 个人,每个人都开着自己的 Harness 工具,有的是 Codex,有的是 WorkBuddy,有的是 Claude Code,这些后台都跑着一堆独立的 AI 智能体,各自在查资料、写代码、整数据,还有的在给别的 AI 分配任务,它们之间在互相调用、传递任务、校验结果。也就是说,今天真正发生的事,不是“人类和人类对话”,也不是“人和 AI 对话”,而是一群人和一群 AI,交织成了一张网。所以我们面对的问题,已经不是“AI 能不能答对问题、能不能完成任务”,而是:这张网里,谁在和谁交互?以什么方式交互?这篇文章要讲的,就是人类与 AI 的交互关系。而它最终的结论,可能有点反直觉:
完成复杂任务的关键,最后会落在 AI 与 AI 的交互上。
一、“人类 + AI 助理”是人类进化的里程碑
小学历史课里就讲过,人类区别于其他动物的关键能力,是使用工具。因此人类的历史,说到底就是一部“使用工具”的历史:纸和笔,是记忆的工具;书籍,是知识的工具;搜索引擎,是检索的工具;手机,是连接的工具。工具每进化一步,人类就变强一截。但有一点始终没变:这些工具都是被动的。 你让笔写什么,它就写什么;你问搜索引擎一句话,它答一句,答完就结束,绝不会追问你一句:“你确定你想问的是这个吗?” 而 AI 是第一个“会主动完成任务”的工具。
“人类 + AI 助理”这件事带来的意义,无论怎样强调都不过分。我与 AI 对话时,经常会说“请认真地评判我的需求,当我有错误时要严肃指出”。有一次我描述完需求,它写完之后附了一句:“这里没有处理异常情况,输入为空时会报错,需要我补上吗?” AI 会反问你,会替你想下一步,会在你的方案有问题时直接指出来,这不是一个工具的行为,这是一个同事的行为。所以我认为 WorkBuddy 的名字取得很好,它就是一个工作助手。严格来说,我们现在不是“在用 AI”,而是在和一个助理共事。因此,当每个人都挂上一个 AI 助理时,“人”这个单位就变了。一个带着 AI 的人,和一个不带 AI 的人,产出可能差十倍,但他们看起来还是同一个人:一样的学历,一样的工位,一样的作息。所以我们正在看到的,是一种新的分层:
不是“聪明人”和“普通人”的差距,而是“人 + AI”和“裸人”的差距。
而这个差距,不是靠学习或者加班就能追上的。因为 AI 在执行任务上的能力,比裸人要强上千百倍,且随着科技的进步还在不断扩大。
二、人类和 AI 的三种交互模式
让我们回到最前面那张图:一个项目组有 5 个人,每个人都带着自己的 AI 助理(Harness 工具),助理背后又挂着一串独立的智能体:查资料的、写代码的、整数据的,还有专门给别的 AI 派活的。把这张图数一数,里面的“主体”其实有两类:
• 一是带 AI 的人,是 N 个(图里是 5 个); • 二是独立运行的智能体,是 M 个(图里是 15 个,但 M 随任务增减,需要多少就开多少)。所以今天真实的协作单元,既不是“N 个人”,也不是“1 个人 + 1 个 AI”,而是: N 个(人类 + AI 助理)× M 个独立智能体。
人和 AI 从“一对一”变成了“一群对一群”。这个变化带来的后果是:交互的种类,从一种变成了三种。
第一种:人-人(H-H)
这是最古老的交互,自人类诞生以来我们就熟悉它,也正是这种交互把人类连接起来,最终站上了食物链的顶端。它的特点很鲜明:慢、贵,而且有立场。 开一次会要提前一天约定,聊一小时能传递的信息有限,中间还夹着情绪、立场、面子和潜台词。但 H-H 有两样东西,是另外两种给不了的:情感和责任。 一句“这事我负责”,只有在人身上才成立。
第二种:人-AI(H-A)
这就是我们当下的主流用法:我提需求,它执行;它反问,我确认;它出错,我纠正。这种模式很清楚:**人发起,AI 陪跑;人握着方向盘,AI 踩着油门。**这种交互方式比 H-H 快一个数量级,但有个隐藏的天花板:带宽卡在人这一侧。 不管 AI 多快,我读它的输出、想清楚下一步、再敲字回去,这几步加起来,就是整条流水线的瓶颈。现在很多人使用 AI 时,只是一个劲地点击“同意”和“下一步”,那么这种交互就失去了意义,退化为 AI 和 AI 的交互了。
第三种:AI-AI(A-A)
这是本文的主角,也是最少被人单独提起的一种。但其实它早就存在了:一个智能体把任务拆开,派给另外几个;几个并行做完,互相校验结果;校验不过,打回去重做。它快、便宜、不知疲倦。但它同样缺两样东西:意义和责任。 它不知道为什么要做这件事,也没人能指着它的鼻子说“你负责”。这三种交互是同时发生、层层嵌套的。一个复杂任务跑起来,大概是这个顺序里的一小段:
我和同事开会定目标(H-H)→ 我把目标讲给我的 AI 助理(H-A)→ 助理拆成子任务 1 写代码、子任务 2 做测试、子任务 3 写文档,其中写代码的任务派给它下面的智能体(A-A)→ 我把子任务 2 和 3 派给组里其他同事(H-H)→ 我们的智能体跑完回来汇报(A-A)→ 我的助理把结果整理给我(H-A)→ 我拿结论去找老板拍板(H-H)。
一圈走下来,三种交互全部出现过。所以真正的问题不是“该用哪种”,而是:在一个任务里,哪一段该交给谁?
三、为什么 AI-AI 交互是完成复杂任务的关键
复杂任务有三个特点:子任务多、依赖复杂、需要反复校验。
写一份几十页的行业研究报告,是复杂任务;开发一个中等规模的软件,是复杂任务;办一场跨部门的营销活动,也是复杂任务。它们的共同点是:拆开来有几十上百个步骤,步骤之间有先后依赖,每一步的产出都要被别人检查,检查不过就得回炉重做。而这三条特点,恰好都是 AI 的主场。A-A 交互的三重碾压是:带宽、成本、速度。
第一重,带宽。
人和人之间交换信息的带宽,低得惊人。有研究测算过,人类语言的最大信息传递速率,大约是每秒几十比特。我描述一个 bug,写三行字,要花两分钟;AI 读这三行字,零点一秒。反过来也一样:它返回一段改好的代码,我得看三分钟才能搞清楚它动了哪里;而另一个 AI 读同一段代码,只要一瞬间。**问题不在谁聪明,在接口太窄。**AI 之间进行交互的媒介就不仅仅是自然语言了,它可以是结构化的数据:JSON、向量、代码 diff,也可以是自然语言,甚至可以是 AI 自己发明的语言(这种语言甚至可以是一次性的)。通过 A-A 交互,双方很快就能做到对同一份数据的理解完全一致,没有歧义,也没有“我以为你说的是这个意思”这种语义损耗。
第二重,成本。
H-H 的成本是人时。两个人开一小时会,成本是两份薪水,外加会前等议程、会后补背景的隐性开销。H-A 的成本是人时加机器时,机器的钱可以忽略,但人的那部分省不掉。A-A 的成本,几乎只有电费。更要紧的是扩容方式完全不同:想让 H-H 快一倍?再加一个人,还得先让他和所有人对齐背景,这本身又是一笔 H-H 成本。想让 A-A 快一倍?多开几个实例就行,边际成本接近为零。
第三重,速度。
三种交互“建立连接”的速度,差了整整三个数量级:人找人,发消息、约会议,是小时到天;人找 AI,打字、读结果,是分钟;AI 找 AI,是 API 调用,毫秒。但这里最要命的,不是“快”,而是迭代次数。A-A 把“一天迭代几次”变成了“一秒迭代几次”。而任何复杂任务的质量,本质上都是靠迭代次数堆出来的。把三个维度摆在一起看,如下表所示:
| 无主体 | |||
| 无 |
在这张表里:前五行全部倒向 A-A,后两行 A-A 是零。
但 A-A 不是完美的,它缺两样东西,而且是致命的:
一是没有责任主体。 出了事,你没法让一个智能体负责,也没法开除它。责任必须落回人身上。
二是没有意义锚点。 它不知道“为什么要做这件事”,也不知道“做到什么程度算够好”。目标、边界、优先级、什么叫“好”,这些定义权只能在人手里。
一句话:A-A 能把事做得飞快,但它不知道要往哪飞,也不知道飞歪了谁来负责。所以正确的图景,不是 A-A 取代 H-H,而是分层:
人定义目标与边界 → 人和 AI 对齐 → AI 之间高速执行与互校 → 结果回到人手里验收、拍板、负责。
人退到“定义”和“验收”两端,AI 占据中间的“执行”段。而中间那一段,是最厚、最耗时、最需要反复迭代的一段。A-A 的占比会越来越大,不是因为 AI 越来越像人了,而是因为复杂任务的结构,本来就长成了 AI 之间最擅长协作的样子。
四、这个趋势会把我们带向哪里?
用过网络的人都知道 TCP 的三次握手:两台机器要通信,得先握三次手,很慢也很慎重,可一旦连接建立,数据就在管道里全速跑起来,快的部分根本不需要人管;握手最慢也最短,价值不在速度,而在于它是唯一能给整条链路赋予意义、承担责任的环节。人留在两端,不是因为慢,而是因为只有人能让这件事“值得做”,也只有人能让它“有人负责”:
人退守到“握手层”:定目标、划边界、验结果、担责任;机器占据“传输层”:跑满带宽、自我迭代、互相校验。
冲击一:分层的标准变了
上一章说 A-A 缺责任主体和意义锚点,而这两个缺口恰好就是人站的位置,于是“分层”的标准也跟着变了:过去的差距是天赋,现在的差距是你能不能站在握手层。站上去需要的能力是把问题定义清楚、判断结果好坏、承担后果,而这三样恰好是过去教育体系里最不被考核的,所以一个执行能力极强、却不会定义问题的人,位置会远远不如一个执行能力一般、却极会定义问题的人。
冲击二:职业被挤向两端
哪一部分会被挤出人的回路,一句话就能概括:**凡是能被清楚地描述、能被客观地判分的环节,早晚都会被挤出去。**能被形式化、能被验证的活都在此列。写单元测试、做数据清洗、整理会议纪要、画标准图表、批量翻译都是,因为能被验证就意味着 AI 可以自己迭代到更好,不需要人盯着;反过来,越是说不清、越需要有人承担后果的事,越会留在人手里。
冲击三:注意力被重新分配
过去一天的时间大部分花在“执行”上:写、算、查、改。但未来注意力会重新分配到两头:开头定义问题,结尾验收、拍板、负责,中间那段会突然空出来;这既是解放也是风险,因为空出来的时间不会自动变成绩效,一个人既不会定义问题,也不愿承担后果,就真的没位置了。
五、我们该如何适应
趋势说清楚了,落到每个人身上只剩一个问题:我该做什么?我想了想,是四件事。
1. 从执行者,变成定义者
过去我们最值钱的能力是“能把事做出来”,会写、会算、会做表;可当执行被 AI 接走之后,真正稀缺的变成了“能说清楚要做什么”。这不是把话说得漂亮,而是把一个模糊的念头拆成目标、约束和验收标准:要解决什么问题、边界在哪、什么算完成、什么算好。这件事 AI 替不了你,因为你心里那点没想明白的东西,它也照不出来;反过来,谁能在开头就把问题定义清楚,谁就自然站在了握手层。
2. 学会“编排”
过去是自己干活,未来更多是组织一群 AI 干活:把一个大目标拆成若干可以并行的子任务,派给不同的智能体,设计好它们之间怎么传递结果、怎么互相校验、什么时候把结论送回给人。这件事的关键不在“会用哪个工具”,而在你会不会设计一套 AI 之间的协作协议:分工、接口、验收、兜底。会编排的人,产出不再受自己双手的限制,而是受自己想法的限制。
3. 守住判断、责任和关系
有三样东西是 AI 拿不走的:判断,在所有选项都不完美的时候挑一个,并且承担后果;责任,出了事站出来说“这是我决定的”,这是 A-A 交互永远给不了的;关系,信任、默契、关键时刻愿意拉你一把的人,都是靠一次次共同经历攒下来的,不是靠调用接口。工具越强,这三样越值钱,因为它们是唯一无法外包、也无法被迭代出来的部分。
4. 把 AI 当同事
最后是心态。既不要把 AI 当成神,它不知道要往哪飞,也不为结果负责;也不要把 AI 当成牲口,只让它干最苦最重复的活,那是最浪费的用法。把它当同事:交代清楚背景,讲明白目标,做得好时说一句好,跑偏时给出具体反馈。你怎么对待一个靠谱的同事,就怎么对待它。这不是礼貌问题,而是因为协作的质量,本来就是这样被决定的。
六、结语:回到“人”
我整篇文章都在讲 AI 与 AI 交互的高效:带宽、成本、速度、迭代次数。但决定这件事往哪走的,始终是人。A-A 能把带宽跑满、把迭代压到秒级,可它不知道为什么要做这件事,也不知道出了事该由谁承担,这两个缺口只能由人补上,而且随着 AI 越来越强,它们只会越来越珍贵。
工具越强,需要有人负责、需要有人共情、需要有人拍板的事,就越值钱。
所以,与其焦虑“AI 会不会取代我”,不如换一个问法:在这张越来越密的网里,我还站在多少“只有人才能站的位置”上?那个定义目标的人,那个判断好坏的人,那个在事情搞砸时站出来说“是我决定的”的人。这种变化的趋势不会让人退场,它只是重新排了一次座次。 席位是有的,只是它不在中间那条高速通道上,而在两端。
所以才会说,烧 token 越多、越习惯和 AI 共事的人,越不会被淘汰。