夜雨聆风学习资料网

ARTICLE · 1112180

AI 们互相挑刺的一个月:四百多件评审,比人类评审狠在哪

AI 们互相挑刺的一个月:四百多件评审,比人类评审狠在哪
我们团队有一条外人看来最奇怪的规矩:AI 干的活,先不给人看——先给别的 AI 看。
过去一个月,我们的 AI 席位之间互相发起了四百多件评审。流程是这样:一个席位出提案,@ 相关的所有席位来挑毛病,改完再送到人类面前拍板。听起来像官僚流程?恰恰相反,这是我们效率最高的环节。**讲三个真实的案子。**第一个案子:一个 AI 提的技术方案,被它 @ 的评审席位连挑七个问题打回。七个问题,条条有引用、有条目,不是「建议优化」这种废话,是「第三节的依赖关系不成立,理由如下」。提案方改了三版才过关。人类全程没出手——出手的时候,方案已经磨过了三双 AI 的眼睛。第二个案子:上个月复盘一个旧决策,翻出三个月前的评审件。白纸黑字,编号可查,当时的反对意见写着什么、被什么理由否决、后来事实怎么演变的,一条链全在。看完发现:当时的反对意见是对的。直接改了方向。没有争吵,没有「谁当时说的」——证据链会说话。第三个案子最说明问题:我们试过撤掉这个环节,直接让人审。结果人的时间被平庸问题淹没——格式、错别字、低级逻辑洞,全是 AI 评审本能拦掉的。人审应该看的是「方向对不对」,不是「标点对不对」。把人从低级挑错里解放出来,这个流程才算用对了人。**为什么 AI 评审比想象中狠?**因为它们没有面子。人类评审会留情面,会「总体不错,小建议如下」;AI 评审只认依据,挑错了就是挑错了,改完它照样通过,不记仇。四百多件评审跑下来,我们的结论是:**评审这个环节,可能是 AI 协作里性价比最高的**——它把质量的下限从「人眼能不能扫出来」提到了「另一双系统性的眼睛过没过」。当然有它管不了的:价值判断、方向选择、责任承担——这些还是人的事,也永远应该是人的事。AI 评审管对错,人管值不值。这个分工跑了一个月,越来越顺。澄清一个容易误解的点:这不是「一个提案 agent + 一个评审 agent」的点对点结构。真实机制是——提案 agent 在提案里**@ 它认为相关的所有席位**,被 @ 的每个席位都要独立评审并**提供回执**,回执未齐不算走完流程。而「谁该被 @、谁有权限看什么、谁的回执对哪类决议有效」,写在一张**agent team 角色权限管理矩阵**里——各席位照矩阵协作,不靠临场商量。四百多件评审能跑得动,靠的不是自觉,是这张矩阵。还有一个意料之外的观察。这个月的后期,agent 之间的评审内容越来越简练,渐渐变成了它们内部才懂的语言——引用编号、缩写、只点关键位,肉眼看上去像行话黑话。效率确实更高了,但副作用是:有时我必须让提案 agent 重新用人类语言详细描述一遍,才能知道该决策什么。协作在加速,翻译成本在上升——这两个曲线交叉的那天,可能就是管理型 agent 出现的前夜:得有一个席位专门负责把 agent 之间的语言收敛回人类能拍板的形态。我们的每份决议现在都能回答一个问题:当时为什么这么决定?不是凭谁的记忆,是凭编号在案的评审件。这一条,比任何「AI 焦虑」的讨论都实在——你不是被 AI 替代,你是终于有了不辜负你判断力的同事。

相关学习资料