最近我开始思考未来的组织会是什么样子?
先看一组AI相关组织的数字。
做 AI 生图的 Midjourney,大概 40 个人,一年收入 3 亿多美金。做编程工具的 Cursor,两百多人,一年收入 20 亿美金。DeepSeek 更是不到 200 人,就冲进了全球模型的第一梯队。
而很多传统软件公司,上千人,收入和利润,却不一定比得上它们。
同样在做产品,为什么组织结构可以差这么多?
人数,到底还决定什么?
关于这篇文章,它不是研究报告,是我试着从第一性原理推出来的想法,加上对现有公司的一些观察,拼起来的一套思考。它不一定对,也不完整,很多地方我自己还在反复。写出来,是想跟同样好奇这件事的人,聊一聊。
一、组织为什么会长成金字塔
要推未来,得先问一个最根本的问题,组织为什么会存在?
经济学的答案是,因为「自己人一起干」,比「什么都临时找人干」更便宜。内部协调的成本,低于市场交易的成本。这个判断,1937 年就有人给出了。
那组织为什么长成金字塔,一层压一层?
因为人的信息带宽有限。一个人最多能有效带 7±2 个人,再多,就传不动话了。所以需要一层一层的经理,往上汇总信息,往下分发指令。
其实层级就是一套「信息传话系统 + 决策过滤系统」。中层干三件事,传话,协调,监督。
二、AI 把三个约束同时拆掉了
AI 厉害的地方在于,它把金字塔赖以存在的三个约束,同时拆掉了。
执行成本趋近于零。写代码、写报告、做分析,多干一份活的边际成本几乎为零。
信息带宽趋近于无穷。检索、压缩、传递,AI 比人快几个数量级,不需要一层层传话。
协调成本趋近于零。AI 和 AI 可以直接协作,不需要人肉开会。
当这三样都归零,组织里还剩什么不可替代?
我的答案是,判断。
什么是值得做的,什么算成功,风险边界划在哪。这三件事没有标准答案,AI 干不了,必须人来定。
于是组织设计的核心问题,从「谁来做」,变成了「什么需要人来判断」。
打个比方。传统组织像一支靠传令兵层层传达命令的军队,传令兵跑不快,所以要设军师旅团营。AI 时代像一支全员实时通话、每人配了自动武器的军队,传令兵和基层调度员失业了,但「这场仗该不该打、目标是什么、打输了怎么办」的决策者,反而更重要了。
三、一把尺子,怎么知道 AI 干对了
说到判断,就绕不开一个词,可验证性。
一句话解释,AI 干完活,你怎么知道它干对了?
把它想成批卷子就懂了。AI 是答题的学生。
选择题,有标准答案,机器一秒批完,那就放心让 AI 自己干,这叫「AI 全自主」。
作文,要人逐字看,有评分标准但见仁见智,那就让 AI 写,人改,人把关,这叫「人在环」。
「这篇作文到底值多少分」,连老师都会吵架,那就只能人拍板,这叫「人判断主导」。
所以组织里的活,可以按这把尺子切成三层。能自动验证的,交给 AI 全自主。验证不了的,AI 干一段就必须停下来,等人在关键节点拍板。再往上,连验证标准都说不清的,只能人来主导。
这里有个容易踩的坑。
很多人说,先拆 AI 能做的,剩下的给人。但「AI 能不能做」是个伪命题,边界天天在变,「能做」也不等于「该做」。真正该问的只有一句,做完了,能不能验证对错。能验证的放 AI,不能验证的留人。
顺序反了会很难受。按「AI 挑剩下的才给人」,剩下的就是一堆边角料活,人成了 AI 的监工,价值感低,留不住人。
正确顺序是,人做最高价值的判断,AI 做其余所有。
四、组织设计的最小单位,从岗位到工作包
顺着这把尺子往下推,组织设计的最小单位也得变。
传统做法是,业务流,拆职能,设岗位,按岗位找人。隐藏前提是,事必须由人来做。
新做法是,业务流,切成「工作包」,每个包打三个标签,能不能验证、错了代价多大、人的判断在这里增不增值,然后分层归类,绑定责任。
什么是工作包?有明确产出、能验收对错的最小工作单元。「写完这份报告」「筛完这批简历」「发布这个版本」,都是工作包。组织设计,变成了「工作包 × 执行主体 × 验证机制」的矩阵。
拿大家都很熟的猎头公司举个例子。
猎头从头到尾的业务流长这样,需求对接,职位分析,寻访,筛简历,初次触达,深度沟通,面试评估,推荐报告,安排面试,谈 Offer,入职跟进,保证期维护。
把这条链切成 12 个工作包,结果挺有意思。正好三分之一可以交给 AI 全自主,寻访、触达、安排面试、入职跟进,都是能验证的机械活。三分之一 AI 干、人把关,职位分析、筛简历、推荐报告、保证期。剩下三分之一只能人主导,需求对接、深度沟通、面试评估、谈 Offer,全是靠判断的活。
组织也随之变了。传统一个团队是「1 个顾问 + 2-3 个寻访员 + 1 个助理」,AI 原生变成「1 个顾问 + 6 个数字员工」。产能放大约 5 倍,顾问做判断的时间,从 30% 变成 80%。
那责任呢?
我坚持一个看法,AI 承接不了责任。它没有利益可损失,惩罚也改变不了它的行为。责任只能落在人身上。
但责任可以前置。AI 干的活出了错,先别怪 AI,问问「验收标准是谁定的」,标准没兜住,就是定标准的人的责任。
组织里最怕的不是 AI 犯错,是「AI 做的,没人负责」的无人区。一个责任只能有一个归属,写进工作包定义,留痕可查。这三条,未来比任何制度都重要。
五、组织沉淀,把经验变成组织的记忆
工作包再往下推一层,还有一个更深的东西,组织沉淀。
传统组织里,know-how 长在人脑子里,人走知识就走。组织永远在「教会新人,人走,再教新人」的循环里漏血。
AI 时代,组织第一次可以把做事的方法,流程、规则、验收标准,写成文档、写成配置,变成不依赖任何个人的「集体记忆」。知识从「人身上的流动资产」,变成「组织的固定资产」。
但这有个反人性的难题,人凭什么把自己吃饭的本事交出来?
传统是「教会徒弟饿死师傅」,AI 时代变成「沉淀完自己,自己就成了可替代品」。所以组织沉淀不是技术问题,是激励设计问题,谁沉淀的知识被复用,谁就该获得回报。
而且要注意,能写成文档的,只是知识的一部分。写不出来的那部分,默会的经验、信任关系、利益格局、此刻正在发生什么,才是人最后的护城河。
AI 拿到的是静态知识,文档里写的。人持有的是动态状态,正在发生的。
未来真正稀缺的人,不是能干的人,而是能承载这些背景信息、并把它喂给系统的人。
六、已经跑出来的活体实验
如果这只是我拍脑袋的推演,那不值得写。
但这两年里,已经有一批公司,几乎是在替我验证这些推演。
Cursor,两百多人做到 20 亿美元收入。没有项目经理、没有审批层、没有 KPI。每个工程师从想法到发布一人包到底,AI 写代码,人做判断和验收。最反直觉的是,他们面试明确禁止用 AI。因为工具可租,判断不可租,招人测的是不靠 AI 的裸判断力。
Anthropic,2500 人,CEO 只有 1 个直属下属。不靠 KPI 和审批,靠一本 36 页的创始人手册把「文化」写下来。他们还做过一个实验,让 AI 真的去经营三家小店,补货、定价、客服,结果发现最有效的干预不是换更强的模型,而是给 AI 强制套上流程和审批。官方原话,「bureaucracy matters」,流程有意义。
DeepSeek,不到 200 人,没有二把手,不打卡不考核。创始人说,「只要我能保持团队稳定,就一定能做成 AGI」。
学术圈也在跟进。Karpathy 有个命题,「AI 自动化的是你能验证的事,不是你能描述的事」,跟上面那把尺子是同一个意思。麦肯锡提出用「工作图」替代「组织图」,传统组织图回答「谁向谁汇报」,工作图回答「怎么达成目标」,目标自动拆成任务,AI 做能做的,人做要判断的。
七、管理的最后一站,护判断
把这些串起来,我最想说的是最后一句,管理的最后一站,是护判断。
回头看四次工业革命,管理焦点一直在迁移。蒸汽时代管纪律,电力时代管动作,泰勒用秒表拆解工人的动作。IT 时代管流程,KPI 追过程。到 AI 时代,前面几样全被机器接管,管理只剩下最后一件事,护住判断的质量。
什么值得做,什么算成功,风险边界在哪。这些判断不能被稀释,不能出错,更不能被 AI 的错误十倍速放大。
管理动作也变了。不再是盯人、催进度,而是设定自主边界,AI 能自己干到什么程度、哪里必须停下。定义验收标准。监控质量漂移。设计紧急停机的开关。
一句话,你管理的是流程,不是人头。
八、但也别只看到乐观的一面
最后泼几盆冷水,也是我自己还没想通的。
第一,层级不会整体消失。层级同时干两件事,传话,这个 AI 能替。分权,谁拍板、谁担责、利益怎么分,这个 AI 替不了。所以更准确的说法是,传话的功能被 AI 吸收,分权的功能被压缩到更窄的判断层。但能压缩到多窄,没人知道。
第二,护判断的代价,可能是丧失判断力。这是我最警惕的悖论,如果所有能验证的事都交给 AI,人失去了练习判断的机会,判断力本身会退化。就像飞行员依赖自动驾驶太久,会丧失手动飞行的能力。护判断不只是把判断留住,还要让判断有练习的土壤。
第三,效率不会自动爆发。电力革命早期,工厂只换马达不重新布局,效率不升反降。等「单元驱动 + 流水线 + 科学管理」三者同时到位,才爆发。AI 现在很可能正处于「只换机不换布局」的低谷,不是 AI 不行,是组织的配套改革还没到。有个数据,整条流程全交给 AI 的公司,效率反而下降 18%,用 AI 辅助人的,效率提升 24%。
第四,扁平化有物理极限。人的注意力有限,几百人的「无组织」能撑,上千人大概率不行。人少可以靠默契,人多必须靠结构。
结尾
写到这里,我的好奇心一点没消,反而更大了。
回到开头那个问题,人数到底还决定什么?
我的答案是,人数不决定产能了,决定的是判断。一个人能承载多少高质量判断,一群人加起来有多少判断密度,才是组织真正的规模。
顺着这个推下去,责任跟着判断走,判断跟着工作包走,工作包跟着可验证性走。组织会从「一张固定的组织图」,变成「一组不断重排的工作包」。
但这套推演有很多漏洞,我自己也知道。可验证性会不会被模型快速抹平?「判断」到底能不能拆得更细?管理者的新技能树长什么样?
这些都是开放的问题。
如果你也在想这件事,欢迎来聊。我特别想听不同的看法,尤其是那些能推翻我这套推演的看法。
夜雨聆风