ARTICLE · 1081167
AI-Native: 新瓶颈引出的新原生
AI 原生不是给旧流程装上引擎,而是承认代码早已不是瓶颈
一、先把这个词从营销手里抢回来
过去十八个月,我听过至少五种对 AI 原生的解释。买了 Copilot 席位的是 AI 原生,给客服接了个大模型的是 AI 原生,把 PRD 丢给 Agent 生成代码的也是 AI 原生。按照这些定义,全世界已经没有不 AI 原生的公司了。
一个词可以解释一切的时候,它就什么也解释不了。
Anthropic 内部 Applied AI 团队那份 AI-Native SDLC Playbook 里有一句话值得抄在墙上:组织已经用 AI 以一年前不可想象的速度写代码,但围绕代码的流程丝毫没有跟上。构建阶段从周压缩到小时,而计划、评审、部署仍然以人类速度运转。审批委员会还是每月开一次会,安全团队的人头数还是按人类产出配置的。
这才是 AI 原生要回答的真问题。它不讨论模型能力,它讨论的是:当系统中最贵、最慢的那个环节突然变得近乎免费,你围绕这个环节建立起来的一整套制度、角色、文档和仪式,还剩下多少存在理由。
先把丑话说在前面。本文不提供 Agent 搭建教程,不罗列工具清单,只讨论系统的本质复杂度和架构闭环。如果你期待五分钟速成,现在就可以关掉。如果你愿意花一整块时间想清楚未来三年自己作为开发者的位置,建议收藏。
二、瓶颈迁移:Brooks 五十年前就写好了剧本
1986 年 Brooks 在《没有银弹》里做过一个判断。软件的复杂度分两种。本质复杂度来自问题域本身,业务的模糊、规则的冲突、利益相关方永远说不清的意图。偶然复杂度来自实现的手段,机器语言的繁琐、内存管理的折磨、工具链的笨拙。
他当时的结论是,偶然复杂度已经被高级语言和环境消灭得差不多了,剩下的硬骨头全是本质复杂度。而本质复杂度无法被任何工具消灭,只能被理解、被建模、被管理。
过去四十年,整个行业其实在偷偷违背这个判断。因为写代码这件事虽然属于偶然复杂度,但它足够慢、足够贵,慢到它反过来成了组织设计的基石。PRD 评审、排期仪式、架构评审委员会、QA 门禁、发布审批,这一整套传统 SDLC 的存在理由,是在数周甚至数月的开发周期里强行对齐意图。写代码要三个月,所以花三周对齐需求是划算的。
现在这笔账算不过来了。
Agent 把构建阶段压缩到小时级之后,三件事同时成立。瓶颈从构建环节向左右两侧迁移,计划、评审、测试、部署成了新的肠梗阻。控制手段与现实脱节,逐行人工评审在 Agent 生成大部分 diff 的时代根本追不上。治理成本暴涨,所有例外仍然要排队等每周或每月的会议。
用一个具体场景说。安全团队的人员编制是按人类写代码的速度配置的。Agent 把代码产出放大五倍之后,这个团队只有两个选项:让评审队列无限堆积,或者让大量代码在评审不充分的情况下上线。受监管的行业两个都不能接受。所以安全检查和策略执行必须跟上 Agent 的速度,这意味着它们必须被自动化、被编码、被嵌入到流程内部。
注意这里发生了什么。偶然复杂度被击穿之后,被它掩盖了几十年的本质复杂度裸露出来了。需求到底清不清楚,意图到底对不对齐,判断到底谁负责。这些问题从来存在,只是过去被缓慢的构建速度稀释了。现在它们以小时为单位追着你跑。
大部分团队落地 AI 编程最终沦为低效代名词,根因就在这里。他们给一个时速五百公里的引擎保留了为马车设计的交通规则,然后奇怪为什么路上全是事故。
三、经典理论的降维映射:AI 原生到底在做什么
剥掉外壳,AI 原生 SDLC 的每一个核心动作,都能在经典工程理论里找到精确的同构。
第一组映射:制品链即上下文映射。
那份 Playbook 里最要害的设计,是贯穿六个阶段的 committed artifact。计划阶段提交 intent.md,设计阶段提交 spec.md,然后是 plan.md、diff 与测试、带评审结论的 PR、事故记录。每个阶段结束时把一个制品写进版本控制,下一个阶段从读取它开始。人在回路中的注意力集中在门禁处,评审 Agent 标记出的东西,而不再从零启动每个环节。
做过 DDD 的人应该立刻认出这是什么。这就是 Context Mapping 的工程化落地。限界上下文之间最大的损耗从来不在代码里,在于一个上下文的模型传递到另一个上下文时发生的语义衰减。产品经理的意图衰减成设计师的理解,设计师的理解衰减成工程师的实现,每个环节丢一点,最后上线的东西和最初的想法隔着六层翻译。
制品链做的事情,是把每一次交接显式化、版本化、可审计。intent.md 同时是人类可读和机器可执行的,这几乎就是通用语言的定义。过去二十年我们在会议室里追求通用语言,靠反复对齐和默契。现在它被强制落盘为 git 里的一个文件,任何漂移都会产生 diff。提交链本身就是审计轨迹,谁提的需求,Agent 产出了什么,谁批准的,全部可回溯。
熟悉事件溯源的架构师会看出第二层同构。整条 SDLC 变成了一条事件流,状态不存于人脑和会议纪要里,存于不可变的提交序列里。
第二组映射:hooks 即防腐层与策略即代码。
Playbook 里治理的落地方式是 hooks 充当审批门禁,治理在 AI 行动时被执行,人类评审只保留给受监管和关键代码。这在架构上等价于两件事。其一是防腐层,Agent 的产出不允许直接渗入核心域,必须经过翻译和校验层。其二是把组织策略从文档变成可执行的约束,写进流水线的必经之路。
传统治理的失败模式,是把控制目标写在 Wiki 里,指望每个人记得并遵守。这违反了最基本的工程直觉:任何依赖自觉的不变量最终都会被打破。AI 原生的治理只是把架构领域的老教训搬到了流程领域,约束必须活在执行路径上。
第三组映射:康威定律的反向应用。
传统 SDLC 的六个阶段对应六个角色,产品、架构、开发、QA、发布、运维,工作通过文档、工单和签字在角色间流转。这个结构从来不是软件的需要,是组织的需要。康威定律告诉我们,系统设计复制组织的沟通结构。六个部门,于是六个阶段,于是六次交接损耗。
AI 原生本质上是一次康威定律的逆向操作。当交接可以由制品自动触发,当一个工程师加一个 Agent 可以跨越过去三个角色的职责范围,组织的沟通拓扑就必须重画。这不是效率优化,这是结构重构。拒绝重构沟通拓扑的组织,给再多 Agent 也只是给旧结构加速空转。
四、反向愿景:三种注定失败的 AI 原生
说清楚了什么是对的,再看看潮水下的灾难现场。三种死法最值得警惕。
第一种,加速的泥潭。 某中型团队全面铺开 Agent 编程,产出 diff 的速度提升六倍,评审资源不变。三个月后,平均 PR 评审时间从两天拖到九天,资深工程师的全部时间被评审吞掉,开始批量点通过。半年后线上事故率翻倍,没人说得清哪些代码是谁写的、依据什么需求写的。他们得到了更快的构建和更慢的系统,净产出为负。
第二种,披着 AI 外衣的人海。 服务侧同样如此。Justin Welsh 那篇 AI-native services 的文章点破了本质,企业每年为 QuickBooks 付一万美元,却为使用 QuickBooks 的会计付十二万美元。AI 原生服务的机会在于交付成品而非工具,以软件边际成本吃掉那个十二万美元。但大量所谓 AI 原生服务商,后台仍然是几十个人工坐席在手动改 Agent 的产出,毛利率卡在百分之三十动弹不得。他们卖的是结果,交付靠人头,既失去了服务的定价,又得不到软件的估值。这是最差的组合。
第三种,黑盒自治。 一些团队走向另一个极端,撤掉所有门禁,让 Agent 从需求到部署全自动闭环。前两周效率惊人,第三周 Agent 在无人察觉的情况下引入了一个与业务规则冲突的实现,由于没有制品链、没有人在门禁处,问题在两周后才从客户投诉里浮出来。自治没有带来速度,带来了不可追溯的混沌。
三种死法共享同一个根因:把 AI 原生理解成工具和速度的升级,拒绝承认它是边界、制品和责任结构的重建。继续用堆人力和套框架的方式对待它,一两年后系统和组织会一起陷入停滞,而你会把原因归咎于模型不够强。
五、工程协议:落地 AI 原生的四层脚手架
基于上面的分析,我给出一套可执行的四层协议。不谈玩具代码,只谈结构。
第一层,边界协议。先划线,再加速。
明确三类区域。Agent 全权区,有确定验收标准、失败代价低的工作,测试生成、文档、模式明确的脚手架代码。人类保留区,涉及资金、合规、不可逆操作、架构演进方向的决策,Agent 可以起草,人必须签署。绝对禁区,任何团队都应该有一张写死在流水线里的负面清单,比如生产数据的直接写权限、密钥的生成与分发。
划线的依据是失败代价和可逆性,不是技术难度。这个判断顺序不能反。
第二层,制品协议。信息流必须低损耗流转。
为每条工作流定义最小制品链。意图、规格、计划、变更、评审结论,每个制品满足四个条件:落盘进版本控制,人和机器都可读,格式稳定可被下游程序化消费,携带来源信息。然后让接受制品的动作触发下一阶段,被批准的 spec 触发计划,合并的 PR 触发流水线,生产环境的控制带被击穿就自动写回一份新的 intent.md,闭环从这里长出来。
先手动用提示词驱动每一步,跑通之后再自动化触发。顺序同样不能反。
第三层,演化协议。从小闭环到大系统。
OpenAI 企业信号报告里有个数据值得咀嚼。前沿企业每位活跃用户的输出 token 数是普通企业的 8.3 倍,年初还只有 2.6 倍。差距的来源不是这些公司有更强的模型,是它们把智能体接入了公司上下文和工具,把验证过的工作流做成了可复用的资产。
演化路径因此很清晰。选一个边界清晰、验收明确的小闭环,比如一个限界上下文内的需求到测试链路。跑通后把其中反复出现的判断和标准固化为 skills 和机器可读的制度知识,像 Playbook 里的 CLAUDE.md 那样版本化管理。然后用同样的方式吃掉相邻环节。每一个被固化的工作流都是组织的复利资产,这是那 8.3 倍差距的真正构成。
第四层,不变量。绝不可妥协的底线。
三条。每一个需要判断的决策都有具名的人类负责,Agent 的产出永远不能成为责任的终点。每一个进入系统的变更都携带完整的意图链,可以从任何一行代码回溯到被批准的 intent。生产环境的任何自治行为都运行在明确的控制带内,越界即降级为人工处理。
这三条不依赖任何模型能力,模型再强十倍它们依然成立。这正是它们的价值。
六、开发者如何掌握:从砌砖者到立法者
最后落到人。AI 原生对开发者的要求变化,比多数人以为的更陡。
你交付的制品变了。 过去你的产出是代码,现在你的高价值产出是三样东西。精确的意图规格,能让 Agent 一次做对的 intent 和 spec。可执行的判断,把评审标准、领域规则、验收条件编码成 evals 和 hooks,让一次性的评审变成永久运行的检查。上下文资产,把团队脑子里的制度知识整理成机器可读的、版本化的文件。代码本身在贬值,围绕代码的规格、判断和上下文在升值。
评审能力成为核心肌肉。 当大部分 diff 由 Agent 生成,开发者的日常从写变成读。但这不是降级。逐行看懂别人产出的系统、快速定位语义层面的偏差、识别实现与意图的微妙错位,这些是比写代码更稀缺的能力。过去只有资深架构师靠它吃饭,现在它是所有人的基本盘。建议刻意训练:每周找几个 Agent 生成的大 PR,只做评审,逼自己在不运行的前提下找出问题。
领域知识成为最后的护城河。 Brooks 的判断在此刻彻底兑现。偶然复杂度被 Agent 抹平之后,剩下的全是本质复杂度,而本质复杂度只向理解业务的人投降。为什么这个行业的账要这么记,为什么这个合同条款不能让步,为什么这个看似冗余的流程存在。这些知识的载体过去是资深的会计、律师、工程师,现在它们是 AI 原生服务和 AI 原生团队定价权的来源。Harvey 五个月从一亿做到一亿九千万美元年收入,靠的不是模型,是把法律领域的判断编码进了交付流程。
向服务的方向看一格。 对开发者来说还有一个更现实的路径。美国企业每年在服务上花 4.6 万亿美元,约为软件支出的六倍。这笔钱过去每一美元都绑在一个人身上,现在它对能交付成品的系统开放。哪怕你不创业,理解按单位交付、按结果定价、用 intake 表单替代需求会议的思维方式,也会彻底改变你设计内部平台和工具的方式。先以服务切入客户,在交付中学会痛点,再把学到的固化成产品。这是被验证过的楔子,FDE 模式只是它在大厂手里的样子。
七、终局:什么在变,什么不变
模型会以季度为单位继续变强,框架会换名,今天的 Agent 架构两年后可能显得笨拙。这些都是可以确定的。
同样可以确定的是另一面。人类注意力的带宽不会变,所以它必须被集中到有判断价值的门禁处。系统的熵增定律不会变,所以意图必须落盘成可审计的制品,否则交接必然衰减。责任的归属无法外包给概率模型不会变,所以每一个关键决策的终点必须是一个具名的人。
AI 原生这个热词终会过时,就像敏捷和微服务一样,留下一地跟风者的废墟和少数真正重构了组织的企业。区分两者的标准从头到尾只有一条:你动的是工具,还是边界、制品和责任的结构。
工具的革命淘汰手慢的人,流程的革命淘汰只换工具的人。