乐于分享
好东西不私藏

AI编程进入多Agent时代:你的代码能力正在贬值,但有一种能力在暴涨

AI编程进入多Agent时代:你的代码能力正在贬值,但有一种能力在暴涨
OpenAI 在 Codex 更新日志里写了一行小字:8 月 31 日后,GPT-5.4 停用,强制迁到 GPT-5.6。
强硬淘汰,没有商量。但真正值得你注意的不是模型换代,而是换代之后发生的事——Codex 不再是一个"帮你写代码的 AI",它变成了一台能同时调度多个 Agent 并行干活的"AI 工程团队"。
六个月前,开发者用 AI 的姿势是:复制报错→贴进去→等 AI 写函数→人审核。一对一结对编程,人来主导。
现在 GPT-5.6 的姿势是:打开 Codex,输入"把这个支付模块改成异步处理",然后去开会。两小时后回来,AI 改了七个文件,跑了测试套件,修了三个失败的测试,在 GitHub 上给你开好了 PR。
从"我指挥它"到"它组队干",这个变化发生在六个月内。

代码能力贬值了

GPT-5.6 把模型分成了三层:**Sol** 负责复杂架构决策,**Terra** 处理日常编码和审查,**Luna** 搞定分类、摘要、格式化。Ultra 模式下默认并行启动 4 个 Agent,协同推进复杂任务。Coding Agent Index 评分直接干到 80 分,SOTA。
写代码这件事,AI 已经在速度和稳定性上超过你了——至少 CRUD 层面是这样。
就业市场给出了更冷的数字。
智联招聘 2026 年一季度报告:普通后端开发、前端开发岗位需求同比下降 **52%**。美国劳工统计局数据:过去两年,被定义为"专门执行编码任务"的 programmer 岗位数量下降了超过 **25%**。翰德《2026 人才趋势报告》:传统软件开发需求下降约 25%,但 AI 应用开发需求增长 60% 以上。
简历通过率更残酷。工作 1-3 年的纯编码初级程序员,简历通过率从 2023 年的 25% 跌到 2026 年的 7%。脉脉数据显示,要求 3 年以上工作经验的岗位占比已超七成,面向应届生的岗位缩减约 20%。
中级程序员成了最尴尬的"三明治层"——他们靠"能写标准化功能"立足,而这个能力恰好跟 AI 高度重叠。企业算了笔账:一个中级工程师的薪资,够买多少个 Token 让 AI 去写代码?答案让人不舒服。
但硬币的另一面:系统架构师需求激增 120%,AI Agent 开发工程师需求增长 215%,AI 相关岗位平均月薪突破 6 万。同资历下,掌握大模型 + Agent 开发能力的工程师,薪资比传统开发高 30%-45%。
"会写代码"从核心竞争力变成了基础门槛。 码农在贬值,能指挥 AI 团队干活的工程师在涨价。这是 2026 年编程世界最清晰的信号。

Agent 正在自动造 Agent

更"恐怖"的事在上周发生了。
LlamaFactory 作者郑耀威开源了 PenguinHarness——一个让 Agent 自动构建、评测、迭代 Agent 的工具。开源地址已经在 GitHub 上。它做的事很简单:你对它说"做一个 RAG 应用,流式返回,带引用",它自己生成脚手架、写提示词、装依赖、搭前端,把完整能跑的 Agent 应用交给你。
成本:0.2 元 Token,一杯咖啡的时间。
对比 OpenAI Codex 做同样的事,PenguinHarness 不仅更快、更便宜,产出的质量也更好——有流式输出、有来源引用,而不是 Codex 那种中英混杂的半成品。
但 PenguinHarness 真正吓人的不是"便宜",是它内置了自进化能力。
它有一个叫 GDPevo 的评估基准,覆盖医疗、金融、法律六大场景。自进化流程就是:出题→评测→定位失分→修改 Agent→再评测→接受或回退。团队实测,用 DeepSeek V4 Flash,一个 Agent 从 53 分优化到了 95 分,全程花费 0.5 元 Token。
什么意思?过去你搭好一个 Agent,你要手动调优——改提示词、调整工具链、反复测试,这活可能干几周。现在 PenguinHarness 让这个流程自动化了。Agent 自己帮你优化 Agent。
团队还公布了两个生产案例:某体检机构用它做报告核查,一份原来 30 分钟的报告现在几十秒完成;某制造企业用 PenguinHarness 构建的多个 Agent 做产线巡检,停机时间减少 **65%**,产出提升近 2 倍。
如果说 GPT-5.6 让你不再需要亲自写代码,那 PenguinHarness 让你不再需要亲自调 Agent。层级递进,每一层都在吃掉上一层的人类工作。

多 Agent 不是越多越好——Nature 论文拆解真相

说完冲击,得说一句实话:多 Agent 不是万能药。
7 月 24 日,《Nature Machine Intelligence》发了一篇重磅研究,覆盖 260 种配置、六类基准、五种架构、三家模型系列。结论很直接:Agent 不是越多越好。
在可拆分的金融任务中,多 Agent 相对单 Agent 最高提升 80.8%。但在顺序依赖很强的 Plan Craft 规划任务中,最高**下降 70%**。在 SWE-bench Verified(软件工程基准测试)上,四类多 Agent 架构全部出现 1.3% 到 12.8% 的下降。
关键变量不是"任务有多复杂",而是**任务能不能被有效拆分,协调成本会不会吃掉协作收益。** 每增加一个 Agent,就要准备上下文、调用模型、传递结果、汇总结论。Anthropic 的内部数据是:单 Agent 的 Token 消耗约为聊天模式的 4 倍,多 Agent 系统约为 15 倍。
这个结论非常重要。因为它说明:**驾驭 AI 团队需要判断力,不是莽。** 知道什么时候让 Sol 上、什么时候放 Terra 批量跑、什么时候根本不应该组队——这种"路由判断力",才是真正稀缺的新能力。
还有一个刻意的降温数据:AI 生成的代码整体缺陷率比人类高 1.7 倍,安全漏洞高 2.7 倍。45% 的开发者表示,调试 AI 代码比手写花的时间更长。中山大学和阿里的联合研究发现,在长期代码维护场景中,大多数大模型可能"越改越糟"——而长期维护占软件生命周期成本的 60%-80%。
所以不是"AI 替代了程序员",而是"程序员跟 AI 的关系被重新定义了"。

一种能力在暴涨

回到题目:什么能力在暴涨?一句话——**从"写代码的人"变成"设计系统、指挥 AI 的人"。**
这不是从士兵变成将军的鸡汤比喻,这是已经发生的事。
Google Cloud AI 总监 Addy Osmani 年初写了一篇万字长文《软件工程的未来两年》,结论是:当 AI 负责了常规的 80% 代码,人类需要专注那最难的 20%——系统架构、棘手集成、创造性设计、机器搞不定的极端情况。AI 的普及非但没有让深度知识过时,反而让它变得前所未有地重要。
清华大学聂再清说得更直白:系统如何架构、目标如何设计,目前仍是"人类思想的自留地"。
具体来说,2026 年最值钱的那几个能力:
**需求拆解能力**——能把模糊的业务目标拆成 AI 能独立执行的子任务
**Agent 路由判断力**——知道什么时候单 Agent、什么时候多 Agent、什么时候根本不该用 Agent
**代码审查和系统把控**——AI 写得快但会有坑,你得看得懂、审得了、兜得住
**行业纵深**——只会编程不行了,但"懂某行业 + 会用 AI 编程"的人极度稀缺
如果你现在还在把时间花在"手写函数"和"记忆 API",你正在跟一台越来越便宜的机器竞赛,而这场竞赛没有赢的可能。
如果你开始把时间花在"这个系统该怎么拆""这几个 Agent 怎么配合""这个业务问题用什么架构",你在做一件机器短期内做不了的事。
差距拉开的不是编程速度,是思维方式。
行动建议:今天打开 Codex 或 Cursor,不用它写一个函数。而是给你正在做的项目下一个完整的任务——让它自己改代码、跑测试、修错误。你只做三件事:审结果、做决策、改方向。体验一下从"操作者"变成"指挥者"的感觉。这一次练习,比你写一周代码更有价值。