一位资深工程师,第一次碰到 Rust;另一边,是一位从没写过 Python、却能把月末结算规则和所有边缘情况说得清清楚楚的会计师。
谁才是“专家”?
过去,答案似乎毫无悬念。现在,答案可能完全反过来。
2026年6月16日,Anthropic公布了一份堪称“程序员价值重估报告”的研究:约40万次Claude Code会话、23.5万名用户、横跨7个月。
最刺眼的数字只有两个:
软件相关职业,验证成功率约34%;其他职业,约29%。
只差5个百分点。
但更猛烈的冲击还在后面:真正能把成功率拉开一倍的,关键可能在于,
你到底懂不懂自己正在解决的问题。

▲ Anthropic于2026年6月16日发布报告,分析约40万次Claude Code交互会话
5个百分点,撬开了“只有程序员才能做软件”的旧门槛
先看这里的成功标准,它相当严。
Anthropic定义的“验证成功”,要求Claude完成任务,并至少具备一项硬证据:例如测试通过、产生匹配任务的Git提交或PR,或者用户明确确认结果正确。
约7.7%没有清晰目标的会话,甚至被直接排除。
在那些确实修改了代码的会话中,软件相关职业的验证成功率约为34%,其他职业约为29%;如果放宽到“至少部分成功”,两边都达到约88%,89%。
更反常的是,在样本最大的十个职业组里,所有职业与软件工程组的差距,都没有超过7个百分点。管理类职业甚至略高于软件相关职业。

▲ 在会修改代码的会话中,各主要职业组的成功率远比想象中接近
社交媒体很快把它压缩成一句爆款口号:“编程已经不重要了。”
但这恰恰是误读。
报告真正说的是:“软件工程师”这个身份标签,对单次编程会话能否成功的解释力正在变弱;与此同时,任务特定的领域专长,仍然极其重要。
知识并未贬值,它的价格体系正在重排。
人类决定“造什么”,Claude包办“怎么造”
把镜头推进一次典型会话。
用户承担约70%的规划决策:目标是什么、选哪条路、什么才算完成。
Claude则承担约80%的执行决策:改哪些文件、写什么代码、运行哪些命令、怎样测试。
一场典型会话只有约4轮来回,但用户每发出一条指令,Claude平均会执行约10次动作,有时超过100次,并产生约2400词的输出。

▲ 人类更多控制“做什么”,Claude更多控制“怎么做”
这更像一个小型施工现场。
人类是产品负责人、架构判断者和质检员;AI则是速度惊人的执行团队。
于是,新的分水岭出现了。
新手每条指令平均只能撬动Claude约5次动作、600词输出;专家却能撬动约12次动作、3200词输出。
同一台机器、同一个模型,为什么差距如此巨大?
因为专家很少只说“帮我做一下”。他知道该指出什么约束、要求什么校验,也能在Claude走错路时迅速喊停。
专家交给AI一张高密度的认知地图,其中包含目标、约束和校验线索。
真正可怕的差距,出现在红灯亮起之后
在最严格的验证成功口径下,新手成功率约为15%,中级及以上则达到约28%,33%。
几乎翻倍。
如果只看“至少部分成功”,差距也从新手的约77%,升至中级及以上的91%,92%。

▲ 成功率的大部分增益集中在“新手到中级”阶段;再往顶尖专家提升,增幅变小
但真正惊险的一幕,发生在系统报错之后。
当会话出现测试失败、反复重试等麻烦时,新手最终验证成功的比例只有约4%,专家则升至约15%。
更扎眼的是“放弃率”:新手约19%,中级及以上只有约5%,7%。
也就是说,AI顺风运行时,人人都像高手;一旦红字刷屏、测试崩溃、结果似是而非,谁真的懂业务,立刻原形毕露。
好消息是,你不需要成为全球前1%的大神。报告显示,绝大部分收益来自新手跃迁到扎实的中级水平。从中级继续走向专家,曲线反而变缓。
门槛已经从“熟背语法”,迁移到了拆解问题、定义标准与发现错误。
代码还在,但钱已经流向了别处
Claude Code的工作范围,早已超出“写代码”。
约56%的会话直接围绕新建、修复、测试或编排代码;**17%用于运维和操作软件;14%用于规划与理解系统;另有13%**产出数据分析、文档或演示等非代码成果。
七个月里,任务结构发生了明显位移:
修复类会话从约33%降至19% 运维从约14%升至21% 写作与数据分析合计从约10%升至20% 参照自由职业市场报价估算,平均任务价值上升约27%

▲ 修复任务减少,运维、分析与写作增加;任务价值估算同步上升
这里的美元价值只是粗略代理指标,不等于真实收入。但方向已经非常清楚:AI正在从“帮你补一段代码”,进入部署、运营、分析和交付。
与此同时,非软件职业中,管理、销售和法律相关用户增长最快。
软件生产正从技术部门向外扩散,像电子表格一样渗进每一个行业的日常工作。
管理者为何可能跑到工程师前面?
管理类职业略高的结果,尤其耐人寻味。
一种解释是,优秀管理者本来就擅长拆目标、定边界、分任务、做验收。这些能力,恰好也是指挥智能体的核心能力。
另一种解释则更朴素:存在测量偏差。验证成功部分依赖会话中的明确确认,而经理可能更习惯说:“对,这就是我要的。”
因此,这个结果不能被读成“经理比工程师更会写代码”。职业也是模型根据项目背景和词汇推断的,并非用户填写的真实职位。
但它依然释放出一个强烈信号:
当“亲手实现”越来越便宜,“准确表达目标并判断结果”就会越来越贵。
先别急着给程序员办葬礼
必须泼一盆冷水。
29%和34%的验证成功率都不高。多数会话仍未达到最严格的成功标准。
研究的观察单位仅限会话,无法覆盖完整项目。它无法知道代码后来是否上线或被删除,更无法证明一场成功对话能扩展到大型系统、安全关键软件或复杂算法工程。
第三方IDE插件和无头自动化模式也被排除;职业、专长与结果主要由模型从对话中分类,仍可能存在误差。
这份报告把焦点放在一件更深刻的事上:语法正在从稀缺资产变成可外包的执行层,但判断仍然无法外包。
未来最值钱的人,也许是能回答四个问题的人:
该造什么?为什么要造?什么才算做完?出错时,错在哪里?
AI降低了执行成本,判断成本依旧高昂。
甚至恰恰相反,当一条指令就能调动十几步行动、数千词输出时,一个错误判断,也会被机器以惊人的速度放大。
键盘的门槛正在塌下去。
但在它后面,一座更高、更陡的门槛已经升起:真正理解一个领域,并让机器在复杂现实里做对事情。
资料来源:Anthropic|Agentic coding and persistent returns to expertise
夜雨聆风