乐于分享
好东西不私藏

当 AI 自己写代码:Anthropic 的 80% 时刻意味着什么

当 AI 自己写代码:Anthropic 的 80% 时刻意味着什么
当 AI 自己写代码:Anthropic 的 80% 时刻意味着什么
AI 深度观察    

当 AI 自己写代码:
Anthropic 的 80% 时刻意味着什么

2026年6月,全球最前沿的AI公司发布了一份让整个技术圈沉默的报告
从手动编码到 AI 自治:四年进化2021-2023手动编码时代2023-2025Chatbot 助手2025-2026Coding Agent今天自主 AgentAI 可完成任务时长:每 4 个月翻倍4分钟 → 90分钟 → 12小时 → 16小时+(2024.3 → 2025.3 → 2026.3 → 2026.6)

2026 年 6 月 4 日,Anthropic Institute 发布了一份题为《When AI builds itself》的报告。报告披露了一个让整个技术圈沉默的数字:2026 年 5 月,Anthropic 生产代码库中超过 80% 的合并代码是由 Claude 生成的。

这不是某个实验室的 demo 项目。这是全球最前沿的 AI 公司——Anthropic 自己的生产环境数据。他们的产品 Claude、Claude Code、支撑数百万用户的基础设施,其底层代码超过八成由 AI 自己编写。

在同一份报告中,他们公布了一个更惊人的趋势:每名工程师每季度的代码产出量,相较 2021-2025 年的基线提升了 8 倍。

递归自我改进——AI 自主建造更强大 AI 的过程——已经不再是一个未来学概念。它正在 Anthropic 内部真实发生。
📅 四年,从零到 80%

2021-2023:手动编码时代。工程师在本地编辑器里写代码和文档,AI 几乎不参与生产代码的编写。2023 年底,Claude 贡献的代码占比还是个位数。

2023-2025:Chatbot 助手时代。开发者用早期模型生成短代码片段,然后手动复制粘贴。AI 像是一个更聪明的 Stack Overflow,但仍然是"建议者"而非"执行者"。

2025-2026:Coding Agent 时代。Claude Code 于 2025 年 2 月发布研究预览。Agent 开始自己写代码、编辑文件。这是第一个转折点——每工程师的代码输出量开始爬升。

今天:自主 Agent 时代。模型能够自主运行代码,将数小时的工作委托给专门的子 Agent。2026 年第二个转折点到来,产出曲线再次陡峭上扬。

METR(一个衡量 AI 能力的独立机构)的数据佐证了这一趋势:AI 能够可靠完成的任务时长正在以每 4 个月翻倍的速度增长,比此前的 7 个月翻倍周期大幅加速。

2024 年 3 月,Claude Opus 3 能完成约 4 分钟的人类任务;2025 年 3 月,Sonnet 3.7 能完成 90 分钟的任务;2026 年 3 月,Opus 4.6 能完成 12 小时的任务。而 Claude Mythos Preview 已经能够持续工作至少 16 小时。

如果这个趋势持续,2026 年内 AI 就能完成需要数天的任务。到 2027 年,以周计的任务也可能进入 AI 的能力范围。

🔬 80% 背后的三个关键发现
发现一:代码质量已经追上人类

Anthropic 内部数据显示:2025 年底 AI 代码质量仍低于人类,2026 年中已大致持平,预计年内将严格超越人类。

更为关键的是,Claude 在解决"开放性问题"(无清晰规格说明的问题)上的成功率从 26% 跃升至 76%,6 个月提升了 50 个百分点。一个真实案例:某次训练任务大规模崩溃,Claude 在约两小时内定位并修复了一个晦涩的调试标志位——正常需要两到三天。

发现二:研究能力正在超车

Anthropic 有一个内部基准测试:给 Claude 一段训练小型 AI 模型的代码,要求它在保持正确性的前提下尽可能提速。2025 年 5 月,Opus 4 实现约 3 倍加速;2026 年 4 月,Mythos Preview 实现约 52 倍加速。而一名熟练人类研究员需要 4-8 小时才能实现约 4 倍加速。

发现三:研究品味——AI 开始学会判断"该做什么"

Anthropic 分析了真实 Claude Code 会话中研究人员做出错误决策的时间点,然后让不同版本的 Claude 来回答"如果当时是你,你会怎么做?"。结果:Opus 4.5(2025.11)比人类更好的选择占 51%;Mythos Preview(2026.4)占 64%。

"研究品味可能只是另一种 AI 能力——在一段时间内表现不佳,然后突然就擅长了。"

AI 代码质量 vs 人类代码质量20242025 H12025 H22026 H1预计人类AI持平— 预计 2026 年内 AI 代码质量将超越人类 —
🌑 暗面:被 AI 重塑的工作与人

80% 的代码由 AI 生成,听起来很美好。但当它真正发生,你会发现一些令人不安的副作用。

瓶颈转移:代码审查成为新地狱

Amdahl 定律说,系统的整体速度提升受限于最慢的组件。当代码生成速度暴增 8 倍后,人类代码审查立刻成为瓶颈。Anthropic 的应对是部署自动化的 Claude Code Review——回顾分析表明,它能捕捉到大约三分之一曾经导致生产事故的 bug。

协作的消失:"Claude 吃掉了人情债"

"工作(和生活)曾经建立在人与人之间的小恩小惠经济上。'能帮我跑一下这个脚本吗?'——每一次请求都创造了一点人情债,一点相互了解。Claude 更快,零债务,但每一次求助都是一次失去的人类协作机会。"

GitHub 的数据佐证了这种变化:2025 年全年约 10 亿次提交;到 2026 年中,每周已达 2.75 亿次。

存在的焦虑

"大约一年前我开始全力使用 Claude。到现在我已经有大约 5 个月没有亲自写过一行代码了。"

"在一切顺利的日子里,我忍不住想,我做的事什么都不重要。但在那些崩溃的日子里,我意识到我已经不知道自己到底在干什么了。"

这是 AI 时代的"意义危机"。当你的核心技能被完全自动化,你如何定义自己的价值?

🔄 递归自我改进:三种未来

Anthropic 的报告提出了三种可能的未来情景——这是整份报告中最有深度的部分。

情景一:趋势停滞(Anthropic 认为不太可能)

即使 AI 能力冻结在今天,改变依然在发生:Project Glasswing 在头几周内就在全球关键系统中发现超过 10,000 个高危漏洞。100 人的公司可以做 1000 人的事。

情景二:复合效率提升(最可能)

AI 帮助人类更快地工作,但方向设定仍由人完成。但效率提升只会把瓶颈推到下一环节——新想法和新工具的数量爆炸式增长,远远超出跟进能力。识别和修复瓶颈的能力,可能成为组织最重要的技能。

情景三:完全递归自我改进(风险最高)

AI 系统自主设计并构建继任者。人类角色缩减为监督和验证。不对齐行为可能在逐代建造中被放大,直到我们失去控制。

Dario Amodei 借此发出呼吁:需要全球协调机制来让前沿开发者能够自愿减速或暂停。但他也承认这极其困难——训练运行比导弹发射井更容易隐藏。

AI 递归自我改进:三种未来情景情景一趋势停滞100人=1000人但不现实情景二复合效率提升100人=10000人最可能情景三完全递归AI 建造 AI风险最高核心问题:对齐偏差会在逐代递归中被放大全球协调机制缺失,训练比导弹更容易隐藏
💡 对每一个开发者的启示

以下几个趋势,每一个开发者都需要认真对待。

         代码质量正在成为商品:当 AI 写的代码达到人类水平时,"能写代码"本身会迅速贬值。
         架构眼光和审查能力是新的护城河:从"写代码"到"告诉 AI 写什么并审查"。
         AI 不会淘汰程序员,但会淘汰停留在"写代码"层面的程序员        
         人机协作的软技能将被重新定价:能提出好问题、能判断方向的人,比 AI 驱动的代码生成器更稀缺。
80% 不是终点,只是一个里程碑。它还意味着剩下 20% 也在这个趋势的射程之内。

作为一个几年前还在北京大厂写代码的人,我亲眼看着 AI 从一个"玩具"变成了"队友",再变成了"主力"。这段历史正在以指数级的速度展开。我们的职业、我们的组织、甚至我们对"智能"的定义,都在被重新书写。

如果你是一个开发者,从现在开始,最值得投资的不是更好的代码能力,而是更好的判断力。

因为代码 AI 会替你写。但方向,仍然需要你来定。

— 一个从北京回到西安、从大厂回归生活的程序员