
一、为什么你觉得没变:最常用的那把尺子钝了

二、AI 编码的强项:它真的在替你干活
场景 | 典型案例 | 效率提升 | 关键特征 |
|---|---|---|---|
重复性迁移 | 跨语言迁移、框架升级、ETL 重构 | 数月→数周 | 规则明确、验证成本低 |
独立修 bug | Claude Code 定位生产 bug | 比人更快 | 单文件、测试可验 |
长程自主执行 | /goal 命令自主跑数小时 | 人走它干 | 目标可量化 |
从零搭原型 | 后端微服务一周→两天 | 2.5 倍 | AI 写 60% 代码 |
三、AI 编码的短板:它不知道自己不知道
失败模式 | 根本原因 | 真实案例 | 下一跳入口 |
|---|---|---|---|
跨模块感知缺失 | 上下文不够 | 1000 万行 Java ERP 卡 9 个月 | 上下文基础设施 |
业务逻辑误解 | 缺验收标准 | 满 40 打九折→单品打折 | 精确验收标准 |
静默失败 | 错误被吞掉 | 占位符 key 返回默认摘要 | agent 说"我不知道" |
生产环境信任 | 权限无边界 | 9 秒删生产库(2026-04) | 权限边界+人类审批 |
四、什么才叫质变

时期 | 工作单元 | 你做什么 | 瓶颈 |
|---|---|---|---|
2018-2022 | 击键/片段 | 你写函数,AI 补全 | 写代码 |
2022-2024 | 函数/模块 | 你写规格,AI 写实现 | 把需求写清楚 |
2025 至今 | 任务/PR | 你写意图,它规划+执行+修 bug | 写意图 + 审 diff |
五、割裂感为什么是必然的

关于本节数据:本节截图与排名数据于 2026-08-09 自 Artificial Analysis 公开页拉取。Artificial Analysis 榜单为独立第三方评测,收录节奏与厂商自有榜相互独立;benchlm.ai 的 SWE-bench Verified 榜因数据源偏 Anthropic、且截至 2026-08-06 仍未收录 Kimi K3 / GLM-5.2 / DeepSeek V4-Flash-0731 等 7 月底新模型,本文不采用。三个月前同期数据可在 archive.org 抓取对照。
原始链接:Artificial Analysis Coding Agent Index | Terminal-Bench v2.1 独立榜

六、下一跳长什么样

尾声
参考资料
SWE-bench no longer measures frontier coding capabilities - Hacker News
The Archaeology Problem: Why AI Coding Agents Fail on Legacy Codebases - Driver.ai
AI Agents Gone Wrong: Real-World Failures - ODSC
How Coding Agents Fail Their Users (arXiv 2605.29442)
Long-running Agents - Addy Osmani
SWE-bench Pro Leaderboard - Morph
Terminal-Bench v2.1 Leaderboard - Artificial Analysis
SWE-Atlas-QnA - Technical Q&A, 124 tasks, by Scale AI
Terminal-Bench v2 - Agentic terminal use, 89 tasks, by Laude Institute
DeepSWE - Software engineering tasks, 113 tasks, by Datacurve
Artificial Analysis Coding Agent Index v1.3 - 独立第三方评测
Codified Context: Infrastructure for AI Agents in a Complex Codebase (arXiv 2602.20478)
SWE-bench Pro (Public Dataset) - Scale Labs 官方榜
DeepSeek-V4-Flash-0731 模型卡 - Hugging Face
夜雨聆风