摘要:2026 年 ,Anthropic 发布了一份有意思的研究:在一个小规模实验中,使用 AI 编程的开发者理解测试得分比手工组低 17%。这个发现让我想到了认知科学里的一个经典理论,也引发了我对行业走向的一些思考。
各位朋友,我是谢先生,技术观察者。
🧠 一切的起点:一个 18 年前的心理学实验
2008 年,UCLA 的心理学家 Robert Bjork 做了一个看似简单的实验。
两组学生学单词:
A 组:反复阅读单词表 B 组:读完后立刻测试,强迫自己回忆
从"学习体验"看,A 组轻松愉快,B 组痛苦焦虑——他们得绞尽脑汁回想刚才看过的词。
一周后测试,结果让所有人意外:B 组的成绩是 A 组的 2.5 倍。
Bjork 给这个现象起了个名字:必要难度 (Desirable Difficulty)。
核心结论:学习的效率和学习的效果是负相关的。
让你学得轻松的方式(反复阅读、划重点),长期记忆效果最差。让你学得痛苦的方式(测试、检索、犯错),长期记忆效果最好。
这不是鸡汤,这是认知科学的铁律。

18 年后,Anthropic 用 AI 程序员重演了这个实验。
结果几乎一模一样。
📊 Anthropic 的实验:一个让 AI 公司"唱衰自己"的研究
2026 年 1 月,Anthropic 发布了一篇论文,标题直白:
"How AI assistance impacts the formation of coding skills"
他们做了一个小规模的随机对照试验(52 人):

核心数据:
17% 的差距,统计学显著(p=0.01)。
不过要说明:样本量不大,结论不能说板上钉钉,但方向值得注意。
一个卖 AI 编程工具的公司,做了一个可能对自己不利的实验。
这需要多大的勇气?或者说,这背后藏着多大的算盘?
🔬 实验设计的精妙之处
Anthropic 的研究团队做了一件非常聪明的事:他们不只看结果,还录下了所有参与者的屏幕。
逐帧分析。看他们怎么用 AI。
这让我想起那句话:数据不会说谎,但数据不会告诉你全部真相。 真相藏在"怎么用"里。
他们发现了什么?
🎭 四种"作弊器"模式:低分者的自画像
先说明一下:这部分是研究者对参与者屏幕录像的定性分析,样本更小(每组只有几个人),结论是"启发性的",不是严谨的统计结果。但我觉得观察很有意思,值得分享。
低分的人(平均分 <40%),不是"不会用 AI",而是"用错了姿势"。
模式一:AI 代写派
直接把需求扔给 AI,复制粘贴答案。

他们完成任务最快,错误最少。但测验时,他们连自己写的代码都看不懂。本质是把 AI 当外包。
模式二:渐进依赖派
开始还自己写,写着写着卡住了,问一次 AI,又卡住了,再问一次……, 最后干脆让 AI 写完。本质是外包了"坚持"。跳过了"痛苦地调试"这个过程。
模式三:迭代调试派
自己写代码,但遇到 bug 就把报错贴给 AI。AI 帮他们改好了,他们改完继续跑,再报错再贴……,本质是外包了"诊断"。跳过了"理解错误"这个过程。
这三种人有什么共同点?
他们都跳过了"痛苦的思考过程"。
而恰恰是那个过程——写代码时的卡顿、报错时的慌张、逐行排查时的烦躁——塑造了真正的技能。

💡 谢先生的思考:
这让我想起 Bjork 的"必要难度"理论。
AI 不是在帮你学习,AI 是在帮你跳过学习。
效率提升的代价,可能是技能形成的缺失。短期爽,长期亏。
🎓 三种"教练"模式:高分派的秘密
那么,那些用了 AI 却依然学得很好的人,到底做对了什么?
模式一:生成-理解派
先让 AI 生成代码,然后追问:
"为什么要这样写?" "这个参数什么意思?" "有没有更好的写法?"
他们不快,但测验得分很高。本质是把 AI 当教科书,而不是答案卡。
模式二:混合解释派
每次让 AI 写代码时,都要求"边写边解释"。他们读解释的时间比写代码还长,但这些解释让他们真正理解了代码背后的逻辑。本质是把 AI 当导师,而不是打字机。
模式三:概念提问派——最优解
这群人只问概念性问题:
"异步编程和线程有什么区别?" "这个报错是什么意思?什么情况下会出现?" "为什么要用这种写法而不是另一种?"
他们不让 AI 写代码。他们用 AI 理解概念,然后自己写。
结果是:
完成速度:全组第二快(仅次于 AI 代写派) 测验得分:全组最高

💡 谢先生的思考:
这三种高分模式有个共同点:把 AI 当陪练,而不是替身。
他们用 AI 跳过的是"查文档"的时间,但没有跳过"写代码"的过程。
效率可以来自"跳过",也可以来自"加速"。前者是偷懒,后者是杠杆。
🔍 最可怕的发现:调试能力正在退化
Anthropic 的实验数据里有一个细节,被很多人忽略了。两组差距最大的题型是什么?不是"写出这段代码"——是"找出这段代码的 bug"。

这意味着什么?当 AI 帮你写完代码,它也帮你跳过了:
看到红色报错时的慌张 逐行检查时的无聊 找到问题那一刻的"啊哈!"
调试能力是人类在 AI 时代最后的护城河。
为什么?
因为 AI 生成的代码可能有错。只有能调试的人,才能发现并修正。
当 90% 的代码由 AI 生成,谁能发现那 10% 的错误?
💡 谢先生的思考:
调试能力不只是"找 bug"。它是你理解一个系统如何运作的唯一方式。
一个系统为什么跑通了?为什么跑不通?为什么跑着跑着就炸了?
这些问题的答案,不在代码里,而在你调试代码的过程中。
调试是"系统思维"的训练场。而系统思维,是程序员区别于"代码打字员"的分水岭。
📜 历史没有新鲜事:每次工具革命都在"阉割"技能
把时间尺度拉长,你会发现:这种焦虑两千年前就有了。

| 调试能力 | "代码能跑,但我不知道为什么" |
苏格拉底在《斐多篇》里批评书写技术:
"书写会让人们变懒,他们不再训练记忆,因为他们可以随时查阅。"
2000 年后,我们还在争论同样的问题。
🤔 但这次不太一样
计算器阉割了心算,但你仍然需要理解"为什么要这样算"。GPS 阉割了导航,但你仍然需要理解"我在哪里、我要去哪里"。搜索引擎阉割了记忆,但你仍然需要理解"这个答案对不对"。
但 AI 编程阉割的,是"理解系统如何运作"的唯一途径。
代码不只是"记住",它是"理解复杂系统"的训练场。
当这个训练场被 AI 接管,我们失去的不只是调试能力,而是整个"系统思维"的养成路径。
💡 谢先生的思考:
以前的工具革命,替代的是"执行层"的技能。
计算器替代计算,GPS 替代导航,搜索引擎替代记忆。
但 AI 编程不同——它替代的是"理解层"的技能。
这才是为什么这次不一样。
📈 能力熵增:一个行业的隐形危机
把 Anthropic 的实验放大到整个行业,会发生什么?我用"能力熵增"这个概念来描述:

短期(1-2 年):效率暴涨。
初级程序员用 AI 生产力翻倍,公司少招人,成本下降。股价上涨,KPI 达成。
中期(3-5 年):技术债务堆积。
AI 生成的代码越来越多,但能理解这些代码的人越来越少。Bug 出现时,没人能解释"为什么"。
长期(5-10 年):能力熵增临界点。
技能从人类流向工具,系统复杂度却在指数增长。最终,整个系统到达一个临界点——
没人能解释它为什么工作,也没人能解释它为什么不工作。
💡 谢先生的思考:
熵增定律:在一个封闭系统中,无序度(熵)总是增加的。要逆转熵增,必须从外部输入能量(努力)。
AI 编程让"写代码"这件事变得有序(高质量产出),但让"理解代码"这件事变得无序(技能退化)。
短期看是效率,长期看是熵增。
当系统的复杂度超过人类理解能力的临界点,系统就会进入"不可维护"状态。这不是危言耸听,这是软件工程的基本常识。
🏗️ 基建的黄昏:别在收费站门口练长跑
就在我写这篇稿子的 2026 年 4 月,OpenAI 把 GPT-5.3-Codex 的系统卡片甩到了大家脸上,微软也把那个所谓的 Azure AI Agent Service 给 GA(商用)了。
很多人在欢呼,但我看到的只有基建税。
大厂正在把路修死。以前你引以为傲的那点"业务逻辑实现能力",在现在的云端基建面前,不过就是一行配置、一个 API 的事。如果你还觉得"手熟"是程序员的护城河,那只能说你对"降维打击"一无所知。
大厂的战略很直白:把编码变成像电力一样的廉价设施,然后按照你消耗的 Token 来收税。
当你发现你花十年磨练的架构,被大厂一个预设的 Agent 模板瞬间秒杀时,你才会意识到:基建越完美,"代码搬运工"的死期就越近。
更扎心的是今日 Arxiv 上那篇论文 (2604.02460)。它直接扯下了"多智能体协作"的遮羞布:研究发现,单体模型的推理能力已经强到可以无视所谓的团队协作。这意味着,平庸的连接毫无意义。
真相是:Token 的噪音再多,也填不平灵魂的贫瘠。 我们不需要一个由平庸 Agent 组成的"委员会",我们需要一个足够强的单体模型,以及一个比模型更强的、拥有终极审美的"人类监工"。
💡 谢先生的思考:
大厂正在修高速公路,并在每一个出口架设收费站。如果你还想靠"走路"(写那点手熟的逻辑)去挣钱,那你只会被碾碎。
在被流水线接管的时代,拒绝当螺丝钉,去当那个设计路网的人。
如果你不能在代码炸裂时,一眼看穿基建背后的逻辑暗门,那你唯一的价值就是给大厂贡献 Token。
基建的黄昏,正是"监工时代"的黎明。
⚠️ 谁是真正的受害者?
大众观点:AI 编程工具会消灭低级程序员。
我的观点:AI 编程工具真正威胁的是中级程序员。

为什么?
低级程序员:本来就不会写,AI 帮他们"升级"了。他们从"写不出来"变成"能写出来",这是净收益。
高级程序员:把 AI 当工具,核心能力(架构、调试、系统思维)不受影响。他们知道什么时候该用 AI,什么时候不该用。
但中级程序员——他们赖以生存的是"能写能改"。
现在"写"被 AI 接管了,"改"(调试)又因为缺乏练习在退化。
他们正处于能力的拐点:比上不足,比下有余。但 AI 正在把这个"有余"吃掉。
💡 谢先生的思考:
中级程序员是整个行业的中坚力量。他们能独立完成任务,但还没有形成"不可替代"的专业壁垒。
AI 对他们来说,既是效率工具,也是能力陷阱。
用得好,他们能快速晋升为高级;用不好,他们会被"降级"为 AI 操作员。
这个群体面临的,是一场静悄悄的"能力淘汰赛"。
🛠️ 一个判断标准:你用的是"外骨骼"还是"轮椅"?
下次你用 AI 写完代码,问自己一个问题:
"如果 AI 不在,我能解释这段代码为什么能跑吗?"
如果能,你在用外骨骼锻炼肌肉。如果不能,你的肌肉正在萎缩。

AI 不是代驾,是外骨骼。
外骨骼能帮你举起 500 公斤。但如果有一天它没电了,你连 50 公斤都举不起来——因为你的肌肉已经萎缩了。
📋 给个人的行动清单
第一层:改变提问习惯
核心原则:问"为什么",而不是"怎么做"。
第二层:每天手写一段代码
哪怕只是 10 行。哪怕只是重复 AI 写过的东西。
肌肉记忆是 AI 抄不走的。
第三层:刻意练习调试
找一个你用 AI 写的代码,故意破坏它,然后自己修。
看看你能多快找到问题。如果不能,说明你还没真正理解。

🏢 给企业的警示
如果你的团队正在大规模使用 AI 编程工具,请思考以下问题:
问题一:谁来维护 AI 写的代码?
AI 能写代码,但 AI 不能维护代码。当 AI 生成的代码需要修改时,你的团队里有多少人能理解并修改它?
问题二:你的初级工程师还在成长吗?
初级工程师的成长路径是什么?是从写简单代码开始,逐步积累调试经验,最终形成系统思维。如果 AI 接管了"写简单代码"这个环节,初级工程师的成长路径就被切断了。三年后,你的初级工程师还是初级工程师。
问题三:你的技术债务在增长还是在减少?
AI 生成的代码,天生带着"技术债务"的属性——因为没人真正理解它。当这些代码积累到一定量级,你的系统就进入了"不可维护"状态。
🎯 结语:效率是短期红利,能力是长期资产
Bjork 的必要难度理论告诉我们:学得轻松,忘得快;学得痛苦,记得牢。
Anthropic 的实验告诉我们:用 AI 代写,学得少;用 AI 理解,学得多。
历史告诉我们:每次工具革命都在阉割技能,但这次不一样——AI 阉割的是"理解层"的技能。
能力熵增告诉我们:短期效率,长期债务。系统的复杂度终将超过人类理解能力。
当你用 AI 越来越顺手的时候,停下来想一想:
你是在积累资产,还是在透支未来?
参考资料
- Anthropic Research
: How AI assistance impacts the formation of coding skills (2026-01-29) - Paper
: arXiv:2601.20245 - Cognitive Science
: Bjork, R. A., & Bjork, E. L. (2008). "The New Science of Learning"
作者:谢先生,用 AI 放大品位,而非替代思考。
觉得分析有道理?点个「在看」,转发给需要看到这篇文章的朋友。
关注公众号,我们在 AI 的最前线等你。
夜雨聆风