乐于分享
好东西不私藏

AI 正在阉割谁的技能?Anthropic 实验揭示的"能力熵增"

AI 正在阉割谁的技能?Anthropic 实验揭示的"能力熵增"

摘要:2026 年 ,Anthropic 发布了一份有意思的研究:在一个小规模实验中,使用 AI 编程的开发者理解测试得分比手工组低 17%。这个发现让我想到了认知科学里的一个经典理论,也引发了我对行业走向的一些思考。

各位朋友,我是谢先生,技术观察者。

🧠 一切的起点:一个 18 年前的心理学实验

2008 年,UCLA 的心理学家 Robert Bjork 做了一个看似简单的实验。

两组学生学单词:

  • A 组:反复阅读单词表
  • B 组:读完后立刻测试,强迫自己回忆

从"学习体验"看,A 组轻松愉快,B 组痛苦焦虑——他们得绞尽脑汁回想刚才看过的词。

一周后测试,结果让所有人意外:B 组的成绩是 A 组的 2.5 倍

Bjork 给这个现象起了个名字:必要难度 (Desirable Difficulty)

核心结论:学习的效率和学习的效果是负相关的

让你学得轻松的方式(反复阅读、划重点),长期记忆效果最差。让你学得痛苦的方式(测试、检索、犯错),长期记忆效果最好。

这不是鸡汤,这是认知科学的铁律。

18 年后,Anthropic 用 AI 程序员重演了这个实验。

结果几乎一模一样。


📊 Anthropic 的实验:一个让 AI 公司"唱衰自己"的研究

2026 年 1 月,Anthropic 发布了一篇论文,标题直白:

"How AI assistance impacts the formation of coding skills"

他们做了一个小规模的随机对照试验(52 人):

核心数据

组别
测验得分
完成时间
AI 组
50%
稍快 ~2 分钟
手工组
67%
基准

17% 的差距,统计学显著(p=0.01)。

不过要说明:样本量不大,结论不能说板上钉钉,但方向值得注意。

一个卖 AI 编程工具的公司,做了一个可能对自己不利的实验。

这需要多大的勇气?或者说,这背后藏着多大的算盘?

🔬 实验设计的精妙之处

Anthropic 的研究团队做了一件非常聪明的事:他们不只看结果,还录下了所有参与者的屏幕。

逐帧分析。看他们怎么用 AI。

这让我想起那句话:数据不会说谎,但数据不会告诉你全部真相。 真相藏在"怎么用"里。

他们发现了什么?


🎭 四种"作弊器"模式:低分者的自画像

先说明一下:这部分是研究者对参与者屏幕录像的定性分析,样本更小(每组只有几个人),结论是"启发性的",不是严谨的统计结果。但我觉得观察很有意思,值得分享。

低分的人(平均分 <40%),不是"不会用 AI",而是"用错了姿势"。

模式一:AI 代写派

直接把需求扔给 AI,复制粘贴答案。

他们完成任务最快,错误最少。但测验时,他们连自己写的代码都看不懂。本质是把 AI 当外包。

模式二:渐进依赖派

开始还自己写,写着写着卡住了,问一次 AI,又卡住了,再问一次……, 最后干脆让 AI 写完。本质是外包了"坚持"。跳过了"痛苦地调试"这个过程。

模式三:迭代调试派

自己写代码,但遇到 bug 就把报错贴给 AI。AI 帮他们改好了,他们改完继续跑,再报错再贴……,本质是外包了"诊断"。跳过了"理解错误"这个过程。

这三种人有什么共同点?

他们都跳过了"痛苦的思考过程"。

而恰恰是那个过程——写代码时的卡顿、报错时的慌张、逐行排查时的烦躁——塑造了真正的技能。

💡 谢先生的思考

这让我想起 Bjork 的"必要难度"理论。

AI 不是在帮你学习,AI 是在帮你跳过学习。

效率提升的代价,可能是技能形成的缺失。短期爽,长期亏。


🎓 三种"教练"模式:高分派的秘密

那么,那些用了 AI 却依然学得很好的人,到底做对了什么?

模式一:生成-理解派

先让 AI 生成代码,然后追问:

  • "为什么要这样写?"
  • "这个参数什么意思?"
  • "有没有更好的写法?"

他们不快,但测验得分很高。本质是把 AI 当教科书,而不是答案卡。

模式二:混合解释派

每次让 AI 写代码时,都要求"边写边解释"。他们读解释的时间比写代码还长,但这些解释让他们真正理解了代码背后的逻辑。本质是把 AI 当导师,而不是打字机。

模式三:概念提问派——最优解

这群人只问概念性问题:

  • "异步编程和线程有什么区别?"
  • "这个报错是什么意思?什么情况下会出现?"
  • "为什么要用这种写法而不是另一种?"

他们不让 AI 写代码。他们用 AI 理解概念,然后自己写。

结果是

  • 完成速度:全组第二快(仅次于 AI 代写派)
  • 测验得分:全组最高

💡 谢先生的思考

这三种高分模式有个共同点:把 AI 当陪练,而不是替身。

他们用 AI 跳过的是"查文档"的时间,但没有跳过"写代码"的过程。

效率可以来自"跳过",也可以来自"加速"。前者是偷懒,后者是杠杆。


🔍 最可怕的发现:调试能力正在退化

Anthropic 的实验数据里有一个细节,被很多人忽略了。两组差距最大的题型是什么?不是"写出这段代码"——是"找出这段代码的 bug"。

这意味着什么?当 AI 帮你写完代码,它也帮你跳过了:

  • 看到红色报错时的慌张
  • 逐行检查时的无聊
  • 找到问题那一刻的"啊哈!"

调试能力是人类在 AI 时代最后的护城河。

为什么?

因为 AI 生成的代码可能有错。只有能调试的人,才能发现并修正。

当 90% 的代码由 AI 生成,谁能发现那 10% 的错误?

💡 谢先生的思考

调试能力不只是"找 bug"。它是你理解一个系统如何运作的唯一方式。

一个系统为什么跑通了?为什么跑不通?为什么跑着跑着就炸了?

这些问题的答案,不在代码里,而在你调试代码的过程中。

调试是"系统思维"的训练场。而系统思维,是程序员区别于"代码打字员"的分水岭。


📜 历史没有新鲜事:每次工具革命都在"阉割"技能

把时间尺度拉长,你会发现:这种焦虑两千年前就有了。

时代
工具
被阉割的技能
当时人的声音
公元前 400 年
书写
记忆能力
苏格拉底:"书写会让人变懒"
1970s
计算器
心算能力
"学生不再懂数学了"
2000s
GPS
空间导航
"年轻人不会看地图了"
2010s
搜索引擎
知识记忆
"信息唾手可得,大脑空空"
2020s
AI 编程
调试能力"代码能跑,但我不知道为什么"

苏格拉底在《斐多篇》里批评书写技术:

"书写会让人们变懒,他们不再训练记忆,因为他们可以随时查阅。"

2000 年后,我们还在争论同样的问题。

🤔 但这次不太一样

计算器阉割了心算,但你仍然需要理解"为什么要这样算"。GPS 阉割了导航,但你仍然需要理解"我在哪里、我要去哪里"。搜索引擎阉割了记忆,但你仍然需要理解"这个答案对不对"。

但 AI 编程阉割的,是"理解系统如何运作"的唯一途径。

代码不只是"记住",它是"理解复杂系统"的训练场。

当这个训练场被 AI 接管,我们失去的不只是调试能力,而是整个"系统思维"的养成路径。

💡 谢先生的思考

以前的工具革命,替代的是"执行层"的技能。

计算器替代计算,GPS 替代导航,搜索引擎替代记忆。

但 AI 编程不同——它替代的是"理解层"的技能。

这才是为什么这次不一样。


📈 能力熵增:一个行业的隐形危机

把 Anthropic 的实验放大到整个行业,会发生什么?我用"能力熵增"这个概念来描述:

短期(1-2 年):效率暴涨。

初级程序员用 AI 生产力翻倍,公司少招人,成本下降。股价上涨,KPI 达成。

中期(3-5 年):技术债务堆积。

AI 生成的代码越来越多,但能理解这些代码的人越来越少。Bug 出现时,没人能解释"为什么"。

长期(5-10 年):能力熵增临界点。

技能从人类流向工具,系统复杂度却在指数增长。最终,整个系统到达一个临界点——

没人能解释它为什么工作,也没人能解释它为什么不工作。

💡 谢先生的思考

熵增定律:在一个封闭系统中,无序度(熵)总是增加的。要逆转熵增,必须从外部输入能量(努力)。

AI 编程让"写代码"这件事变得有序(高质量产出),但让"理解代码"这件事变得无序(技能退化)。

短期看是效率,长期看是熵增。

当系统的复杂度超过人类理解能力的临界点,系统就会进入"不可维护"状态。这不是危言耸听,这是软件工程的基本常识。


🏗️ 基建的黄昏:别在收费站门口练长跑

就在我写这篇稿子的 2026 年 4 月,OpenAI 把 GPT-5.3-Codex 的系统卡片甩到了大家脸上,微软也把那个所谓的 Azure AI Agent Service 给 GA(商用)了。

很多人在欢呼,但我看到的只有基建税

大厂正在把路修死。以前你引以为傲的那点"业务逻辑实现能力",在现在的云端基建面前,不过就是一行配置、一个 API 的事。如果你还觉得"手熟"是程序员的护城河,那只能说你对"降维打击"一无所知。

大厂的战略很直白:把编码变成像电力一样的廉价设施,然后按照你消耗的 Token 来收税。

当你发现你花十年磨练的架构,被大厂一个预设的 Agent 模板瞬间秒杀时,你才会意识到:基建越完美,"代码搬运工"的死期就越近。

更扎心的是今日 Arxiv 上那篇论文 (2604.02460)。它直接扯下了"多智能体协作"的遮羞布:研究发现,单体模型的推理能力已经强到可以无视所谓的团队协作。这意味着,平庸的连接毫无意义。

真相是:Token 的噪音再多,也填不平灵魂的贫瘠。 我们不需要一个由平庸 Agent 组成的"委员会",我们需要一个足够强的单体模型,以及一个比模型更强的、拥有终极审美的"人类监工"。

💡 谢先生的思考

大厂正在修高速公路,并在每一个出口架设收费站。如果你还想靠"走路"(写那点手熟的逻辑)去挣钱,那你只会被碾碎。

在被流水线接管的时代,拒绝当螺丝钉,去当那个设计路网的人。

如果你不能在代码炸裂时,一眼看穿基建背后的逻辑暗门,那你唯一的价值就是给大厂贡献 Token。

基建的黄昏,正是"监工时代"的黎明。


⚠️ 谁是真正的受害者?

大众观点:AI 编程工具会消灭低级程序员。

我的观点:AI 编程工具真正威胁的是中级程序员。

为什么?

低级程序员:本来就不会写,AI 帮他们"升级"了。他们从"写不出来"变成"能写出来",这是净收益。

高级程序员:把 AI 当工具,核心能力(架构、调试、系统思维)不受影响。他们知道什么时候该用 AI,什么时候不该用。

但中级程序员——他们赖以生存的是"能写能改"。

现在"写"被 AI 接管了,"改"(调试)又因为缺乏练习在退化。

他们正处于能力的拐点:比上不足,比下有余。但 AI 正在把这个"有余"吃掉。

💡 谢先生的思考

中级程序员是整个行业的中坚力量。他们能独立完成任务,但还没有形成"不可替代"的专业壁垒。

AI 对他们来说,既是效率工具,也是能力陷阱。

用得好,他们能快速晋升为高级;用不好,他们会被"降级"为 AI 操作员。

这个群体面临的,是一场静悄悄的"能力淘汰赛"。


🛠️ 一个判断标准:你用的是"外骨骼"还是"轮椅"?

下次你用 AI 写完代码,问自己一个问题:

    "如果 AI 不在,我能解释这段代码为什么能跑吗?"

如果能,你在用外骨骼锻炼肌肉。如果不能,你的肌肉正在萎缩。

AI 不是代驾,是外骨骼。

外骨骼能帮你举起 500 公斤。但如果有一天它没电了,你连 50 公斤都举不起来——因为你的肌肉已经萎缩了。


📋 给个人的行动清单

第一层:改变提问习惯

❌ 错误问法
✅ 正确问法
帮我写一个异步任务
异步任务和同步任务的区别是什么?
这段代码报错了,帮我改
这个错误意味着什么?我该怎么排查?
写完这个功能
写完这个功能后,给我解释一下核心逻辑
帮我重构这段代码
重构这段代码时,你考虑了哪些因素?

核心原则:问"为什么",而不是"怎么做"。

第二层:每天手写一段代码

哪怕只是 10 行。哪怕只是重复 AI 写过的东西。

肌肉记忆是 AI 抄不走的。

第三层:刻意练习调试

找一个你用 AI 写的代码,故意破坏它,然后自己修。

看看你能多快找到问题。如果不能,说明你还没真正理解。

🏢 给企业的警示

如果你的团队正在大规模使用 AI 编程工具,请思考以下问题:

问题一:谁来维护 AI 写的代码?

AI 能写代码,但 AI 不能维护代码。当 AI 生成的代码需要修改时,你的团队里有多少人能理解并修改它?

问题二:你的初级工程师还在成长吗?

初级工程师的成长路径是什么?是从写简单代码开始,逐步积累调试经验,最终形成系统思维。如果 AI 接管了"写简单代码"这个环节,初级工程师的成长路径就被切断了。三年后,你的初级工程师还是初级工程师。

问题三:你的技术债务在增长还是在减少?

AI 生成的代码,天生带着"技术债务"的属性——因为没人真正理解它。当这些代码积累到一定量级,你的系统就进入了"不可维护"状态。

🎯 结语:效率是短期红利,能力是长期资产

Bjork 的必要难度理论告诉我们:学得轻松,忘得快;学得痛苦,记得牢。

Anthropic 的实验告诉我们:用 AI 代写,学得少;用 AI 理解,学得多。

历史告诉我们:每次工具革命都在阉割技能,但这次不一样——AI 阉割的是"理解层"的技能。

能力熵增告诉我们:短期效率,长期债务。系统的复杂度终将超过人类理解能力。

当你用 AI 越来越顺手的时候,停下来想一想:

你是在积累资产,还是在透支未来?


参考资料

  • Anthropic Research
    : How AI assistance impacts the formation of coding skills (2026-01-29)
  • Paper
    : arXiv:2601.20245
  • Cognitive Science
    : Bjork, R. A., & Bjork, E. L. (2008). "The New Science of Learning"

作者:谢先生,用 AI 放大品位,而非替代思考。

觉得分析有道理?点个「在看」,转发给需要看到这篇文章的朋友。

关注公众号,我们在 AI 的最前线等你。