乐于分享
好东西不私藏

AI不是罪魁祸首,它是X光

AI不是罪魁祸首,它是X光

AI不是罪魁祸首,
它是X光

26811名学生,30个月追踪——
当AI撕开"看起来学会了"的伪装,
我们该怪工具,还是换尺子?

CEPR 大规模追踪研究

+18%

作业成绩

-20%

闭卷月考

-24%

中考

-18%

高考

26811名中国中学生 · 30个月 · 9个科目
从未用过AI的学生,成绩纹丝不动

2025年,欧洲经济政策研究中心(CEPR)发布了一项大规模追踪研究:26811名中国中学生,30个月,9个科目。结论炸了——

用AI的学生,作业成绩平均涨了18%,作业时间缩短了30%。好看。但闭卷月考成绩跌了20%,中考跌24%,高考跌18%。从没用过AI的学生,成绩纹丝不动。

一时间,"AI毁了学习"的论调铺天盖地。

但等等。这个数据里藏着一个被大多数人跳过的细节:约80%的学生把AI当代写工具,成绩崩了;约20%的学生把AI当家教,成绩没跌。

问题来了——这80%的学生,在AI出现之前,他们"真的学会了"吗?

AI没有制造差生,
它只是让差生现了形

🔍

X光逻辑:不制造问题,只显现问题

主流叙事里,AI被比作轮椅——坐久了腿会萎缩。这个比喻听起来很直觉,但它藏着一个致命假设:这些学生的"腿"本来是好的,是AI让他们萎缩的。

事实可能恰恰相反。

想想一个典型的"中等偏上"学生怎么应付考试:反复刷题,把题型和答案刻进短期记忆,考试时精准复现,考完三天忘干净。这套方法在闭卷考试里极其有效,但它测的不是理解力,是记忆力和服从性。这些学生从来就不是"学会了",而是"看起来学会了"。

AI出现之前,"看起来学会了"是有成本的。你得花时间抄、背、刷,这个苦功夫本身就是伪装的门槛。AI把这个门槛降到了零——一键生成,格式工整,逻辑通顺。作业瞬间变得漂亮,但考试一闭卷,原来没记住的还是没记住,原来没理解的还是没理解。

AI没有制造问题。它只是让一个一直存在的问题,从"需要仔细看才能发现"变成了"肉眼可见"。

X光不会让你骨折,它只是让骨折显现。

学科冲击排序

社科
-27%
理科
-22%
语言类
最小

越依赖记忆和复述的学科,AI冲击越大。语言类更侧重理解和表达,而非纯复现。AI冲击的不是"思考能力",是"复现能力"——只是我们的考试一直把复现当成了思考。

19%的沉默证据:
不是AI没用,是考试没用

🌡️

用体温计测血压——不是没变,是尺子不对

80%的故事讲完了。那20%呢?

CEPR研究里,约20%的学生属于"辅助学习型"——他们用AI辅助思考,而不是替代思考。做作业时依然保持正常的时间投入,用AI查漏补缺、拓展思路、验证逻辑。这批学生,闭卷考试成绩没有下滑。

但也没有上涨。

这才是最值得玩味的地方。如果AI真的增强了学习能力,为什么这20%的学生在考试中看不出优势?

答案不在AI身上,在考试身上。

闭卷考试测的是什么?独立复现知识的能力。给你一道题,不许看任何资料,凭记忆作答。这个格式天然排斥AI辅助带来的那部分能力增量——信息整合、跨域迁移、问题重构。一个学生用AI学会了把历史事件和经济学原理交叉验证,闭卷考试不考这个。一个学生用AI把物理概念和工程案例打通了理解,闭卷考试也不考这个。

两种能力,两把尺子

存储量

闭卷考试测的

你一个人在脑子里
能装多少、能调多快

战斗力

AI辅助培养的

你带着工具
能解决多复杂的问题

用存储量的考试去测战斗力的增长,当然测不出来。就像用体温计去测血压——不是血压没变,是体温计根本不是干这个的。

20%的学生成绩没涨,不是AI对学习无效的证据,恰恰是现有考试对能力变化失灵的证据。这批学生不是"没进步",而是"进步了,但考试看不见"。

关掉X光机,还是补钙?

🦴

关掉X光机,骨头不会自动长好

面对这组数据,最本能的反应是什么?

禁AI。

华东师范大学一项面向江浙沪中小学的调研显示,超过六成教师反映"作业全会、一考就废"在AI普及后更加突出。不少学校的应对措施直接粗暴:校园网屏蔽AI工具,作业要求手写,考试加严监考。禁AI的人不是没有道理——卡内基梅隆大学和微软的联合研究提供了科学支撑:使用不当的AI工具会降低大脑认知活跃度,"认知卸载"不是比喻,是已有研究反复验证的现象。

这些都没错。但逻辑链断了一环。

一刀切禁AI的代价

~80%

外包型学生

AI是认知卸载,禁了也只是回到"看起来学会了"的幻觉——伪装的成本回来了,伪装本身没有消失

~20%

辅助型学生

AI是认知增强,禁了等于没收增强器——因为80%用错了工具,就惩罚20%用对了的人

有意思的是,政策层面其实已经意识到了这个问题。教育部近年持续推进"破四唯、立新标",教育界也在推动考试评价从"统一标尺"走向"多元融合",从"标准化量表"转向"智能生态系统"。方向说得很清楚:旧尺子不够用了。

但一线的反应速度远远落后——多数学校的第一反应仍然是"堵"而不是"疏",是"禁工具"而不是"换尺子"。

为什么?因为禁AI只需要一道行政命令,换评价体系需要重新定义"学会"的标准、重新设计考核方式、重新培训教师、重新说服家长。每一环都是硬仗。而闭卷考试最大的优势就是"简单"——出题方便,阅卷方便,排名方便,选拔方便。它之所以存在了这么久,不是因为它测得准,是因为它用着省事。

省事和正确,从来不是一回事。

换尺子

📏

一把尺子既测不出假,也测不出真——留着它不是因为管用,是因为顺手

回到开头那个问题:AI毁了成绩吗?

没有。AI毁掉的不是成绩,是成绩的信用。

当80%的学生可以用AI让作业"看起来完美",当20%的学生用AI真正增强了能力但考试测不出来——这套评价体系已经同时失灵于两个方向:它既拦不住伪装,也识别不了真进步。

尺子失灵的判断标准

条件一:拦不住伪装

约80%的学生用AI轻松伪装,闭卷考试拦不住

条件二:识别不了真进步

约20%的学生用AI真正增强了能力,闭卷考试识别不了

当一套评价体系同时满足这两条——它就该换了。

那该换什么样的尺子?方向其实已经浮现。不是回到更严的闭卷,也不是走向完全的开卷,而是把考核从"你脑子里装了多少"转向"你带着工具能解决什么"。开卷+限时+真实问题情境,考的不是记忆深度,而是信息筛选、逻辑整合和方案输出。AI辅助下的协作任务,评估的不是个人复现能力,而是人机协同的战斗力。过程性评价替代一考定终身,看的是思考路径而不是最终答案。

这些不是天马行空的想象,部分高校和职业院校已经在试。只是试的范围太小、速度太慢,远追不上AI渗透的速度。

CEPR那组数据最该让人警醒的,不是"成绩跌了20%",而是"成绩跌了20%之后,我们的第一反应是怪工具,而不是问这把尺子量对了没有"。

X光照出骨质疏松,
该做的是补钙。

不是砸了X光机,
然后假装骨头没断。

数据来源:CEPR / 华东师范大学 / 卡内基梅隆大学×微软