ARTICLE · 1044371
为什么学生乱用AI工具会导致成绩下降?
为什么学生乱用AI工具会导致成绩下降?一、研究数据:下降的不是分数,是独立解题的能力 香港大学经济学系教授吴延晖与瑞典斯德哥尔摩大学经济学教授大卫·斯特伦伯格(David Strömberg)历时30个月,追踪中国中部某县九所中学共26811名初高中生的AI使用行为与学业表现,提出了“AI学习惩罚”这一概念。研究采用双重差分模型,对比学生在使用AI前后的成绩变化[1]。 核心发现如下: - 使用AI完成作业后,作业成绩平均提升18%,用时从约64分钟缩短至45分钟 - 6个月内,闭卷月考成绩平均下降20% - 累计使用两年后,中考分数下降24%,高考分数下降18%[1] 需要注意的是,作业成绩在上升。这说明AI工具本身没有降低学生的能力,它只是把“会做的部分”做得更快了。真正导致成绩下滑的,是工具介入的方式——把本该由自己完成的思考环节交了出去。 2026年6月针对该县26811名学生的调研显示,约80%的学生报告使用过生成式AI工具,其中超七成学生最主要的用途是完成作业[3]。也就是说,绝大多数学生的用法高度集中在同一个动作上:搜题看答案。这正是问题所在。 二、乱用的核心特征:思考环节被整体外包 所谓“乱用”,在这项研究中的具体表现非常明确:遇到不会的题,第一反应不是自己想,而是打开APP拍照。 这一顺序的颠倒,导致后续四个认知环节同时失效。 (一)前额叶皮层的激活不足 大脑中负责逻辑推理、问题分析与规划决策的区域是前额叶皮层,其能力发展遵循“用进废退”原则[2]。 麻省理工学院(MIT)媒体实验室2025年6月发布了一项脑电(EEG)监测研究:54名18至39岁的参与者被分为三组(ChatGPT组、Google搜索组、纯大脑组),连续四个月进行写作任务,同时实时监测32个大脑区域的活动。结果显示:纯大脑组在α波段(与创造力和语义处理相关)的神经连接数为79个,而ChatGPT组降至42个,降幅达47%;整体大脑连接性比纯大脑组低55%,比搜索引擎组低48%[2][4]。 当作业帮、猿题库等工具直接把答案和解析呈现在屏幕上时,孩子大脑中与推理相关的区域几乎没有被充分激活。偶尔一次影响有限,但如果日常作业中频繁出现这种“跳过”,负责高阶思维的神经回路因使用频率降低而逐步弱化。 这里需要区分两种情况:自己先想一遍再查解析,与直接看答案再抄上去。前者的大脑激活程度接近独立完成,后者则接近零。乱用与合理使用的差别,就在这里。 (二)记忆编码环节被绕过 知识进入长期记忆需要经过“深度加工”——即反复尝试、犯错、调整思路的过程。这一过程由大脑的海马体完成编码[2]。 MIT同一项研究的行为数据佐证了这一点:当被要求复述几分钟前刚“完成”的文章内容时,83.3%的ChatGPT用户无法回忆起任何有效信息,而纯大脑组仅有11.1%出现此情况[2][4]。 这恰好解释了为什么作业全对但考试下滑:作业阶段的“正确”依赖外部工具完成,知识并未真正编码进入大脑;考试是闭卷环境,大脑无法调取未编码的信息。 同样要区分的是:知识存储的位置不同。合理使用AI的学生,知识存在自己脑子里;乱用AI的学生,知识存在APP里。断网考试的那一刻,差异就暴露出来了。 (三)策略层的路径地图没有建构 解题能力的核心之一,是在头脑中为题目建立一张路径地图。这个过程包含一系列操作:判断题目属于哪一类、从长时记忆中提取可用的定理和方法、把这些方法组合成几条候选思路、逐一评估可行性并选定一条推进。认知心理学把这种内部表征称为“问题空间”,把由此形成的稳定模式称为“图式”。这些操作本身构成了能力的主体,答案只是它们的最终产物。 直接看解析时,学生拿到的是一张已经绘制完成、且只保留成功分支的地图。所有试错、回溯和在分岔口上的取舍都被删去,呈现为一条没有折返的直线。学生因此只获得了“这条路能走通”的结论,却没有获得“为什么选这条路而不是另一条”的判断依据。而考试真正考查的正是后者。 更重要的是,这张地图必须由学习者自己建构才能转化为可用的图式。别人给出的地图只能被“看懂”,无法被“内化”——看懂依赖的是解析者的结构,内化依赖的是自己搭建的结构。长期跳过建构过程的学生,头脑中积累的往往是大量孤立的题型—答案配对,而不是一套可迁移的策略体系。 这也解释了研究中成绩变化的具体形态:作业题目与题库原题高度相似,可以直接检索到对应路径;考试题目则多为变式,条件或知识点的组合方式发生改变,必须重新建图。习惯了“看答案”的学生在需要重新建图的情境下难以启动这一过程,表现为“做过类似的题,但还是不会做”。这种缺口无法通过增加刷题量弥补,因为刷题本身如果依赖搜题,同样绕过了建构过程。 (四)元认知能力得不到训练 元认知是对自身认知过程的监控与调节:我目前卡在哪一步?这一步推导是否成立?是否需要换一种方法?这类判断只有在真实的不确定性中才有对象可供练习。当答案已经摆在面前时,不确定性消失,监控和调节也就失去了练习的机会。解析带来的流畅感容易被误认为掌握了方法,但这只是一种错觉。 乱用AI的学生往往会出现一种典型状态:作业本上全是红勾,心里其实一片模糊。他无法准确判断自己哪些是真会、哪些是假会,因为判断的依据——独立做题时的卡顿感——从未出现过。 三、乱用的具体表现:三个可识别的信号 2026年6月的调研数据显示,在吴延晖研究的样本中,81%的AI使用学生被归类为“作业外包”组(作业完成时间少于50分钟),50%为“完全外包”组(少于45分钟)[3]。 从家庭观察的角度,乱用通常表现为以下三个信号: 1. 作业时间异常缩短。原本60分钟的数学作业,用上工具后40分钟完成,且正确率反而提高。这不是效率提升,而是思考环节被省略。 2. 做一题查一题。手机放在手边,遇到卡顿立刻拍照,而不是先尝试推进。这种用法下,每一道题都失去了训练价值。 3. 错题讲不清思路。对照答案改完后,让孩子讲一遍正确做法,如果只能复述步骤而说不出“为什么要这么做”,说明他只是看懂了别人的思考,没有形成自己的。 这三个信号的共同点在于:工具介入在了思考之前,而非思考之后。 四、怎样才算不乱用:四种合理场景 关键不在于“用不用”,而在于“怎么用”和“什么时候用”。 ✅ 鼓励使用的场景 1. 先做完再查:作为批改工具 孩子先独立完成作业,完成后用作业帮或猿题库逐题对照答案检查对错。重点在于比较“我的思路和解析里的思路有什么不同”,而非仅确认对错。这相当于配备了一位“对答案的老师”。 2. 错题复盘:作为讲解工具 考试或作业中做错的题,用搜题功能查看分步解析和视频讲解,目的是理解“我卡在哪一步”。作业帮的“举一反三”同类题推送功能,在这一场景下是有效的[3]。 3. 知识点查漏补缺:作为诊断工具 数学某个知识点反复出错时,用AI精准学功能定位薄弱知识层级;英语作文写完后用工具检查语法错误。这类用法属于“辅助诊断”,而非“替代完成”。 4. 口语与听力练习:作为陪练工具 英语听说训练、跟读评测等互动练习不涉及外包思考,属于合理使用。 ❌ 需要限制的用法 - 写作业时每道题都先搜再看(直接跳过思考环节) - 作文直接复制AI生成的内容 - 考前用搜题工具“背答案”而非复习知识点 五、家长可以怎么做? 一个核心原则:先自己尝试,再寻求帮助。 具体可落实为以下家庭规则: - 计时独立做:作业开始时约定一个独立尝试时间(如每道数学题至少思考5分钟),期间不碰手机 - 做完再查:全部完成后才打开APP对答案,而非做一题查一题 - 错题必须讲:对照答案发现有错,孩子需要用自己的话讲出“正确的思路是什么、我原来哪里想错了” - 每周错题重做:将一周内做错的题集中起来,遮住答案重新做一遍,确认不是“看懂了但没学会” 研究表明,使用AI后仍花费相近时间完成作业的学生(即保留独立思考过程的学生),学习损失较小[1]。这说明AI本身并非问题,“先思考再使用”与“先用后思考”的区别,才是关键。 乱用AI的后果,不在于孩子多用了某个软件,而在于他把学习中最该自己经历的那一段路,交给了机器去走。那段路走不走,决定了考试时他能不能自己找到方向。 参考资料 [1]吴延晖, Lei Victor, David Strömberg. 生成式人工智能学习惩罚:中国中学的证据(Generative AI Learning Penalty: Evidence from Chinese Middle Schools)[EB/OL]. 2026年6月预印本研究. [2]麻省理工学院媒体实验室. 使用大语言模型写作时人类大脑神经连接的改变(Brain connectivity during AI-assisted writing)[R]. 2025年6月发布. [3]吴延晖团队. 中国中部某县26811名初高中生AI使用行为追踪调研[R]. 2026年6月. [4]MIT. 人类使用AI工具的认知影响系列实验[R]. 2025-2026年.