夜雨聆风学习资料网

ARTICLE · 1127278

AI学习工具效果随机对照研究

AI学习工具效果随机对照研究

近期,关于“AI学习工具效果”的相关研究发布,包括哈佛的对照实验、马里兰大学团队研究的试验结果及土耳其的现场实验结果,引起了“AI辅导让学生成绩更低”与“AI辅导效果翻倍”两类新闻同时流传。这些研究究竟说明了什么呢?

一、研究事实

2026年10月初由布朗大学Annenberg研究所发布了一篇工作论文(EdWorkingPaper No. 26-1598),是关于马里兰大学团队(Jing Liu、Tracy Sweet等)在2025年秋季学期对2379名本科生、30名教师、34个教学班开展随机对照试验,试验工具为基于GPT-4o、以课程材料做检索增强生成(RAG)的"虚拟学习助理"(VSA)。

试验结果表明,在内容完全匹配的教学班比较中,被提供AI辅导的期末成绩低4.12分(百分制,约0.37个标准差);学习管理系统参与度下降0.90个标准差;但使用率仅14.63%——被提供工具的学生中不到六分之一打开过它。同时,使用结构高度失衡,73.8%的请求是索要答案或解释,请求批改自己作业的仅0.7%。此外,第一代大学生(父母未受过高等教育的群体)的成绩损失约为其他学生的两倍。

土耳其的现场实验(Bastani等,PNAS 2025,约千名高中生的数学课)设三组,包括无AI组、无护栏GPT-4组、护栏导师组(系统提示只给提示、永不给答案)。练习成绩上无护栏组提升48%、护栏组提升127%;但移除电脑后的闭卷考试中,无护栏组比从未使用AI的对照组低17%,护栏组则与对照组无统计差异。

哈佛的对照实验(Kestin等,Scientific Reports 2025,194名物理课学生)结果则显示,深度教学设计的定制AI辅导使学习增益中位数超过主动学习课堂的两倍(效应量0.73—1.3个标准差),用时49分钟——其设计要点是系统提示词按主动学习原则工程化、嵌入专家编写的分步解答、平台按教师课堂序列逐题引导,而非一个即开即用的聊天窗口。

表1 三项研究的设计对比

研究

出处

样本与场景

设计

土耳其· 数学(“PNAS 研究”)

Bastani H., Bastani O., Sungu A., Ge H., Kabakcı Ö., Mariman R.,PNAS, 122(26):e2422633122, 2025年6月25日在线发表(另有8月勘误)

土耳其某高中 9—11年级约50个班、近1000名学生;4次90分钟练习课

三臂随机:无 AI对照(仅课本与笔记)、GPT Base (标准GPT-4对话界面)、 GPT Tutor(只给提示不给答案,并内置教师编写的标准解法与常见错误应对)

哈佛· 物理(“Sci Rep 研究”)

Kestin G., Miller K., Klales A., Milbourne T., Ponti G., Scientific Reports, 15:17458,2025年6月3日发表

哈佛Physical Sciences 2(生命科学方向物理课) 233人选课、194人纳入分析;2023年秋季学期第9—10周;两个主题(表面张力、流体流动)

随机交叉设计(每名学生在两周内先后经历两种条件):家中使用定制AI辅导(PS2 Pal)vs课堂主动学习;两组使用同一份学案,测试由未参与设计与授课的团队成员编写

马里兰· 多学科(“Annenberg 研究”)

Liu J., Sweet T. 等(马里兰大学),EdWorkingPaper No. 26-1598,布朗大学 Annenberg研究所,2026 年 10月发布

2379名本科生、30名教师、34个教学班,覆盖理工、人文、社科、教育等;2025年秋季学期

教师层面随机(课程内分区块):提供基于GPT-4o、以教师所选课程材料做检索增强生成(RAG)的“虚拟学习助理”(VSA)vs不提供;工具默认“直接讲授”模式,教师可切换为“引导辅导”模式

表2 三项研究的结果对比

研究

练习 / 过程表现

无 AI 辅助条件下的独立表现

PNAS 研究

练习成绩较对照:GPT Base +48%, GPT Tutor +127%;但GPT Base在练习题上给出正确答案的比例仅 51%,失败中42%源于逻辑错误。

闭卷考试:GPT Base比从未用AI的对照低17%;GPT Tutor 点估计 −0.004,与对照无统计差异(即护栏实现了“不伤害”,但未带来增益)

Sci Rep 研究

后测中位数:AI组4.5、课堂组3.5 (前测中位数2.75,p<10⁻⁸);中位用时49分钟vs 60钟;83%学生认为AI讲解不逊于甚至优于教师;“投入感”4.1 vs 3.6、“动机”3.4 vs 3.1。

学习增益超过主动学习课堂两倍以上;回归估计效应量0.63个标准差(作者自认受天花板效应低估),分位数回归为0.73—1.3个标准差。注意:本研究测量的是即时后测,未做延迟保持测量

Annenberg 研究

被提供工具的学生学习管理系统参与度显著下降:页面浏览−0.37 SD、活跃天数−0.51 SD、总参与度−0.90 SD;作业成绩无显著变化;工具使用率仅14.63%,其中73.8%的请求在索要信息/解释/答案,约11%为练习或备考,仅0.7%请求批改自己的作答

内容完全匹配的教学班比较(exact-match):期末成绩低4.12分(百分制),约−0.37 SD;等级成绩−0.13 SD;第一代大学生(父母未受高等教育)的估计损失约为其他学生的两倍。研究者明确说明:不能认定“平台参与度下降导致成绩下降”,且低使用率意味着所测为“提供接入”的效应,而非“活跃使用”的效应

二、辨析三项研究的“不矛盾”

不少人将三项研究理解为“科学界打架”,从方法学上看是却是对三项研究的误读。

因为,三项研究随机化的是完全不同的东西。

哈佛Sci Rep研究采用固定教学法,只变传递媒介,尝试回答“设计良好的AI教学能否胜过好课堂”。

土耳其PNAS研究采用固定模型,只变护栏,试图回答“答案可及性本身是否有害”。

马里兰Annenberg研究却是在真实运营条件下变动工具接入,探索回答“把课程集成的AI助理放进真实校园会发生什么”。

三个问题的答案当然不同。

马里兰Annenberg研究的负面结果尤其需要精确解读。

它测量的是“提供AI接入”的总效应,而非"使用AI工具”的效应。因为在试验中,AI工具使用率仅14.63%,这意味着效应的主要来源不是活跃用户的损失,而更可能是大学背书改变了全体学生对“可接受AI使用”的感知边界。请注意,对照组学生在实验期间同样可用ChatGPT与Gemini,研究者本人提出了这一解释但未下定论。同时,73.8%的请求在索要答案、仅0.7%在请求反馈,说明工具被用作“答案机”而非“教练”,替代了本应自主完成的学习活动,这正是研究者所称的替代效应。主要研究者Jing Liu的表述应完整引用:“这些发现并不能证明专门构建的AI辅导工具没有益处”,并强调评估AI工具必须考虑“它替代了什么”,比如参加答疑、投入教材、向教师提问虽费时且显得低效,但它们是学习的必要构件。

当然,还需要注意到的是,马里兰研究Annenberg研究以课程成绩而非独立测验为结果变量,问卷回收率低,且无法排除学生将部分学习转移到研究未测的其他AI工具;哈佛Sci Rep研究的效应基于即时后测、仅覆盖两个物理主题、单校单课程,作者本人强调该工具是对人的教学的补充而非替代;土耳其PNAS研究的效应基于练习课与随后的考试,样本限于单一学校。

此外,MIT媒体实验室一项54名成人的EEG写作实验(小样本预印本)报告ChatGPT组中83%无法引用自己刚写完的句子,但该预印本作者公开反对将其标题化为“AI导致脑腐”。

三、机制综合的启示

三项研究合成后的机制图景是清晰的。

AI辅导的效果是“部署条件”的函数,而非技术本身的属性。

决定方向的四个条件分别是:

护栏设计。土耳其PNAS研究证明是提示而非解答,可消除考试惩罚,但也仅止于不伤害。

嵌入结构。哈佛Sci Rep研究证明高强度教学设计可带来正效应,马里兰Annenberg研究证明低结构接入带来负效应。

被替代的活动。替代教材阅读与练习则有害。

使用者结构。Annenberg研究显示第一代大学生损失最大,提示无结构的AI接入将扩大而非缩小教育差距,这一发现对教育公平的含义比“AI是否有效”更值得关注。

附录:主要信息来源

Bastani H., Bastani O., Sungu A., Ge H., Kabakcı Ö., Mariman R. "Generative AI without guardrails can harm learning: Evidence from high school mathematics." PNAS, 122(26): e2422633122(2025-06-25在线,8月勘误)

Kestin G., Miller K., Klales A., Milbourne T., Ponti G. "AI tutoring outperforms in-class active learning: an RCT introducing a novel research-based design in an authentic educational setting." Scientific Reports, 15:17458(2025-06-03)

Liu J., Sweet T. 等. EdWorkingPaper No. 26-1598,布朗大学Annenberg研究所(2026-10);EdTech Innovation Hub、Pivot News相关报道

Robinson C. D., Gormley D., Trindade Ribeiro A., Loeb S. "Access is Not Enough: Human Support Improves Engagement with AI Tutoring." Annenberg Institute working paper(2026-06)

Kosmyna N. 等(MIT Media Lab)EEG写作实验预印本(2025)

相关学习资料