ARTICLE · 1112108
哈佛王牌课堂被AI干趴下了?两倍提分背后,一场颠覆大学教育的秘密实验

作者 | 郑睿
编辑 | 李博
哈佛大学最引以为傲的王牌教授,在一场严格的对照实验中,被一个AI聊天机器人“干趴下”了。
不仅输了,而且输得相当彻底
在同样的物理核心课程中,使用专属定制AI家教的学生,学习增益超过了哈佛顶级实体课堂的两倍;不仅成绩大幅领先,学生掌握知识的用时还缩短了近两成,课堂投入度与学习动机更是全线飙升。

▲ 社交网络上的高传播推文:直指AI家教在哈佛课堂中展现出惊人的两倍学习增益
消息一出,全网哗然
马斯克在社交平台顺手转发,只留下了两个字:“Sounds right(听起来没错)。”

▲ 马斯克的简短回复引发了各方对未来课堂模式的讨论
难道上百年来伫立在学术金字塔尖的常春藤名师,真的要被一串代码扫进历史的垃圾堆?
别急着下结论这场发表在《自然》旗下顶级期刊《Scientific Reports》上的轰动实验,背后藏着远比“AI打败教授”精彩得多、也惊险得多的教育真相。
01一场精心设计的“降维打击”
实验发生在哈佛大学的核心课堂
这门课程叫 Physical Sciences 2(简称 PS2),是哈佛大学面向生命科学专业开设的入门物理课,也是全校规模最大的王牌硬核课之一。
主导实验的 Gregory Kestin 教授与 Kelly Miller 团队,在 2023 年秋季学期挑选了 194 名哈佛在读生,做了一场极其严格的随机交叉对照试验(Crossover RCT)。

▲ 哈佛团队发表在《Scientific Reports》上的重磅研究
所谓交叉对照,就是让同一批哈佛学霸,在两周内轮流体验两种截然不同的学习模式:
- 模式 A(实体主动学习课堂)
:在真实教室里,由哈佛名师带领,配合助教巡回答疑,学生分组讨论、即时反馈; - 模式 B(AI 专属导师)
:学生坐在宿舍里,独自面对一个名为“PS2 Pal”的专属 AI 教学系统。
哈佛这次用于与 AI 较量的基准,是全球教育界公认的高标准,“主动学习(Active Learning)课堂”。课堂上由教授与助教全程引导互动答疑,89% 的学生也表示其互动强度远超其他理工课程。
可实验结果,却让所有人倒吸一口凉气:
- 后测成绩
:AI 组的后测得分中位数高达 4.5 分,而名师课堂组只有 3.5 分; - 学习时长
:课堂组固定消耗约 60 分钟,而 AI 组学生的中位用时仅为 49 分钟,约 70% 的人提前交卷; - 主观体验
:在学习投入度(4.1 vs 3.6)与内在动机(3.4 vs 3.1)上,AI 组同样形成了全面碾压。

▲ 实验数据显示:AI 组不仅成绩增益翻倍,而且多数学生用时显著短于传统课堂
课后评价同样出人意料:83% 的学生认为,该 AI 导师的答疑水平完全不亚于、甚至优于线下任课教师。
02“两倍增益”到底是怎么算出来的?
数据公布后,网上立刻有人质疑:“4.5 分比 3.5 分,明明只高了 1 分,凭什么吹成两倍增益(2X)?这难道是数据夸大?”
评论区很快给出了清晰的统计学澄清。
在教育学中,“学习增益(Learning Gain)”的核心指标,着眼于学生在完成学习后相对于起点的净提升量。

▲ 讨论串中针对“两倍增益”计算方式的统计学澄清
这道算术题的具体算法如下:
实验开始前,所有 194 名哈佛学生的前测基线中位数是 2.75 分; 经过哈佛名师的线下高强度互动,学生考到了 3.5 分,净提高:$3.5 - 2.75 = 0.75$ 分; 而在 AI 导师的引导下,学生一路冲到了 4.5 分,净提高:$4.5 - 2.75 = 1.75$ 分; - $1.75 \div 0.75 = 2.33$ 倍!
在控制了先验知识、试卷版本与学习时间后,统计学上的效应量达到了惊人的 0.73 至 1.3 个标准差。
学生的用时分布同样展现出明显的自适应特征:在 AI 组中,感到课程难度高的学生,系统会放慢节奏陪伴推导,学习时间自然延长;而基础扎实的学生,十几分钟就能顺利完成。
千百年来困扰传统班级教学的“拔尖还是补差”矛盾,在 AI 的自适应节拍器面前,被瞬间消解了。
03惊天反转:隔壁实验测出的“认知毒药”
既然定制 AI 效果如此突出,是否意味着只要直接引入大模型,传统教学就可以被完全取代?
然而事实远非如此简单
就在哈佛论文发表的同月,另一篇发表在《美国国家科学院院刊》(PNAS)上的重磅随机对照研究,直接给狂热的舆论浇了一大盆冰水。

▲ PNAS 刊登的土耳其高中近千人对照实验:无护栏 AI 反而重创了独立考试成绩
沃顿商学院的研究团队在土耳其一所大型高中,对近千名高中生做了长达数月的跟踪测试。他们把学生分成三组刷数学题:一组用普通课本,一组用没有任何限制的“原装 ChatGPT”,一组用带有教学引导的定制 AI。
在平时的练习阶段,AI 展现出了近乎作弊的神效:使用原装 ChatGPT 的学生,练习得分比课本组高出 48%。
然而,高潮发生在随后的独立闭卷考试上,
当所有学生坐进考场、被拿走电脑和手机后,残酷的一幕出现了:平时依赖原生 ChatGPT 刷题的学生,独立考试成绩比从没碰过 AI 的普通学生低了整整 17%!

▲ 媒体对 PNAS 研究的报道指出:缺乏教学引导的生成式 AI 容易沦为心智拐杖,削弱了学生的深度学习成效
为什么平时的“提分神器”,一到考场就变成了“智商毒药”?
原因极其刺骨:没有束缚的通用大模型,太擅长替人类思考了。
面对复杂的数理推导,学生只要把题目丢进去,AI 就会奉上天衣无缝的完整答案。学生的大脑在看似行云流水的复制粘贴中,产生了“我已经彻底学会”的认知幻觉。一旦拿走拐杖,心智肌肉早已萎缩的学生只能在考卷面前瞬间瘫痪。
04拆解黑盒:哈佛如何把 AI 驯化成“苏格拉底”?
综合两所学府的研究可以发现,两倍学习增益的关键支撑,在于经过精密工程化封装的教学法体系:
能够带来显著学习增益的核心要素,正是被精密工程化包裹后的“教学法体系”。
哈佛的“PS2 Pal”之所以能取得理想成效,关键在于它摒弃了通用的无约束问答模式。
在它看似简单的对话框背后,哈佛团队耗费数月构建了一套坚不可摧的认知脚手架:

▲ 哈佛教授 Gregory Kestin(左)与 Kelly Miller(右)
- 强行剥夺“直接给答案”的权力
:系统提示词被严格注入了苏格拉底式提问法。无论学生怎么撒娇耍赖,AI 只会用启发式提问引导下一步; - 锁死题目推进逻辑
:为了防止模型跳步或跑题,软件从底层架设了硬性流水线,学生必须自主推导完当前步骤,才能解锁下一道关卡; - 预先注入标准认知路径
:为了彻底杜绝大模型在数理公式上的“幻觉胡说”,教授团队提前把经过同行校对的完整分步正解喂入底层,让 AI 充当极其严格的轨道巡检员。
在哈佛最大的王牌计算机课 CS50 中,系主任 David Malan 教授甚至将这种“反直觉设计”推向了极致。
他们开发的 AI 助教“CS50 Duck(橡皮鸭导师)”,在底层中间件里部署了一道极其变态的代码拦截网,只要检测到 AI 试图直接给学生吐出一段可运行的代码,系统就会在毫秒内强制截断并重写。
与此同时,团队还借鉴了《塞尔达传说》的“红心扣减机制”:
当系统后台检测到某些学生在极短时间内连续向小鸭子追问几十个问题、试图靠套话白嫖思路时,学生的“生命值红心”就会被扣光,强制进入冷却锁定状态。
学生必须离开对话框,老老实实回到终端编译器前自己敲代码、查日志,才能重新获得提问资格。
优质教学设计的核心,在于运用技术推动学生完成自主推导与高强度的深度思考。
05翻转课堂 2.0:大学百年秩序的重构
当 AI 接管了“一对一概念讲解”,大学教室到底还剩下什么价值?
哈佛团队给出的实践方向,是一场被称为 “翻转课堂 2.0” 的教学重构。

▲ 哈佛科学教育研究实验室(SERL)对个性化 AI 教学范式的总结
在传统的大学体系里,最昂贵的面授课时,往往被浪费在最廉价的“单向知识灌输”上,教授在讲台上推导公式,台下两百个学生神游天外。
而在哈佛描绘的未来范式中,职责被重新划分:
- 首次深度接触(First Substantial Engagement)外包给 AI
:深夜两点,学生在寝室里和带护栏的定制 AI 斗智斗勇,自定步调地完成基础概念的破冰建构; - 重构实体课堂的不可替代性
:把白天宝贵的名师与同伴时间,彻底留给更高维度的批判性辩论、跨学科团队协作、开放式实验排错与高难度综合项目。
早在 1984 年,著名教育心理学家本杰明·布卢姆(Benjamin Bloom)就提出了著名的“2 Sigma 难题”:一对一导师辅导,能让普通学生的成绩跃升整整两个标准差(相当于从中等水平直接冲进前 2% 的顶尖梯队),但高昂的师资成本让这种模式注定只能服务极少数精英。
40 年后的今天,这扇被成本锁死的重门,终于被工程化的大模型撕开了一道裂缝。
这场实验最终揭示的核心,正是教育中个性化引导与深层互动的根本价值。
技术并不能取代那些启发思考、组织思想碰撞的导师;它所重构的,是把课堂从单向传授转变为激发创造力的高地。