ARTICLE · 1123044
AI家教有没有用?关掉AI再做一遍
一道题讲得通俗,追问也都答上来了,最后还夸一句“你已经掌握了”。这样的AI辅导,很容易让人觉得这一小时没有白花。
但判断有没有学会,还差一个动作:关掉对话框,换一道题,自己做。
这个动作很朴素,却让“AI家教有没有用”变成了一个可以检查的问题。我们既不用因为它讲得漂亮就买单,也不用先争论机器到底懂不懂教育。先看看,得到辅导的人,离开它以后能做什么。
▍把考卷交给学习者
9月23日首发、9月30日修订的StudentBench预印本,把考察重点放在了这里。研究分析2383名成年人的2469次GRE数学或语文实验。参与者随机进入AI辅导、真人辅导或看无关教育视频的对照组;完成一小时的分组活动后,按要求独立完成另一套题的后测。下图是流程简化示意。

这比展示一段精彩的讲题对话,多问了一层。讲解清楚,是教学过程中值得观察的表现;学生能否独立完成新题,才直接关系到这次学习留下了什么。两者都重要,却不能用同一张截图回答。
标题里的“再做一遍”,也不必是重抄刚看过的原题。答案还在眼前时,顺着步骤写下来,检查的是能否跟上。换一道考同类概念的题,才有机会看见:究竟理解了方法,还是记住了上一道题的样子。
▍等效结论有多大范围
论文报告,合并数学和语文后,AI与真人辅导的学习增益达到统计等效。它采用的边界是正负0.25个标准差,约正负4.09个百分点;语文单项没有证明等效,真人组也只有140次实验。
“等效”有明确尺度。可以把它理解为:研究用一道设定好的范围,检查两组平均差距是否足够小。这比“没检出显著差异,所以一样好”严格。读者仍要问,这个范围对自己的学习目标是否合适,平均表现又能否代表具体的人。
还要留意论文的研究局限:它没有设置独自练GRE题的对照,也没测长期保持;研究由Handshake AI资助,当前是预印本。成人考试的短期结果,不能直接当作儿童家庭辅导的效果证明。
因此,这项研究可以增加我们对AI辅导的兴趣,暂时还不能替一个家庭决定要不要换老师。家长需要考虑的还有孩子能否坚持、遇到挫折时怎样回应,以及课程是否适合。一次考试练习提供不了这些问题的全部答案。
对自学者,证据留下的问题同样具体:同样花一小时,AI讲解、自己刷题、读教材,各自能带来多少进步?比较对象少了一种,结论的适用范围就要相应收窄。认真对待一个积极结果,也包括把它尚未回答的问题留下来。
▍给一次AI辅导留个验收环节
日常使用不必复制完整实验。下面是一套可以试用的检查办法,并非这篇论文已经验证的学习方案。
先挑一个小目标。比如今天只解决“为什么列这个方程”,不要笼统要求“帮我学好数学”。学习前,找一道有可靠答案的题独立做,保留自己的过程。做不出来也有用,至少知道卡在哪里。
再让AI围绕卡点辅导。可以直接告诉它:“先看我的步骤,找出我从哪一步开始不理解。每次给一点提示,等我尝试后再继续。”这句话的作用,是把谈话组织成便于观察的练习;它并不保证AI判断正确。碰到讲法与教材冲突,要回到可靠材料核对。
辅导结束后,把聊天记录收起来。从教材或可信题库另选一道考同类概念的题,独立完成,并写下最关键的一步为什么这样做。如果只会复述AI的句子,却不能解释眼前这道题,下一次就有了明确的追问方向。
核对时也别只记一个对错。看不懂题意、选错方法、算错一步,需要的帮助并不相同。比如方法已经选对,只在运算上失误,下一轮可以练得更有针对性;如果一换题就不知道从何下手,就该请AI重新解释适用条件,而不是把同一份答案再讲一遍。
这里有个容易省掉的细节:验收题最好别完全交给同一个AI出、同一个AI判。若它在讲解、出题和批改中重复同一个错误,整个过程可能显得非常顺利。至少用一份可靠答案校准,难以判断时请老师或熟悉该内容的人复核。
当天做出来之后,还可以隔几天再试一次,或换个背景稍有不同的例子。这是在补查“还能不能记住”和“换个情境会不会用”,不必把一次答对当成掌握的终点。延后多久、换多难的题,需要按学习内容调整;论文没有给出一套通用答案。
▍从一次检查开始
如果是家长陪孩子尝试,可以先把范围缩到一道题、一个概念,再一起看独立完成时卡在哪里。不要因为一回没做出来就判断孩子不用心,也别把每次聊天都变成考试。检查的价值,是帮助下一次辅导更具体。
同样,不宜把AI的使用时长、对话条数或一页整齐的答案,直接记成学习成果。更有用的记录可以很短:今天原本哪里不会,后来哪一步能独立完成,下次还要补什么。连续留下几次记录,才更容易看出这套辅导方式是否适合自己。
AI家教有没有用,值得认真试,也值得认真验。下次结束对话时,不妨少问一句“我学会了吗”,留一道自己要完成的新题。
关掉AI以后,能独立做出的那一步,才是我们想得到的进步。