夜雨聆风学习资料网

ARTICLE · 1093124

AI 辅导让学生成绩涨 48%,撤掉工具后倒跌 17%

AI 辅导让学生成绩涨 48%,撤掉工具后倒跌 17%

同一套 AI 工具,在土耳其一项高中数学研究里带出两种结果。基础版 GPT 组的学生成绩提高了 48%,加了教学护栏的 GPT Tutor 组提高了 127%。撤除工具的那个环节给出了第三组数字,工具收走之后,基础组的成绩比从未用过 AI 的对照组低了 17%。《2026全球人工智能与教育发展报告》汇集了 32 个实践案例,把这些差异背后的条件逐条摆了出来。

涨上去的成绩,撤掉工具就掉回来

土耳其那项研究的完整结果是三段。用基础 GPT 的那一组,当次测试成绩比对照组高出 48%;换成带教学护栏的 GPT Tutor 后,涨幅拉到 127%;而在撤除工具、重新回到纸笔测试的环节,基础组的成绩比对照组低了 17%,带护栏的那一组没有出现回落。同一批学生、同一个知识点,工具带来的增益能不能留下来,差别在有没有被设计进教学流程。

管理学界的判断与此吻合。一般性的 AI 工具可以提高任务表现,但并不自动转化为学习成果。学生把题目做对了,可能是因为工具替他完成了思考环节,而不是他自己掌握了方法。当工具被移走,被替代的那部分能力缺口就暴露出来,成绩随之下落。

使用强度的影响同样明显。田纳西州一项覆盖 18 所学校、历时两年的集群随机试验显示,参与项目的学生平均每学期提升约 1.3 个百分位,而参与者的中位使用频率只有可用天数的三分之一左右。投入的资源没有全部转化为使用时长,效果也随之被摊薄。设备到位、账号开通,距离稳定使用还有一段不短的距离。

加了护栏,效果差出近三倍

把工具装进一条被约束的教学路径里,效果会出现量级差异。土耳其案例中,48% 与 127% 之间的差距出在护栏设计上。题目范围被限定、答题步骤被要求写出、错误类型被即时归类反馈,底层模型并没有更换,约束条件不同,产出的教学价值差了近两倍。

对照实验给出的数据更扎实。一项名为 Tutor CoPilot 的干预中,学生掌握率提升约 4 个百分点,而对经验较少的导师帮助更明显,说明工具先在补师资的短板。哈佛大学一项物理课程实验纳入 194 名学生做随机对照,AI 导师组报告的学习增益高于课堂主动学习组。

低成本方案的表现不弱。加纳一个项目覆盖约 1000 名三至九年级学生、11 所学校,数学成绩提升约 0.37 个标准差,采用的是对带宽要求很低的交互方式。尼日利亚一项干预的综合效果约 0.3 个标准差,英语科目约 0.24 个标准差。乌拉圭的个性化学习项目数学成绩提升约 0.2 个标准差,低社会经济地位的学生收益更高。美国佐治亚州立大学的提醒干预则让按时入学率提升约 3.3 个百分点。

这几个案例分布在四大洲,共同点是效果都出现在有明确教学目标的场景里。宽松的聊天式提问、没有任务的自由探索,目前还没有对照数据支撑其教学价值。

效果的分母是供电和连接

把视线从实验班移到全球基数,条件差距会显得更硬。2024 年全球约有 2.73 亿儿童和青少年失学,小学、初中、高中分别为 7900 万、6400 万、1.3 亿,约占相应年龄人口的 17%。按时完成率在全球范围内是小学 88%、初中 78%、高中 61%,而低收入国家只有 60%、37%、20%。

学习质量的基线同样偏低。小学结束时达到最低阅读水平的比例估计为 58%,达到最低数学水平约 44%,青年识字率约 93%。2022 年的一项模拟估计认为,低中收入国家约 70% 的十岁儿童读不懂一段简短文本。这些数字意味着,AI 辅导要在这些地区落地,先要面对的是最基础的教学缺口。

硬件条件的分布更不均。2025 年全球互联网使用率约 74%,其中非洲约 36%、美洲 88%、欧洲 92%;城市与农村分别是 85% 和 58%,男性与女性是 77% 和 71%。低收入国家的小学里,有稳定供电的约 28%。一端是联网率九成以上的课堂,另一端是连电力都只有不到三成的教室,同一套云端工具在这两端的作用完全不同。

师资的缺口也在扩大。到 2030 年,全球需要新增约 4400 万名教师,其中撒哈拉以南非洲约 1500 万名。财政能力同步受限,教育财政中仅有 41 个国家(共 183 个)同时达到两项国际参照标准。护栏设计、使用规范、教师培训这些决定效果上限的环节,恰恰是最缺人的地方。

使用规范的数量远少于工具

与工具扩散的速度相比,规范的建设慢了一拍。调查显示,不到 10% 的学校和大学有正式的人工智能使用指引。绝大多数课堂上,工具的使用边界、数据处置方式、作业允许范围都处在没有明确规则的空白状态。

已经有地方出现了实操层面的调整。韩国在 2024 年公布 76 种 AI 数字教材,2025 年起用于特定年级和学科;2025 年 8 月,相关产品又被从法定教材的分类中重新划出。从全面纳入到重新分类,中间隔了一年多,反映出教育系统对教学材料属性的判断仍在调整。

已有的规模数据说明了这潭水有多深。中国 2025 年有各级各类学校 44.07 万所,学历教育在校生 2.804043 亿人,专任教师 1870.1 万人。要在这样一个体量的系统里建立统一的使用规范,涉及课程标准、评价方式、教师培训、数据管理多个环节,任何一项都不是短期工程。

效率收益确实存在,但集中在规则清晰的场景。美国密歇根大学一个课程里,500 多名学生提出了约 1000 个问题,教师估计由此节省了 5 到 12 小时。澳大利亚南澳州的 EdChat 覆盖 1 万名学生,约 94% 的互动与课程内容相关。这两个数字背后都有同一个前提,答疑范围被约束在课程之内。

国家路径已经分叉

各国选择的时间表并不一致。中国 2026 年由五部门发布「人工智能+教育」行动计划,将目标节点定在 2030 年;新加坡 2026 年公告设立 AI 素养里程碑,计划到 2027 年让 Code for Fun 覆盖所有学校;阿联酋从 2025—2026 学年起把 AI 纳入政府学校 K—12 课程。时间跨度从两三年到五年不等,路径依赖各自的师资与财政基础。

跨国课程产品的覆盖面给出了另一种参照。芬兰的 Elements of AI 触达超过 100 万人、170 个国家、26 种语言,属于面向公众的通识产品。英国 Oak National Academy 的 Aila 工具在 2025 年初约有 3 万个账号,主要服务在职教师备课。一个做的是大众科普,一个做的是教师提效,都不直接指向学生成绩。

治理框架的更新也在同步进行。从 2019 年的《北京共识》,到 2023 年的生成式 AI 使用指南,再到 2024 年面向学生与教师的能力框架,国际层面的文件逐年在细化。相关材料同时提示,2035 年的图景不是确定性预测,案例库呈现的是分布而不是效果证明,学校自述的经验数据也缺少独立标注。

把这几组数字连起来看,效果的形成有一条可拆解的链条:工具先提高当次表现,撤除后是否回落取决于它有没有替代思考环节;护栏设计决定了增益是 48% 还是 127%;使用频率把可用时长打了三分之一的折扣;而供电率 28%、联网率 36% 这些基础条件,直接决定了方案在哪些地区能跑起来。同一款产品落在不同条件里,产出可以差出量级,这也是各国时间表无法统一的原因。

关注公众号,后台回复【报告】获取完整报告 PDF

文章数据来源:《2026全球人工智能与教育发展报告》

欢迎加入“报告洞察员”知识星球
每日持续更新最新行业洞察
星球成员可免费获取全部内容
内容更新已经累计数千份
🔗 扫码加入知识星球,解锁全部深度报告
今日星球更新内容:

相关学习资料