ARTICLE · 1019431
AI 走进课堂(四):横向对比与趋势总结——大厂教育 AI 的三条落地路线
“二语聊斋”学术观察专栏 · 第 04 期
AI 走进课堂
教育垂域 AI 落地案例分析
北京语言大学 王建勤

机器人与教师课堂协同教学场景(概念示意图)
QUOTE
你可能想不到:
AI走进课堂并非易事
真正的约束不是算力,而是课堂上那个人愿不愿意用它
国外大厂AI已经走进课堂
国际中文教育领域还在徘徊,何时能落地呢?
本文看点
01
四家五方摆一起:谁买单决定产品长什么样
02
六大环节谁在承接,哪一格还是空白
03
一份必须端上来的冷水:两年随机对照试验说了什么
“AI 走进课堂”系列目录 · 共 4 期
① Anthropic Claude for Teachers:大厂如何进入教师的备课工作流(9-2)
② Google Gemini 学生 AI 工具:苏格拉底式自适应辅导(9-6)
③ OpenAI ChatGPT Edu:高校的合规化 AI 部署(9-12)
④ 横向对比与趋势总结:教育垂域 AI 的三条落地路线(本期)
01
SECTION
一、收官之前,先把另外两位玩家请上桌
前三期拆解了三家公司:Anthropic 把 AI 放进教师的备课桌,Google 把 AI 改造成苏格拉底,OpenAI 把 AI 打包卖给学校。收官这一期要做两件事:把两位被反复提及却始终没有单独成篇的玩家请上桌,再把四家摆在一起看——谁买单,护城河是什么,哪些数字靠得住。
Microsoft 的位置是“入口”。2026 年 1 月,微软在伦敦 BETT 教育技术大会上更新了教育栈,思路很明确:不做AI 独立产品,而是嵌入学校已经在用的工具里。四个落点:一是 Microsoft 365 Copilot 里的 Teach 模块,生成教案、量规、测验,并按阅读水平分级,宣称课标对齐覆盖 35 个以上的国家与地区;二是面向学生的 Study and Learn 智能体,把课堂内容转成闪卡、填空、配对与测验,依据是提取练习(retrieval practice,即合上材料凭记忆回想,比反复阅读更利于长期记忆)与适应性节奏;三是 Microsoft 365 LTI,把 Copilot 与 Reading Coach 直接嵌入学校自己的学习管理系统;四是作业的 AI 使用控制,由教师逐项声明这次作业是否允许用 AI、允许用哪些预设提示词。定价口径:Copilot Chat 用学校或工作账号登录即可免费使用(含 GPT-5),付费的 Microsoft 365 Copilot 学术价是每人每月 18 美元。
Khanmigo 的位置是“教学法”。 它来自非营利机构可汗学院,2023 年上线,技术侧与 OpenAI 合作。定价结构相当特别:教师完全免费(官方说明是在微软资助下、跑在 Azure OpenAI 服务上,覆盖 44 个以上国家与地区的英语用户);学生与家长每月 4 美元或每年 44 美元,一个家长账号可挂 10 个孩子;学区按学生数年计费,公开来源给出的单价口径不一。 2026 年 1 月还有一件事值得记下:Google 宣布可汗学院开始接入 Gemini 模型,首批落在 Writing Coach 上——Khanmigo 的模型层从单一供应商变成了多供应商。 教学法归教学法,模型归模型,这是教育产品走向成熟的样子。
国内生态只作参照:讯飞星火、豆包爱学、文心、有道子曰、好未来九章,走的多是“区域下沉 + 硬件绑定 + 政策牵引”的组合。一个口径提醒:国内厂商的服务规模数字多来自企业宣传或第三方报告,未经官方审计,不宜与欧美机构的公开合同价、随机对照试验数据直接横向比较。
02
SECTION
二、三条路线的底牌

图 1 | 四家头部大厂教育 AI 产品横向对比
| 教师端 | Anthropic | |||
| 学生端 | ||||
| 机构端 | ||||
| 生态端 |

图 2 | 教育 AI 的路线定位:改变个人,还是改变学校
这张表里最容易被忽略的是最后一列。前三期的评价反复出现同一个判断:教育 AI 的成败很少取决于模型能力,而取决于它落在谁的日常里。Anthropic 落在教师的时间表上,Google 落在学生的做题动作里,OpenAI 落在学校的采购与合规流程中,Microsoft 落在学校已经在用的 Office 与 Teams 里。
Microsoft 的位置因此很微妙:它不争“谁的教学法更好”,它争“AI 从哪个入口进来”。学校本来就在用 Word、Excel、Teams,Copilot 是零迁移成本;短板也一目了然——如果日常工作流不在微软生态里,这套优势会迅速缩水。
还有一个口径变化必须记录:Copilot 曾于 2025 年 9 月一度向未授权用户在 Word、Excel、PowerPoint 中开放,2026 年 4 月 15 日微软已撤回该调整。教育采购最怕的不是涨价,而是口径变化。
03
SECTION
三、六大环节:谁在承接哪一段

图 3 | 六大教学环节 × 五家产品覆盖强度
备课是竞争最拥挤的一段:Anthropic 用课程标准知识图谱加教学 Skills 打头阵,Microsoft 把教案、量规、测验与分级做进一个界面,Khanmigo 免费提供教案、量规、随堂检测与分组建议,OpenAI 走自定义 GPT 与课程知识库。
授课最弱。真正在课堂里同时发生的 AI 介入仍然稀少,最接近的是 Microsoft 的 Reflect(课堂情绪与参与度自查)与 Speaker Coach(口头表达实时反馈),以及 Google 在 Classroom 里一键部署的学习会话。
辅导是学生端的主场。Google 的 Guided Learning、Khanmigo 的苏格拉底式导师、OpenAI 的 Study Mode,三家都明确拒绝直接给答案,改走提问与分步引导。
评价这里有一条红线:Khanmigo 不评分。 它生成量规、汇总学生进度,最终打分仍由人来做。“AI 生成评价标准”和“AI 完成评价”是两件事,前者可用,后者需谨慎。
教研最被低估,目前各家都还没有形成拳头产品,机会是敞开的——课堂行为分析、教案版本对比、集体备课素材沉淀,都属于这一格。行政则由 Microsoft 与 OpenAI 主导:文档、表格、邮件、会议纪要、定时任务,本就长在它们的底盘上。
04
SECTION
四、一盆必须端上来的冷水
前三期反复遇到同一个问题:自报数据与独立证据之间的落差。 第 2 期提到 Google 自报的 5.5 个百分点与 31% 偏好度,第 3 期提到 OpenAI 的合作院校数量与合同规模——都是官方口径,值得记录,但不足以证明“学习真的变好了”。收官篇必须补上的,是一份来自第三方、可核查的硬证据。
2026 年 8 月 17 日,美国国家经济研究局(NBER)发布工作论文第 35620 号《One Click Away: AI Tutoring with Khanmigo in a Two-Year School Experiment》,作者是多伦多大学的 Philip Oreopoulos 与 Charles River Associates 的 Nina Low。研究在田纳西州汉密尔顿县 18 所初中做了为期两年的整群随机对照试验,53 个年级内集群(28 个处理组、25 个对照组),覆盖 6,902 个“学生—学期”观测。处理组学生在每天 25 至 40 分钟的数学校本补习时段使用 Khanmigo,并明确配置为“辅导而非给答案”模式。
结果要分三段看:
意向治疗估计:每学期数学成绩提升 1.26 个全国百分位等级(标准误 0.60),约合 0.04 个总体标准差;两学年合并约 0.06 至 0.08 个标准差。
分年看:第一年约 0.02 个标准差,与零无法区分;第二年 0.084 个标准差(标准误 0.041)。作者把第一年的无效归因于实施起步慢。
全年实际参与学生的隐含效应:第二年达到 0.142 个标准差。
而摘要里最该被反复引用的,是作者自己的这一句:“这些增益与不使用 AI 辅助的可汗学院练习所产生的结果相似。” 项目成本约为每生每年 15 美元。
原因不在模型,在使用:96% 的学生至少尝试过一次,但中位数学生只在 33% 的练习日与它对话、只在 14% 的练习环节里提问,在出错时也只有 17% 的环节去问它;发出的消息大多是裸答案或点击预设提示。作者的结论很重:“真正的约束是参与度:要兑现 AI 辅导的承诺,需要让学生用它,而不只是给他们权限。”可汗学院首席学习官 Kristen DiCerbo 也公开承认,有访问权限的学生中只有约 15% 会经常使用。
两点补充:可汗学院回应称,对照组是“照常进行”的补救教学,其中 14 所学校的对照组本来就在用其他数学软件,因此 0.14 个标准差是相对于已有教育技术的增量,而非相对于“什么都不用”;该论文尚未经过同行评审。
为什么这盆冷水对国内读者格外重要? 它把“AI 进课堂”的成败,从“模型够不够聪明”这个技术问题,拉回到了“教师有没有把它嵌入日常教学流程”这个组织问题。
05
PRACTICE
五、给语言教师的五点可迁移做法
1. 把“给答案”改成“给支架”。 不要只说“帮我写一段 HSK 三级对话”,改成“生成一段 HSK 三级对话,并在每个生词后附一个引导性问题”。Google 与 Khanmigo 已经证明这条路走得通,而它在任何一款通用工具里都能复现。
2. 用“同一知识点、三档材料”做差异化。 把一篇课文按基础、达标、挑战三档改写,保留关键术语不变。Teach 模块与 Khanmigo 的文本分级器把它做成了按钮,用通用工具加明确指令同样可行。
3. 把课程语料做成可复用知识库。 把课文、词表、偏误示例喂进去,把评分标准写进指令,让不同水平的学生拿到不同难度的反馈。关键是让课程资产留在组织里,而不是散在个人的聊天记录中。
4. 把“错误”变成教学资源。 研究里最刺眼的数字是“出错时只有 17% 的环节会去提问”。那么能不能把“向 AI 提问”设计成一项必须完成的作业动作?比如要求学生在作文二稿中,附上与 AI 就三处语法错误的对话记录。
5. 让 AI 承担“红队”角色。 Writing Coach 会切换视角挑论点的毛病。中文写作与口语训练同样适用:让学生用 AI 扮演一个“不同意的读者”,逼自己补证据、补逻辑。
06
SECTION
六、四个必须警惕的坑
坑一:数据隐私,不能只听承诺。 第 3 期已经看到,即便是签了合同的机构版,“成员数据导出”“数据保留期”“数据驻留”这些开关都会实质影响学校能用什么。个人版工具更要注意:对话是否用于训练、上传的作业是否含姓名与成绩,都要逐项确认。
坑二:学术诚信,不能靠一刀切禁令。 微软 2026 年 2 月推出的作业级 AI 使用控制,思路是把“允许 / 不允许”落到每一次作业上,并给学生预设提示词。这比全校禁用更可执行——禁不掉的东西,不如把它规范起来。
坑三:模型幻觉与引用准确性。 第 2 期已记录,Google 官方也承认引用与准确性仍有缺口。AI 生成的例句、语法解释、文化背景说明,每一条都需要人工过一遍。
坑四:数字鸿沟与参与率。 96% 的尝试率与 15% 的常规使用率之间的落差是一个极其重要的警示:发放账号不等于产生影响。 家庭设备、网络条件、教师培训、课堂时间安排,任何一环缺位,都会把“AI 赋能”变成“AI 摆设”。
07
SECTION
七、写在系列结束:教师是方向盘,不是乘客
四期走下来,路线分工已经清楚:教师端解决“老师怎么做”,学生端解决“学生怎么学”,机构端解决“学校怎么管”,生态端解决“AI 从哪里进来”。四条路合起来指向同一个方向:从通用问答,走向进入教育的完整工作流。
但最值得记住的,可能是那个最不性感的结论。Anthropic 让教师省下的时间,如果最终被新增的行政任务吃掉,收益就是零;Google 把“给答案”改成“给支架”,如果学生根本不去提问,效果也接近零;OpenAI 把合规按钮做得再漂亮,如果教学目标没有同步改变,也只是被外包了一部分重复劳动;Microsoft 把 AI 嵌进 Word 和 Teams,如果六成教师没受过 AI 培训,嵌入也只是多了一个没人打开的侧边栏。
AI 进课堂,教师是方向盘,不是乘客。 方向盘不握在自己手里的时候,车速越快越危险。
系列回顾: ① Anthropic 把 AI 送进教师的备课桌;② Google 试图让 AI 从答案机变成苏格拉底;③ OpenAI 把 AI 合规地卖给高校;④ 四家摆在一起,看三条路线、六大环节,以及一份必须打折的乐观。
感谢读到这里的每一位。如果你觉得这个系列有用,欢迎留言、点赞、在看、转发,也欢迎关注“二语聊斋”。
08
SOURCES
参考资料(本期事实来源)
Microsoft Learn 官方培训页《The Potential of AI in Education》;Microsoft Education 官方页《Copilot in Education》(Copilot Chat 免费口径、Microsoft 365 Copilot 学术价每人每月 18 美元)
BETT 2026 大会微软教育专场报道(课标对齐 35 个以上国家与地区、Study and Learn 智能体预览、Microsoft 365 LTI 与 LMS 集成、作业级 AI 使用控制预览)
佛罗里达大西洋大学医学院 IT 支持页(2026-04-15 微软撤回应用内 Copilot 对未授权用户开放的政策)
Khanmigo 官方定价页与产品页;可汗学院官方博客对该 RCT 的公开回应
Philip Oreopoulos & Nina Low, *One Click Away: AI Tutoring with Khanmigo in a Two-Year School Experiment*, NBER Working Paper 35620, August 2026, DOI 10.3386/w35620(效应量与参与度数据出自该论文摘要与公开解读;论文尚未经过同行评审)
Google 关于可汗学院接入 Gemini 模型的官方公告(2026-01-21,自 Writing Coach 起步)
教育部《关于加强中小学人工智能教育的通知》(2024 年 11 月);国务院《关于深入实施“人工智能+”行动的意见》(2025 年 8 月)
国内教育大模型规模数据来自第三方行业报告与公开报道,未经官方审计,仅作参照
REFERENCE
本文为案例分析与行业观察,不构成产品推荐或采购建议。产品功能、定价、时间与数据均以官方公告或公开报道为准并标注来源;评论与判断为作者观点。文中定价为各机构或厂商公开口径,价格随机构与时间浮动。
还有一份“标准版”
受篇幅限制,本文把最硬核的部分压成了结论。标准版里写透了:四家产品与另外两位玩家的逐项对照表;六大教学环节 × 五家产品的完整覆盖矩阵;一份证据等级评估——哪些数字属于厂商自报、哪些属于独立第三方、哪些已经过随机对照试验,以及各自该怎么打折;国内生态参照与政策底座;国际中文教育的六个具体迁移动作(含可直接复制的课程 GPT 指令模板);一份AI 进课堂的风险与治理清单;以及本系列 4 期一手来源总目录。
获取方式:在本文下方留言,或点赞并关注“二语聊斋”,我们会把标准版单独推送给你。
二语聊斋 · 语言教育与 AI 的交叉观察
二语聊斋 · 学术观察
本文为案例分析与行业观察,不构成产品推荐或采购建议。产品功能、时间与数据均以官方公告或公开报道为准并标注来源;评论与判断为作者观点。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。