这两天有三件事撞在一起。
OpenAI 披露其 GPT-5.6 Sol 在安全评测中突破沙盒隔离,链式完成真实攻击路径并入侵 Hugging Face 生产系统;DeepMind 的 WeatherNext 把飓风平均预警时间提前了 24 小时;Anthropic 的未发布版 Claude 把黎曼 ζ 函数零点下界从 41.6% 推到 67.2%。
同一段时间,国内 AI 进教育这条线也在动。腾讯云混元在 K12 加大学的知识图谱已经做到 800 万以上知识点、2000 万以上关系。韩国宣布 2025 年起把 AI 引入中小学,2028 年全面覆盖。
不只是学校。科技馆、青少年活动中心这些科普阵地,这两年也在悄悄补课——展品的 AI 讲解、探究课程的 AI 辅助、甚至科技竞赛里 AI 已经从"禁用项"变成"标配工具"。科普和教育本来就是一张纸的两面,学校在发生的事,场馆迟早也要面对。
大模型这条线和教育这条线看似是两条线,指向其实是同一件事。模型再强,最后都要落到具体场景里到底管不管用。教育场景里,校长、采购方、家长最后会问的,就三个问题。
学情数据怎么收的?知识图谱搭得怎么样?用了之后升学率涨没涨?
放到科普场景里,这三个问题也完全成立:探究过程数据怎么收的?科技知识图谱搭得怎么样?用了之后孩子的科学思维涨没涨?
一、学情数据,以前只是考试那天才有的东西
早几年 AI 进校园,数据来源就三种。
学校一次性导入的历史成绩。学生做题时点对点错。偶尔的课堂答题器蹦一下。
这叫截面的数据,只看结果,看不到过程。打个比方,一个学生数学考了 60 分,卷子发下来一看,选择错 5 道,填空错 2 道,应用题扣 18 分。传统数据到这儿就结束了。
现在的玩法不一样了。
这个学生做错的那道应用题,他在草稿纸上画了 3 次图,擦掉重写 2 次,在"动点问题"那一步停了 47 秒,最后放弃了。这 47 秒的犹豫,比那个 60 分值钱 100 倍。
这就是过程数据。笔迹,修改痕迹,停留时长,卡在哪一步。这些才是 AI 真正能用的东西。
头部现在都在怎么收,我大致整理了一下。
AI 学习机搭配手写笔,把学生思考的细节全部数字化。这一步家长抵触很大,下面会讲。智能黑板搭配摄像头,能算出抬头率和表情,画出整堂课的注意力曲线。AI 阅卷不只判分,还能分析主观题的思维漏洞,错在概念混淆还是计算失误,AI 能区分。错题本把"错"拆成具体的知识点漏洞,不是简单标红。语音和视频答疑让学生讲一遍自己的思路,AI 判断他到底是真不会,还是会做但说不清。
腾讯云混元跟某 K12 机构合作的那组数据挺说明问题。作业完成时间从 90 分钟压到 60 分钟,智能答疑问题解决率 92%,期末平均分涨了 15 分。
但重点不是 92% 这个数字本身。是"问题解决率"这个指标只能靠过程数据算出来。没有过程数据,过去只能问学生"你懂了吗",学生说懂了,你信吗。
科技馆其实天然也有过程数据的土壤——一个孩子在展品前按了几次按钮、试了几种参数组合、在哪种现象前停留最久,这些都是现成的行为数据。但问题是,大多数场馆的展品日志只用来统计人流量,从来没真正用在"看懂一个孩子的探究路径"上。学校还在想办法"采集"过程数据,科技馆是已经有了但不会用。
数据闭环真正难的有三道坎。
第一道是隐私。你愿意让你家孩子的草稿纸被 AI 看完吗。笔迹,犹豫,擦掉重写,这些数据敏感得吓人。K12 阶段这一关很难硬过,只能慢慢磨。
第二道是跨学科打通。数学薄弱是函数不懂,英语薄弱是时态不懂,但底层可能都是抽象能力差。能把这一层关系挖出来,画像就比别人准一个段位。
第三道,也是最多产品死在上面的一道,是数据能不能回流到教学。数据收了一堆,老师看了没,调整教学没,学生成绩变了没。大多数 AI 教育产品死在"数据漂亮但老师不动作"这一步。
放到科普场馆,这第三道坎就是"数据能不能回流到展教设计"。观众行为数据有了,但策展人、辅导员看不看、改不改展品和教案?这道坎过不去,数据就是一堆报表。
二、知识图谱,是 AI 进教育的骨架
通用大模型啥都会一点,但它不会按教学大纲走。
学生问水为什么 100 度沸腾,ChatGPT 能答得很漂亮。但它不会告诉你这是初二物理第三章第二节,按考点应该延伸到沸点和气压的关系。考试考的是气压,AI 答的是温度,答得再好也不得分。
知识图谱干的就是这件事。
教材每章拆成几百到几千个知识点。知识点之间用"前置/后置/并列"关系串起来。每一道题、每一段讲解全部挂在知识点上。AI 回答的时候不是自由发挥,是沿着骨架走。
头部做到什么程度,我挑几家能拿到材料的讲。
智慧树长期死磕课程知识图谱,自动解析课程内容,生成结构化图谱。时空节拍把图谱和 AIGC 工具当核心壁垒,主打师范生和教师备课。超星把百万级课程资源和 AI 工具打通,老师不用从零搭。数传集团做了一件挺有意思的事,输入课程大纲,AI 自动生成教材初稿、习题库和 PPT,把"AI 辅助教材编写"做成产品。
一个参考数字。腾讯云混元在 K12 加大学的知识图谱里,已经做到 800 万以上知识点、2000 万以上知识点关系。这不是一年能搭起来的。
科技馆其实也有自己的"大纲"——就是展品体系和探究式课程体系。但问题是,大多数场馆的展品是按学科领域分片的(力学厅、电磁厅、生命厅),展品之间的知识关联、探究路径的前后关系,很多时候只存在于老辅导员的脑子里,没有结构化成文,更别说做成机器能理解的图谱了。学校的图谱有课标可以对标,科普的图谱得自己从零搭。
图谱真正的分水岭不是"图谱有多大",是三件事。
第一,能不能精确到考点级。"三角函数"是粗的,"正弦定理在解三角形中的应用"才是考点级。高考要求的颗粒度是后者。
第二,能不能动态更新。教材改版了,考纲变了,命题趋势变了,图谱能跟着变吗。这要求背后有教研团队和 AI 协同的迭代机制,不是纯技术问题。
第三,能不能反向诊断。学生答错一道题,图谱能立刻定位是哪个前置知识点没掌握,而不是简单说"这题错了"。
对科普来说,这三条同样适用,但"考点级"要换成"探究节点级"——"浮力"是粗的,"通过改变排开水量观察浮力变化并提出可验证的假设"才是探究节点级。科普教育的颗粒度要求,其实比应试教育更细,因为它要的不是答案,是思维过程。
三、闭环跑起来之后,护城河在教学干预的精度
数据和图谱都是基础设施,真正的胜负在"看完数据之后,老师和学生该干嘛"。
三个层级差别巨大。
层级一,自适应推送,由机器自动完成。错一道函数题,自动推 3 道同类题,加 1 个讲解视频,加 1 个易错提醒。这层 2024 年就普及了,没啥壁垒。
层级二,路径重规划,机器为主,老师监督。系统发现学生连续 3 章函数题错率高,自动调慢节奏,插入前置知识点的复习,降低难度但保证掌握。这层需要图谱和学情数据同时够厚。
层级三,教学决策建议,老师为主,机器辅助。系统给老师发报告,"本班 23% 的学生在函数单调性证明上集中卡壳,建议下节课先用 10 分钟复习导数与单调性的关系,再切入新内容"。
这层才是数据闭环的终点,AI 真正开始影响教学,不只是配合学习。
一个被忽略的真相是,大多数 AI 教育产品只做到层级一,少数做到层级二,能稳定做到层级三的极少。
原因也不复杂。层级一只需要算法。层级二需要图谱加上足够样本。层级三需要老师真的愿意看报告,也真的会改教学,这是组织层面的事,不是技术问题。
所以赢家只能是技术、教研、师训三位一体的玩家。这也解释了为什么 2026 年教师 AI 培训突然变成香饽饽,不少地方师范和职校的研修班开始把"用 Coze 搭教学智能体"作为正式内容,老师要从讲课者变成 AI 训练师和学习设计师。
这三个层级放到科技馆场景里也完全对应。层级一是展品的 AI 讲解和互动推送,层级二是个性化参观路径和探究路径规划,层级三是给辅导员的教学决策建议("今天这批孩子在变量控制上普遍薄弱,建议辅导时加强这一块")。目前大多数科技馆的 AI 应用还停留在层级一,能做到层级二的不多,层级三几乎是空白。而空白的地方,恰恰就是机会。
同样地,科普场馆的 AI 落地,瓶颈也不在技术,而在人——辅导员愿不愿意用、会不会用、能不能把 AI 当成探究教学的助手而不是威胁。这也是为什么"场馆 FDE"(场馆课程设计工程师)这个方向值得关注:未来的科技馆辅导员,可能也要从"讲解者"转型为"AI 训练师 + 探究学习设计师"。
四、三个判断
第一个,未来 12 个月会有一批 AI 教育公司被教育主管部门清退。拿不出过程数据,图谱是买的,教学效果说不清的,采购目录直接划掉。
第二个,K12 会先跑出区域级数据闭环。一个区或一个市统一采购,统一数据格式,统一图谱标准。这条路是可能走通的。韩国已经宣布 2025 年起把 AI 引入中小学,2028 年全面覆盖,是一个参照样本。
第三个,也是最激进的一条,教师评价体系会开始和 AI 使用数据挂钩。老师用了 AI,学生进步了,绩效加分。老师抵触 AI,班级数据没改善,培训或者调整。这条比前两条都激进,但方向上几乎不可避免。
这三条判断放在科普领域也基本成立,但节奏会慢半拍。学校有课标、有考试、有明确的评价体系,AI 落地有抓手。科普场馆的评价体系本身就模糊——科学素养怎么测、探究能力怎么量化,行业还在摸索。所以 AI 进科普,会比 AI 进教育晚 1 到 2 年,但大方向是一样的。
夜雨聆风