ARTICLE · 1054005
AI 会做题,却未必会教人:首个“学习者适配”教学智能体基准揭示了什么?
论文标题:Findings of the First Teaching Monster Challenge: A Benchmark of Pedagogical Content Knowledge in AI Agents
作者:Yi-Cheng Lin、Yu-Kai Guo、Szu-Chi Chen、Bo-Han Feng、Yun-Man Hsu、Hsiang Hsieh、Yu-Jung Lin、Yue-Ling Wu、Jia-Kai Dong、An-Yu Cheng、Yu-Han Huang、Lok-Lam Ieong、Kuan-Yu Chen、Ming-Douo Tchouang、Shao-Hua Sun、Che Lin、Jian-Jiun Ding、Hung-yi Lee
作者单位:National Taiwan University;NTU AI Center of Research Excellence
发表信息:arXiv 预印本(v1,2026 年 8 月 9 日;论文 PDF 标注 AAAI 2027 版权)
论文链接:arXiv:2608.08852
挑战赛主页:Teaching Monster Challenge
关键词:AI Agent、教学视频生成、Pedagogical Content Knowledge、Learner Persona、LLM-as-a-Judge
一、一句话概述
这篇论文提出了首个把学习者画像(learner persona)作为显式评价条件的教学视频生成基准:智能体不仅要把知识讲对,还要针对不同年级、先修知识和注意力跨度,把同一个主题讲成不同的课。
首届挑战赛给出的答案很鲜明:今天的 AI 已经比较擅长覆盖知识与组织内容,但在教学适配、脚手架设计和多模态呈现上仍明显不足;更耐人寻味的是,自动 LLM 评委能淘汰差作品,却几乎无法给最强系统排出可靠名次。
二、研究背景与动机:会回答,不等于会教学
生成式 AI 已经能解题、写代码、回答专业问题,也能自动制作幻灯片、旁白和视频。但教学不是把正确答案换一种语气说出来。真正的教师必须判断:学习者已经知道什么、哪里最容易卡住、应该先讲直觉还是公式、需要什么例子,以及信息应该以怎样的节奏出现。
论文借用 Shulman 的经典框架,把教师知识分成三层:
• 🧩 Content Knowledge:是否真正掌握学科内容; • 🧩 Pedagogical Knowledge:是否懂得一般性的教学组织与表达; • 🧩 Pedagogical Content Knowledge(PCK):能否把特定知识转换成某个具体学习者能够理解的形式。
PCK 是这项工作的关键。一个模型可以在数学题上得到满分,也可能完全不知道该怎样向一名害怕公式的九年级学生解释牛顿第二定律。过去的评测分别关注解题正确率、文本辅导对话或视频感知质量,却很少把“这堂课究竟是为谁讲的”纳入核心评分。
Teaching Monster Challenge 因此不要求系统回答一道题,而是要求它在无人介入的情况下,端到端生成一段完整教学视频。输入包含课程要求和学习者画像;输出既要正确、完整,又要体现对目标学习者的适配。

图1:任务的 matched-pair 设计。同一课程要求分别搭配不同学习者画像,系统应生成难度、例子和呈现方式不同的教学视频。
这种配对设计非常重要。论文中的部分题目固定 course_requirement,只改变 learner_persona。当主题难度与内容范围保持不变时,两段视频之间的差异更有可能来自学习者适配,而不是题目本身。
三、基准如何设计:从一道“需求”到一堂完整的课
3.1 输入、输出与任务范围
每个任务包含两部分输入:
• 🔸 course_requirement:给出学习目标和必须覆盖的核心概念;• 🔸 learner_persona:用自然语言描述年级、背景、已有知识、知识缺口和注意力跨度。
参赛系统必须在 30 分钟生成预算内返回一个完整视频。任务覆盖 Physics、Biology、Computer Science 和 Mathematics 四个中学阶段 STEM 学科,并以美国 AP 课程体系作为范围锚点。
论文刻意把任务限定为 single-shot instructional video generation。系统需要一次性完成整堂课,而不是像互动式 tutor 那样根据学生后续提问再修正。因此,这个基准衡量的是“把学习需求转化为教学内容”的能力,不是连续诊断与动态反馈能力。
3.2 四个评价维度
每个视频都从四个维度接受评价:
• ✅ Content Accuracy:事实是否正确,是否出现幻觉或关键错误; • ✅ Pedagogical Logic:讲解顺序、脚手架、因果衔接是否清楚; • ✅ Learner Adaptability:术语、难度、节奏和先修知识是否匹配画像; • ✅ Engagement and Multimodal Presentation:旁白、视觉、动画与注意力引导是否协同。
前两项更多检查“内容有没有讲对、讲顺”,后两项检查“这个人能不能听进去、看明白”。论文后面的结果正是在这两组能力之间拉开了明显差距。
3.3 三层评测漏斗
大规模视频评测很昂贵,论文采用逐层收缩的三阶段流程:
1. Layer 1:LLM-judge 自动筛选。 对所有提交进行四维打分,选出前 10 个系统; 2. Layer 2:众包两两比较。 普通观看者在同一题目下比较两段视频,选择哪一段更能帮助指定学习者理解,并以 Elo 汇总排名; 3. Layer 3:专家排序。 教师、校长和大学教授组成专家组,直接排序三支决赛队伍,决定最终名次。
这套设计把自动评测定位为高吞吐量筛选器,把稀缺的人类判断集中到强系统之间的细微差异上。它既是比赛流程,也成为论文研究“LLM 评委是否可信”的实验装置。
3.4 LLM 评委并不是一个提示词,而是三智能体协作

图2:Layer 1 的三智能体评测架构:感知智能体生成内容地图与多模态审计,评分智能体负责准确性与教学逻辑,画像评审智能体负责适配性与参与度。
🔧 Perceiving Agent 先观看原视频,提取带时间戳的内容地图,并进行多模态审计,但不直接打分。随后,Grading Agent 根据结构化结果评估 Content Accuracy 和 Pedagogical Logic;Persona Judging Agent 会再次参考原视频,评估 Learner Adaptability 与 Engagement。
评分也不是让模型凭感觉给 1~5 分。每个维度从 4.0 起步,根据 rubric 执行扣分或奖励:严重度指标按三级扣分;事实错误等计数指标按出现次数扣分,单项扣分最多 2 分;超出通常预期的表现可以获得奖励,奖励上限为 1 分;最终分数截断在 1~5 之间。
这一机制的优点是审计路径相对清晰,但后续结果显示:评分稳定,不等于排序有效。
四、参赛系统如何生成教学视频
论文没有提出一个统一的新模型,而是通过赛后问卷总结参赛方案。绝大多数系统都收敛到六阶段级联工作流:
4.1 学习者画像解析与路由
系统先把自由文本画像转换成结构化 JSON,并把年级、先修知识、认知目标和注意力跨度传递给后续模块。有的团队还按学习者条件选择不同规划模型:需要深入讲解时使用能力更强的模型,注意力较短时选择更简洁的规划路径。
这里的关键不是“把画像放进 prompt”这么简单,而是让画像成为每个阶段的条件。否则,系统可能只在开场说一句“这是一堂为初学者准备的课”,后续内容仍然保持统一模板。
4.2 课程规划与知识落地
规划模块根据课程要求和画像生成完整教学大纲。为降低幻觉,一些系统用 Web Search 对内容进行 grounding;为避免结构松散,一些系统以 Bloom’s Taxonomy 约束目标层次,再通过闭环 LLM 检查大纲是否满足预定认知要求。
这一步决定“先讲什么、后讲什么”。如果课程规划没有显式补齐学习者缺失的先修知识,后面再精美的动画也只能包装一个存在逻辑跳跃的脚本。
4.3 幻灯片与脚本生成
系统逐页生成画面和旁白,常见载体包括 Marp Markdown、LaTeX 与 HTML/CSS。入围 Layer 2 的团队中,HTML/CSS 最常见,因为它提供更细的布局控制。
为了减少元素溢出、遮挡和代码错误,有的系统使用固定模板库,有的则加入 reviewer–fixer 循环:检查智能体发现布局或代码问题,生成智能体再迭代修改,直到页面通过检查。
4.4 视觉、动画、语音与时间对齐
参赛者普遍发现,图像生成模型不适合直接制作需要精确标注的科学图。一种更稳妥的策略是:概念性插图交给生成模型,数学图形交给 matplotlib 等程序化工具;另一些团队预先建立图像库,再让智能体检索选择。
动画方面,Manim 是最常见的引擎之一。由于一次性生成 Manim 代码容易失败,部分团队把过程拆成“JSON storyboard → code generation”两步。旁白由 TTS 生成后,再使用 faster-whisper 恢复词级时间戳,让动画、指针和讲解在具体单词处同步触发。
从工程视角看,这说明高质量 AI 教学视频并不是单一大模型的直接输出,而更像一个需要规划、渲染、审查、对齐和编译共同工作的生产系统。
五、数据规模与实验设置
挑战赛包含 Warm-up、Preliminary 和 Final 三个阶段:
• 📊 Warm-up:两轮校准,共有 46 支团队至少提交过一次,产生 1,696 段视频; • 📊 Preliminary:两轮各 16 个任务,77 支团队产生 1,612 段视频; • 📊 Layer 1:基于 gemini-3-flash的三智能体评委使用 22 个 rubric 子项,选出前 10 名;• 📊 Layer 2:59 名 Prolific 参与者完成 246 次两两比较,以带 90% bootstrap 置信区间的 Elo 排名; • 📊 Final:三支决赛队针对 16 个专家设计题目生成 48 段视频,由专家组完成最终排序。
组织者还建立了三种参照系统:级联式生成管线、NotebookLM Video Overview 商业黑盒,以及从 257 个 Creative Commons 视频中检索内容的静态框架。第三种方法几乎不做画像适配,仅用注意力跨度约束视频时长,因此可以作为“内容相关但不个性化”的下界参照。
读者视角:看到这里,真正应该验证的并不只是“谁夺冠”。更关键的是三个问题:系统把知识讲对了吗?它真的针对不同学习者改变了吗?自动评委能否识别这些差异?
六、实验结果:内容能力领先,教学适配掉队
6.1 总排名:三层评测给出了不同答案

表1:十个入围系统在 LLM 评委、众包 Elo 与专家排序中的结果,以及三种组织者基线的自动评分。
最终冠军是 tsunumon,其次是 OmegaZeroRe 和 ScaffoldAI。但自动评委只把冠军排在第 4;自动评委排名第 1 的 Team 67,到了众包阶段仅排第 8;自动排名第 2 的 Kuro,众包排名为第 10。
更有现实意味的是三种组织者基线。众包比较中,级联管线、NotebookLM 和静态检索框架都被推断位于第 1~2 名之间,只有冠军 tsunumon 明确胜过它们。也就是说,多数参赛系统尚未稳定超越成熟商业产品,甚至没有稳定超越一段检索得当的人类制作视频。
6.2 RQ1:系统最擅长什么,最薄弱的又是什么?

图3:四个维度的分数分布。虚线表示均值;接近 1 分的尖峰主要来自跑题或占位视频。
全部提交的平均分依次是:Content Accuracy 4.31、Pedagogical Logic 4.19、Learner Adaptability 3.77、Engagement 3.86。内容正确性和组织逻辑集中在高分区,而学习者适配最低,说明“会讲什么”已经比较成熟,“为谁而讲、怎样让他理解”仍是短板。

表2:1,612 段初赛视频产生的 6,699 个负面标记。类别百分比表示该类标记占比,具体指标百分比表示触发该问题的视频比例。
问题最集中在四个方向:
• 🧩 视觉呈现占 39%:33% 的视频出现 ineffective visual representation,24% 缺少明确 visual signaling,23% 存在旁白与画面脱节; • 🧩 学习者适配占 27%:29% 缺少必要脚手架,23% 术语过载,22% 存在先修知识缺口; • 🧩 内容问题占 16%:更多是标题与深度不匹配、覆盖不完整或解释不够深入,而非普遍性知识错误; • 🧩 旁白问题占 8%:33% 的视频触发单调或机械语音问题。
不过,“内容得分高”不能被误读为“内容完全可靠”。17% 的视频仍包含关键事实错误,12% 存在因果不一致。论文的结论应理解为相对优势:内容正确性优于适配与呈现,但仍远未达到可以放弃人工校验的程度。
6.3 RQ2:AI 是否真的根据学习者画像做了改变?
论文没有只看自动评分,而是设计了 persona identification study。观看者看完一段视频后,需要从三个候选画像中选出它面向的学习者,随机猜测的准确率为 33.3%。

图4:学习者画像识别准确率。静态检索基线为 30.8%,十个入围系统为 51.7%,人工视频为 61.9%。误差线是 Wilson 95% 置信区间。
69 名参与者共提供 214 次判断。静态检索基线只有 30.8%,接近随机水平;入围 AI 系统达到 51.7%;人工制作视频达到 61.9%。进一步的 GEE 模型表明,实验组相对于静态基线的正确识别优势比约为 2.44,p = 0.0069。
AI 组与人工视频组之间的差异不显著,优势比约 0.78,p = 0.4220。但论文特别提醒:这只是“没有检测到显著差异”,不是证明两者等价。更稳妥的结论是,AI 的适配信号确实能被人感知,但适配质量仍不够好。
6.4 RQ3:LLM 评委为什么排不好强系统?
十个入围系统的自动分数都挤在接近 5 分的狭窄区间,产生明显天花板效应。Layer 1 排名与 Layer 2 众包排名的 Spearman 相关系数仅为 ρ = -0.17,几乎没有一致性。
这并不能简单归因于“LLM 每次打分都随机”。论文对同一 (system, topic) 单元进行了三次重复评测,综合分数的组内标准差中位数只有 0.14。换句话说,评委可以稳定地给出相似分数,却稳定地抓不住人类在强作品之间真正在意的差别。

表3:自动评委最常记录的指标与众包解释中最常出现的偏好理由。左右百分比定义不同,应该分别纵向阅读。
自动评委对许多指标几乎“逢视频必记”,例如 pure-calculation bias 的记录率为 99.7%、visual signaling 为 97.5%。这些指标可能有价值,却因所有强系统都差不多而缺乏区分度。
人类进行两两比较时,更常引用视觉效果 33.8%、内容覆盖 29.7%、例子 26.2%、难度水平 25.5%、结构 24.8% 和脚手架 24.1%。他们的决定往往来自局部但显著的体验差异,而不是把二十多个维度平均后得到的微小分差。
因此,本文并非得出“LLM-as-a-Judge 无用”的结论。更准确的定位是:自动评委适合从大规模提交中分离明显失败样本,不适合在分数饱和后充当强系统的最终裁判。
七、案例分析:精美视频为何仍可能教不好?

图5:某决赛视频的两页遗传学课件。左侧以血型谜题引入,右侧用 token algorithm 解释孟德尔分离定律。
这两页课件看起来已经很像成熟产品:先用父母血型与孩子血型的反直觉现象制造悬念,再通过 token、Punnett square 和概率图讲解等位基因分离。但论文逐项审查后发现,视觉精美与教学有效之间仍有距离。
🔸 准确性方面:“4 genotype boxes”容易让人误以为存在四种基因型。事实上,Aa × Aa 有四个等概率配子组合,但只有 AA、Aa、aa 三类基因型,其概率分别为 0.25、0.50、0.25。画面中肤色变化又没有被定义为目标性状,可能造成不必要的遗传学联想。
🔸 教学逻辑方面:开场使用 ABO 血型,随后突然切换到抽象的 Aa × Aa,中间缺少从真实案例到符号模型的桥梁。术语列表、流程图和 Punnett square 同时堆叠,也增加了视线切换成本。
🔸 学习者适配方面:目标画像是没有正式遗传学基础的七年级学生,只掌握基本概率。课件却从“父母各随机给一个等位基因”直接跳到四个 0.25,缺少 0.5 × 0.5 = 0.25 的显式推导。
🔸 多模态呈现方面:页面信息密度高,旁白缺少语调变化,在概率部分没有明显放慢,也没有指针告诉学生此刻应该看流程图、文本还是方格。
这个案例解释了全局数据中的矛盾:一个视频可以在内容和美观上都“看起来不错”,却仍在关键概念桥接、视觉指引和学习者节奏上失分。真正的 PCK 往往隐藏在这些细节里。
八、论文的主要贡献
• ✅ 提出首个显式评测学习者画像适配的端到端教学视频生成基准; • ✅ 通过 matched-pair 设计,把主题难度与学习者差异尽可能解耦; • ✅ 建立 LLM 筛选、众包比较和专家决赛组成的三层评价协议; • ✅ 用首届 77 支参赛团队的数据,刻画当前教学智能体“内容强、适配弱”的能力结构; • ✅ 通过画像识别实验验证,AI 生成视频确实携带可被人感知的适配信号; • ✅ 发现自动评委对弱系统有效、对强系统失灵,并公开任务、rubric、评分轨迹与人类判断,用于同时研究“更好的教师”和“更好的评委”。
九、不足与未来方向
9.1 当前不足
🔸 没有直接测量学习增益。 基准以专家和观看者判断的教学质量作为学习效果代理,但“看起来更会教”不一定等同于学生在前测—后测中学得更多、保持得更久。
🔸 评测漏斗存在入口依赖。 Layer 1 决定谁能进入人类评测,而论文又证明 LLM 排序与人类偏好不一致。虽然它善于淘汰低质量长尾,仍可能在入围边界误伤某些人类更喜欢的系统。
🔸 范围有限。 当前只覆盖 AP 对齐的四个中学 STEM 学科,视频均为英语;专家主要具有台湾教育体系背景,结果不能直接代表其他学科、语言和教育文化。
🔸 只考察单轮生成。 系统看不到学生的提问、误解与反应,因而无法评估真实教学中最重要的动态诊断、反馈和二次讲解能力。
🔸 部分基线与系统难以完全复现。 NotebookLM 是商业黑盒;参赛系统的工程总结部分来自赛后问卷。论文能够描述当时访问到的行为,却无法验证内部机制是否持续不变。
🔸 画像可识别不等于适配有效。 视频可能通过语速、词汇或表面风格暴露目标年龄,却未必真正提高理解。未来需要把“画像信号”与“学习成效”分开测量。
9.2 未来研究方向
🚀 从代理指标走向真实学习实验:加入前测、即时后测、延迟后测和迁移题,测量知识获得、保持与应用,而不只评价视频质量。
🚀 从 single-shot 走向互动教学:让智能体根据学生错误、停顿和追问动态调整解释,评测多轮诊断与个性化反馈。
🚀 改造强系统评价机制:对入围系统使用成对比较、动态 rubric、置信区间与可审计证据链,避免把接近满分的绝对分数硬排序。
🚀 强化跨模态教学对齐:把“旁白说什么、画面突出什么、指针指向哪里、动画何时发生”纳入统一规划,而不是在流水线末端被动拼接。
🚀 扩展语言、学科与特殊学习需求:覆盖人文社科、职业教育、多语言环境,以及阅读障碍、听觉障碍等更丰富的学习者画像。
十、总结
Teaching Monster Challenge 把一个常被忽略的问题推到台前:AI 生成一段知识正确的视频,离真正“教会一个具体的人”还有多远?首届结果表明,这段距离主要不在知识检索,而在脚手架、先修知识桥接、节奏控制、视觉引导和跨模态同步。
论文的另一个贡献是揭示了评测本身的难题。一个自动评委可以稳定地打分,也可以有效清除明显失败样本,但当所有强系统都接近满分时,它未必知道人类真正偏好哪一个。未来的教学智能体研究因此有两条同样重要的主线:一条是让 AI 更会教,另一条是让评测更懂什么叫“教得好”。
💡 延伸思考:个性化教学的下一道门槛,也许不是让模型知道更多,而是让它持续维护一个关于学习者的“认知状态模型”:哪些概念已经掌握、哪些误解刚刚暴露、下一步应该减少还是增加抽象程度。只有当课程生成从“画像条件化内容生产”升级为“基于学习证据的闭环决策”,AI 教师才会真正从视频生成器走向教学者。