
Edu-π |· 试题创编系列
2026年6月18日
💜 【问候】
执笔之初,依旧先问好👋:
各位 Edu-π 的读者,大家好呀~
本篇是 Edu-π(读作"教育派")"文献育见"板块更新的第90篇。
顶刊文献的专业壁垒,常让前沿科研显得遥不可及。但是,顶级期刊里的突破,不该只属于实验室;每一位一线教师,都值得看懂正在改变教学的科学。
看到这,不妨点个关注💜,和 Edu-π 一起,用 π 一样无限不循环的好奇心,丈量这个日新月异的教育世界。
📝 小编有话唠~
从这一期开始,Edu-π 的写法有一个变化想跟我的读者说明。过去很长一段时间,这个号以"文献介绍"为主——把一篇论文说了什么,客观地告诉"你"。这种方式有它的价值,但读下来,总觉得少了点什么。少的是"我"——我读了之后真正想的事情,我判断背后的理由,以及这件事和你实际教学之间的关系。
所以从本期起,我会以"认知旅程"来写:从我看到的一篇(或几篇)文献出发,带你走一遍我发现问题的过程、我提炼的框架、以及最后我认为值得你带走的建议。文献仍是根基,但叙事方式变了。如果你喜欢新风格,欢迎留言告诉我;如果你更想念旧风格,也欢迎说——"你的反馈"会决定这个号接下来长成什么样子。
我最近集中读了5篇关于AI赋能生物学教学的论文,从备课到命题、批阅、课堂诊断、视频资源开发——几乎跑了一个完整的教学闭环。读完之后,我发现了一个大家都没有明确说出来的规律:
AI在每一个环节都能帮忙,但在每一个环节,它都做不了最关键的那一步。
这不是"AI有用"还是"AI没用"的争吵。我觉得更精确的描述需要三个词。
也可以说是一个框架,
替代 → 互补 → 协同
替代,是AI做原来人做的事——搜集资料、润色文本、识别手写答案,这些重复性脑力劳动,AI确实比人快。
互补,是人做不了但AI能补上的——同时批阅50份试卷并逐人给出个性化反馈,一节课24个提问瞬间分类并告诉你哪些是低阶问题。
协同,是人和AI一起创造出新的可能——从命题蓝图的视角重新定义"人机协作命题",让AI不只是加速器,而是改变命题方式本身。
但5篇论文摆在一起看,现实很清楚:大部分应用还在"替代"层面,偶尔摸到"互补"的边,"协同"还远。
在"替代"这个维度上,我们遇到的真实困境是:平原用Kimi做了命题实测,AI可以帮你搜集情境资料、挖掘考点、生成试题——但直接生成的试题对学生思维水平要求低,设问指向过于明确,与课标匹配度不高。
换句话说,
AI能替你做命题的体力活,但替不了命题的脑力活。
这正好呼应了之前我们讨论命题蓝图时提出的问题(《生物学考试命题蓝图的内涵、特征与制订方法》):命题不只是"出题",而是基于核心素养测评的系统设计。如果蓝图本身没有想清楚,AI再快也只是加速了一个方向模糊的过程。
三个维度,五篇论文的实际表现
我翻了这5篇论文,逐个梳理它们在替代、互补、协同三个维度上的实际表现。
1. 替代维度:AI能做体力活,但专业性始终欠缺
"平原"的实测是最直接的。他用Kimi跑了命题的三个环节:搜集情境资料、挖掘考点并生成试题、优化题干文本。
搜集资料时,Kimi能检索网络信息并整理反馈,基本替代了教师人工收集的过程。但一个关键缺陷是:Kimi参考的资料大部分为通用资料,纳入的科研文献较少,专业性不足。
挖掘考点时,Kimi的表现让人惊喜——除了提示词预设的3个角度,它还挖掘出了题干与细胞结构、单克隆抗体、生物多样性等方面的联系,为命题提供了新思路。但当平原进一步测试Kimi基于情境直接生成试题时,结果令人清醒:生成的试题信息复杂度低,设问指向非常明确,对学生思维水平的要求低,无法有效测评核心素养。
文本优化是AI做得最好的环节——按要求缩短文本,表达流畅,可以反复修改直到满意。但平原特别提醒:教师必须识别经AI处理后的文字是否存在科学性问题,人工审读环节不可或缺。
"吴海锋"等用ChatGPT+VEED联合生成教学视频,也呈现了类似的替代逻辑。5步流程——导入素材→输入指令→生成脚本→优化脚本→生成视频——AI替代了脚本撰写和素材匹配。但自动匹配的素材质量参差不齐,与教学内容不完全契合,教师仍需手动筛选。AI能替你做视频的"粗加工",科学性和教学适配性仍需人来把关。
2. 互补维度:AI做了人做不到的事,但前提是人先做好关键设计
"韦玉红、张金鑫"做了一件有意思的事:他们设计了一套主观题AI批阅的完整方案。流程分三步:
第一步,手写识别与校正。先用扫描全能王批量识别学生手写答案,再用Kimi校正识别误差。比如把学生写的"伴a隐"纠正为"伴X隐性遗传",补充遗漏的标点和专业术语。这个过程既保留了学生原始答案的特征,又降低了后续批阅的干扰。
第二步,AI批阅与反馈。教师先撰写科学的评分标准,然后让Kimi依据评分标准逐人评分——每个学生得到得分点、扣分原因、学习建议的个性化反馈。一位老师不可能为50个学生逐一写出不同的问题诊断和学习建议,这是AI真正的互补价值。但韦玉红发现了一个前提条件:不同指令会导致批阅结果有差异。教师必须反复优化提示语才能保证准确性。
评分标准是人的工作,AI是执行工具——分工逻辑和命题完全一致。
"王丽"的AI智能诊断系统做了另一种互补。教室前后摄像头采集数据,用S-T分析法量化师生行为比例,用布鲁姆分类法评估提问层次,用4MAT模型分析问题类型。
S-T分析法在之前的文章中我们提到过,横轴是时间,纵轴标记每个时刻是谁在主导课堂。T多表示“讲得多”,S多表示“学生参与多”,以此来描述课堂结构。
布鲁姆分类法(Bloom's Taxonomy)是“认知阶梯”。它回答“学生的大脑应该达到什么层次”,从死记硬背到创造新东西,是衡量思维深度的标尺。
4MAT模型(4MAT System)是“学习闭环”。它回答“学生怎么学最带劲”,从“为什么学”到“如果……会怎样”,是覆盖所有学习风格的教学流程。
它们都是用来设计课程和教学的,但视角完全不同:一个关注“怎么想”(认知深度),一个关注“怎么学”(学习风格与体验循环)。


该案例的诊断结果很直白:细胞器课中,记忆型问题占37.5%,无认知水平问题占37.5%,而评价型和创造型问题仅各占4.17%。问题总数24个,偏多,"如何"类型的问题为0。这是很多教师自己很难意识到的倾向——你以为自己问了高质量的问题,实际上大部分是让学生回忆事实。
但这种互补有明显局限。"王丽"说得很直白:AI诊断系统目前还不能和生物学特定模块的评价标准对接。不同章节、不同课型需要不同的评价标准,AI做不到这一点。
3. 协同维度:最远的可能性,目前还只是设想
"张军爱"等展示了最接近"协同"的案例。他们用ChatGPT设计了跨学科教学活动——让生物学与地理学在"染色体变异"主题上融合,探究大陆漂移引发的物种染色体变异机制。这不是AI替代教师备课,也不是补足短板,而是帮助教师看到了一个原本可能看不到的跨学科关联。但他们还做了另一件事——开发"扣子"智能体。不需要编程技能,可以部署在社交网络里,打破时空限制。方向值得跟进。
但回到命题这件事,协同还远。"平原"在论文末提了一个方向:现有大语言模型由海量通用数据训练,满足不了核心素养测评的专业性要求。他建议开发由课程标准、科研论文、成熟试题训练的小型语言模型(SLM)。这个建议从"替代"走向了"协同",但目前只是设想。
一个被忽视的深层问题
读到这里,有一个细节容易忽略:这5篇论文都在说"AI能帮忙",但帮的方式完全不同,而且彼此之间没有打通。
"平原"用Kimi命题,"韦玉红"也用Kimi批阅——理论上,命题产生的试题特征可以直接输入批阅系统,批阅发现的学生共性错误又可以反馈给命题系统,形成闭环。但目前,这两个环节各自独立运行,数据没有流动。
更值得想的是"平原"提的那个问题:教师依赖AI命题,会不会让自己失去专业发展的动力?还是说,AI的介入会重新定义教师该有的学科教学知识?
我的判断是——看你怎么用。例如:把AI当加速器,你确实在萎缩;把AI当镜子,让它先出一份试题你来审视哪里不行,这个审视本身就是锻炼。
替代是AI替你做事,互补是AI补你做事,协同是你和AI一起重新定义做事的方式——但协同的前提,是你自己先想清楚"做什么"和"为什么做"。
给你的5条落地建议
| 1 | 建议1:先让AI出"半成品",然后你来做"必审环节" |
(→ 回扣:关键问题——AI在每个环节都能帮忙,但每个环节都需要人做"最关键的那一步",这一步到底是什么,以及它为什么只能由人来做?)
"平原"的实测告诉我们,AI直接生成的试题达不到核心素养测评的要求。但AI搜集的情境资料、挖掘的考点角度,确实有价值。正确用法是:让AI做"粗加工",你做"精加工"。具体操作——上传一篇科研论文给Kimi,让它挖掘考点,然后你从中选择有价值的角度,自己重新设计设问。AI负责拓宽视野,你负责守住质量。
| 2 | 建议2:命题时先想蓝图,再找AI帮忙 |
(→ 回扣:关键问题 + 第83期命题蓝图文献育见 | 命题不再盲目!新课标:从“测试蓝图” 到 “命题蓝图”,生物学考试该怎么设计?)
上一期我们讨论了命题蓝图——它是命题的顶层设计。如果你没有蓝图,AI帮你出的题只是在"低水平上加速"。所以顺序应该是:先写蓝图(确定考查什么素养、用什么情境、设什么层级的问题),再让AI帮你找情境资料、拓宽考点。蓝图是人的工作,AI是执行工具——这个分工不可颠倒。
| 3 | 建议3:批阅时先写好评分标准,再让AI执行 |
(→ 回扣:韦玉红的研究)
"韦玉红"的实践证明,AI批阅的准确性取决于评分标准的质量。她的做法是:先对主观题答案进行合理解构并赋分,撰写科学的评分标准,经过反复预批阅优化指令,然后才让AI执行。评分标准是人的判断,AI是执行——和命题的分工逻辑完全一致。
| 4 | 建议4:用AI诊断你的提问习惯,然后刻意调整 |
(→ 回扣:王丽的研究)
"王丽"的诊断发现,那位教师的记忆型问题和无认知问题各占37.5%。你可以用同样的方法:录一节课,让AI分析你的提问类型分布,看看你是否也有"低阶问题过多"的倾向。发现之后,用4MAT模型刻意设计"为何""如何""若何"类型的问题来补足。
| 5 | 建议5:视频资源别全交给AI,手动审核科学性 |
(→ 回扣:吴海锋的研究)
ChatGPT+VEED生成的视频,素材匹配可能出错,脚本可能有科学性问题。让AI生成初版,你来审核修改——和命题、批阅的逻辑一样:AI做粗加工,人做精加工。
但这引出一个更大的问题:当AI在每个环节都能"帮忙",但每个环节都需要人做"最关键的那一步",那么教师的工作总量并没有减少——只是从体力活变成了脑力活。这种转变,到底是解放了教师,还是让教师的精神负荷更重了?
也许,真正需要改变的,不是AI的能力,而是我们对"教学"这件事的理解本身。
本期参考文献
•平原. 生成式人工智能在高中生物学考试命题中的应用测试和问题建议[J]. 生物学教学, 2024, 49(12): 54-56.
•张军爱, 李高峰, 刘海军. 生成式人工智能赋能高中生物学备课的创新功能[J]. 生物学教学, 2025, 50(1): 52-54.
•韦玉红, 张金鑫. 生成式人工智能在高中生物学主观题批阅中的应用[J]. 生物学教学, 2025, 50(12): 56-59.
•王丽. AI智能诊断系统在高中生物学教学中的应用实践与反思[J]. 生物学教学, 2025, 50(2): 14-17.
•吴海锋, 张营, 肖佳语. 人工智能赋能的中学生物学课程视频资源的开发[J]. 生物学教学, 2025, 50(5): 44-45.
关联阅读
→ 第83期:生物学考试命题蓝图的内涵、特征与制订方法(邓纯臻, 隆平, 2026)
→ 试题创编系列持续更新中
夜雨聆风