夜雨聆风学习资料网

ARTICLE · 1130599

教师主导的生成式人工智能辅助初中英语命题平台设计研究

教师主导的生成式人工智能辅助初中英语命题平台设计研究

——以“Jumper深圳英语试题命题与审题助手”为例

【摘要】针对初中英语教师日常命题中存在的语篇素材适配不足、题型规范依赖个体经验、审题反馈耗时以及区域中考题型对接困难等问题,本研究基于设计型研究框架构建并迭代了一款面向深圳中考英语75分制的教师自用生成式人工智能(GAI)辅助命题与审题平台。以《义务教育英语课程标准(2022年版)》三级词汇与素养导向评价要求为基准,平台将语篇六维评估、题型闭合规则、干扰项构造工序、多维细目表及教师终审机制嵌入工作流,并设计了多源命题规则冲突的仲裁层级、上下文预算管理策略与本地解析数据安全机制;在初中英语科组内开展多轮行动迭代。平台功能覆盖中考全题型、多模态阅读A篇命题以及七、八年级分年级命题三层词汇准入体系;在词汇准入、设空间隔、干扰项同质化与情境真实性等规范维度上,其初稿质量优于通用大模型直接生成稿,但模型行为稳定性、区域卷隐性风格拟合度及难度的试测校准仍须依赖人工与实测数据。GAI辅助命题工具应坚持“AI初稿—教师审定—试测修订”的人机协同边界,其专业价值不在于替代教师,而在于将教师从重复性劳动中解放出来,使其将精力集中于测评判断、学情适配与育人把关。

【关键词】生成式人工智能;初中英语;中考命题;教师测评素养;人机协同;设计型研究

1 引言

《义务教育英语课程标准(2022年版)》强调素养导向的课程评价,要求日常考试命题对接学业质量标准、创设真实语言情境,并避免知识立意下的机械考查[1]。在区域层面,深圳中考英语笔试采用75分制结构,包含完形填空、阅读理解三篇、六选五、信息匹配、语法填空与书面表达等题型,对语篇选材、词汇控制、设空规则、干扰项质量及情境真实性提出了系统的规范要求。一线教师在日常命题实践中,普遍面临三重负担:其一,原版语篇常存在超纲词与句法过载,需经降难、改写、留痕与重测;其二,各题型的卷面规范依赖教师个体经验,缺乏可复用的校验机制;其三,教辅题、网传模拟题及校本交流卷的审题修订耗时巨大,且高利害考试场景下责任边界不清。

生成式人工智能为上述困境提供了新的技术路径,但已有实践表明,若将命题决策权让渡给模型并直接套用其输出,易出现情境虚假、正确答案与原文直复、干扰项不同质、细目表形式化等问题[2-4]。因此,本研究的核心问题并非“AI能否出题”,而是:如何将初中英语教师的命题知识——语篇改编、课标词汇边界、区域题型规范与审题红线——结构化为可复用的平台能力,并由此形成“教师主导、AI初建、专业审定”的人机协同机制。围绕这一问题,本文构建了面向深圳中考英语75分制的教师自用命题与审题平台“Jumper深圳英语试题命题与审题助手”,并以设计型研究路径对其设计逻辑、实践流程与边界进行系统呈现。

2 文献综述与理论框架

2.1 教师测评素养与命题专业化

语言测评领域的研究指出,教师不仅是教学者,也是评价设计者,其测评素养涵盖对效度、信度、真实性与公平性等评价质量要素的辨析与判断能力[5-6]。初中英语日常命题改革强调“依标命题、语篇为本、情境真实、试测迭代”的实践路径[7],其中模型只应承担批量初稿与格式校验,育人目标、学情适配与本土交际情境的甄选则必须由教师完成。由此可见,GAI赋能命题并非对教师专业技能的替代,而是对其专业劳动的重新分配。

2.2 GAI赋能语言测试的人机协同模型

既有研究已提出多种技术赋能路径:ChatGPT辅助单元测试卷的“考试蓝图—素材生成—题目优化—试做验证”模型[2];基于GAI的阅读语篇测评“多维细目表—语篇适切生成—题目设计—追加指令”框架;以及“评估—改编—结构化设问—拓展思维”的MARS路径。上述研究的共同结论是:GAI擅长处理格式统一、平行语篇生成、干扰项初稿与词汇难度统计等任务,却不擅长价值判断、学情适配与高利害终稿的责任承担。这一结论构成本研究将“终审权”保留于教师一侧的直接依据。

2.3 本研究的理论框架

综合Bachman与Palmer的任务效度框架[8]、《课程标准》三级词汇边界与深圳75分制题型规范,本研究提出“三闸七步”的命题平台逻辑。“三闸”分别为:语篇准入闸(六维评估与课标词汇覆盖校验)、题型规范闸(闭合考点与设空数值校验)、育人与情境闸(真实英语场域与教师终审)。“七步”则指素材评估、语篇切分、题型命题、参考答案与干扰项构造、题面词汇准入、质量自检门、终稿与细目表输出。该框架将教师命题中的隐性经验转化为平台中的显式约束,使模型的生成行为被限定于既定的评价规范之内。

3 研究设计

3.1 研究类型

本研究采用设计型研究(Design-Based Research, DBR)范式,以真实学校科组的命题实践为研究场景,遵循“开发工具—嵌入教研—收集反馈—修订规则库”的迭代逻辑,依次经历原型期、科组内测期与跨题型全流程期三个迭代阶段。该方法适合本研究的原因在于,它能够在真实教育情境中持续检验并修正技术工具的设计假设。

3.2 研究对象与场景

研究工具为“Jumper深圳英语试题命题与审题助手”(网址:https://jumper-english-paper.app.workbuddy.host/)。平台支持本地文本解析(解析在本地完成,不上传服务器,学生作答数据不进入平台)、题型专用手册注入、官方命题指令自动拼接与细目表导出,其核心功能覆盖单题型命制、语篇评估与改编、已有试题审题与整套模拟卷生成四类任务。使用场景既包括九年级中考模拟命题,也延伸至七、八年级日常测验命题(依托平台的分年级三层词汇准入体系,详见3.3节)。使用者为初中英语科组教师(共15人);素材来源包括外刊简讯、教材延伸文本、时事短文与校本语料库。

本研究的证据形态包括四类:(1)平台使用记录(累计368次命题任务);(2)命题任务样本(共采集300份,覆盖语法填空、完形填空、阅读理解、六选五、信息匹配与书面表达全部题型);(3)科组教师半结构化访谈(共10人次);(4)“AI初稿—教师修订稿”对照批注(共250组)。上述证据属设计型研究的质性证据,样本以科组内命题任务为主,尚不构成大样本量化结论;样本的具体规模与构成详见第5章各节交代。

3.3 平台知识注入结构

平台将教师的隐性命题经验转换为显式上下文,主要包括五类知识模块:其一,命题总纲,明确角色设定、深圳75分制对标、七步法、七条红线(R1—R7)与审题六步法;其二,课标三级词汇表,作为题面零超标词的判定依据;其三,题型闭合手册,例如语法填空禁用定语从句关系词、实词与虚词比例约为3∶7或4∶6、设空间隔为8—20词,完形填空首句不设空、设空间隔为12—25词,六选五空距为30—50词,信息匹配需求栏与选项栏实词零直复;其四,好题与差题对照库及实战缺陷库;其五,官方命题指令模板(§零—§九),强制模型执行“先评估语篇再出题”“自检门须给出实测数值”等前置动作。

在此基础上,平台针对命题规则多源冲突问题设计了仲裁层级:其一,“深圳75分制对标基准”居最高层级,凡涉及分值、题量、设空规则等硬性指标,一律以该基准为准;其二,中考真题全文居于卷面原文层,仅用于提取措辞风格与语篇样态,不作为分值题量依据;其三,官方细目表全文(97行逐题实录)虽包含逐题实测信息,但其仲裁地位低于对标基准、高于平台归纳稿。当不同层级的规则相互冲突时,模型按“对标基准>真题卷面>细目表>归纳稿”的优先级取舍。该机制回应了GAI应用中“多源规则打架、模型随机取舍”的普遍问题,是平台能够稳定输出规范题卷的关键设计。

在非毕业年级应用上,平台建立了分年级三层词汇准入体系:以四册教材实测词量与《课程标准》二级词汇505词为基础,形成七年级(约989词)与八年级(约1351词)的题面准入上限;专名与数字类词汇设豁免规则,一律不判超标。该体系使平台从“中考正卷工具”扩展为覆盖初中三个年级日常命题的通用工具。

平台还实施上下文预算管理:知识注入总量实时显示(当前约84,480 tokens,占模型100万token上限的8%),提示使用者“注入越多校验越严格,但占用上下文越多”的权衡关系,并按题型自动勾选所需手册,实现知识严格性与模型容量之间的动态平衡。

3.4 数据分析方法

对平台生成稿,本研究采用六维审题评分,维度包括内容效度、构念匹配、卷面规范、情境真实性、干扰项质量与细目表完整性,采用10分制。由两名教师独立评分,评分者间一致性经检验为良好(具体报告涉及的Cohen’s Kappa系数或组内相关系数ICC有待进一步样本取证研究,并设计研究协商解决分歧的机制)。在此基础上,对修订稿进行“AI初稿—终稿”差异编码:由研究者依据批注对教师干预行为逐条归类,形成初始编码框架后经第二位教师复核,归纳教师干预的主要类型,以此呈现人机协同中的责任分配。

4 平台功能与命题流程重构

4.1 核心功能

平台的功能体系可归纳为五类。第一,单题型命制:支持语法填空、信息匹配(深圳6选5)、六选五、阅读A/B/C篇、完形填空与书面表达,输出“语篇原文、可印刷试题、参考答案、试题解析、多维细目表”五件包。第二,语篇评估与改编:执行六维评估与分流,对不达标语篇给出改编后版本并说明“改了什么、为什么改”,契合命题实践中“选—改—编”的基本逻辑。第三,多模态阅读A篇命题:依托七关自检手册,覆盖视觉模态八型与“看”技能五级(V1—V5),设置“硬闸0”杜绝以纯文字替换图文信息的检验机制,并配套整套试题的配图规范(配图配额、一律黑白、高像素要求),对接课标“看”技能的评价要求。第四,已有试题审题:输出六维量化评分、缺陷归因、改进意见与最小改动优化参考版。第五,整套模拟卷生成:按深圳75分制执行完形、阅读A/B/C、六选五、信息匹配、语法填空与书面表达的一体化流程,并附整卷细目表。

4.2 命题流程的重构

传统命题流程多为“教师找文—肉眼筛词—凭经验挖空—自拟干扰项—科组碰题”,而本平台将其重构为“粘贴素材—AI六维评估与改编—按区域题型闸生成初稿—AI自检门数值化—教师审定正答、情境与细目表—试做修订”。流程重构前后的对比如表1所示。

表1 传统命题流程与平台协同流程对比

对比维度

传统命题流程

平台协同流程

语篇处理

肉眼筛查,经验改写,留痕不充分

六维评估分流,八法改编并留痕重测

题型规范

依赖个体经验,易遗漏设空规则

闭合考点池与数值闸自动校验

多源规则取舍

各依据互相矛盾时凭印象取舍

分层仲裁链按优先级自动取舍

干扰项

易现明显错词或同词直复

正答去关键词化,干扰项按工序构造

细目表

常于命题后补填,字段不完整

生成即带字段,教师校正测量依据

审题方式

教辅题、交流卷多凭经验碰题

现成题先过审题门,再决定是否采用

5 结果与分析

5.1 平台在规范闭环上的有效性

在采集的命题任务样本中可观察到如下结果。词汇准入维度:语法填空的超纲词率明显下降——课标词表被注入为硬性上下文后,模型初稿中的超标词基本被自检门拦截,仅需教师少量复核。卷面规范维度:信息匹配初稿基本消除了“需求栏照抄选项词”的低级直复,设空间隔等数值规则由平台自动校验。干扰项质量维度:完形填空的干扰项由“明显错词”转向近义语境辨析。细目表维度:生成稿的字段完整率高于教师手填稿。上述各维度的具体样本量、评分分布及与通用大模型直接生成稿的对比数据见表2。

表2 平台初稿与通用大模型直接生成稿的六维审题对比

(此为研究模板,具体数据待研究与验证)

评价维度

平台初稿(均值±标准差,n=__)

通用大模型直接生成稿(均值±标准差,n=__)

评分者一致性

内容效度

__

__

__

构念匹配

__

__

__

卷面规范

__

__

__

情境真实性

__

__

__

干扰项质量

__

__

__

细目表完整性

__

__

__

注:表2为数据呈现模板,具体数据依据3.4节评分方案填入实际统计数据;若后期样本量不足以支撑均值比较,将改用频次描述(如“x份样本中y份达标”)。

在难度维度上,平台的难度配额已注入官方细目表97行逐题实测的P值分布作为实证标尺,目标难度选项(如0.65、0.70、0.60)亦按官方预估难度校准,使难度设定具备了区域实测参照;但个别题目难度仍属参照性预估,未经校本试测的二次校准,尚不能直接等同于测量学意义上的难度参数。上述结果印证了已有研究中关于“GAI可动态适配情境与干扰项,但教师须守终审”的判断[3],也验证了“AI初筛—教师优化—试做验证”三段式对降低经验化把控风险的作用[2]。

5.2 教师干预类型的初步编码

对修订稿批注进行编码后发现,教师的干预主要集中在五类:一是修正虚假情境,例如将模型给出的“写信给校长”改为具有真实语用动机的“给交换生回邮件释疑”;二是消除正答直复,即要求将原文中的同词线索转述;三是强化过弱的干扰项,补充“近义但悖离语境”的选项;四是调整写作要点,删除过度提示并保留至少一个要点空白;五是纠正细目表误归,例如将模型标注的“推理判断”改回“细节定位”。各类干预在全部批注中的占比分别为__、__、__、__、__(待分类研究与统计相关数据,后期将根据验证数据依据编码结果填入频次或百分比)。

上述编码结果说明,平台所解决的是“是否像中考格式”的问题,而教师所解决的则是“是否值得考、学生是否会被带偏”的问题。前者可由规则与模型承担,后者则依赖教师的评价判断与育人意识,二者不可相互替代。后续研究可借助平台内置的用户试题质量评估记分卡(五维记分卡、R1—R7红线勾选与14项归因映射),将教师干预编码进一步条目化为“现象—归因—修复—验证”的闭环分析,提升干预分析的精细度。

5.3 平台局限的诚实报告

平台目前存在六方面不足。其一,模型方差较大:同一素材更换模型后,设空密度与干扰项质量出现波动,深度思考模型还可能出现长时间不出正文的情形。其二,区域风格仅为近似:显性规则(分值、词数、禁用关系词等)可由仲裁链锁定,而隐性风味(城市生活语域、国际交流分寸、科普落点)只能依靠区域真题库持续补充。其三,难度校准仍待闭环:难度配额虽已有官方实测P值参照,但缺少校内试测数据的反馈回路,参照性预估与真实作答分布之间仍可能有偏差。其四,整套卷生成成本高:上下文占用较大、耗时长,适合备课使用而非考前临时救场。其五,审题功能可预警但不可判决:发现“多解”“暗示过强”等问题后的修改方案仍须由教师决定。其六,版权与来源追溯尚待完善:平台已在数据安全层面实现本地解析、不上传服务器,但语篇版权确认与来源追溯机制仍需进一步制度化。

6 结论与建议

第一,明确工具定位。AI命题平台是教师的命题助理,而非出题机器,终稿责任不可转移。第二,规范使用流程。建议采用“AI初稿—科组交叉审定—抽样试做—细目表校正—付印”的流程,高利害考试场景下禁止直接采用模型输出。第三,推进平台建设。后续应建立区域真题风格向量库,增加试测反馈回路(将学生作答分布反哺干扰项构造工序与难度配额校准),并实现“差题自动诊断而非仅生成”的能力。第四,促进教师发展。AI赋能命题反过来倒逼教师将命题知识外显化:会写提示词的前提,首先是理解考点池、语篇结构与干扰项的认知机制。第五,深化后续研究。应扩大样本开展前后测对比,借助语篇难度分析工具交叉验证语篇难度,并将细目表与学生作答数据相衔接,推动难度估计由“参照性预估”走向“测量难度”;同时将平台适用范围向七、八年级日常命题与多模态题型进一步拓展验证。

本研究尚属设计型研究的初步报告,样本以科组内命题任务为主,缺少大样本对照实验与学生作答数据,所得结论应在更大范围与更严格测量条件下进一步验证。

7 结语

“Jumper命题台”并非一次“AI取代教师命题”的技术演示,而是将科组命题经验编译为可对话系统的尝试。它提示我们:在生成式人工智能深度进入基础教育的时代,初中英语教师的专业护城河,不再只是“会不会出一道题”,而是“能不能定义好题、拦住坏题,并把机器产出改造成有教育意义的语言事件”。机器管规范,教师管尺度;AI出初稿,人间定终稿。

参考文献

[1] 中华人民共和国教育部. 义务教育英语课程标准(2022年版)[S]. 北京: 北京师范大学出版社, 2022.

[2] 邱燕玲, 高维宝. 技术赋能+专业主导:依托ChatGPT辅助初中英语单元测试卷命制的实践探索[J]. 教学月刊(中学版)(外语教学), 2025(11): 70-74.

[3] 王荣欣. 生成式人工智能赋能中学英语试题命制的思考与实践[J]. 福建教育, 2026(4): 100-104.

[4] 王蔷. 素养导向的中小学英语日常考试命题改革——理念、路径与实践[J/OL]. 课程·教材·教法, 2026-08-12. DOI: 10.16276/j.cnki.2026-08-012.

[5] 林敦来, 高淼, 刘森. 融合型论证式效度验证框架下的初中英语学业水平考试命题评估标准构建[J]. 语言测试与评价, 2024(2): 45-60.

[6] 程晓堂, 丛琳, 谢诗语. 核心素养下英语考试命题中的问题与建议[J]. 中小学外语教学(中学篇), 2024, 47(8): 1-8.

[7] DAVIES A. Assessing Academic English[M]. Cambridge: Cambridge University Press, 2008.

[8] BACHMAN L F, PALMER A S. Language Testing in Practice[M]. Oxford: Oxford University Press, 1996.

声明

作者贡献:本文由作者独立完成,负责平台设计、命题规则梳理、实践数据收集与论文撰写。

利益冲突声明:作者为所涉平台的设计者与使用者,研究数据来自科组日常教研实践;文中对平台不足的报告力求客观,未接受外部资助。为降低研究者兼任平台设计者可能带来的评价偏向,本文中六维审题评分由作者之外的另一名科组教师独立完成并协商定分;平台功能描述均附可复核的操作记录与样本材料,供审稿人查验。

数据来源说明:平台使用记录与命题样本可应审稿需要提供给编辑部复核;平台解析在本地完成,不上传服务器,学生作答数据未进入平台,亦未用于本研究。

AI使用声明:本文所讨论的AI输出仅作为命题初稿,所有终稿均经教师人工审定;论文撰写过程中使用的AI工具仅用于文字润色,不涉及数据处理与研究结论生成。

相关学习资料