人机协同与循证命题:AI辅助试题命制的技术演进、幻觉治理与测评学校验实务
随着教育数字化转型的深入,试题命制工作正经历一场从“经验本位”向“证据驱动”的深刻变革。特别是在“双减”政策及《深化新时代教育评价改革总体方案》的背景下,学业水平考试(以下简称“学考”)命题强调“严格依据课程标准,取消考试大纲”。这对命题的科学性、规范性与情境创设能力提出了极高要求。AI技术的介入,并非旨在取代教师的专业性,而是通过重构命题流程,充当高效的“副驾驶”。然而,如何将AI的生成能力与严谨的测评学逻辑相结合,规避技术陷阱,是当前教研工作的核心议题。本文将融合AI命题的最新技术趋势、常见“幻觉”问题及其治理策略,以及基于课程标准的测评学校验流程,构建一套完整的闭环操作体系。
学业水平考试命题方法与应用:指向核心素养的评价图书目录
第一部分 测验的基本概况
第一章 测验、测量与评价 测验、测量与评价的概念辨析。 测验的类型与功能。 测验的理念与原则。 测验的发展趋势 第二章 教育评价基本理论 布卢姆教育目标分类学 学习结果的结构分类学 教育评价理论的实践应用
第二部分 测验的编制
第三章 测验框架与蓝图设计 测验设计的核心逻辑, 测验方案的制定方法 ,命题蓝图的编制技术 第四章 题目类型及命题一般原则 常见题目类型解析, 命题的基本原则与规范 第五章 选择反应试题
选择题、判断题等题型的命题技巧 ,选项设计与干扰项设置 第六章 建构反应试题 建构反应试题的概念与类型, 编制的基本原则与评分标准 第七章 表现性评定 表现性评定的内涵与特征, 表现性评定的类别与实施, 评分规则与质量保障
第三部分 测验质量的评价
第八章 测验质量分析 信度、效度的概念与检验方法 难度、区分度的计算与应用 第九章 测验结果的应用分数解读与教学改进 ,评价结果的反馈与应用
第四部分 核心素养测评前沿
第十章 高级思维能力测评 高级思维能力的内涵界定, PISA等国际测评工具借鉴 ,本土化一致性分析工具开发 第十一章 档案袋评价与跨学科评价
档案袋评价的设计与实施 跨学科核心素养的测评路径
张咏梅:背景:2003年毕业于北京师范大学心理学院基础心理学专业,获博士学位。研究方向:深耕教育测量与评价领域二十余年。专长:专注于大规模教育评价、教育考试的理论与应用研究,以及教育测验工具的设计、开发与高级数据分析。代表作:已出版《表现性评定的理论与实践研究》《大规模学业成就调查的开发与应用》等专著。《学业水平考试命题方法与应用——指向核心素养的评价》立足新时代评价改革要求,系统构建了从测验设计、纸笔命题到质量分析的完整方法论体系。它将核心素养导向融入命题全流程,既详解测验蓝图、表现性评价等技术要点,也结合问题解决、审辨思维等能力评价展开实践指导,兼具理论深度与实操价值,是教研人员、一线教师优化命题设计、落实素养评价的专业指南。
一、技术底座升级:从通用生成迈向学科内化
早期的AI命题多停留在简单的Prompt(提示词)调用,极易产生知识性错误。2025年以来,技术发展的关键趋势在于学科规律的内化与多模态协同。
首先,针对理科命题的“物理幻觉”与“数学谬误”,业界已开始采用“学科专用小模型外挂”的策略。例如,在物理命题中,引入包含物理定律验证环节的框架(如FysicsAny),对AI生成的电路图、力学运动过程进行逻辑自洽性校验;在数学领域,AMD发布的SAND-Math模型展示了从零构建新题的能力,并通过“难度调节器”控制认知负荷,而非仅仅是对旧题的改写。这意味着,未来的命题工具将不再是单一的通用大模型,而是由“通用LLM+学科合规校验模型”组成的双引擎架构。
其次,多模态技术正在攻克理科图表的精度难题。传统的文生图模型难以保证几何图形的度量准确性。而诸如MAGMA-Edu等框架的出现,通过引入代码中间表示(如SVG参数)而非直接生成像素,实现了图文一致性的质的飞跃。结合GeoGebra或RDKit等专业工具,AI已能够根据题干描述自动生成几何图形、化学分子结构式,并确保图形参数与题干条件严格对应。这对于需要大量示意图的物理、化学、生物及地理学科而言,是生产力和命题质量的双重解放。
再者,RAG(检索增强生成)与知识图谱的深度融合已成为命题系统的标配。单纯的RAG解决了“幻觉”问题,而结合了Tree-KG(树状知识图谱)的系统则能实现更深层次的关联。它能清晰地映射出知识点之间的前置后置关系,从而在命题蓝图中自动预警“超纲”风险,并支撑“千人千卷”的个性化组卷需求。这种技术架构确保了AI的所有输出都锚定在指定的课标、教材及历年真题库中,而非漫无边际的网络语料。
二、风险管控:AI命题“幻觉”的六维诊断与治理
尽管技术底座在不断加固,但在实际操作中,AI生成的试题仍普遍存在“幻觉”问题。这些幻觉隐蔽性强,若不加以甄别,极易流入考场造成事故。结合一线教研实践,我们将命题幻觉归纳为以下六类,并提出针对性的治理方案。
1. 知识点错位与版本混用
这是最高发的幻觉类型。AI训练语料混杂了各版本教材及竞赛内容,常出现“串台”现象。例如,在高中化学合格考命题中,AI可能生成涉及“三聚氰胺检测”或复杂有机合成路线的题目,这超出了必修课程范围。更有甚者,在计算过氧化钠与水反应的电子转移时,AI可能错误地认为生成1mol氧气转移4mol电子(正确值为2mol)。
治理策略:Prompt工程必须锁定版本依据,如“依据2017年版2020年修订的普通高中化学课程标准及人教版2019必修第一册”。同时,建立校本RAG库,将对应版本的教材PDF切片入库,强制AI仅从库中检索知识,切断其调用外部错误知识的路径。
2. 数据编造与虚假情境
AI擅长编造看似真实的文献引用和新闻事件。例如,生成一道关于“2024年我国科学家在《Nature》发表复活猛犸象研究”的生物题。这类虚假情境不仅误导学生,更严重违背了学考命题“真实性”原则。
治理策略:一是实施“来源追溯制”,要求AI在引用事实时必须给出可核查的来源,否则强制其使用“某研究”“某地区”等泛化表述;二是情境素材优先选用发布超过6个月、能在官方网站(如科技部、中科院官网)查证的成果,避免使用未经证实的前沿热点。
3. 情境与任务的“穿靴戴帽”
此类幻觉表现为题干材料冗长华丽,但与设问严重脱节。例如,用800字详细描述“神舟十七号对接空间站”的参数,最后却只问一个简单的动量守恒问题。这属于典型的“机械拼接”,未能发挥情境对思维的承载作用。
治理策略:在审校环节引入“情境必要性测试”:如果删除该情境,题目依然成立且设问不变,则该情境无效。Prompt中应明确要求“情境信息须被后续设问至少两处直接调用”,倒逼AI精简素材,强化逻辑关联。
4. 选项逻辑矛盾与答案不唯一
AI在生成选择题时,常因推理失误导致选项自相矛盾。例如,在一道一元二次方程根的判别式中,AI计算得出k=1,却在选项中标注“C. 0或1”为正确答案。此外,还存在题干条件缺失导致多解,但答案仅给出一种的情况。
治理策略:推行“先算后出”机制。在Prompt中要求AI先输出完整的解题过程,再根据过程生成选项,最后进行一致性核对。更重要的是,必须由非命题组成员进行“盲试”,若盲试者发现多个合理答案,往往意味着AI的逻辑出现了漏洞。
5. 难度漂移与认知层级错位
由于训练语料中高难度的高考真题占比较大,AI在生成“合格考”难度的题目时,容易出现“难度漂移”。例如,在生物学考中引入“基因连锁互换定律”或复杂的“9:7变式”计算,这对应了学业质量水平4,远超合格考要求的水平2。
治理策略:必须在Prompt中严格界定考试性质:“目标为学考合格考,学业质量水平≤2,难度系数预估0.75±0.05”。命题后,利用多维细目表进行逆向核验,重点审查认知层级的分布,确保识记、理解、应用的比例符合7:2:1或类似的合格考要求。
6. 公平性幻觉
AI默认视角为训练语料中最主流的城市生活背景。例如,语文阅读理解选用“周末自驾去崇礼滑雪”的素材,这对缺乏相关生活经验的农村学生构成了“Construct-irrelevant variance”(构念无关方差),即测量了学生的家庭背景而非阅读能力。
治理策略:在命题蓝图阶段即确立“公平性审查”环节。Prompt中明确规定避开需要高消费或特定地域背景才能理解的素材,优先选用校园生活、公共交通、国家重大工程(如天宫空间站、高铁网络)等跨地域、跨阶层的公共场景。
三、循证校验:基于测评学的试题打磨流程
AI生成初稿仅是第一步,试题的最终质量取决于后续的测评学校验。这一过程需紧扣学考“标准参照”的属性,遵循“依标命题”的原则。
1. 对标学业质量标准
学考的核心功能是衡量学生是否达到国家规定的学习要求。因此,审校的第一步是将试题与课标中的“内容要求”“学业要求”及“学业质量水平”进行逐一比对。合格考的内容范围必须限定在必修模块,难度系数通常控制在0.70—0.80之间。任何超出必修范围或学业质量水平3以上的题目,无论AI生成得多么精妙,都必须坚决剔除。
2. 多维细目表的逆向核验
命题前应制定包含知识板块、认知层级、难度预估、题型结构的多维细目表。命题结束后,必须进行“逆向核对”。重点核查:知识覆盖是否均衡(主干知识占比≥60%)?认知层级是否符合“识记:理解:应用≈3:4:3”的合格考结构?预估难度与实际试答难度是否吻合?若整卷信度系数α低于0.6(合格考标准),则需重新审视题目的同质性。
3. 情境的真实性与思维含量
依据“无价值不入题、无思维不命题、无情境不成题”的命题导向,审校时应重点评估情境的质量。优质情境应具备三个特征:一是真实性,源于生产生活或科研实际;二是关联性,与考查的知识点和能力要求自然融合;三是导向性,有利于考查学生运用所学知识解决实际问题的能力。同时,要警惕“重知识轻能力”的倾向,减少死记硬背的题目,增加对信息提取、逻辑推理、批判性思维的考查。
4. 微观层面的技术打磨
这是对题干、选项和评分标准的精细化加工。
题干:语言需简练、准确、无歧义。避免使用否定句或复杂的从句结构,防止造成阅读障碍。
选项:干扰项应源于学生的典型错误,具有似真性,而非简单的常识错误。研究表明,三选项的选择题往往比四选项更有效,因为避免了为了凑数而产生的弱干扰项。
评分标准:特别是非选择题,需制定包含得分点、典型错误及相应分数的“评分量表”,以减少阅卷时的主观误差。
四、构建人机协同的闭环生态
综上所述,AI辅助试题命制并非一蹴而就的自动化过程,而是一个“人机协同、迭代优化”的闭环生态。
在这个生态中,教师始终是命题的“方向盘”。教师的职责在于顶层设计:确定命题蓝图、设定测评指标、筛选核心价值素材。AI则是强大的“仪表盘”和“加速器”:它负责快速检索文献、生成多模态素材、进行初步的难度预估和查重、并根据反馈数据调整命题策略。
未来的命题工作流程将演变为:教师制定蓝图 → AI生成初稿 → 学科模型合规性校验 → RAG知识库溯源 → 教研组基于测评学标准多轮审校(依标、情境、逻辑、公平性)→ 小样本试测与数据分析 → 终稿入库 → 考后数据反哺命题模型。
这一流程不仅大幅提升了命题效率,更重要的是,它通过技术手段固化了科学的命题规范,确保了每一次考试都能精准地反映课标要求,切实发挥学业水平考试在诊断学情教情、改进教学实践中的功能,最终服务于学生的全面发展和核心素养的提升。对于一线教研员和教师而言,掌握这套融合了AI技术与测评学智慧的命题方法论,将是新时代专业成长的关键路径。

夜雨聆风