从测评学看试题命制:AI替代不了的七个专业决断
——写给一线教师的命题技术深度指南
核心观点:试题命制不是"出题",而是"测量工具的设计与开发"。AI可以生成题干文本、批量组卷、辅助阅卷,但在测评学的七个关键决断节点上——测量目标界定、命题蓝图规划、情境效度建构、认知诊断设计、技术参数标定、公平性审查、评分量规研制——人的专业判断不可替代。本文以经典测量理论(CTT)、项目反应理论(IRT)和认知诊断理论(CDT)为理论框架,为一线教师提供一份可直接参照使用的命题技术指南。
。
学业水平考试命题方法与应用:指向核心素养的评价图书目录
第一部分 测验的基本概况 第一章 测验、测量与评价 测验、测量与评价的概念辨析。 测验的类型与功能。 测验的理念与原则。 测验的发展趋势 第二章 教育评价基本理论 布卢姆教育目标分类学 学习结果的结构分类学 教育评价理论的实践应用
第二部分 测验的编制 第三章 测验框架与蓝图设计 测验设计的核心逻辑, 测验方案的制定方法 ,命题蓝图的编制技术
第四章 题目类型及命题一般原则 常见题目类型解析, 命题的基本原则与规范 第五章 选择反应试题 选择题、判断题等题型的命题技巧 ,选项设计与干扰项设置 第六章 建构反应试题 建构反应试题的概念与类型, 编制的基本原则与评分标准 第七章 表现性评定 表现性评定的内涵与特征, 表现性评定的类别与实施, 评分规则与质量保障
第三部分 测验质量的评价 第八章 测验质量分析 信度、效度的概念与检验方法 难度、区分度的计算与应用 第九章 测验结果的应用 分数解读与教学改进 ,评价结果的反馈与应用
第四部分 核心素养测评前沿 第十章 高级思维能力测评高级思维能力的内涵界定, PISA等国际测评工具借鉴 ,本土化一致性分析工具开发第十一章 档案袋评价与跨学科评价
档案袋评价的设计与实施 跨学科核心素养的测评路径
张咏梅:背景:2003年毕业于北京师范大学心理学院基础心理学专业,获博士学位。研究方向:深耕教育测量与评价领域二十余年。专长:专注于大规模教育评价、教育考试的理论与应用研究,以及教育测验工具的设计、开发与高级数据分析。代表作:已出版《表现性评定的理论与实践研究》《大规模学业成就调查的开发与应用》等专著。
引言:命题是一道"测量学"题,不是一道"写作"题
很多教师对"命题"的理解,停留在"围绕知识点编一道题"的层面。这种理解在AI时代面临直接挑战——如果命题只是"编题",那AI确实已经能做到:给定知识点和难度要求,大语言模型可以在几秒内生成一道结构完整、表述流畅的试题。
但问题恰恰出在这里。 测评学告诉我们,一道试题首先是一个测量工具,其次才是一段文本。作为测量工具,它必须满足一系列严格的技术要求:它测的是它声称要测的东西吗(效度)?反复测量的结果一致吗(信度)?对不同水平的学生有区分能力吗(区分度)?对所有考生群体公平吗(公平性/DIF检验)?这些问题的回答,远非"语言流畅"就能解决。
湖南师范大学测评研究中心主任杨志明教授指出,考试质量评价需要从六个维度考察:考试蓝图是否科学合理、考试题目是否科学公平恰当、试卷是否完整且符合蓝图、测评指标是否达到现代测量理论要求、主要考生群体作答表现是否异常、考试管理和质量检测流程是否规范[1]。这六个维度中的每一个,都要求命题者具备专业的测量学素养——而这种素养的运用,正是AI无法替代的。
本文将从测评学角度,逐一拆解试题命制全流程中AI替代不了的七个专业决断节点,并给出一线教师可直接参照的操作框架。
一、测量目标界定:从"考什么知识"到"测什么素养"
1.1 测量目标是一切命题的起点
在测评学中,命题的第一步不是"选素材",而是界定测量目标。测量目标解决的是"这道题究竟要测量学生的什么特质"的问题——是测量某个知识点的记忆?是测量某种认知技能的运用?还是测量在特定情境中调动学科素养解决复杂问题的能力?
这个界定之所以是起点,是因为后续所有命题决策——情境选择、任务设计、选项编制、评分标准——都要围绕测量目标展开。如果测量目标本身模糊不清,后续工作越精细,偏差就越大。正如雷新勇等学者所言,试题是"对刺激情境和应答形式的规定,其目的是获取被试的应答,并根据应答对被试某方面特质的表现进行推测"[2]。这个"某方面特质",就是测量目标。
1.2 AI为什么替代不了这一步
AI可以生成一道关于"勾股定理"的题目,但它无法独立判断:这道题应该测量的是"勾股定理的记忆",还是"在真实情境中运用勾股定理建模的能力",还是"从复杂图形中识别直角三角形并选择恰当方法解决问题的素养"?这三种测量目标对应着完全不同的命题设计。
测量目标的界定,需要命题者回答以下问题:

1.3 给教师的操作框架:测量目标界定的"四问法"
一线教师在命制每道题前,建议用"四问法"明确测量目标:
第一问:课标定位。 这道题对应课程标准中的哪一条核心素养?该素养在学业质量标准中的哪个水平描述?请写出具体条目编号。
第二问:认知层次。 用改良版Bloom分类法或SOLO分类法界定认知层次。是"记忆/识别"(前结构/单点结构),还是"理解/运用"(多点结构),还是"分析/评价/创造"(关联结构/拓展抽象)?
lSOLO分类法速查(可保留备用):前结构:答非所问,逻辑混乱
l单点结构:只能提到一个相关要点
l多点结构:能提到多个要点但缺乏整合
l关联结构:能将多个要点整合为系统认识
l拓展抽象:能将认识迁移到新情境或更高层面
第三问:与整卷的关系。 这道题的测量目标与试卷中其他题目是否重叠?如果重叠,是否是有意的"同素养不同水平"的梯度设计?请在双向细目表中标注。
第四问:学情适配。 这个测量目标对你的学生来说,是"跳一跳够得着"还是"远超最近发展区"?你做出这个判断的依据是什么(历次测验数据?课堂观察?作业分析?)。
这四个问题的回答,构成了这道试题的"测量目标说明书"——它是后续所有命题工作的地基。
二、命题蓝图规划:双向细目表不是"填表格"
2.1 命题蓝图的测评学意义
命题蓝图(Test Blueprint),通常以双向细目表的形式呈现,是"对考试内容的一种事先约定"[1]。它的一般形式是:纵向为知识维度(考查内容/知识点),横向为能力或素养维度(认知层次/素养水平),单元格中标注题量、分值等信息。
但从测评学角度看,双向细目表远不只是"填表格"。它实际上是试卷效度的事前保障机制。杨志明教授指出,"考试蓝图就好比高楼大厦的建设施工设计图,只有设计方案科学合理,才能保证建设的质量"[1]。具体而言,双向细目表的测评学功能包括:
第一,内容效度的结构化保障。通过双向细目表,命题者可以检验试卷是否有效覆盖了计划考查的重要知识、能力和素养内容,避免"重点内容没考、次要内容考了一堆"的结构性偏差。
第二,测量目标的去重叠检验。在细目表中,每道题的测量目标一目了然,命题者可以快速发现"两道题测的是同一个东西"的冗余问题。试题应具有"相对独立性和代表性,无重叠或相互提示现象"[1]。
第三,难度结构的整体规划。细目表中应标注每道题的预期难度系数,使整卷难度分布(易∶中∶难通常为7∶2∶1或6∶3∶1)在命题阶段就得到规划,而非事后发现"整卷太难"再被动调整。
2.2 AI为什么替代不了蓝图规划
AI可以生成一个"看起来合理"的双向细目表——它会按章节分配题量、按认知层次标注分值。但这种生成存在根本缺陷:
缺陷一:AI不掌握真实的"知识权重"。某个知识点在本校这届学生中是重点还是次重点,哪些内容在教学中投入了更多课时,哪些是学生普遍薄弱需要重点检测的——这些信息不在任何公开语料中,只存在于教师的教学记录和学情数据中。
缺陷二:AI无法进行"试卷系统优化"。好试卷不是好题目的简单堆砌。命题者需要在整卷层面统筹:总分分配是否合理?题型搭配是否覆盖了不同认知层次?阅读量是否适中?不同题型的分值比例与所测内容是否契合[1]?这些系统层面的权衡,需要对"这份试卷要服务于什么考试目的"的清晰理解——是诊断性考试、形成性考试还是终结性选拔考试?不同目的下,蓝图的规划逻辑完全不同。
2.3 给教师的操作框架:三维细目表
建议一线教师从传统的"二维"细目表升级为**"三维细目表"**,增加"预估难度"和"素养水平"两个维度:

l参数说明:难度P值:预计答对该题的学生比例。P值越大题越易,通常整卷P值控制在0.60—0.75之间。
l区分度D值:高分组与低分组答对率之差。D≥0.40为优秀,0.30—0.39为良好,0.20—0.29为尚可,D<0.20需淘汰或修改。
这个三维细目表在命题完成后还有一个关键功能:与考后实测数据对照。如果预估难度与实测难度偏差超过0.15,说明难度预判有问题,需要复盘命题中的哪个环节导致了误判——这种复盘正是提升命题专业能力的核心路径,也是AI无法替代的"经验积累"过程。
三、情境效度建构:真实情境不是"编故事"
3.1 情境效度的测评学内涵
素养导向的命题改革,使"情境"成为试题的核心要素。华东师范大学杨向东教授指出,素养是"在特定情境中,学生面对生活中复杂多变的问题时,是否能够利用和调动已有的资源……去观察和理解世界、去构建自己对问题的认识、用行动去检验自己对世界的认识是否合理"[3]。情境,是连接学科世界和现实世界的桥梁。
但从测评学角度看,情境不是"包装纸",而是测量工具的核心组成部分。情境效度(Context Validity)指的是试题情境能够有效引发目标素养表现的程度。一个情境如果无效,即使题干文字再优美、知识点再准确,这道题的测量价值也是零——因为它测的不是它声称要测的东西。
情境效度建构需要满足以下条件[2][4]:
1.真实性:情境中的现象、数据、问题在现实世界中成立
2.适切性:情境与测量目标高度匹配,不含与测量目标无关的干扰变量
3.公平性:情境为大多数考生所熟悉,不因性别、地域、文化背景造成作答差异
4.探究性:情境中蕴含"潜在的问题",能够引发学生的学科思维
5.层次性:情境的复杂度与目标素养水平相匹配
3.2 AI为什么替代不了情境效度建构
这是AI命题最受诟病的环节。研究发现,AIGC生成的试题"过于依赖算法,受限于对论文、评价体系和课标的解读,生成的试题缺乏灵活性,难以完全符合命题要求"[5]。更具体地说,AI在情境创设中存在三类根本性缺陷:
缺陷一:幻觉导致的科学性错误。 AI大模型的"幻觉"(hallucination)机制使其可能生成看似合理但实际违反基本科学原理的情境。例如,AI可能编造一个"某地区年均降水量5000mm但属温带大陆性气候"的地理情境——在气候学上这是自相矛盾的,但AI不知道。这种科学性错误在高利害考试中是不可接受的。
缺陷二:隐性抄袭导致的情境雷同。 AI的"原创"本质上是对训练语料的重组。它生成的情境即使文字查重通过,也很可能在核心设计上与已有题目高度雷同——因为它就是从那些题目"学"来的。而高考命题对原创性的要求近乎严苛,不能使用公开题库中的成题,不能直接搬用教辅资料的改编题[2]。
缺陷三:"伪情境"问题。 AI擅长生成"看起来有情境"但情境与设问脱节的题目——情境只是"背景板",去掉情境题目照样能做。这种"伪情境"在素养导向命题中是失败的,因为素养测评要求学生在"理解情境→提取关键信息→调动学科知识→解决问题"的完整链条中展现素养,而非简单复述知识。
3.3 给教师的操作框架:情境效度审查清单
建议一线教师在命制情境题后,用以下清单逐项审查:
□ 真实性核查
l情境中的数据、事实是否有可靠来源?(写出来源)
l情境中的科学原理是否自洽?(请学科专家或同事复核)
l如情境为虚构,是否标注了"假设"并确保假设的合理性?
□ 适切性核查
l去掉情境后,题目是否仍可作答?(如是,则情境是"伪情境",需重新设计)
l情境中是否包含与作答无关的冗余信息?(适度冗余可考查信息筛选能力,但过量冗余会降低效度)
l情境的复杂度是否与测量目标匹配?(测量"记忆"不需要复杂情境,测量"创造"必须给足情境信息)
□ 公平性核查
l情境是否可能对特定群体(城乡、性别、文化背景)不利?
l情境涉及的背景知识是否超出了课程标准要求的范围?
l情境中的语言表述是否存在歧义?
□ 效度链核查
l立意→情境→任务→答案四要素是否逻辑一致?[2]
l情境能否有效"引出"与测量目标对应的学科任务?
l学生在情境中的表现,能否有效推断其素养水平?
四、认知诊断设计:从"给分"到"诊断思维"
4.1 认知诊断理论的命题意义
传统命题关注"学生得了多少分",认知诊断理论(CDT)关注"学生为什么得这个分"——他的知识结构中哪个属性掌握了,哪个属性没掌握?他的思维路径中哪个环节出了问题?
认知诊断测验的核心工具是Q矩阵。Q矩阵是一个"题目×属性"的二维表格,明确规定了每道题考查了哪些认知属性[6]。一个设计良好的Q矩阵,能够通过对学生作答数据的分析,精准诊断出每个学生在每个认知属性上的掌握状态。
这意味着,命题不再只是"出一道题给个分",而是设计一个能够暴露学生认知结构的探测工具。每道题的选项、干扰项、设问方式,都要有意识地指向特定的认知属性。
4.2 AI为什么替代不了认知诊断设计
AI可以生成"四个选项+一个正确答案"的选择题,但它难以做到的是:为每个错误选项赋予明确的认知诊断意义。
在认知诊断导向的命题中,每个干扰项都不是"随便编一个错误答案",而是对应一种典型的错误认知模式。例如:

这种设计要求命题者对学生可能出现的错误思维有深度了解——哪些概念容易混淆?哪些运算规则容易被误用?哪种解题路径是"看起来对但实际错"的?这些信息来自长期的教学经验和学情追踪,不在AI的训练语料中。
更关键的是,认知诊断模型的Q矩阵标定需要领域专家的专业判断——每道题考查了哪些认知属性,属性之间的层级关系如何,这些判断直接影响诊断结果的准确性。研究指出,Q矩阵的误指定(misspecification)会严重影响参数估计和分类准确性[7]。AI可以辅助生成Q矩阵的初稿,但最终的标定必须由学科专家完成。
4.3 给教师的操作框架:干扰项的认知诊断设计
建议一线教师在编制选择题时,为每个干扰项写一句"诊断说明"——如果学生选了这个选项,他最可能在哪个认知环节出了问题?这个认知错误对应哪种典型思维误区?
操作步骤:
1.列出本题涉及的认知属性。例如,一道关于"浮力"的题可能涉及:属性a(浮力方向判断)、属性b(阿基米德原理运用)、属性c(受力分析)。
2.为每个属性设计"错误版本"。 属性a的常见错误是什么?(误认为浮力方向与物体运动方向相同);属性b的常见错误是什么?(混淆排开液体的体积与物体的体积)。
3.将"错误版本"转化为干扰项。 确保每个干扰项至少对应一个明确的认知错误,而不是"随便编一个看起来不对的数"。
4.考后验证。利用选项分析数据(每个选项的选择率),验证干扰项是否发挥了预期的诊断功能。如果某个干扰项几乎无人选择(选择率<5%),说明它没有"击中"学生的实际认知错误,需要重新设计。
五、技术参数标定:难度与区分度不是"拍脑袋"
5.1 测量学参数的严格定义
在经典测量理论(CTT)框架下,每道试题有两个核心技术参数:
难度系数P:答对该题的学生比例。P=X̄/T(平均得分/满分)。P值越大,题目越易。一般而言,P值在0.30—0.80之间为合理区间,整卷平均难度通常控制在0.60—0.75。
区分度D:题目区分高分组与低分组的能力。常用计算方法为:D=PH-PL(高分组答对率-低分组答对率,高分组和低分组各取总人数的27%)。D值评价标准如下:

在项目反应理论(IRT)框架下,题目参数更加精细:区分度参数a、难度参数b、猜测参数c(三参数Logistic模型),以及适用于主观题的广义分步计分模型(GPCM)[1]。IRT的优势在于题目参数与考生能力参数位于同一量表上,不受样本影响,是计算机化自适应测验(CAT)的理论基础。
5.2 AI为什么替代不了技术参数标定
这是AI命题面临的最硬的技术壁垒。研究明确指出:"AI仅擅长生成固定答案的封闭题,无法设计考查创新思维、批判性思维的开放题;新试题缺少作答数据,难度、区分度预测易偏差"[8]。
具体而言,AI在参数标定上面临三个层次的困难:
第一层:无作答数据,无法实测。难度和区分度不是"声明"出来的,而是通过试测数据计算出来的。AI生成的全新试题,没有任何学生作答过,其难度和区分度完全是未知的。AI可以基于训练数据"预测"难度,但这种预测有两个根本缺陷:一是训练数据中的"难度"是事后统计值,不一定适用于当前考生群体;二是AI无法预测特定学生群体在这道题上的表现——而难度始终是相对的。
第二层:难度预估的认知建模偏差。准确预估难度,需要命题者对"学生在面对这道题时会怎么想、会卡在哪里、可能犯什么错"有精准的认知建模。这种建模基于命题者对学生认知规律的长期观察和教学经验。AI的"认知建模"本质上是对语料中"学生常见错误"文本的统计提取,它知道"学生常在某个知识点上出错"的统计事实,但不知道"我教的这届学生在这一步最容易出错"的具体情况。
第三层:区分度调控需要"恰到好处"的干扰设计。 一道区分度好的题,要能把"真懂"和"半懂"的学生区分开来。这要求干扰项有"恰到好处的迷惑性"——太明显则人人排除(区分度低),太刁钻则连高手也上当(同样区分度低,甚至负区分度)。这种"恰到好处"的调控,是对命题者教学智慧的极致考验,AI的语言生成机制天然难以企及。
5.3 给教师的操作框架:难度预估的"认知负荷法"
在没有试测条件时,一线教师可用以下方法提高难度预估的准确性:
步骤一:分解认知步骤。 将解题过程分解为若干认知步骤,每一步对应一个认知操作。例如,一道几何证明题可能包含:识别已知条件(步骤1)→联想相关定理(步骤2)→构造辅助线(步骤3)→完成推理链(步骤4)。
步骤二:估算每步的通过率。基于教学经验,估算这一届学生在每个步骤上的通过率。步骤越多、每步通过率越低,整题难度越高。
步骤三:识别"认知瓶颈"。 哪一步是多数学生会卡住的?这一步的通过率往往决定了整题的难度。如果认知瓶颈在步骤2(联想定理),题目偏"知识型"难度;如果瓶颈在步骤3(构造辅助线),题目偏"策略型"难度。
步骤四:与历年同类题目对照。找出历年考过的、认知结构相似的题目,对照其实测难度,修正你的预估。
步骤五:考后复盘。 考试结束后,计算实测P值和D值,与预估值对照。如果偏差超过0.15,分析是哪个认知步骤的通过率估计失误——这就是你下次预估难度的经验增量。
关键提醒:区分度负值(D<0)是"红旗事件"。它意味着低分组反而比高分组答对率高,通常原因有:题目有歧义导致高手"想多了"、正确答案有线索可循(如选项长度异常)、题目超纲导致高手犹豫而差生蒙对。遇到负区分度,必须逐项排查原因,绝不能简单"改个选项"了事。
六、公平性审查:DIF检测与伦理把关
6.1 公平性的测评学标准
公平性是教育与心理测验的三大核心标准之一(另外两个是效度和信度)。《教育与心理测验标准》(AERA、APA、NCME联合修订)对公平性做出了详细规定,包括考试实施过程的公平性、消除测量偏见、构念可测性,以及考试用途和分数解读方面的公平性[1]。
在试题层面,公平性审查的核心工具是差异项目功能分析(DIF, Differential Item Functioning)。DIF检测的是:在能力相同的条件下,不同群体(如男生/女生、城市/农村、不同民族)在某道题上的作答概率是否相同。如果某道题在控制了总分后,仍然对某一群体显著更难,则该题存在DIF,可能存在不公平。
杨志明教授特别强调:"良好的考试结果应只与所要考查的知识、能力、素养或实践经验等因素有关,不会出现歧视特定群体的问题,题目的DIF估计值也没有超过临界标准。"[1]
6.2 AI为什么替代不了公平性审查
AI在公平性上存在两层问题:
第一层:训练数据的群体偏见。研究指出,AI命题的"训练数据存在城乡、区域差异,易让AI命题产生偏见"[8]。如果训练语料中大量情境素材来自城市生活,AI生成的题目可能天然对农村学生不利——不是因为题目"错"了,而是因为情境的背景知识对农村学生不熟悉,增加了不必要的认知负荷。这种偏见是隐性的,AI自身无法察觉。
第二层:AI无法执行DIF检测。 DIF检测需要基于实际作答数据,运用Mantel-Haenszel方法、Logistic回归方法或IRT-based DIF分析方法进行统计检验。这些分析必须在考试实施后进行,需要专业的测量学软件和统计判断。AI可以辅助计算,但对DIF结果的教育性解释——这道题为什么对农村学生更难?是情境问题还是语言问题还是知识背景问题?——需要命题者结合具体题目和群体特征进行专业判断。
6.3 给教师的操作框架:公平性审查清单
在没有条件进行正式DIF分析时,一线教师可使用以下清单进行初步公平性审查:
□ 情境公平性
l情境涉及的背景知识是否对所有学生同等可达?
l是否存在只有特定群体(如城市学生、某地区学生)才熟悉的生活场景?
l情境中的图片、图表是否对不同文化背景的学生同等可读?
□ 语言公平性
l题干表述是否可能因方言或文化差异产生歧义?
l是否存在不必要的生僻词或专业术语(超出课程标准要求)?
l阅读量是否适中?过长的题干可能对阅读速度慢的学生不利。
□ 认知公平性
l题目考查的是学科素养还是"背景知识红利"?如果某个群体仅仅因为更熟悉情境背景就能得分,这道题的效度就有问题。
l是否存在"陷阱式"设问?即利用学生的阅读疏忽而非认知不足来制造错误。这种题目区分的是"细心程度"而非学科素养,对考试效度有害。
□ 伦理审查
l试题内容是否尊重各民族文化和信仰?
l是否避免了性别刻板印象?
l是否符合国家政策法规要求?
七、评分量规研制:开放题评分的"专业天花板"
7.1 评分量规的测评学意义
如果说前六个环节解决的是"出好题"的问题,那么评分量规解决的是"如何对学生的作答做出公平、准确、有诊断价值的评判"的问题。在素养导向的命题改革中,开放性试题的比重越来越大,评分量规的研制能力已成为命题者专业素养的"天花板"。
杨向东教授指出:"比命题更难的是'素养导向等级评分标准的研制'。"[3]传统的"采点记分"方式——学生提到了几个关键词就给几分——在素养测评中已经失效,因为素养不是知识点的简单叠加,而是"在情境中整合运用知识、技能、方法和观念解决问题的综合品质"。
当前国际上较有影响的开放性试题评分方法主要有两种[9]:
一是等级描述型的SOLO分类法。 根据学生回答的结构复杂度,将学习结果分为五个递进层次:前结构→单点结构→多点结构→关联结构→拓展抽象。每个层次有质性描述,评分时判断学生的回答属于哪个层次。
二是要素分析型的PTA量表法。 将作答分解为若干关键要素(如"论点明确性""论据充分性""逻辑严密性""语言表达"),每个要素分等级赋分,总分由各要素分数加总。
此外,杨向东教授还介绍了两种评分标准研制模式[3]:
l自上而下模式:先从理论出发定义不同水平的表现描述,再对照学生作答验证。例如从0到5分六级,每一级对应化学思维的不同层次(从常识理解→概念运用→知识结构化→模型建构)。
l自下而上模式:先收集大量真实作答(包括专家、大学生、高中生的回答),分析其认知特征,归纳出不同水平群落的特征,再形成评分标准。
7.2 AI为什么替代不了评分量规研制
AI可以生成"看起来合理"的评分标准——它会按"优秀/良好/合格/待改进"分档,每档写几句描述。但这种生成存在根本缺陷:
缺陷一:AI不理解"素养发展的层级结构"。 SOLO分类法或自上而下模式中的层级划分,依据的是对学生认知发展规律的深刻理解——从"前结构"到"拓展抽象",每一级跃迁背后的认知机制是什么?学生在哪个层级会出现典型的"半懂不懂"状态?这些层级的质性描述需要从大量真实作答分析中提炼,而非凭空生成。
缺陷二:AI无法进行"自下而上"的作答分析。评分量规的研制需要收集大量真实作答,分析学生在解决问题过程中的实际思维路径——他们是怎么想的?卡在了哪里?哪些回答是"看起来对但思维水平低"的?哪些回答是"表述不完美但思维水平高"的?这种分析需要命题者对学科认知规律的深度把握,AI的文本生成能力无法替代。
缺陷三:AI无法保证评分者信度。 评分者信度(Inter-rater Reliability)指的是不同评分者对同一作答给出相同分数的程度。杨志明教授指出,"评分者信度最好大于0.80,不得低于0.70"[1]。一个评分量规要达到这个标准,必须经过试评、修订、再试评的迭代过程——在这个过程中,评分者之间的分歧会被逐一讨论,量规的描述会被不断细化。这种迭代是对命题者专业判断力的持续考验,AI无法参与。
7.3 给教师的操作框架:评分量规研制的五步法
第一步:明确素养表现的层级。从课标的学业质量标准出发,界定本题要考查的素养在不同水平上的表现特征。先写"最高水平"和"最低水平"的描述(两端锚定),再逐步填充中间水平。
第二步:收集真实作答。 在试测或教学实践中,收集至少30—50份学生真实作答(最好覆盖不同能力水平的学生)。
第三步:对作答进行聚类分析。将作答按思维特征分组——哪些是"只提到单一要点"的?哪些是"提到多个要点但缺乏整合"的?哪些是"系统整合并形成结构化认识"的?每组对应一个水平。
第四步:撰写等级描述。 用"能……""能……但……""能……并……"的句式,写出每个水平的质性描述。描述要具体、可操作、可区分,避免"较好""一般"等模糊用语。
第五步:试评与迭代。 邀请2—3位同事独立评分,计算评分者一致性。对分歧较大的作答进行讨论,修订量规描述,直到评分者信度达到0.80以上。

八、人机协同:AI能做什么,不能做什么
前面七个环节的分析并非否定AI在命题中的价值。恰恰相反,清晰的边界认知是有效协作的前提。以下是基于测评学框架的人机分工建议:
命题环节 | AI可承担的工作 | 必须由人完成的工作 |
测量目标界定 | 检索课标条目、提供素养水平描述参考 | 判断目标适切性、与学情匹配 |
命题蓝图规划 | 生成细目表模板、分配题量分值 | 确定知识权重、系统优化试卷结构 |
情境创设 | 检索素材、生成情境文本初稿 | 科学性核查、效度建构、公平性把关 |
认知诊断设计 | 辅助生成Q矩阵初稿 | 属性标定、干扰项诊断意义设计 |
技术参数标定 | 辅助数据计算、生成分析图表 | 难度预估、区分度调控、参数异常诊断 |
公平性审查 | 辅助DIF统计计算 | DIF结果的教育性解释、伦理判断 |
评分量规研制 | 辅助文本聚类、生成描述初稿 | 层级界定、作答分析、量规迭代 |
核心原则:AI负责"繁琐的中间环节"(检索、生成初稿、辅助计算),人负责"专业的两端决断"(前端的目标界定与价值判断,后端的质量把关与伦理负责)。这与人工智能赋能考试命题研究中的核心结论一致——"人工智能的核心价值并非替代教师,而是赋能教育、回归育人本质。未来唯有坚持育人为本,让技术贴合教育规律,构建人机协同、公平透明的智能评价生态"[8]。
九、给一线教师的行动建议
建议一:建立你的"命题档案"
每命制一道题,都记录以下信息:测量目标(课标条目+认知层次)、预估难度和区分度、情境来源、干扰项诊断说明、考后实测数据、复盘反思。这个档案是你命题专业能力成长的"数据足迹",也是AI无法替代的个人经验沉淀。
建议二:每学期做一次"命题复盘"
选取一次考试的全部试题,计算每道题的实测P值和D值,与预估值对照。重点分析三类问题题:D值<0.20的题(区分度不足)、实测P值与预估偏差>0.15的题(难度预判失误)、选项选择率异常的题(干扰项失效或正确答案有线索)。每一次复盘,都是一次命题技术的精进。
建议三:学习用测量学语言说话
把"这道题有点难"换成"这道题的P值预估0.45,实测0.38,偏差0.07,主要原因是认知步骤3的通过率低于预期";把"这道题还行"换成"这道题D值0.42,区分度优秀,四个选项的选择率分别为62%/18%/12%/8%,干扰项诊断功能良好"。用测量学语言描述命题问题,是走向专业命题者的必经之路。
建议四:参与一次正式的命题工作
如果有机会参与区级或市级统考的命题工作,一定要抓住。正式命题流程中的双向细目表制作、磨题、审题、试测、等值等环节,是在日常教学中难以接触到的测量学实践。一次完整的正式命题经历,胜过一百篇理论文章。
建议五:把AI当"命题助手"而非"命题替代者"
用AI检索素材、生成题干初稿、辅助文字润色,但测量目标的界定、情境效度的审查、干扰项的诊断设计、难度区分度的调控、公平性把关、评分量规的研制——这七个专业决断,必须由你来做。 这不是技术保守主义,而是教育测量的专业底线:每一道进入考场的试题,都必须有能够承担专业责任和伦理责任的"人"在背后签字。
结语:命题的专业性,就是教育的专业性
回到开头的问题:AI能替代试题命制吗?
从测评学的回答是:AI能替代命题中的"文本生产"环节,但不能替代命题中的"测量学决断"环节。 文本生产是技术问题,测量学决断是专业问题和伦理问题。
一道好题的诞生,需要命题者理解课标、理解学生、理解学科、理解测量理论,并在这些理解的基础上做出一系列有理有据的专业判断。这些判断的每一个,都承载着教育评价"指挥棒"的重量——它决定着学生会怎样学习、教师会怎样教学、教育会走向何方。
这种重量的承担,是AI的结构性缺失。不是因为它"不够聪明",而是因为它不能负责。
我国现行法规明确规定,生成式人工智能的使用者必须对生成内容负责,不得以"AI生成"标注为由逃避法律责任。在教育测量领域,这个"负责"的含义更加深远——它意味着对每一个学生的公平负责,对每一次诊断的准确负责,对教育评价的科学性负责。
这些责任,只能由人承担。而这,正是试题命制永远需要人的根本原因。
参考文献
[1] 杨志明, 张玉玲, 夏胜俊. 考试质量评价:标准构建与考察维度[J]. 教育测量与评价, 2023(6).
[2] 朱志平. 试题要素与命题技术规范[J]. 教学与管理, 2020.
[3] 杨向东. 育人方式变革下的考试命题改革[R]. 全国首届"新教学 新评价 新技术"论坛, 2023-12-03.
[4] 教育部. 关于加强初中学业水平考试命题工作的意见(教基〔2019〕15号)[Z]. 2019.
[5] 生成式人工智能辅助地理试题命制与评阅的实践策略[EB/OL]. 2025-05-15.
[6] 涂冬波, 蔡艳, 丁树良. 认知诊断理论、方法与应用[M].北京: 北京师范大学出版社, 2012.
[7] Rupp, A. A., & Templin, J. L. The effects of Q-matrix misspecification on parameter estimates and classification accuracy in the DINA model[J]. Journal of Educational Measurement, 2008, 45(3): 197-213.
[8] 杜桢. 人工智能赋能考试命题:理论、案例与未来挑战[J]. 素质教育, 2026(6).
[9] 开放性试题的编制与评分[EB/OL]. 中国兴华科学教育网.

夜雨聆风