在教育测量领域,存在一个耐人寻味的现象:学科专家眼中的“好题”,在测量学专家看来往往是“坏题”。这种评价的分裂,不仅折射出教育评价中不同立场的差异,更暴露了一个深层问题——我们对“好题”的认知可能存在根本性的偏差。
以作文题为例。从学科专家的角度看,一道作文题是否优秀,取决于它能否激发学生的深度思考、展现其语言表达能力和逻辑建构能力。因此,那些立意深刻、开放性强、留给学生充分发挥空间的作文题,往往获得学科专家的高度评价。然而,测量学数据却可能给出截然相反的结论。若某道作文题的得分率高达0.75,区分度却低于0.2,意味着大部分学生都能得到差不多的分数,无法有效区分不同水平的学生。这样的试题,在测量学专家眼中,只能被判定为不合格、应当淘汰的“坏题”。
更为典型的例子是数学、物理、化学等学科中最难的单项选择题。这类题目的设计初衷,往往是为了考察高阶思维和综合能力,目标指向区分高分段学生。学科专家们精心设计复杂的推理路径、巧妙的陷阱选项,期待只有真正理解知识本质、具备较强思维能力的顶尖学生才能解答。然而,测量学数据却常常呈现出令人尴尬的结果:难度值很低,通常低于0.3,且不同层次学生的得分率相差无几,未能实现预期的区分效果。
这背后的原因值得深思。对于这类极难的单选题,少数高分学生虽然具备更强的思维能力,但他们往往会在题目上投入大量时间进行深入思考,反而可能因为过度推敲而落入陷阱,或者由于解题路径过于复杂而产生疏漏。反观大部分中等生和后进生,他们面对这样一道毫无头绪的难题,往往采取最简单的策略——快速蒙一个答案。由于是单项选择题,每个选项都有25%的概率蒙对。如此一来,这种高难度的题目不但没有给高分学生带来优势,反而在概率意义上“优惠”了普通学生。
这种现象揭示了一个测量学的基本原理:题目的难度与区分度并非简单的负相关关系。一道题目过难,会导致几乎所有学生都答不对,高分段和低分段学生之间的差异被“地板效应”掩盖;一道题目过易,则几乎所有学生都答对,差异被“天花板效应”掩盖。只有难度适中的题目,才能最大限度地区分不同水平的学生。而那些意图考察高阶思维的极难题目,往往因为难度超过合理范围,反而失去了测量学上的价值——这正是学科专家与测量学专家视角差异的核心所在。
学科专家的关注点在于“题目是否考察了重要的能力和知识”,而测量学专家的关注点在于“题目是否能有效区分学生的水平”。两者并非天然对立,但在实践中常常难以兼顾。一道题目可能从学科角度设计得精妙绝伦,但如果它过于困难,以至于学生的得分更多取决于运气而非能力,那么它在测量意义上就是失败的。
这一矛盾对于考试命题工作具有重要启示。命题者需要认识到,学科视角和测量学视角的平衡至关重要。在设计高难度题目时,应当审慎评估其实际区分效果,避免“看上去很美”却无法实现测量目标的题目进入正式试卷。对于那些旨在区分高分段学生的试题,或许可以考虑采用多选题、填空题等客观题形式,或适当控制题目难度,使其保持在能够有效区分的范围内。
教育测量的本质,是用有限的信息推断学生的真实能力。在这个意义上,一道“好题”不仅要考察重要的能力,更要能准确地反映不同学生的能力差异。只有当学科专家的专业判断与测量学专家的数据分析形成合力,我们才能命制出真正意义上的“好题”——既有学科深度,又有测量精度。
建议命题老师和命题专家不仅仅要学习本学科命题理念和命题技术,也要学习测量学命题理念和命题技术,做到内外双修,才能命制出指正的好试题。
个人观点仅供参考,请点红心关注转发,
扫描二维码加好友,欢迎留言交流探讨!
旭东JY测评公众号

作者微信二维码

作者简介
夜雨聆风