卷子出完了?先过"四度"这道关
前三篇我们聊了命题的五大原则、四要素和全流程,番外篇还推荐了研修书单。但私下有同行问了我一个很犀利的问题:
"兴奇老师,你说的这些我都照做了,但怎么知道我出的卷子到底好不好?有没有什么标准可以衡量?"
这个问题问到根子上了。命题不是"写完就算完",写完只是第一步。一套卷子到底行不行,得拿数据说话——这就是第四个研修主题:试题质量评价。
一什么叫"质量评价"?说白了就是给试卷做个体检

我们当老师的,平时出了卷子发下去考完,最多翻翻平均分及格率,就算"评价"了。但严格来说,试题质量评价是看考试结果与考试目标之间的吻合程度——你想考的东西,学生答出来的分数到底有没有反映出真实的水平?这个吻合度,需要从定性和定量两个角度来衡量。
定性分析看的是:试题内容有没有超纲?情境合不合理?设问清不清楚?答案有没有歧义?这些靠经验能判断。
定量分析就要上数据了。一套高质量的试题,应该具备恰当的难度、必要的区分度、可靠的信度、有效的效度——简称"四度"。这四个指标,就像体检报告上的四项关键数据,哪一项超标或偏低,都说明卷子"身体"出了问题。
之前一次月考,某备课组出了套地理卷。考完一看,平均分72分,年级领导说"不错,难度适中"。但教研组和备课组一分析数据就发现问题:有3道选择题,全班正确率都在90%以上——白送分的题占了大半;还有1道综合题,全年级只有2个人拿到一半以上的分——难度失控,区分度为负。表面看平均分漂亮,实际上这套卷子既没区分出好学生和差学生,也没考出真实的教学效果。
这就是只看平均分、不看"四度"的后果。
二难度:不是越难越好,而是"恰好够得着"

难度是"四度"里最直观的一个,但也是被误解最多的一个。很多老师觉得"难=有水平",其实不是。难度系数P等于平均得分除以满分,P值越小,题目越难;P值越大,题目越容易。
一般来说,整卷的难度系数控制在0.2到0.8之间比较合理。整套卷子的平均难度在0.5-0.6左右,既有台阶又有梯度,学生考完不至于全军覆没,也不会觉得太水。
那哪些因素会影响一道题的难度呢?我总结了六条:
① 内容熟悉度——考学生见过的、练过的,难度自然低;考陌生的、边缘的,难度就高。
② 情境熟悉度——用学生熟悉的日常生活情境,比用陌生的科研情境更容易上手。
③ 目标层次——考查"记忆"的题比考查"分析评价"的题容易得多。布鲁姆分类越往上走,难度越大。
④ 信息量与呈现方式——材料越长、图表越多、信息越隐蔽,学生提取有效信息的难度就越大。
⑤ 题型——选择题有选项可以排除,比填空题和简答题容易;开放性试题最难把控。
⑥ 答案设置——选择题的干扰项设计得好,难度就上去了;答案有歧义,难度也会"虚高"。

知道哪些因素影响难度,调控起来就有方向了。书里总结了六种调控难度的方法:
改设问条件(增减限制条件)→ 改设问方式(正向问改反向问)→ 改综合程度(单要素改多要素综合)→ 改情境素材(熟悉换陌生)→ 改思维路径(直问改推理)→ 增加开放性(唯一答案改多元答案)
▲ 这六种方法不是孤立的,一道题可以同时用两三种。关键是改完之后要重新预估难度,别从一个极端跳到另一个极端。
好题不是让学生做不出来的题,而是让学生"跳一跳够得着"的题。难度控制的本质,是给学生搭台阶。
三区分度:好卷子的"筛子"功能

如果说难度管的是"会不会",那区分度管的就是"谁会谁不会"。一套好的试卷,应该像一把好筛子——能把不同水平的学生筛出层次来。
区分度的计算方法是:把学生按总分从高到低排列,取前27%作为高分组,后27%作为低分组,用高分组的该题得分率减去低分组的该题得分率,就是这道题的区分度D。D值范围在-1到1之间,越接近1,说明这道题越能把好学生和差学生区分开。
这里有个特别重要的规律:区分度和难度是联动的。当难度系数在0.5左右时(即中等难度),区分度最高;当题目太难(P接近0)或太容易(P接近1)时,区分度都会趋近于0——因为太难大家都做不出来,太容易大家都做对,自然就分不出高低了。
这也是为什么前面说"难度控制在0.2-0.8"——不光是为了让学生有台阶下,更是为了让区分度能真正发挥作用。

之前教研群里有位年轻教师小李出了道综合题考"流域综合治理",自己觉得很精彩。考完一算数据:难度系数0.15,区分度0.08。她不解地问老周:"这么好的题,怎么数据这么难看?"
老周说:"题是好题,但太难了。全班只有三五个人碰到门槛,其余的连门在哪都没找到。你觉得是在考流域治理,实际上是在考运气——谁恰好见过类似题型谁就能写两句。把材料拆成两段,加一个引导性设问当台阶,难度降到0.3-0.4,区分度自然就上来了。"
四信度与效度:试卷的"稳定性"和"有效性"
难度和区分度是单题层面的指标,信度和效度则是整卷层面的指标。打个比方:难度和区分度是体检时查的"单项指标",信度和效度就是"整体健康评估"。

信度:再来一次,结果还一样吗?
信度指的是测试结果的稳定性和一致性。说白了就是:同一群学生、同一份卷子,如果今天考和明天考,结果差不了太多,信度就高;如果今天考80分明天考40分,信度就低。
影响信度的因素有几个:
① 测验长度——题量越多,信度越高。一套卷只有5道题,偶然性太大;20道题以上,信度才有保障。
② 区分度——区分度高的题越多,信度越高。全是"送分题"或"送命题"的卷子,信度都不会高。
③ 难度分布——难度太集中(全难或全易)会降低信度。合理的难度梯度才能保证信度。
④ 被试同质性——学生水平差异越大(比如混合编班),信度越低;水平接近(比如分层教学),信度越高。
⑤ 偏题怪题——超出考查范围的偏题、表述不清的怪题,会严重干扰信度。
⑥ 施测标准——考场纪律、监考松紧、时间控制不一致,也会影响信度。
效度:考的到底是不是你想考的?
效度是"四度"里最重要的一个,指的是测试对其预定测量目标测量到的程度。说白了:你想考"区域认知",结果出的题实际上考的是"死记硬背",那效度就低。

一套有效的测试,应该做到五点:
① 试题内容与教学目标吻合——考什么就出什么,别跑偏。
② 试题内容丰富、覆盖面广——不能只考某一章,要有代表性。
③ 难度分布合理——有梯度,有层次,不能全是同一难度。
④ 题型搭配适当——选择题、综合题、开放题合理搭配,不偏废。
⑤ 开放性试题评分合理——评分标准明确、可操作,不能凭主观印象给分。
信度解决"稳不稳"的问题,效度解决"准不准"的问题。一套卷子可以很稳定地考错了东西——信度高不等于效度高,但效度高必须有信度做基础。
五用数据说话:一份真实试卷的质量分析

光讲理论不过瘾,我拿一份真实考试的数据给大家看看"四度"在实际中长什么样。这是某年文综地理卷的统计结果:
▲ 数据为教学示例,仅供理解"四度"概念参考。实际考试分析需全卷逐题统计。
看这张表,几个关键发现:
第1题难度0.88、区分度0.15——典型的"送分题"。大多数学生都能做对,区分不了好坏,这4分基本是浪费的。要么提高难度,要么干脆删掉换一道有区分度的题。
第6题难度0.19、区分度0.06——典型的"送命题"。太难了,全班几乎没人做对,区分度也接近0。这道题需要大改:要么加台阶,要么拆设问,要么换素材。
第3题和第36题是这套卷子里的"模范题"——难度适中(0.5-0.6)、区分度优秀(>0.4),既考出了水平,又分出了层次。出卷的时候多出几道这样的题,整卷质量就有保障了。
这就是数据的力量。光凭感觉,你会觉得第1题"学生掌握得不错"、第6题"这道题有点超纲了";但看了数据你才知道,这两道题的问题不是学生的问题,是命题的问题。

1. 下次考完试:别只看平均分。让年级备课组导出每道题的得分率,自己算一算难度系数P和区分度D。
2. 发现异常题:P>0.85或P<0.20的题,标记出来,分析原因——是难度失控还是区分度不足?
3. 建一个"试题档案":每次考完把每道题的P值和D值记下来,积累两三学期,你就有了自己的"题库数据库"。
4. 改一道"差题":从最近一次考试里挑一道D<0.20的题,用本章的六种方法调难度、加台阶,下次再用。
5. 教研组分享:把你的质量分析数据带到教研组会上,让全组都看看"数据说话"的力量,比嘴上争论哪道题好不好用一百倍。
你平时出完卷子,会做质量分析吗?欢迎在评论区分享你的做法,我们一起把"感觉命题"变成"数据命题"。
第一篇:吃透高考地理命题五大核心原则
第二篇:试题命制技术——立意、情境、设问、答案
第三篇:试题命制流程——从细目表到定稿
番外篇:地理命题研修推荐书单
第四篇(本文):试题质量评价——难度、区分度、信度、效度

夜雨聆风