夜雨聆风学习资料网

ARTICLE · 1117732

高中英语试卷评价标准(蒸馏两本权威测试理论)

高中英语试卷评价标准(蒸馏两本权威测试理论)

高中英语试卷评价标准

理论框架 · 指标体系 · 实操案例

依据:李筱菊《语言测试科学与艺术》、刘润清·韩宝成《语言测试和它的方法(修订版)》

目 录绪论 我们为什么需要一套"能落地的"评价标准第一章 理论基座:从"考了什么"到"凭什么说它考对了"1.1 语言测试的实质 1.2 三代体系与能力模型 1.3 信度与效度 1.4 题型的功能定位(A—E 类) 1.5 评价的五个维度与一道总闸门第二章 评价方法论:三级指标、定量阈值与证据链2.1 否决项/核心指标/加分项 2.2 定量指标与阈值速查 2.3 证据从哪来 2.4 结论分级与报告 2.5 质量控制卡的中学化改造第三章 听力测试评价标准第四章 阅读理解测试评价标准第五章 完形填空测试评价标准(考点效度)第六章 语法填空测试评价标准第七章 写作测试评价标准(含读后续写)第八章 整卷层面:结构、配比、常数与后效第九章 落地:三张表、一张卡与工作流程附录 术语对照 · 速查表 · 五张可打印评价表

本文的用法。前三章是"理",回答"凭什么这样评";第四至八章是"法",按题型给出可执行的条目与阈值;第九章与附录是"器",把前面所有标准压缩成三张表、一张评分卡,拿去就能用。文中所有案例均取自真实的市级高三检测试卷(称"S 卷")与两本理论著作中的经典样例;对 S 卷的一切批评都是对题不对人,且只作为"如何发现这类问题"的示范。 

绪论 我们为什么需要一套"能落地的"评价标准

0.1 教研员评卷的三个场景

一名高中英语教研员拿到一份试卷,通常要在三种场合下给出判断:

其一是考前审题。市里要组织一次统考,命题组交来 A、B 两套初稿,要求一周内给出取舍意见。这时你不能说"我觉得 B 卷更顺",必须指出 B 卷哪一道题、违反了哪一条、应当如何改。

其二是考后评估。考试已经结束,成绩也已公布。校长问:"这次英语卷出得怎么样?"你手上有一份分数表和几道争议题的反映。你需要回答的其实是三个问题:分数可不可以信?考的是不是我们想考的?下一次该怎么改?

其三是命题培训。你要带一批青年教师学会命题。你不能只讲"选项要长短一致"这类口诀,因为口诀解决不了"这一篇短文该不该删这个词"。你得给他们一套能推理的框架。

这三种场景的共同要求是同一件事:把"好不好"变成"依据什么、违反了哪一条、怎么改"。这就是本文要解决的问题。

0.2 眼下常见的三种评法,以及它们各自的毛病

第一种是印象式评法。"读下来感觉还行""这套卷偏难"。它的毛病不在于主观,而在于无法转化为改进指令——命题人不知道下一次该改什么。

第二种是难度式评法。只看平均分、及格率、难度系数,卷子"好"就等于"难度 0.55 左右"。这是把试卷质量等同于一个统计量。刘润清、韩宝成把测试质量列为六项:效度、信度、难度、区分度、实用性、后效作用;难度只是其中一项,而且是针对每一道题的项,不是针对整卷的总评。李筱菊说得更直接:一份"分数分布很漂亮"的卷子,可能恰恰是一份结构效度为零的卷子——她举旧统考的例子,全部题目只测出一个有效因素,"只测试语言知识,那就从根本上是无效度的"。

第三种是套话式评法。评价表上写"命题科学、覆盖全面、梯度合理",等级栏里全是"优"。李筱菊在谈写作评分标准时专门批评过这类文字:"综合性评分标准最忌写上许多相对性的形容词,成为人人都可以有不同理解的、没有什么实际作用的官样文章。"评卷意见同样如此。

0.3 本文的理论来源与使用方法

本文的理论骨架主要取自两本书。

其一是李筱菊《语言测试科学与艺术》。这本书提供了三样别处不易得到的东西:一是"语言测试是通过测量目标能力的表征行为去推论目标能力"这一基本定义,它把"考什么—怎么考—凭什么说考对了"串成一条链;二是信度与效度的七对矛盾及四条处理路子,它让我们承认"信度效度不可兼得"是常态,从而把评价从"追求完美"改为"判断取舍是否明智";三是考点效度与考点层次(单词/词组/句子/语篇,W—P—S—D),这是评判完形、语法填空乃至阅读题质量最锋利的一把刀。此外,该书的A/B/C/D/E 试题分类框架和质量控制表(材料卡 T 卡、题目卡 Q 卡、覆盖分析表),是本文第二、九章的直接来源。

其二是刘润清、韩宝成《语言测试和它的方法(修订版)》。这本书的价值在于"可操作":它按题型分章(第四至十一章分别讲多项选择题、完形填空、词汇、语法、阅读理解、听力、口语、写作),每章都给出命题要求与正反例题;第十三章给出效度、信度、难度、区分度、实用性、后效六项标准及具体算法与阈值;第十四章讲成绩分析。凡涉及"具体数字"与"怎么算",本文多依此书。

需要说明两点。第一,两本书成书于上世纪九十年代至本世纪初,其经验数据(如 MET 的题目分析数据)来自当时的考试,不能直接搬用到今天的新高考,但其判定逻辑与阈值区间仍然有效,本文在引用时会标明来源并给出适用于当下高中学段的建议值。第二,凡涉及新高考的具体题量与赋分,本文以现行全国新高考英语卷的结构(听力 30 分、阅读 50 分、语言运用 30 分、写作 40 分)为参照,各地自主命题可据本地卷种平移。

第一章 理论基座:从"考了什么"到"凭什么说它考对了"

1.1 语言测试的实质:我们永远测不到能力本身

评价一份试卷,第一个该问的问题不是"难不难",而是"它想测的那个东西,究竟能不能被测到"。李筱菊给出的起点非常清醒:

——李筱菊《语言测试科学与艺术》第二章 2.2

这个定义可以拆成三个环节,评卷时正好对应三问:

环节

记号

含义

评卷时对应的问题

①

B → A

所测的行为(B)是不是目标能力(A)的表征

这道题考的"动作",真是我们要考的"本事"吗?

②

b → B

我们从 B 中抽出的样本(b)是不是有效抽样

题量够不够?覆盖面够不够?抽得有没有偏?

③

F → b

分数(F)是不是对作答(b)的正确标示

评分准不准?客观题有没有机器误差?主观题评分员一致吗?

她把全部工作的关键概括为"确立命题⑤及命题⑥,即:b 可以推论 A,F 可以推论 b"。换成教研员的语言:一份试卷的质量,等于"抽样是否有效"乘以"评分是否可信";而抽样是否有效,取决于你声称要测的能力到底是什么。

由此立刻得到一条实操规则:评卷必须先问"考试大纲/命题说明里声明要测什么",再问"题目是否对应"。李筱菊在讲内容效度时强调,检验内容效度"主要靠试题设计和试题生产时严格遵守大纲要求。验证主要靠考试前对试题的覆盖分析",而"验证的依据是大纲"。她甚至直言:"我国至今很多公共考试连这点(明晰大纲)都没有做到,因此也就无从检验这些考试的内容效度。"——这句话今天依然值得每一位命题负责人贴在墙上。

1.2 三代体系:先判断这份卷"站在哪一代"

刘润清、韩宝成把语言测试的发展划为三代体系,这不仅是学术史,更是评价时的第一把尺子:

代际

名称

语言观

典型题型

第一代

科学前测试

语言是一套知识(语音、语法、词汇)

翻译、默写、语法问答

第二代

心理计量—结构主义

语言是一套形式系统;能力=操作这套形式的技能

分立式测试(一题一考点):多项选择、语法填空、改错、词汇填空

第三代

交际语言测试

语言使用是动态的交际过程;能力=交际能力

综合性/直接性任务:真实语篇的听读、有情景的写作与口语、综合性运用题

第二代体系的三条自我设限,恰恰是今天大量模拟卷的通病,可以直接当检查项用:

· 忽略语境——为凑考点而生造句子,导致"整句无情景";

· 技能割裂——听力只辨音、阅读只认词、写作只套句;

· 话语失真——"每一句话的出现,不是按交际需要而自然地出现,而是为了带出要出现的结构,结果话语变得比较干瘪,而且有人工编造的痕迹"(刘润清、韩宝成语)。

第三代的能力模型,本文采用 Bachman 的交际语言能力(CLA)框架:语言能力(组织能力:语法+语篇;语用能力:语义+功能+社会语言)+ 策略能力(评估/确定目标/制订计划/执行计划的元认知策略)+ 心理生理机制。它对命题人的翻译是三条:

——刘润清、韩宝成《语言测试和它的方法》第二章 2.4.2(据 Bachman)

评卷用法:拿到一份试卷,先用一句话概括它隐含的能力观(例:"本卷把英语能力理解为'词汇+语法知识+对书面语篇的信息提取',写作只作为附属"),再判断这一能力观与课程标准/考试说明是否一致。这一步叫结构效度判断,是所有评价的总闸门——李筱菊说得很重:"结构效度就是考试的原则理论的效度。显然,这是所有的各种效度之本。没有结构效度,旁的效度都站不住脚。"

1.3 信度与效度:不是"两个指标",而是一对矛盾

(1)两个定义

李筱菊对信度给出了一个比"结果是否稳定"更严密的表述:

——李筱菊,第二章 2.3.1.1

这个"两问"结构很有用:前者指向评分(主观题评分员一致性、客观题机器误差),后者指向施测与题目本身(指令是否清楚、时间是否够、题目是否有歧义)。评卷时可以把信度问题拆成"评得准不准"和"考得公不公平"两类,分别归因。

效度的定义两书一致:是否考了想要考的、在多大程度上考了。李筱菊按内在/外在/使用/超考试四维度归置了八种效度,其中五条对中学评卷最有直接用处:

效度类型

判定问题

中学评卷的证据来源

内容效度

是否考了大纲规定要考的?抽样是否有代表性、是否适合考生?

双向细目表、考点覆盖分析表

结构效度

依据的语言观是否有效?(不是指试卷结构)

能力观陈述、题型与能力的对应

表面效度

考生/教师看上去觉得它像不像有效的考试?

考生与教师问卷、座谈

反应效度

考生是否按设计意图去作答?

异常答卷抽查(如把指令译成英文作答)

反拨效度

这份卷会把教学导向哪里?

教师访谈、课堂观察、次年教学行为变化

一条可以直接引用的判词

李筱菊:"任何负责公共考试的人,在设计考试的时候就应该有意识地让考试给教学带来一种良好的导向作用。这是比考试本身的目的更重要的目的,也是一种超考试的目的。考试能达到这个目的,就算具有好的反拨效度。" 

(2)七对矛盾:评价时真正的分析工具

信度与效度不只是"互相依存",更关键的是互相排斥。李筱菊列出七对矛盾,其表述之精准,使得它们几乎可以直接当作评卷时的"取舍说明书":

#

矛盾

信度一侧

效度一侧

1

量的测量 vs 质的测量

定量测量易保信度

语言运用能力本质上是质的,要定性判断

2

两分判断 vs 连续判断

黑白分明才可靠

"意思抓准了还是偏了、抓全了还是漏了"是程度问题

3

分割法 vs 整体法

元件单一、项目多

"语言不是拼盘,而是部分的有机组合……只有整体法的语言测试,才符合效度要求"

4

单维观 vs 多维观

单维测量易保信度

真实运用牵涉语码、渠道、意义、语体、环境、背景诸维度

5

静态(成果)vs 动态(过程)

成果测试易保信度

过程测试在效度上胜于前者

6

有限的语法 vs 无限的运用

以语法为目标能力易保信度

"仅仅以语法作为测试的目标能力,这能说是有效的测试吗?"

7

抽象行为 vs 具体行为

抽象行为外推性强→信度有保证

具体行为符合交际实际→效度高

她给出的四条处理路子是:保证高信度忽视效度(逆于科学进步方向)、追求高效度放弃信度("测试学界的理想主义者",无法广泛实施)、消极妥协(Alderson:"一切测试都是妥协")、积极平衡("刻意寻求能体现更高的效度同时也体现更高的信度的新突破")。

评卷用法

评卷结论不要写"本卷信度不足"或"效度不高"这类孤立的判断,而要写:本卷在矛盾 X 上选择了信度一侧(表现为……),代价是效度损失(表现为……),该取舍是否符合本次考试的目的。例如:月考是诊断性考试,重信度、可分割、可定位薄弱点,属合理取舍;而高考模拟应当更靠近效度一侧。 

1.4 题型的功能定位:A—E 类框架(本文的主骨架)

李筱菊按离散考点—综合考点、单技能—综合技能、间接—直接三个维度,把试题分为 A 到 E 五类。这个框架的价值在于:它告诉你每一种题型"天生能测什么、天生测不了什么",从而避免用一把尺子量所有题型。

类

定位

说明

本文涉及的题型

A

离散考点 · 单技能 · 间接

一题只考一个语言点,最远端,直接程度最低

无语境的语法填空(单句填空)

B

综合考点 · 单技能 · 间接

成段默写、背诵、朗诵;脱离交际情景

(中学少用)

C

综合考点 · 单技能 · 间接(有语境无情景)

考点综合且放在上下文里考,但缺交际情景;只考到语言能力与语篇能力,未考语用能力

完形填空、成段改错、有语境的语法填空

D

综合考点 · 单技能 · 直接

听说读写各一技能,必须有语境;直接程度取决于"以意义为纲"还是"以形式为纲"

听力、阅读(接收性运用);写作(产生性运用)

E

综合考点 · 综合技能 · 直接

又读又写、又听又说;最符合交际实际

读后续写(读+写)、听写

这张表立刻产生四条评价准则:

1. 位置决定期待。不能用"真实性"去苛求完形(C 类,天生无交际情景),也不能用"一题一考点"去要求阅读(D 类,天生综合)。

2. 同一题型会因命题方式而位移。李筱菊指出,B/C/D/E 的分界"进入三角地带后都带向下箭头",意即赋予语境情景后即可向直接方向移动。同样,语法填空若只有孤立单句,就是 A 类;若置于完整语篇并要求据上下文推断,就移向 C 类——这正是新高考把"单句语法填空"改为"语篇型语法填空"的理论依据。

3. 考点窄化会导致题型降级。她明确判定:"只删动词的完形填空题,考的只是语法……是单技能单考点试题",依分类"不该放在 C 类,而应放在 A 类之下"。同理,一篇语法填空若 10 个空里 4 个考介词,它事实上已退化为 A 类。

4. 各题型之间应当分工而非重复。若完形与单项填空(或语法填空)经因素分析考的是同一个因素,李筱菊的反问是:"这样,单项填空大题之外,何必还要加一道完形填空试题?"

1.5 评价的五个维度与一道总闸门

综合两书,本文把试卷评价收敛为五个维度,外加一道总闸门:

维度

要回答的问题

中学评卷里的具体抓手

① 结构效度(总闸门)

它依据的能力观是否站得住?

能力观陈述;题型—能力对应表;是否只测出一个因素

② 内容效度

考的是不是大纲要考的?抽样是否有代表性?

双向细目表;考点覆盖分析表;材料卡(题材/体裁/难度/来源)

③ 题目效度

每一道题是否真的测到了它声称测的东西?

考点层次(W/P/S/D);考点因素(语法/搭配/意义);干扰项似乎可能性

④ 信度

分数是否公正、稳定、可比?

题量;客观题机器误差;主观题评分员间/自身一致性;等值

⑤ 后效与可行性

会把教学带向哪里?实施条件是否具备?

反拨效度判断;听力设备、阅卷人力、时间配额;卷面与指令

五个维度的判定顺序不可颠倒:先看结构效度(总闸门),再看内容效度,其次逐题看题目效度,然后看信度,最后看后效与可行性。原因正是李筱菊的那句话——没有结构效度,其余效度都站不住脚;而刘润清、韩宝成也强调:"如果一项测试不可靠,该测试必然无效……信度差则效度差,但效度差不一定信度差。"

第二章 评价方法论:三级指标、定量阈值与证据链

2.1 三级指标:否决项、核心指标、加分项

把标准写成一长串平等的条目,评卷人一定会漏看、会平均用力。本文把所有标准分成三级,处理方式完全不同:

级别

名称

性质

处理方式

权重

L0

否决项Fatal

硬伤。出现即说明该题/该大题不合格

直接判该大题不合格,必须返工;不计入加权,不因其他方面优秀而抵消

—

L1

核心指标Core

质量主体,逐条打分

按 0/1/2 三档计分,加权汇总

80%

L2

加分项Bonus

超越合格线的优秀设计

每项 +1 分,封顶 10 分

20%

这样设计有两个好处:一是避免"平均主义"掩盖硬伤——一份卷子哪怕其他方面都很好,只要有一道题出现"答案不唯一",该大题就是不合格;二是给优秀设计留出上行空间,让评价不只是挑错。

2.2 定量指标与阈值速查表

以下指标来自两书,括号内为出处。凡有阈值,均给出书中原值与本文建议的中学适用值。

指标

代号

算法/含义

书中阈值

中学适用建议

答对率/难度

P

答对该题人数 ÷ 考生总人数(主观题:该题平均分 ÷ 满分)

理想 0.5;MC 卷可放宽至 0.6 左右

0.3—0.7 为主体

难度(Δ 值)

Δ

由答对率推算,1—25,数值越小越易,中间值 13

Δ=9 约 84% 答对;Δ=17 约 16% 答对;68% 题目控制在 9—17

全卷均值 12—14

难度配比

—

全卷 P 值分布

MET 指标:70% 的题 P 在 0.3—0.7,P<0.3 与 P>0.7 各约 15%

照此执行;选拔性考试可适度右移

区分度

rbis

(双列相关)题目区分高低水平考生的能力,−1—1

≥0.3 合格,>0.4 为优;≤0.2 者不可用;负值一律淘汰

≥0.3;未经试测的卷,rbis<0.3 的题控制在总题数 5% 以内

全卷区分度

Rbis

不能用小题算术平均,另有算法

≥0.3 为质量指标之一

≥0.35

信度

R / α

KR-20(客观卷)/Cronbach α(含主观题)

理想 R≥0.9,α≥0.8

客观卷 ≥0.85;含写作的全卷 α≥0.8

答案项数据

n / m / r

选该选项的人数、本大题平均分、区分度

答案项 n 尽量 20%—80%;m>13;r≥0.3

同左

干扰项数据

n / m / r

同上

n 在 5%—30%(≤5% 无效,>30% 太强);m<13;r 应为正值

同左;n 低于 5% 的干扰项等于白设

偏态/峰值

Sk / Ku

分数分布形态

两者控制在 ±1 之内即基本正态;Sk>0 偏难,Sk<0 偏易

同左

全距

Range

最高分 − 最低分

对照:旧高考某次仅 21%,MET 为 58%

全距过小说明区分不足

大题相关

r

各大题得分的相关矩阵

0.4 有意义,≥0.5 显著相关

某大题与所有大题都不相关=异常,须查

因素负荷

—

因素分析

单因素负荷 <10% 视为未考到/无效因素

至少 2 个有效因素(知识/运用)

适宜性

fit

Rasch 模式下不适宜试题/不适宜考生占比

约 5% 可容许;接近或超过 10% 即效度信度有问题

同左

题量

N

客观题小题总数

标准化试卷题量应不低于 90 道

新高考 80—90 小题(含听读语言运用),基本可满足

两条使用告诫

其一,数据是参考不是判决。李筱菊在讲题目分析时说得很透:"决不能简单地、机械地完全依赖数据——数据带给我们的信息,虽然很有参考价值,有时却很难解释,有时微妙而矛盾,有时甚至会误导……同时要靠命题人的良知,结合命题人的经验,发挥命题人的艺术。"她还举过一个例子:某题数据不理想(答对率 .29、区分度 .23),按理应废弃,但她主张保留,因为数据暴露了中国学生"对 happen 是不及物动词缺乏明确的概念,连学得较好的学生也弄不清","为了促进教学,有时考试中是可以容许一些数据不完全符合要求、但针对教学弱点的题目的"。

其二,区分度优先于难度。她的排序是:"这当中区分度尤其重要。"一道偏难但区分度好的题可以留;一道难度适中却毫无区分度的题必须改。

2.3 证据链:评卷意见必须能追溯到证据

一份有说服力的评卷报告,每一条结论后面都要有证据来源。证据分三段采集:

阶段

证据

具体做法

命题前

考试大纲/命题任务书/双向细目表

要求命题组提交"能力—题型—题量—赋分—难度"对照表;无此表即无从检验内容效度

命题中

考点覆盖分析表、材料卡、题目卡、审题记录、试做记录

见 2.5;试做:找 2—3 名未参与命题的教师在不看答案的情况下做一遍(李筱菊:可发现"时间不够,客观题答案不对或有多种可能,甚至于编号、打字、装页上的错误");试测:有条件时 200—300 人彩排

考后

题目分析(P、Δ、rbis、选项 n/m/r)、分数分布、相关矩阵、因素分析、适宜性分析

至少做题目分析并存档入库;这是下一次命题的资产

李筱菊对审题的要求值得原样转述给每一位审题组长:

——李筱菊,第五章 5.3.1

刘润清、韩宝成则提供了一个成本极低却极有效的补充办法——冷处理:"一套试卷设计完毕之后,就在自己抽屉里锁上几天。等忘得差不多了,再取出来看一看,自己马上会发现问题。"

2.4 结论分级与报告结构

评卷结论按五级给出,避免"优/良/中/差"的空转:

等级

判据

处置

A 可直接启用

无 L0;L1 加权 ≥85

可用;建议记录优秀设计供推广

B 修改后启用

无 L0;L1 加权 70—84

列出必须修改的题号与改法,复核后启用

C 重大修改

无 L0;L1 加权 60—69

大题级返工,重新审题

D 不宜使用

存在 L0 且涉及 2 个以上大题

整卷返工

E 否决

结构效度不成立(能力观与课标/考试说明冲突)

退回重订命题任务书

报告固定为五段:①一句话总评(含等级)→ ②能力观判断(结构效度)→ ③逐大题评价(否决项在前,核心指标在后,每题给"现象—依据—改法"三件套)→ ④数据体检(若已有成绩数据)→ ⑤优先改进清单(按"改一处收益最大"排序,不超过 8 条)。

2.5 质量控制卡的中学化改造(本文的落地核心)

李筱菊的试题生产流程是 16 步、五道关口,配套三套卡片:材料卡(T 卡)、题目卡(Q 卡)、大题覆盖分析表。对中学而言全量执行成本过高,但其信息结构可以完整保留。本文改造为三张简表:

简表一:材料卡(每篇语篇一张,5 分钟填完)

栏目

填写内容

评价用途

基本信息

用途(听/读/完形/语填);词数;来源(原文/改编/重写)及其出处

查"每篇出处不同""改编是否失真"

题材领域

七类:自然科学与技术/社会科学/世界与国家/经济贸易/人物·社会生活与文化/艺术与人文/日常生活

查全卷题材分布是否失衡

篇章类型

广告/通知/便条/公函/私人信件/新闻报道/报刊文章/百科条目/说明手册/图表/故事叙述/演讲/访谈/报告/论文……

查"篇篇有异"

文体范畴

知识性 I/实用性 P/说理性 R/文艺性 L

查四种范畴是否兼顾

难度

生词率(≤2%—3% 并加注);句法复杂度;易读性判断(0—9 级)

查难度梯度与超纲

备注

是否可用、适合什么题型、上次使用记录

建题库

简表二:题目卡(每道小题一张,2 分钟填完)

李筱菊 Q 卡反面的设计极精妙:她把"要传示的意义"按三个角度分成 13 种,并标上正负号——意义的界限(局部 +/全局 −)、范畴(事实/概念/态度/功能/关系)、传示方式(直截 +/非直截 −,集中 +/分散 −,明说 +/隐含 −),再加上七种"促成技能"(理解图表、借助世界知识、据上下文猜义、分析信息、综合信息、逻辑推理、判断与欣赏)。规则是:

——李筱菊,第五章 5.3.3(Q 卡)

由此得到题目层次估计 H/M/L。她的控制指标是:为每一套试题预设"正号题/负号题比例"和"需用促成技能题数"两项指标;MET87 阅读理解实考的层次小结是高层次 8 题、中层次 11 题、低层次 6 题,她的评价是"中、低层次题目数之和,约为高层次题目数的一倍。这种层次分布也基本符合 MET 程度的考试的要求"。

中学化改造(题目卡精简版)

每题填三栏:①考点(一句话:这道题考的是什么信息/什么语言点);②层次(负号意义/正号意义;是否需促成技能;圈 H/M/L);③考点因素(语法 G/搭配 C/意义 M,标出焦点因素)。控制指标(建议值):整套阅读题 H∶M∶L ≈ 1∶1.4∶0.8(参照 MET87 的 8∶11∶6);全卷"需促成技能"的题不少于 40%。 

简表三:大题覆盖分析表(每个大题一张)

上半部填材料(篇名/题材/体裁/范畴/来源/难度/字数),下半部填题目(题型/每题的意义类型/促成技能/层次估计/层次小结)。用途是"在各大题的覆盖分析的基础上,便可作全卷的横向的宏观质量控制,然后作考试次与次之间的纵向的宏观质量控制"。

她对该表的三条判定标准可以直接搬用:①篇数及总字数符合考试大纲规定(她举 MET 的例子:不少于三篇、不少于 600 字);②同一个考试用的材料,只要可能,还是应该每篇都选自不同的出处;③材料的题材和体裁,更是必须篇篇有异。

第三章 听力测试评价标准

题型定位:D 类接收性运用试题(综合考点 · 单技能 · 直接)。它测的不是"辨音",而是"在语流中获取信息并据以做事"。李筱菊把本节限定为"听取信息",明确排除 A 类的听辨语音语调与 C 类的听写。 

3.1 听力到底测什么

刘润清、韩宝成把听力理解的过程分为自下而上的三层,这是分析听力题层次的现成工具:

层次

名称

内容

可设的考点

第一层

语音识别

对听觉呈现的语言刺激作初步编码加工

(不宜单独成题,见 3.2 否决项)

第二层

句子理解

在语音编码基础上把握词义,并进行句法分析和语义分析

单句层面的事实信息

第三层

语篇理解

在单句理解基础上"揣摩、猜测说话者的意图";对语篇的把握反过来加深对句子的理解

主旨、态度、推断、情景、说话人关系

两书都强调听力理解的实质不是复述:"一位正常的听者决非是一台被动的录音机,他在听的过程中具有选择性"(刘润清、韩宝成)。由此得到最重要的一条听力命题原则,李筱菊的表述最精彩:

——李筱菊,第九章 9.2.3.3

微技能方面,刘润清、韩宝成引 Richards(1983)归纳的七项可直接作为考点清单:①掌握中心思想和重要细节;②理解隐含的意思;③判断话语的交际功能;④判断说话人的观点、态度;⑤理解句际关系(比较、原因、结果、程度、目的);⑥从连续话语中辨别语音;⑦理解重音和语调。其中前五项面向中高级考生,后两项面向初级——高中段应以前五项为主。

3.2 否决项(L0):出现即判该大题不合格

听力大题的 8 条否决项

1. 用书面语材料充当听力材料。李筱菊批评这种现象时用了很重的词:命题人"随便拿起一篇东西录上音就用",听力题里"充塞着本该是阅读用的'假'听力材料"。刘润清、韩宝成则给出量化判据:口语的冗余信息多达 50%—70%,书面语不具备这一特征。

2. 考点问的是"不听自明"的信息。李筱菊明确判定:问谈话题目、问说话人身份是合理考点;问场所、时间、可见的伴随情况则不合理——对在场者是"不听自明","这种考点缺乏真实性,试题缺乏有效性(invalid)"。

3. 整段材料只问一道题,而答案完全依赖只出现一次的一个词或短语。李筱菊:"假如一篇听力材料只问一道题目,题目的回答却完全依赖于仅仅一个单词或片语……而且这单词或片语又只出现一次,这就不大合理了。"

4. 答案不唯一或选项互相牵连。如 constable 与 policeman 同义并列,"两者互相牵连,也就互相抵消"。

5. 把听力题出成语法/词汇题。如四个选项全考虚拟语气,"这明显考的是语法";改问某词词义即成词汇题。

6. 干扰项在语境情景中完全不可信。李筱菊举了一个真实案例:Must you leave us so soon? 的干扰项竟有"细细地嚼""月亮旁边见金星",她注明"这可是全世界 170 个国家和地区使用的考试里的实例"。

7. 题干若以录音形式呈现却不是完整问句。"如果录音里读半个句子,那当然是很不自然。"

8. 段落提示与题号错位、指令自相矛盾(如"每段读两遍"却只录一遍、作答时间与题量不匹配)。

3.3 核心指标(L1):材料、呈现、题目三层

A. 材料(8 条)

#

检查项

标准与依据

档

1

材料类型

必须是该受试群在真实听的情景中会听到的类型。反例:我国考试爱用儿童故事、中国人讲中国情况的讲话,"显然不是成人听外语的真实情景里要听的真实材料类型"

0/1/2

2

口语体

口头语的文体与语言;"多数情况下只要不是显然的书面语,具有口头语的主要特征便可"

0/1/2

3

地道性

过"是不是这样说"这一关——李筱菊主张听力材料最好由本族语命题人写,至少经本族语审题人审过

0/1/2

4

难度

略低于同级考试的阅读材料(李筱菊);刘润清、韩宝成亦主张"听力测试用的材料要比阅读测试用的材料容易得多"

0/1/2

5

语速

自然语速,不人为放慢;高级取偏高、低级取偏低,均在自然幅度内。刘润清、韩宝成给出英语讲话速度约每分钟 120—150 词为参考(原书 OCR 存疑,本文建议按 130—160 wpm 掌握并每年实测)

0/1/2

6

长度

单段以不超过三四百字为宜;"听力不同阅读,一边听一边要用脑子记……材料如果太长,考记忆的成分过重,不合理";两书一致给出长材料上限 400 字

0/1/2

7

总量与时长

含指令与供答题的停顿,录音约半小时(两书一致)

0/1/2

8

多样性

题材体裁多样;会话与一人连贯讲话兼顾;有稿之外尽可能含无稿口语;避免"千篇一律都是会话或独白"

0/1/2

B. 呈现与施测(4 条)

· 遍数:一般只听一遍。李筱菊:"听多遍的,往往要求听取具体字眼或数字"——这与"以听取意思为目的"相悖。(新高考目前按"每段两遍"执行,属历史形成的妥协,但命题时应意识到它降低了对语篇层次的要求。)

· 问题呈现:可录进录音,也可书面印卷。跳听(scan listening)的问题必须前置,其余一般后置。

· 题干语言:若以录音呈现,必须简洁、口语化、得体。"如果问题本身又长、又复杂、又拐弯抹角,那就成了考对问题的理解为主。"

· 语音系统的偏颇性:李筱菊专门指出除内容偏颇外还有"语音的偏颇性"——澳音、美音、英音各对一部分考生不利,"必须慎重考虑",最好据调查或考试大纲解决。

C. 题目与选项(8 条)

· 考点是信息,不是语法/词汇/句子释义。

· 考点是考生的未知信息——遮住录音、单凭常识不可作答。

· 会话题的考点须为"谈话本身的意思""从谈话可推断的情况""谈话的情景或语境"三类之一;不问场所、时间、可见的伴随情况。

· 考点覆盖整个语篇:不存在"只听一人/一句即可作答"的对话题。李筱菊批评某题"只须听后一人的话,前一人话完全可以删掉",指出其实质是从语篇层次降回单句层次,降低效度。

· 层次与范畴多样:局部/全篇、事实/概念/态度、明说/隐含均有分布。

· 每题一个考点中心,答案唯一;四项形式差距不显著;选择项不互相牵连。

· 尽量不用材料原字眼。听力特有的一条例外:在有两句以上语篇制约时,可有意照搬原词考"耳听—眼读能否对上号"(她举 luck / lark / lock / look 之例)。

· 干扰项的似乎可能性以"语境情景中的意义"为准。这是她对听力干扰项的特殊主张:阅读里显得荒唐的项在听力里"却是容许的",因为可凭发音线索成立;但焦点仍须落在意义上,"听力试题比任何其他试题都更有必要从语境情景上去要求干扰项的似乎可能性",而这一点"还远未得到足够的重视"。

3.4 案例:S 卷听力的三条发现

S 卷=某市 2027 届高三上学期第一次质量检测英语试题,结构与分值完全对标新高考:听力 20 题 30 分(短对话 5 题 + 长对话/独白 15 题)。以下三条取自该卷实际文本。

案例 3-1 一道设计得不错的干扰项(S 卷听力第 5 题)

录音原文

题目与选项

M: Mom took that shot of the road. The colorful flowers got Mom's attention. W: Hey, look! This one is something! It's the sandcastle contest we went to last summer. Remember the crowded beach and the hot weather? M: Of course! 

5. What are the speakers mainly talking about? A. A contest. B. Flowers. C. Photos. ✓

评析。三个选项在录音中全部出现(contest、flowers、photos→shot/this one),这是典型的"局部信息充当干扰项",符合"干扰项须有似乎可能性"的要求;区分点在"mainly",即要求考生在语篇层次上判断主旨,属 H 层考点。李筱菊对"主信息核心是主攻目标"的要求在此落实得很好。可保留。

一处提醒。正确项用了 Photos,而录音里出现的是 shot 与 this one,属同义替换,未照抄原词,符合"题目里尽量不要用材料里同样的字眼"。若此处直抄 shot,该题难度会显著下降。

案例 3-2 计算题的边界(S 卷听力第 12 题)

录音:Over the next five days, take two tablets four times a day. 题干:How many tablets should the man take a day? 选项:A. Four. B. Eight. ✓ C. Ten.

评析。干扰项设计精准:Four 对应"four times"(漏听 two),Ten 对应 5×2(误把五天当每天)。这是"按学生可能的错误反应写干扰项"的范本——刘润清、韩宝成说干扰项"估计学生听错什么地方就设计什么干扰项",正是此意。

但须警惕边界。李筱菊把"长数字、复杂计算"列为诡题特征;刘润清、韩宝成也说计算题"至少不能用得太多,因为多了就成了数学测试"。建议操作口径:每套听力卷的计算/数字题不超过 2 题,且必须两个乘数都在录音中清晰出现、间隔不超过一句。

案例 3-3 指令性硬伤:段落提示与题号错位

S 卷听力第二节的一处排版缺陷

卷面顺序为:……13、14、15 题(第 9 段录音)→ "听第10段录音,回答第17至20题" → 16. What does the man suggest Lynn do with her manager? → 17、18、19、20 题。 第 16 题在内容上属于第 9 段录音(Lynn 求职话题),却被排在第 10 段的段落提示之后。 

评析。这是典型的指令性硬伤,直接命中 3.2 否决项第 8 条。它的危害不是"看起来别扭":听力考试中考生按段落提示预读题目,一旦提示与题号错位,考生会把第 16 题误认为属于第 10 段录音,从而带着错误的预期去听第 9 段结尾,直接产生非能力性失分——这正是李筱菊所说"试题是否给了受试群公正而客观的作答机会"的信度问题。

改法。把"听第10段录音,回答第17至20题"移到第 16 题之后。流程建议:听力卷定稿后,必须做一次"段落提示—题号—答案键"三方对位核对,由一名未参与命题的教师朗读式通读全卷指令。

3.5 听力大题评价表(可直接打印使用)

层

检查项

0

1

2

记录

材料

材料类型对受试群真实

□

□

□

口语体(冗余充分、无书面语痕迹)

□

□

□

本族语审校("是不是这样说")

□

□

□

难度低于同级阅读;语速自然

□

□

□

长度(≤400 字/段)与总量(≈30 分钟)

□

□

□

会话/独白/有稿/无稿多样

□

□

□

呈现

遍数、停顿、作答时间匹配

□

□

□

跳听题干前置;题干为完整问句且简洁

□

□

□

语音系统无偏颇性

□

□

□

题目

考点为信息,非语法/词汇

□

□

□

无"不听自明"的考点

□

□

□

无"只听一人/一句即可作答"

□

□

□

覆盖全语篇;层次范畴多样(H/M/L 分布)

□

□

□

H__ M__ L__

干扰项在语境情景中具有似乎可能性

□

□

□

未用材料原词;题与题不互泄、不互否

□

□

□

否决

8 条否决项逐条过

命中____条

加分

含无稿口语/真实场景录音/任务型(图表笔记)题

+1 / 项

数据

P____ Δ____ rbis____;干扰项 n<5% 的题数____

第四章 阅读理解测试评价标准

题型定位:D 类接收性运用。核心原则一句话——"阅读测试测试的是信息的获得,考点自然应以信息为目标"(李筱菊)。阅读题最忌讳的,是把它做成语法题、词汇题、句子释义题,或者做成"不用读原文也能答"的常识题。 

4.1 阅读能力的构成与考点分级

刘润清、韩宝成把阅读能力分为高层与低层两部分,这份清单可以直接用作考点类型清单:

层次

能力条目

占比取向

高层能力(6 条)

①掌握主旨和大意;②了解阐述主旨的事实和细节;③根据上下文判断某些词汇和短语的意义;④理解上下文的逻辑关系;⑤根据所读材料进行判断、推论;⑥领会作者的观点、意图和态度

"阅读理解测试中,人们一般把测试的着眼点放在对考生高层能力的测量上"

低层能力(5 条)

①理解各种语法概念(原因、结果、目的、比较);②理解主从句的句法结构;③理解句段的标志;④理解词汇和/或语法的连贯关系;⑤理解词汇的意义

低层能力是"门槛"(Alderson,1984),是高层能力得以进行的基础

李筱菊则提供了考点的价值分级,这是判断"这一题该不该出"的关键工具:

——李筱菊,第九章 9.1.3.1

她还有一条极重要的补充:篇章常含"潜信息"(实质、功能、意图、态度),"很多时候潜信息比明信息更关键……如果篇章含有潜信息,阅读理解试题却没考着这潜信息,试题就不能算有效"。

以及一条极实用的检验法:"看受试者如果把问题都答对了,是否就能说明他把材料真看懂了?或者反过来说,受试者是否要真看懂材料,才可能把问题都答对?"——这句话建议每一位审题人手抄一遍。

4.2 否决项(L0)

阅读大题的 9 条否决项

1. 不读原文就能作答的题。李筱菊"以未知信息为考点"原则;刘润清、韩宝成举的反例是四个选项"无需阅读原文也能回答""A 项和 D 项互相矛盾,使学生会去猜"。

2. 把阅读题出成语法、词汇或句子释义题。两书一致列为大忌。

3. 答案不唯一(两书均用整节讨论)。刘润清、韩宝成的办法是"冷处理"+他人独立作答;李筱菊的办法是逐项自查四种成因。

4. 选项互相牵连或互相矛盾到暴露二选一。

5. 题干为空题干。刘润清、韩宝成列了一张黑名单:According to the passage, / We learn from the passage that / Which of the following is (NOT) true? / The passage tells us that / It is implied/inferred/concluded that / The author says/tries to tell us that……"题干光秃秃的,选项内容不集中,不知道问的是什么"。

6. 题干或选项照抄原文原句,等于泄露答案。两书一致。

7. 一题泄露另一题答案,或一题否定另一题的干扰项。李筱菊给出可操作的经验法则:"每道题的每个选择项,都要看看在每另一道题中是否至少有一个和它相容的选择项。如果没有,就得改。"

8. 材料含知识性错误、注释错误或敏感内容(政治、民族、宗教、地区、性别)。

9. 材料为典型"课本体"——词句经不自然的人为简化、叙述啰唆重复、无真实语篇特征。

4.3 核心指标(L1)

A. 选材(10 条)

#

检查项

标准

1

篇数

不少于 3 篇(李筱菊举 MET 大纲规定:"不少于三篇,不少于 600 字")。新高考为 4 篇+七选五 1 篇

2

单篇长度

"以 100 至数百字比较适宜";刘润清、韩宝成建议 200—500 词,"中等以上的测试中 300 词左右最为理想"

3

阅读速度

李筱菊给出底线:"每分钟读 30 单词,并答一个 MC 题,应该说已经是有效阅读的最低速度,再低,就不能说是有效阅读,甚至不能算是阅读了。"(她批评某年把阅读速度降到 22 字/分是"倒退")

4

出处

"同一个考试用的材料,只要可能,还是应该每篇都选自不同的出处"

5

体裁

"材料的题材和体裁,更是必须篇篇有异"

6

生词率

两书一致:不超过 2%(李筱菊说 2%—3%,且每个都要求加汉注);语法结构不得超纲

7

真实性

四层递进(李筱菊):"首先要有情景的真实,然后有篇章类型的真实,再然后有文体的真实,最后是语言的真实"

8

不"规范化失真"

真实性包含规范性,但"是具有社会语言学定义的规范性"。刘润清、韩宝成:改写"必须严格控制,改得太多,就失去了原有材料的语言和文体的真实性"

9

有新信息

"阅读材料没有新信息,就无法问问题。即使你问了问题,受试者答对了,你也说不清是由于他原来就知道,还是由于他读懂了材料"

10

无偏颇偏僻

"在信息的新鲜性与熟悉性之间把握好分寸";避免文化差距与过于专门的内容

B. 写题(9 条技术要求)

· 语言正确、地道、得体、简洁;题目难度不得超过材料难度。

· 考点明确,每题一个考点中心并在题干点出;无空题干。

· 每题只有一个答案;选择项不互相牵连。

· 选择项尽可能一致(长度、结构、类属、难度)。刘润清、韩宝成特别提示"四个选项都用了比较级"而题干用了 compared with 这类搭配错误。

· 把四个选项逐一代入题干,检查语法、搭配、意义三项是否都讲得通。

· 题干形式交替:填空式与疑问式混合,不要连出三题同型。

· 考点顺序:与文章局部有关的考点顺着文序;归纳全篇的可前可后,"只求思路自然"。

· 覆盖:考点应覆盖材料各主要部分,"不要明显地只集中考材料的一部分而置另一部分于不顾"。

· 成卷三查(刘润清、韩宝成):题序是否与文序大致相同、答案是否集中在某个选项、不同题目的选项在意义上是否有关联。

C. 层次与答案分布

· 层次配比:整份阅读题 H∶M∶L ≈ 1∶1.4∶0.8(参照 MET87 的 8∶11∶6,即"中低层次之和约为高层次的一倍")。

· 促成技能:需"借助世界知识/据上下文猜义/分析/综合/逻辑推理/判断欣赏"的题不少于 40%。

· 答案分布:A/B/C/D 均匀。李筱菊的经验是"命题人随意出题答案是 C 最多、B 其次、D 再其次、A 极少甚至全无",故必须统计后调整;刘润清、韩宝成亦要求"答案的排列是否集中在某个选项"必须复查。

4.4 案例:S 卷阅读的三条发现

案例 4-1 一处必须拦截的知识性错误(S 卷 D 篇注释)

原文与注释

"...can reduce the carbon footprint of aviation by using the helium (氮气) inside the balloon to do the lifting, rather than a carbon-emitting jet engine." 

问题。helium 是氦,不是氮(nitrogen)。这是硬性的知识错误。

为什么这属于否决项而不只是"小瑕疵"。第一,注释是命题人主动提供的 scaffolding,考生会照单全收,错误注释等于直接传授错误知识;第二,本段的核心信息正是"用氦气浮力替代喷气发动机以实现零碳排放",氮气(N₂)虽也轻于空气但不可用作浮升气体的常识与"helium"的所指冲突,会干扰考生对因果链的理解;第三,它破坏了试题的表面效度——教师与考生一旦发现,整卷的专业可信度崩塌。李筱菊在讲卷面与指令时强调"试卷要印得清楚醒目,避免拼法错误、遗漏或涂改"(刘润清、韩宝成在"实用性"一节亦同),注释错误比拼写错误更严重。

同类问题(A 篇)。A 篇把 premiere 注为"首次公演"。该处原文为 one of the premiere sports venues in the area,实为 premier(首屈一指的、一流的)之误植/误注,"首次公演"既不合词性也不合语境。

流程建议。凡加中文注释的词,必须执行"三查":查词性、查该语境下的义项、查与前后文语义是否自洽;由一名非命题教师专门复核注释栏。这是成本极低、收益极高的一道关口。

案例 4-2 一道值得商榷的"最佳选项"(S 卷阅读第 22 题)

原文依据

题目与选项

"You can purchase parking passes in advance for events at BC Place Stadium online, which helps to avoid higher parking rates on site." "Parking around BC Place Stadium can cost anywhere between $10 and $30 on event days, depending on the type of parking and location." 

22. How can you reduce your parking rate at BC Place Stadium?A. Choose a parking location. ✓ B. Reach parking lots in advance. C. Purchase parking passes on site. D. Display passes on the phones. 

问题。原文明示的省钱方法是"提前网上购买停车证",但这一信息未被设为正确项,而是被改造成干扰项 B(把 purchase passes 换成 reach lots,故 B 确实错)。正确项 A 则需从"价格因类型和位置而异"反推"选位置可以省钱"——这是一次额外推断。

评价。该题不构成否决项(答案唯一,B 的错因清楚),但属于典型的"考点与原文对应不够严密":把明示信息让位给推断信息,会把能力较强的考生推向"我明明读懂了为什么选 A"的困惑,压低区分度。李筱菊的检验法在此正好适用:"受试者是否要真看懂材料,才可能把问题都答对?"——本题中,真看懂了原文的考生反而可能不选 A。

改法。把正确项改为 Buy parking passes ahead of time.(考明示信息,稳、有效度),把原 A 改造成干扰项(考"价格因位置而异"这一辅助信息可另设一题)。如果坚持要考推断,则应在题干中明示推断指向,如 What does the price range suggest about saving money?

案例 4-3 A 篇三题的层次定位(可接受,但要计入全卷配比)

S 卷 A 篇为体育场导览(应用文/实用性语篇),三题均为"局部信息核对":第 21 题考举办过的赛事(干扰项以 Winter→Summer、Championship Match→Final、North American→World 等细节偷换构成),第 23 题考可携带物品(干扰项均取自原文禁令清单)。

评价。三题均属 L 层(局部、事实性、明说)。这不是缺陷——应用文的功能定位本就是信息查取,李筱菊说跳读类考点"无所谓难易,也无所谓的层次……是技能测试多于理解测试"。真正的要求是:A 篇的 L 层题必须在 C、D 篇由 H 层题补偿,使整份阅读题的 H∶M∶L 达到约 1∶1.4∶0.8。S 卷 C 篇(AI 与艺术)考"作者态度"(第 31 题)、"艺术如何弥合内心隔阂"(第 30 题),属概念性与态度性信息,可达 H 层;D 篇第 32 题考"作者如何解释飞艇回归"(写作手法)、第 35 题考末段意图,亦属 H 层。建议的做法是:逐题圈定 H/M/L 后统计总数,写进审题记录。李筱菊提醒:"有了合乎多层次要求的材料,也还需要在命题时有意识地去努力,否则有了多层次的材料也会写出单层次的题目来。"她还一针见血地指出我国英语试题的"通病之一,就是把试题都出成是一个层次的"。

4.5 阅读大题评价表

层

检查项

0

1

2

记录

选材

篇数 ≥3;总字数达标

□

□

□

__篇 / __词

每篇出处不同

□

□

□

题材体裁篇篇有异

□

□

□

生词率 ≤2%—3% 且注释无误

□

□

□

__%

真实性(非课本体、未规范化失真)

□

□

□

含新信息;无偏颇偏僻

□

□

□

无政治/民族/宗教/性别敏感内容

□

□

□

折算阅读速度 ≥30 词/分

□

□

□

__词/分

写题

考点以信息为目标;优先必要/关键考点

□

□

□

潜信息(意图/态度/言外之意)已考到

□

□

□

无空题干;每题一考点中心

□

□

□

题干选项未照抄原文;四项一致

□

□

□

四项代入题干语法/搭配/意义俱通

□

□

□

覆盖材料各部分;题序与文序相合

□

□

□

结构

层次配比 H∶M∶L ≈ 1∶1.4∶0.8

□

□

□

H__ M__ L__

答案 A/B/C/D 分布均匀

□

□

□

A__B__C__D__

否决

9 条否决项逐条过

命中____条

数据

P____ Δ____ rbis____;rbis<0.3 的题____

第五章 完形填空测试评价标准:考点效度

题型定位:C 类(综合考点 · 单技能 · 间接)——有语境、无交际情景。它测的是"利用冗余信息还原被破坏的语篇"。本章的核心是李筱菊提出的考点效度与考点层次,这是评判完形质量最锋利、也最容易量化的一把刀。 

5.1 完形凭什么能测能力:冗余、还原与单一能力假说的破产

完形程序(cloze procedure)由 Taylor 于 1953 年依据格式塔心理学发明:人观察有缺口的图形时会下意识地把缺口补上,阅读亦然。其信息论基础是冗余:自然语言含有大量冗余信息,"一个人的语言水平越高,可容忍的被破坏的信息度越大"(刘润清、韩宝成语),因此还原残缺语篇的能力可以反映语言水平。

但李筱菊对"完形天然能测全面能力"这一流行信念作了系统拆解,用的是她自己的"酱坛子"比喻:

——李筱菊,第八章 8.1.2.1

她引的实证是:同一篇文章、同一删词距离、仅起点不同的两道定距完形,同水平考生得分显著不同;把所删项目分两类作因素分析,可析出两个不同因素。结论是"完形填空试题所测试的能力并不是单一的"。

由此得到本章的第一条总原则:完形"到底测什么"不由题型决定,而由"删了什么词、配了什么选项"决定。完形既不天然测全面能力,也不天然只测低层次技能——一切取决于考点。

5.2 考点效度:W—P—S—D 四层次与焦点因素

李筱菊用四个圆弧表示考点层次:"在决定用什么词填每一个空缺的时候,需要考虑多广的上下文,才能作出决定。"

层次

记号

定义

示例

焦点因素

单词

W

光看单词本身,无须看上下文即可决定

四个选项 flyed / flied / flew / flewn → 只考拼写与词形变化

语法

词组

P

与前后词有固定搭配关系,只看空缺前后即可决定

_ Pacific → the;husband and _ → wife;pick up new hobbies

搭配(亦可为语法/意义)

句子

S

本句之内即可决定,不必超出句子范围

What _ he do last Sunday? → did

语法/搭配/意义

语篇

D

光看本句不成,须超出句子在语篇层次上考虑

"Man is the cleverest animal… But in his war against the rat, he seems always to be the _" → 须通篇才能判 loser

必为意义

配套的判定原则,建议原样背下来:

——李筱菊,第八章 8.1.2.2

还有一条必须记住的保留条款:上述"上层包下层"的道理"对于选择式完形填空试题,就不一定了"——选择式完形的特定考点"常常只考这个层次这个因素,不一定把以下其他层次及其他因素都必然包容进去"。更严重的是:

——李筱菊,第八章 8.1.2.2(论开放程度)

5.3 最常见的病:把完形做成"单项填空加一篇短文"

这是李筱菊批评得最严厉的现象,几乎是对当下大量模拟卷的现场写照:

——李筱菊,第八章 8.1.2.2

她给出的实证对照([例8.7]原版 MC 完形 vs [例8.8]改良版,同一题材、同为 20 空):

版本

W

P

S

D

李筱菊的评价

[例8.7]原版(MC 式)

1

约 7

11

1

"其考点的层次明显地下降了。也就是说,效度减低了"

[例8.7]同文开放式

0

3

8

9

(开放式层次显著更高)

[例8.8]改良版(MC 式)

0

3

4

13

"即使是很受限制的选择式完形填空试题,只要命题时带着明确的层次意识,题目的质量是完全可以提高的"

由此可得的量化门槛(本文建议)

15 空的选择式完形:D 层 ≥ 5 题(1/3)为合格线,≥ 7 题(近 1/2)为良,≥ 10 题为优;W 层应为 0。依据:李筱菊改良范例达 13/20=65%,她所批评的典型劣质题仅 1/20=5%;取中间偏上作为合格线。 

5.4 否决项与核心指标

完形大题的 7 条否决项

1. D 层考点为 0 或仅 1 题。——完形失去存在理由。

2. 多数空格"切开短文后仍可作单项填空"。这是第 1 条的可操作检验法,见 5.5 案例。

3. 选材为"课本体""简化体"。李筱菊:"如果短文都是短短的句子,都是单调的句型,句与句之间看不出过渡、转折、呼应、层次、依赖、连结等等关系,这样的短文是无法写出语篇层次的完形填空题目的";"语篇特征正是真实语言的一个不可缺的属性"。

4. 删了不该删的词:数字、专有名词、"或者其他不受语境牵制的实词、信息的表达又全无羡余可借以推测的词"(如 Julian、日期、park)。

5. 首句即设空,或首句连设数空。刘润清、韩宝成批评某题"头一句就有空格,而且第一个句子就有 3 个空格"。

6. 空格间距失控:连续三句无空却在某一句连设四五个空;或相邻空格仅隔 2—4 词。刘润清、韩宝成给出硬约束:定距删词间隔 5—11 词且全篇恒定;合理删词平均间隔不超过 11 词,李筱菊给出"空当之间距离不小于三个单词"。

7. 任一空答案不唯一,或选择项互相牵连/抵消。

核心指标(L1)

· 层次结构:逐空判 W/P/S/D 并统计;D 层占比(见 5.3 门槛)。

· 焦点因素结构:数"以意义为焦点(M)"的题数;D 层题的焦点必须是意义,若标为语法说明层次判定有误。

· 选材:语言正确、地道、得体=真实性;"简洁倒并不特别重要(需要有羡余),但是正确、地道、得体很重要";难度低于阅读;长度 350—500 词为宜(刘润清、韩宝成),简单且自成一体的可缩至 150—200 词。

· 题材:避免偏颇(部分人熟、部分人生)也避免偏僻(对全体都生疏);题材体裁多样化——"真实生活中我们不会只读故事"。

· 排版:李筱菊认为"选项置右边与短文并排"是"比较理想的排版设计";避免翻页、避免割裂语篇。

· 选择项:完形"不需要像 A 类试题那样强调一致性",但底线是"不要因此突出了答案或者削弱了干扰项";容许多考点,但 MC 完形中一题多考点易削弱题目。

· 间距分布:统计并复核相邻空格间距,不能只看平均数——刘润清、韩宝成批评某高考题"均 7.8 词/空,扣除首句后 7.2,且 25% 的间距仅 4—5 词,这种设计恐怕不十分妥当"。

5.5 案例:S 卷完形 15 空的层次体检

S 卷完形为 15 空(41—55),答案键:CADBA CBDAA CDBAB。下面按李筱菊的四层次逐空判定(判定可由读者自行复核,允有 ±1 题的出入,但量级结论稳定)。

空

答案

判定依据

层次

焦点

可独立成题?

41

occupied

"8-to-3 schedule kept me __" 句内语义+keep sb. adj. 结构

S

C/M

是 ⚠

42

assignment

须读到下句 "anything but working on my schoolwork" 方能排除 socialization

D

M

否

43

spare

spare time for anything,固定搭配,句内可判

P

C

是 ⚠

44

picking up

pick up new hobbies,固定搭配

P

C

是 ⚠

45

dynamic

与 open-minded、fun 并列,句内语义场

S

M

否

46

uplifting

与 long dull nights 构成反义,句内

S

M

否

47

push

push oneself harder,固定搭配

P

C

是 ⚠

48

define

"__ my college experience in ways nothing else can",句内

S

M

否

49

traveler

须读下文 "tour Sweden… day trips to Cape Cod" 方可确定

D

M

否

50

climb

"the morning sun __ over the trees",句内意象

S

M

否

51

vitality

breathe vitality into,固定搭配

P

C

是 ⚠

52

sure

句内插入语,与 However 呼应

S

M

否

53

volunteer

须由 shelter 与下句 "a love of social work" 推断

D

M

否

54

twists

"a story's unexpected __",回指全篇经历,须语篇主旨

D

M

否

55

regret

"taking roads not taken" 与篇首 wonder 形成呼应

D

M

否

统计:D=5(33%)、S=6(40%)、P=4(27%)、W=0。

诊断结论与处方

① 合格但偏保守。D 层 33% 落在"合格线(≥1/3)"边缘,高于李筱菊所批评的 5% 典型劣质值,但明显低于她的改良范例(65%)。W 层为 0,符合要求。

② 最值得警惕的一处:5 个空(41、43、44、47、51)"切开短文后仍可作单项填空"。检验方法极其简单——把该句单独抽出来,遮住其余全文,看能否作答。这 5 空全部可以。它们集中在 keep sb. occupied / spare time for / pick up hobbies / push oneself / breathe vitality into 五个固定搭配上,即李筱菊所批评的"先找一篇短文,在里面挑语言关键点,再按单项填空的办法命题"。这 5 空事实上由"语法填空"承担更合适。

③ 处方(三条可执行):换考点——把搭配型空(如 51)改为删除一个需要跨段判断的词(如体现语篇转折的连接副词、回指性代词、需要综合人物态度才能确定的形容词);改选项——对 P 层空,把四个选项都改成"语法与搭配上都成立、只有放到语篇里才分得出对错"的词,逼迫考生回到语篇;换文本——选用过渡、转折、呼应更明显的语篇(李筱菊:"语篇连贯性"是写出 D 层题的前提)。

5.6 完形大题评价表

层

检查项

0

1

2

记录

选材

语篇连贯(有过渡/转折/呼应/层次)

□

□

□

真实语篇(非课本体/简化体)

□

□

□

题材不偏颇、不偏僻;难度低于阅读

□

□

□

长度与排版(选项与短文并排优先)

□

□

□

__词

删词

首句完整;未删数字/专名/不可推测的实词

□

□

□

间距 ≥3 词;无"三句无空+一句多空"

□

□

□

均__词

有意识删体现语篇连贯的词(连词/连接语/指代词)

□

□

□

__空

字数与空数比(约 15—20 词/空)

□

□

□

__词/空

考点

逐空判层次:D__ P__ S__ W__

□

□

□

D__% 

D 层 ≥1/3(目标 ≥1/2);W 层 = 0

□

□

□

"切开可独立成题"的空 ≤2 个

□

□

□

__个

焦点为意义(M)的题数 ≥ D 层题数

□

□

□

M__

选项

不突出答案、不削弱干扰项;无互相牵连

□

□

□

四项代入后语法/搭配/意义俱通

□

□

□

否决

7 条否决项逐条过

命中____条

数据

P____ Δ____ rbis____;与语法填空的相关____(<0.5 为佳)

第六章 语法填空测试评价标准

题型定位:处于 A 类(离散考点·单技能·间接)与 C 类(综合考点·单技能·有语境)之间的连续体,位置由"有没有语境"决定。孤立单句的语法填空是 A 类;置于完整语篇、需据上下文推断的是 C 类。新高考的"语篇型语法填空"正属于后者——这是本题型的效度命门。 

6.1 测什么:产出性技能,而不是"认得出规则"

刘润清、韩宝成对填空题的定位非常明确,这句话应当写进每一份命题任务书:

——刘润清、韩宝成,第七章 7.3.3

李筱菊的分类框架则给出一条明确的降级判据:"只删动词的完形填空题,考的只是语法……是单技能单考点试题",依分类"不该放在 C 类,而应放在 A 类之下"。同理,一篇语法填空如果 10 个空全部只靠本句就能填出、与语篇无关,它事实上已经退回 A 类。因此本题型的第一条评价原则就是:

原则一:语境参与度

逐空判断"是否需要超出本句的上下文"。建议门槛:10 空中至少 3 空需要跨句信息(即达到 S 层以上的语篇制约),至少 1 空需要全篇信息。达不到,则本题只是"披着语篇外衣的单句填空"。 

6.2 否决项(L0)

语法填空大题的 8 条否决项

1. 任一空存在两个可接受答案。这是本题型的头号杀手,见 6.4 的"回填校验"。

2. 提示词形式不规范:该给提示词的没给、不该给的给了;提示词本身拼写错误;同一括号内出现两个词。

3. 答案为改编产物,非原文用词。语篇型语法填空的铁律是只删不改:答案必须逐字取自原文,命题人不得为凑考点改写原文。

4. 考点重复:同一考点占 3 空以上(刘润清、韩宝成批评某卷"三道大题各 20 题中考介词分别为 5/4/5 道……用近乎 1/4 的分量考介词,就已经是有失比例了")。

5. 语法点超纲,或使用了有争议的语法现象。刘润清、韩宝成的忠告:"命题时还是依据传统语法为好……If I was you…、I don't know nothing 一类最好不要出现在测试题中,以免引起争议。"

6. 挖空后语篇不通顺、信息链断裂——为凑考点而删掉关键实词。

7. 空白设置违反唯一性技术:如"补缺词落在行首或行尾"(李筱菊论成段改错的技术要求,同理适用)。

8. 语篇本身有语言错误或知识性错误。

6.3 核心指标(L1):十空的考点结构

最有效的工具是考点覆盖分析表。李筱菊在论成段改错时明确要求:"应该用本书第五章[表5.2]那样的语法考点覆盖分析表分析一下……还应和同一考试中其他大题所考的语法点一起作平衡和分工。"下面这张表就是它的语法填空版。

建议的考点配比(10 空)

考点维度

建议取值

理由

提示词 ∶ 无提示词

6∶4 或 7∶3

两者测的能力不同:提示词空考词形变化与构词(偏产出),无提示词空考功能词与结构词(偏语篇理解)。失衡则会退化为单一技能

介词空

≤ 1

刘润清、韩宝成对介词占比失衡的批评;单一考点过度集中会降低内容效度

冠词空

≥ 1

冠词是汉语母语者的系统性薄弱点,也是语篇衔接手段;全省略属遗漏

谓语动词

1—2

时态、语态、主谓一致;被动语态优先于简单时态

非谓语动词

1—2

不定式/分词/动名词

词性转换

1—2

派生构词

从句引导词

1

关系代词/关系副词/连接词

连词/逻辑连接

1

体现语篇层次

代/副词等

0—1

指代与修饰

其他核心指标

· 语境参与度:≥3 空需跨句信息,≥1 空需全篇信息(见 6.1)。

· 难度梯度:10 空内应有易、中、难梯度,不宜前 3 空即出现最难点(会打击后续作答信心)。

· 答案唯一性验证:执行"回填重建校验",见 6.4。

· 语篇质量:题材真实、语言地道得体、有语篇连贯特征;词数控制在 180—240(这是中学语篇型语法填空的通行区间)。

· 生词率:≤2%—3%,超纲词须加注。

· 与题干其他大题的分工:同一套卷里,语法填空与完形、写作评分标准所关注的语法点应当分工,避免重复考查。

6.4 答案唯一性:两道必须执行的校验程序

程序一:回填重建校验(技术性)。把 10 个答案按空号顺序回填到挖空文本,与原文逐字符比对,必须完全相等。这道程序能一次性抓出三类问题:①答案错位(空号与答案对不上);②答案为改编产物(原文用的不是这个词);③挖空时误删了原文已有的词(例如原句已有 the,却仍把冠词设为答案)。

程序二:同义可接受性审查(语言性)。由一名未参与命题的教师,在不看答案的情况下独立填一遍,逐空追问"还有别的词也能讲得通吗"。刘润清、韩宝成举过一个典型的反例:词库式填空中,carry 作为多余项出现在词库里,但它完全可以填进另一空代替 bear,"有的空格就有两个答案,给评分带来麻烦"。他们给出的两条硬规则是:①提供的词应多于空格数;②要保证多余的词不能出现在任何空格上。

6.5 案例:S 卷语法填空的考点体检

S 卷语法填空为舞狮题材语篇,10 空(56—65),答案键:an / is performed / to bring / symbolic / where / are / but / booked / maturity / without。

空

答案

考点

提示词

层次

判定说明

56

an

冠词

无

P

iconic part 前的不定冠词,句内可判

57

is performed

谓语动词·被动语态

有

S

主语 the lion dance 与 perform 的被动关系,句内

58

to bring

非谓语·不定式

有

S

与 drive off 并列,须据并列结构判(见下)

59

symbolic

词性转换 n→adj

有

P

a __ ceremony,句内

60

where

定语从句·关系副词

无

S

先行词 ancient legends,从句内部结构完整,句内可判

61

are

there be 主谓一致

有

S

statistics 为复数中心词,句内

62

but

连词·转折

无

D

"没有官方统计"与"舞狮无处不在"的转折,须跨句理解两个分句的逻辑关系

63

booked

非谓语·get + 过去分词

有

S

get booked 结构,句内

64

maturity

词性转换 adj→n

有

P

reach full __,句内

65

without

介词

无

D

"not complete __ lion dances",须结合全篇主题判"没有舞狮就不完整"

统计:提示词 ∶ 无提示词 = 6 ∶ 4 ✓;介词 1 空 ✓;冠词 1 空 ✓;谓语动词 1、非谓语 2、词性转换 2、从句引导词 1、连词 1、主谓一致 1。层次结构:D=2、S=5、P=3、W=0。

做得好的三处

①考点分布均衡,无重复考点,介词与冠词各一,符合配比要求;

②62、65 两空达到语篇层次(转折关系、全篇主题),使本题真正立于 C 类而非退回 A 类;

③57 考被动语态、63 考 get + done,属中国学生的真实薄弱点,而非送分点。

需要复核的两处

① 第 58 空的并列结构。原句为 the lion dance is performed during Spring Festival, which begins from Feb 17 this year, __58__ (bring) good luck, prosperity and fortune and drive off evil spirits for the new year. 答案 to bring,其合法性依赖"to bring … and drive off"的不定式并列(后者省略 to)。风险在于:若考生视 bring 为伴随状语而填 bringing,则与后面的原形 drive off 不平行——这个"不平行"是答案唯一的全部依据,而这依据很细窄。若原文此处本为 bringing … and driving off,则命题时的删改已违反"只删不改"。

处方:执行 6.4 的回填校验,核对原文该处动词形式;若确为改编,应改回原文形式或换一处挖空。同时在审题记录中写明"本空唯一性依据为并列结构平行"。② 语境参与度偏低。D 层仅 2 空(62、65),刚过本文建议的"≥3 空"门槛的下沿。建议下次命题有意识地删除一个体现全篇逻辑的连接性词语(如 However / Therefore / In addition)或一个需要跨段判断的指代/修饰词,把 D 层提到 3—4 空。

6.6 语法填空大题评价表

层

检查项

0

1

2

记录

语篇

真实、地道、得体;语篇连贯

□

□

□

词数 180—240;生词率 ≤2%—3%(超纲已注)

□

□

□

__词 / __%

题材不偏颇偏僻;无知识性错误

□

□

□

考点

提示词∶无提示词 = 6∶4 或 7∶3

□

□

□

__∶__

介词 ≤1;冠词 ≥1;无考点占 3 空以上

□

□

□

考点覆盖表已填,与完形/写作分工

□

□

□

逐空判层次:D__ S__ P__ W__(D≥3,W=0)

□

□

□

D__

技术

回填重建校验通过(与原文逐字符相等)

□

□

□

同义可接受性审查通过(无第二答案)

□

□

□

提示词形式规范;无超纲/争议语法点

□

□

□

否决

8 条否决项逐条过

命中____条

数据

P____ Δ____ rbis____

第七章 写作测试评价标准(含读后续写)

题型定位:应用文写作=D 类产生性运用(综合考点 · 单技能 · 直接);读后续写=E 类(综合考点 · 综合技能 · 直接,先读后写)。写作是全套卷子里效度最高、信度最低、可行性最差的题型——李筱菊把它在"效度—信度—可行性"三角中的位置画得很清楚:离 V 点很近,离 R 点相当远,离 C 点(实施条件)更远。因此评价写作题,重心不在"好不好写",而在"写得对不对、评得准不准"。

7.1 写作的价值:它是唯一能带来"纯正面反拨"的题型

刘润清、韩宝成把写作称为综合性测试:"它不仅测验学生的词汇、用法、语法等语言要素,而且测验学生的组织能力、分析能力、表达能力、逻辑推理、对各种语体的掌握等。所以有人认为只有写作能力才能真正反映一个人的语言修养。"其弱点是评分主观——"10 位老师可能给出 10 个不同的分数",他们甚至记下了这样一句现场批评:"目前在我国的大规模测试中,写作一项常常由一位教师评分,而且要求他每天评阅 120 份作文。在这种情况,教师只好昧着良心瞎划一个分数,哪还有信度可言。"

但写作必须考,理由是后效:

——李筱菊,第十章 10.1.2

刘润清、韩宝成的说法更直白:"在我国,英语教学已经被客观试题冲击得不成样子。天天四项选择,许多人靠猜题过日子。有点写作测试无论如何是必要的。起码会逼着考生动动手,写几个英语句子。"

7.2 命题的五条设计原则(李筱菊)

#

原则

内涵

反面(不算写作题)

一

以信息表达为目的

"前者测试的焦点是意义(信息)。后者测试的焦点是语言形式——语法(包括语音和拼写)和词汇"

造句、条件翻译、改写、补全短文、串句成文、跟读、背书、复述——"普遍地冒名顶替"

二

情景真实且切当

"他们现在或将来很有可能会遇到的情景";"不宜把仅仅是对读、听是真实的情景用于考写、说。更不宜把用母语写或说的真实情景,用于考外语"

真空中作文;让中国学生用英文给父母写信、向国内中文刊物投稿

三

测试层次是语篇层次

"语篇的定义是语境和情景中的语言"

看图写单词/写句子=单词或句子层次

四

要求是互动性行为

"信息的传递不可能是单方面的,必须是双方的";须"带着明显的对象意识去写"

无读者的独白式作文

五

语言制约来自交际情景

交际情景 →制约→ 要表达的意义 →制约→ 要用的语言形式

人为指定必须用哪些词、哪些句型

第五条尤其值得展开。李筱菊的意思是:控制写作的变量要从"情景"那一头入手,而不是从"语言"这一头入手。例如想考"道歉",不要规定"请用 apologize",而要设计一个"你把同学的书弄丢了"的情景——"丢书说'感到内疚',给词造句则心理过程完全违反了实际运用语言的心理过程"。她还给了判分例子:按情景自由选词,"只要说的话得体而正确,就应该给满分";而"我万恶不赦,痛不欲生"则不给分,"这就是情景对语言的制约"。

7.3 四要素:情景、馈入、输出、评分

(1)情景

· 按受试群现实/将来的需要设计;"设计得好的 D 类产生性运用试题……已经不是一般的试题命题,而是一种艺术创作"。

· 说明要非常清楚,同时又要尽可能地简洁;情景及人物关系本身"不能太复杂"。

· 用目标语说明情景时,"不应太难,以致成为阅读或听力理解测试"。

· 假设情景"要做到明确,却又要尽量淡化……能让受试者自然而然进入情景而不自觉"。

· 公平性:李筱菊举过一例——某题要求写"爱猫者协会"年历短文,"碰上不爱猫的人,让他写,就有点不公平",解决办法是另出一道水平与要求相仿的等值题,由考生任选其一。这条极有价值。

(2)馈入(input)

两大作用:具体化输出内容、限制输出内容。限制的两个理由是:低水平考试只能是"控制性的写"且不超大纲;"假如不对内容加以限制,受试者的答题内容一定会五花八门,难以用同一标准评分"。两条准则:

馈入的两条准则

①"馈入限于提供内容,不提供表达的形式"; ②内容"不应和盘出……也应在现实容许的范围内,给受试者尽量多的自由"。馈入只是"关于内容的提示(hints 或 cues)、刺激(stimulus)、来源(source)或根据(basis)"。 

技术要点:用目标语馈入要防止照搬原字眼,用母语馈入要防止直译;因此宜用"简化的语言形式,譬如只给提纲要点,只给图表数据"——这正是现行应用文与读后续写的做法。

(3)输出(output)

· 量的要求:"抽样必须有一定的量才有效"。李筱菊记下 MET 书面表达"约 8 至 12 个句子"、口试"16 至 20 句话",并称"我们认为是测量写和说的能力最低的抽样量了"。→ 现行应用文 80 词、读后续写 150 词与此相当,属下限,不宜再压。

· 多样化:正规文章/便条/应用书信等轮换。

· 方式:"是否真正的写;受试者心理上是否感觉自然。这直接关系到考试的表面效度。"

(4)评分(详见 7.6)

7.4 否决项(L0)

写作大题的 7 条否决项

1. 以形式而非意义为焦点:规定必须用某些词/句型、要求翻译或改写原文、要求背诵式套写。

2. 情景对受试群不真实或不切当(如让中国学生用英文向国内中文刊物投稿、给父母写英文信)。

3. 情景可能对某一子群体不公平且未提供等值备选题("不爱猫"问题)。

4. 馈入提供了表达形式(如直接给出要用的句式、给出可照抄的范文片段),使任务退化为抄写。

5. 输出量低于最低抽样量(不足 8 句/60 词)。

6. 无评分标准或评分标准含大量相对性形容词("语言流畅、内容充实"而无分等描述)。李筱菊:"综合性评分标准最忌写上许多相对性的形容词,成为人人都可以有不同理解的、没有什么实际作用的官样文章。"

7. 阅卷组织无法保证信度:单人无控制评分、无抽样复核、日阅卷量过大。

刘润清、韩宝成还给出两条应当回避的命题行为:一是依赖语言之外的背景知识("Is photography an art or science? Discuss."——"只能对个别学生有利";Milton 诗句评论题——"学生不知道 Milton 是何许人,也看不懂他的哲理深奥的诗句,如何进行评论呢?");二是话题与认知水平不匹配("让一名学过两年英语的初中生用英语去谈论环境保护、人权、交通堵塞等是不现实的")。

7.5 案例:S 卷的两道写作题

案例 7-1 应用文(S 卷写作第一节,满分 15 分)

原题

你校英文报"Opinion"栏目正征稿,请同学们对未来交通方式的变化发表自己看法,并阐明变化带来的好处。请你写一篇短文向该栏目投稿。 注意:1. 词数 80 左右;2. 请按如下格式在答题卡的相应位置作答。Future Mobility

要素

评价

依据

情景

合格偏上

校英文报栏目征稿,是学生真实可能遇到的情景;具备读者(编辑与同学)与目的(发表看法),满足"互动性"与"语篇层次"

馈入

合格

仅一句中文要点,只提供内容、不提供表达形式,符合"馈入限于提供内容";也未和盘托出,留有自由

输出

合格(下限)

80 词约 8—10 句,恰是李筱菊所说"最低的抽样量"。建议:不宜再低于 80 词

焦点

合格

要求"发表看法并阐明好处",焦点是意义而非形式;未规定必须用哪些词句

公平性

有隐患

"未来交通方式"对城市与农村学生的经验基础不同;但话题属公共议题、可凭常识展开,风险可控。若话题更依赖个人经历(如"我的第一次飞行"),则必须提供等值备选题

标题

建议改进

给出英文标题 Future Mobility 有利有弊:利在统一情境、便于扫描阅卷;弊在等于馈入了一个关键表达,且 mobility 对部分考生生僻。建议:给标题的同时在评分标准中说明"标题已给出,不计入词数、不因标题用词扣分"

案例 7-2 读后续写(S 卷写作第二节,满分 25 分)

材料:麻醉师 Alan 山地骑行时突发心梗,挣扎到停车场呼救,调度员让他原地不动;他躺下等救护车,三辆车骑过无人停下;最后一位骑行者停下来说"We will wait with you until it gets here."。两段开头语:① Soon, Alan heard ambulance sirens rapidly getting closer. ② Eventually back home, Alan found his bike parked against the wall.

要素

评价

依据

题型定位

优

E 类:又读又写,综合技能,最符合交际实际。李筱菊指出 E 类试题应体现主题连贯——一次进入情景、情景"积累利用",读后续写正是如此

材料

优

情节完整有断层、人物少、冲突清楚、情感线明确;具备"新信息"与"潜信息"(陌生人善意),能支撑 H 层理解

开头语的约束力

优

第②段开头语 Alan found his bike parked against the wall 是一处极强的照应指令:它要求考生在前一段必须交代"自行车如何回家",否则第二段无法接上。这既约束了情节方向(提高评分可比性),又留下了创作空间(谁送的、怎么送的、Alan 的感受)。这是读后续写命题的核心技术,本卷做得好

与原文的衔接要求

合格

人称(第三人称 Alan)、时态(过去时)、文体(叙事)、人物性格(医生的专业冷静+陌生人的朴实)均已由原文给定。建议在评分标准中把这四点明文列为"衔接"评分项

输出量

合格

两段合计约 150 词,与"最低抽样量"相当

公平性

合格

题材(户外遇险与陌生人相助)不依赖特定文化背景;anaesthetist、paramedics、dispatcher 已加注

值得推广的一条做法

读后续写的开头语应当是可检验的"情节约束":读完开头语就能推断出上一段必须交代什么。本卷②中"bike parked against the wall"与原文"Alan 把车停在停车场、车留在原地"构成硬约束——考生必须补出"车如何回到家"这一环。这类设计把开放式写作变成了半约束任务,正是李筱菊所说"馈入……限制输出内容"以保证"能用同一标准评分"的范例。评价他人命制的读后续写时,可以用一句话检验:遮住原文,只看两段开头语,能否说出每一段大致该写什么?说不出,说明开头语约束力不足。 

7.6 评分:本题型的全部难点

(1)三种评分法

方法

操作

评价

机械法计算错误法

数错误扣分(如语法错 5 个扣 10 分)

刘润清、韩宝成批评三条:错误性质不同却同扣分不合理;硬性规定倍数也是主观判断;"它只注意文章的缺点,忽视了最根本的东西——思想表达,是否言之有物,是否达意,是否顺畅",会束缚创造力

印象法≈ 整体评分

据总体印象给一个总分;多人评定(3—4 人为好)

"实践证明,印象法比机械和分析法都省时间……三个人的印象比一个人的分析更可靠些"。须配套:评分员培训、定额(如每小时 5 篇)、"阅读速度减慢必须休息 10 分钟"

分析法≈ 分项评分

分项目按事先集体规定的标准分别评分后汇总

日常教学可用;书中给出 25 分制分项样例:语法、词汇、标点与拼写、行文、切题

李筱菊的主张是"我国当前的大面积考试中的主观题,恐怕只能走综合与分解相结合的评分路子";刘润清、韩宝成亦谓"中间派占了上风",即在条件允许时客观项目与作文并用。

(2)评分的出发点:不是"准不准",而是"成不成"

——李筱菊,第十章 10.2.2(论评分原则)

(3)可选择的评分方式

李筱菊列出五种方式并明确排除三种:"第一种——人工单人无控制评分,和第三种——人工双人共商评分,都是没有信度的评分方式。第五种——机器评分,尚未达到可以应用的地步。所以现阶段可供选择的,实际只有两种:第二种——人工单人有控制评分,和第四种——人工双人独立评分。"并给出一种变式:一人按综合法、一人按分解法,然后取平均。

(4)分等与监控

· 等级划分"一方面不能绝对,另一方面又必须准确而具体";国外一般 5—10 等,TWE 分 6 等被认为最佳。

· 标准"要以学习理论为指导、以本受试群具体情况为根据,常常还要经过不只一次的试测评分实践修改"。

· 设 1—2 名巡视检查人员随机抽查评分员:刘润清、韩宝成的判词极准——"一个人的评分始终偏高或偏低,问题倒不严重,只要他自己坚持一个标准,最后可以校正过来。最可怕的是忽高忽低,看不出评分的标准,也无法校正。"

· 组织底线:杜绝"一位教师一天评 120 份"式的安排。

7.7 写作大题评价表

层

检查项

0

1

2

记录

任务

焦点为意义(非规定词句/翻译/改写)

□

□

□

情景真实切当;有明确读者与交际目的

□

□

□

测试层次达语篇层次

□

□

□

馈入只提供内容、不提供表达形式

□

□

□

续写(如适用)

材料有断层与伏笔;人物少、冲突清

□

□

□

开头语具情节约束力(遮原文可推知该段写什么)

□

□

□

人称/时态/文体/人物性格由原文给定并可评

□

□

□

公平

无子群体不公平;必要时备等值题

□

□

□

输出量 ≥ 最低抽样量(≥8 句/60 词)

□

□

□

__词

评分

标准以"交际是否有效"为出发点

□

□

□

分等具体、非官样文章;5—10 等

□

□

□

__等

综合+分解结合;双评独立或单人有控制

□

□

□

培训+定额+巡视抽查(查"忽高忽低")

□

□

□

否决

7 条否决项逐条过

命中____条

数据

P____;评分员间相关____;抽查一致率____%

第八章 整卷层面:结构、配比、常数与后效

8.1 先看结构:双向细目表

整卷评价的第一步不是看题,而是看双向细目表(能力 × 题型)。李筱菊反复强调:"命题前要根据考试大纲、教学内容和教学目标,拟订好考试的内容,并一一罗列出来,这个内容细目表定的越详细、越明确越好,然后再按照这个表去编制具体的题目"(刘润清、韩宝成语)。

细目表至少要有两维:一维是能力(听/读/写的能力分项,参照第一、三、四、七章的能力清单),一维是题型与题量赋分。有了它,才能回答三个问题:有没有要考而没考的?有没有不考而考了的?各能力的权重是否与考试目的一致?

8.2 S 卷的整卷体检(示范)

板块

题量

分值

占比

题型类

整卷视角的评价

听力

20

30

20%

D 接

短对话+长对话/独白,与"听在日常交际中占比 40% 以上"(刘润清、韩宝成)的现实需求相比仍偏低,但受设备与可行性制约,属合理妥协

阅读理解

15

37.5

25%

D 接

两项合计 33.3%。刘润清、韩宝成记下"在有些测试中,阅读理解占到总分的 40% 以上";本卷 33% 属常规区间

七选五

5

12.5

8.3%

D 接

完形填空

15

15

10%

C

见第五章:D 层 33%,合格但偏保守;5 空可独立成题

语法填空

10

15

10%

A→C

见第六章:考点结构良好,D 层仅 2 空,建议提升

应用文写作

1

15

10%

D 产

写作合计 26.7%。李筱菊记下 MET 书面表达占比 13%→15%→16.7% 的演进;本卷已达 26.7%,在反拨效度上是明确的进步——它逼着教学真的去教写作

读后续写

1

25

16.7%

E

合计

67

150

100%

—

客观题 55 小题;题量距"标准化试卷不低于 90 题"(刘润清、韩宝成)仍有差距,这是新高考结构的固有约束,但正因题量有限,每一道题的质量权重更高——这恰恰是本文强调逐题体检的理由

8.3 全卷的定量体检清单

· 难度配比:70% 的题目 P 落在 0.3—0.7,P<0.3 与 P>0.7 各约 15%(李筱菊记 MET 指标)。

· 区分度:Rbis ≥0.3;未经试测的卷,rbis<0.3 的题控制在总题数 5% 以内(李筱菊:超出即"需要对具体区分度低的题目逐条研究找出原因")。

· 信度:客观题部分 R(KR-20)≥0.85;全卷含主观题用 Cronbach α,≥0.8。注意:刘润清、韩宝成指出"只适用于计算客观试题的信度",含主观题须改用 α。

· 分布形态:Sk、Ku 控制在 ±1 之内。

· 全距:若全距过小(如对照的 21%),说明卷子拉不开差距。

· 大题相关矩阵:某大题与所有大题的相关均低于 0.4 即为异常。李筱菊记下 MET87 的实例:完形填空与任何大题都达不到显著相关,诊断为"短文文体太抽象、难度太大"——这是一个可直接照搬的诊断思路。

· 因素分析:有效因素不应只有 1 个;单因素负荷 <10% 视为未考到。她给出的最重判词是:只测出"语言知识"一个因素的卷子,"那就从根本上是无效度的"。

· 适宜性分析(有条件时):不适宜试题与不适宜考生各约 5% 可容许,接近或超过 10% 即有问题。

· 等值:多次举行的统考须做等值——或在正式卷中插入不计分的共用题目,或另出等值试题并设固定点(锚点)学校。

8.4 反拨效度:这一节必须写进报告

李筱菊把反拨效度与实效效度合称"超考试效度",并说这是"比考试本身的目的更重要的目的"。刘润清、韩宝成的观察同样尖锐:"考什么,学生就学什么;不考什么,学生就不学什么;考试怎么考,学生就怎么学。"

反拨效度的四问(建议写进每一份评卷报告的末尾)

1. 这份卷会促使教师教真实语篇还是教"应试技巧"?——取决于选材真实性与考点层次。

2. 这份卷会促使学生大量阅读还是刷选择题?——取决于阅读的分量与速度要求。

3. 这份卷会促使师生重视写作与表达还是放弃写作?——取决于写作权重与评分的可信度。

4. 这份卷会不会催生"背模板、押题、套写"?——取决于写作任务是否有真实情景与对象意识。李筱菊提醒:无情景的写作会把学生置于"虚假的情景中",而"事先就能背熟答案来应付"的低水平面谈同样如此。

第九章 落地:三张表、一张卡与工作流程

9.1 表一:命题任务书(命题前,命题负责人填写)

栏目

内容

考试性质

成绩测试/诊断测试/水平测试/选拔测试。性质决定效度侧重点:刘润清、韩宝成指出"语言潜能测试多基于某种语言学习理论,因此重视结构效度。水平测试强调有共时效度和预测效度。成绩测试和诊断测试受教学大纲的限制,因此首先要看内容效度"

能力观陈述

一句话:本卷把英语能力理解为____,因此重点测____

双向细目表

能力 × 题型 × 题量 × 赋分 × 难度(必附)

选材计划

各篇的题材、体裁、文体范畴、来源、字数(用材料卡简表)

控制指标

难度配比(70/15/15);层次配比(阅读 H∶M∶L;完形 D 层 ≥1/3;语法填空 D 层 ≥3);需促成技能题 ≥40%;答案分布

时间与流程

命题—审题—试做—修改—定稿—付印各环节的责任人与日期

9.2 表二:审题清单(定稿前,逐条打钩)

#

环节

检查内容

1

对表

逐题对照双向细目表,查有无超纲、有无遗漏、有无重复

2

过否决项

五个大题的否决项清单逐条过(第三至七章)

3

填考点表

完形逐空判 W/P/S/D;语法填空填考点覆盖表;阅读逐题圈 H/M/L

4

查互泄

每道题的每个选项,在每一道别的题里是否至少有一个相容项(李筱菊经验法则)

5

查答案分布

A/B/C/D 统计;调整(命题人天然偏 C 多、A 极少)

6

查注释

所有中文注释三查:词性、义项、与语境自洽(见案例 4-1)

7

查指令

听力段落提示与题号对位;各题指令清楚、简洁、无歧义;"无需监考人做什么口头解释"

8

试做

2—3 名未参与命题者独立做一遍,记录用时与疑问题

9

冷处理

锁抽屉数日后复审(刘润清、韩宝成)

10

集体通过

李筱菊规则:不是多数通过,而是"每人、每题、每个选项都认可"

9.3 表三:考后试卷质量分析报告

固定五段(见 2.4):一句话总评 → 能力观判断 → 逐大题评价(现象—依据—改法)→ 数据体检 → 优先改进清单(≤8 条)。数据体检部分至少包含:

项目

本次

目标

说明

全卷平均分/标准差

SD 足够大

SD 小则信度受限

Sk / Ku

±1 内

Sk>0 偏难

难度配比

70/15/15

统计 P<0.3、0.3—0.7、>0.7 的题目数

区分度

Rbis≥0.3

列出 rbis<0.3 的题号并逐题分析

信度

R≥0.85 / α≥0.8

注明所用公式

干扰项体检

n 在 5%—30%

列出"白设干扰项"(n<5%)与"过强干扰项"(n>30% 或 m≥13)

主观题评分信度

双评相关 ≥0.85

抽查一致率;记录"忽高忽低"的评分员

存档

—

每题的 P/Δ/rbis 与选项 n/m/r 填入题目卡,入库

9.4 一张卡:试卷评分卡(100 分制)

板块

满分

计分办法

得分

听力

18

各板块内:核心指标按 0/1/2 计分,求和后归一到板块满分;命中任一否决项则该板块记 0 分

阅读理解

22

完形填空

15

语法填空

15

写作

20

整卷与后效

10

细目表 3、结构赋分 2、难度区分配比 3、反拨效度 2

加分项

+10

真实语料/无稿口语/任务型听力/等值备选题/题库化存档等,每项 +1,封顶 10

合计

110

≥95 为 A;80—94 为 B;65—79 为 C;<65 或 2 个以上大题记 0 为 D;能力观与课标冲突为 E

9.5 争议处理规则

评卷现场最常见的三类争执,事先约定规则可省大量时间:

争议

处理规则

"数据不好但我觉得这道题很好"

以区分度为准:区分度达标即可保留,数据不佳但针对教学薄弱点的题可保留并注明理由(李筱菊保留 happen 一例)。区分度 ≤0.2 或为负者,一律改

"这道题有争议,但说不清哪里错"

启用"冷处理+他人独立作答";若两人以上给出不同答案且都能自圆其说,即判为多答案题,必改

"命题人坚持自己的写法"

李筱菊规则:组内有一人有异议即须充分讨论,"尽量做到全体同意、满意为止";她同时提醒不可盲信本族语专家——她记下过一个外籍专家主张的干扰项反而造成双答案的实例

附录

附录 A 术语对照

中文

英文

记号

含义(一句话)

信度

reliability

R / α

分数对作答、试题对考生是否公正客观

效度

validity

—

是否考了想要考的

内容效度

content validity

—

是否考了大纲要考的、抽样是否有代表性

结构效度

construct validity

—

所依据的语言观是否成立(不是"试卷结构")

表面/反应效度

face / response validity

—

看上去像不像有效考试/考生是否按设计意图作答

反拨效度

backwash / washback validity

—

是否给教学带来良好导向

答对率

facility value

P

答对人数 ÷ 总人数

难易度

delta

Δ

1—25,中值 13,越小越易

区分度

biserial correlation

rbis

题目区分高低水平的能力

干扰项

distractor

—

错误选项;须有"似乎可能性"

似乎可能性

plausibility

—

干扰项看起来成立的程度

诡题

tricky item

—

"好学生比差学生更可能中圈套"的题

偏颇性

bias

—

对某一子群体系统性有利/不利

考点效度

(李筱菊自创)

W/P/S/D

考点所在层次越高,效度越高

促成技能

enabling skills

—

猜义、分析、综合、推理、判断欣赏等

冗余

redundancy

—

口语冗余达 50%—70%,是完形与听力的基础

等值

equating

—

使不同次考试分数可比

附录 B 阈值速查卡(可裁下随身带)

项

合格线

优良线

小题答对率 P

0.3—0.7

≈0.5(MC 卷 0.6)

难度配比

70/15/15

同左

小题区分度 rbis

≥0.3(≤0.2 不可用)

>0.4

rbis<0.3 的题占比

≤5%

≤3%

信度

R≥0.9 / α≥0.8

同左

Sk / Ku

±1 内

±0.5 内

干扰项选中率

5%—30%

10%—25%

干扰项平均分 m

<13

<12

生词率

≤2%(可放宽至 3%)

≤2%

阅读折算速度

≥30 词/分

≥60 词/分

完形 D 层占比

≥1/3

≥1/2

语法填空 D 层空数

≥3

≥4

语法填空提示词比

6∶4 或 7∶3

同左

阅读 H∶M∶L

≈1∶1.4∶0.8

同左

写作输出量

≥8 句 / 60 词

≥10 句 / 80 词

适宜性(不适宜占比)

≈5%

<5%

附录 C 主要参考书目

· 李筱菊《语言测试科学与艺术》,湖南教育出版社。本文引用的核心章节:第二章(理论框架、信度与效度)、第四章(统计分析)、第五章(试题生产与质量控制表)、第六章(试题分类)、第七章(A 类试题与题目分析)、第八章(完形填空与考点效度)、第九章(阅读与听力试题)、第十章(产生性运用试题)。

· 刘润清、韩宝成《语言测试和它的方法(修订版)》,外语教学与研究出版社。本文引用的核心章节:第二章(理论基础)、第四章(多项选择题)、第五章(完形填空)、第七章(语法测试)、第八章(阅读理解)、第九章(听力)、第十一章(写作)、第十三章(评判测试的质量)、第十四章(成绩分析)。

· Bachman, L. F.(1990/1991)交际语言能力(CLA)模式与交际真实性、情景真实性之二分;Bachman & Palmer 的测试有用性框架(reliability / construct validity / authenticity / interactiveness / impact / practicality)——本书据两本中文著作转述。

· 其他被引学者:Richards(1983,听力微技能)、Canale & Swain(1980,交际能力四成分)、Alderson(1984,低层能力作为"门槛";"一切测试都是妥协")、Taylor(1953,完形程序)、Klein-Braley(C-test)、Oller & Conrad、Heaton、Morrow(超考试目的论、实效效度与反拨效度)、Davies、Henning、Carlson et al.(TWE 六等评分)。

最后一句

评价一份试卷,最终不是给它打一个分,而是回答三个问题:它想测什么?它真的测到了吗?它把教学带向哪里?三个问题都能给出有证据的回答,这份评价就站得住;三个问题都答不上来,再漂亮的统计表也只是一张纸。 

相关学习资料