夜雨聆风学习资料网

ARTICLE · 1117759

高中英语试卷评价标准(蒸馏核心期刊论文)

高中英语试卷评价标准(蒸馏核心期刊论文)

高中英语试卷质量评价标准的建构

——以阅读理解、完形填空、语法填空与书面表达为核心

【摘要】试卷评价是高中英语教研员的核心专业活动之一,但实践中的"试卷分析"常被简化为平均分、得分率与典型错题的罗列,缺少可复用的质量判据。本文以《普通高中英语课程标准(2017年版2025年修订)》的学业质量标准与命题建议为上位依据,整合《中国高考评价体系》的"一核四层四翼"结构、Bachman & Palmer 测试有效性六维模型、真实性评价的五个"真实"与主体适应原则、SOLO 分类理论以及经典测量学的难度—区分度指标,建构了一套"六维三层"的试卷质量评价标准:六个一级维度管住全卷的价值、效度、真实性、认知层次、测量学性能与结果解释,三个颗粒度(全卷层/题型层/单题层)逐层下探。在此框架下,本文分别给出阅读理解、完形填空、语法填空、书面表达四类核心题型的专项评分表(含观测点、判定标准、分值权重与缺陷清单),并设计了"红线核查—静态评分—技术校验—测量学统计—报告与反拨"五步实施流程,以及双人独立评分、差异超阈值即协商或仲裁的一致性控制办法。标准把经验判断转化为可计分、可留痕、可追溯的专业判断,供区域统考、学校联考、教辅选用三类场景使用。

【关键词】试卷质量评价;评价标准;学科核心素养;学业质量水平;真实性;SOLO 分类;阅读理解;完形填空;语法填空;书面表达

一、问题的提出

教研员拿到一套试卷,通常要在很短的时间内回答三个问题:这套卷子能不能用?哪里不能用?怎么改才能用?这三个问题听上去朴素,却牵涉这道题考了什么、有没有考到该考的、能不能考得出来、分数能不能说明能力等一连串的专业判断。

现实中的回答方式大致有三种。第一种是数据替代判断:只看平均分、合格率、得分率,凭"难度适中""区分度还行"下结论,把试卷质量的评价降格为考生分数的描述。第二种是题感替代标准:凭资深教师的经验说"这篇阅读选得好""这个完形有点偏",结论往往正确,但依据不可传递、不可复核,同一套卷换一个人评就可能得出相反的结论。第三种是校对替代评价:把注意力放在答案有没有错、有没有重题、有没有错别字上,做完校对就以为完成了评价。

三种做法各有价值,但都不是完整的试卷质量评价。张小萌(2011)在讨论如何利用终结性评价进行质量分析时明确指出,质量分析不等同于试卷分析:试卷分析只是"从英语期末考查卷的角度来分析问题,是比较片面的",而质量分析必须站在使全体学生都得到发展、使教师全面完成教学工作要求的立场上进行,涵盖试卷总体分析、情感态度分析、纵向分析、横向分析、原因分析、改进措施与个体分析七个步骤。[来源:张小萌《怎样利用终结性评价进行质量分析》,《中小学英语教学与研究》2011年第5期]这一区分对教研员尤为重要:我们可以看分数,但不能只评分数;我们评的是"试卷作为测量工具的适切性"。

1998年度普通高考英语试卷评价报告代表了另一种成熟的取向。该报告以抽样统计为基础,系统报告了全卷及各大题的平均分、标准差、难度、区分度,并把主观判断(如"实现了理想的难度控制""坚持把测试的基本点定位在语篇上")牢牢建立在数据之上:NMET1998 各小题中区分度很好的项目占 37%,较好的占 41%,一般的占 20%,较弱的仅占 2%;全卷难度约 0.54,接近理想难度。[来源:1998年高考英语试卷评价组《1998年度普通高考英语试卷评价报告(上)》,《中小学外语教学》1999年第4期/人大复印资料《中学外语教与学》1999年第4期]这说明大规模考试的官方评价早已是"数据 + 学理"的双轮驱动。

本文的任务,是把这条成熟的路径下沉到区域与学校层面,形成一套可操作、可计分、可追溯的标准,尤其是针对占分最大、争议最多的四类核心题型——阅读理解、完形填空、语法填空、书面表达。

二、评价标准的学理基础

任何评价标准都不是凭空拟定的。本文的上位依据来自四条互相支撑的线索:国家课程标准与高考评价体系规定"应该考什么",测试有效性模型规定"怎样判断好不好",真实性评价与 SOLO 分类规定"情境与思维怎么评",经典测量学规定"分数怎么读"。

(一)课程标准:确立目标的边界

《普通高中英语课程标准(2017年版2025年修订)》在"实施建议·学业水平考试与高考建议"中给出了迄今最完整的一套命题规范,可概括为"四原则—四结构—三情境—四类题型—评分细则"。[来源:(4)普通高中英语课程标准日常修订版(2017年版2025年修订),第57—62页]

1. 四条基本原则。强化育人导向、依据课程标准、坚持改革创新、遵循科学规范。其中"引导教学减少死记硬背和机械刷题等现象"一句,直接给出了评判试题优劣的反向指标:一套迫使师生靠刷题提分的卷子,是要被判为低质的。

(1)强化育人导向:以英语为文化交流与传播工具,讲好中国故事,坚定文化自信。

(2)依据课程标准:命题考查要求与学业质量标准保持一致性。

(3)坚持改革创新:增强试题的基础性、应用性、综合性、创新性、开放性。

(4)遵循科学规范:确保试题的公平性、科学性、规范性。

2. 边界性的硬杠。课标明确写道:"英语学科学业质量水平一是高中毕业应当达到的要求,也是高中英语学业水平考试合格等级的划定依据。英语高考命题不超过学业质量水平二的要求。学业质量水平三可以用于指导在英语学习方面有更高需求的学校设计和实施英语课程。"这为教研员提供了一条形而下的判据:凡是超出学业质量水平二的考查要求,即为超标,无论它看起来多有"区分度"。

3. 试卷的四种结构。目标结构(理解性技能与表达性技能的比重)、材料结构(三大主题语境全覆盖,兼顾书面与口头、连续性与非连续性、虚构类与非虚构类语篇)、内容结构(必修 / 选择性必修)、难度结构(涵盖各个难度层次,据此确定整体难度)。

4. 情境的三项属性。情境为日常生活、学习活动、跨文化沟通三类,设置时须具备教育性(正确价值导向)、真实性(紧密联系学生英语学习和生活实际,体现真实语言使用)、适用性(符合学生的生活经验和认知水平)。

5. 评分标准的制定。课标对主观题提出了非常具体的处理口径:语法填空题的作答如果属于参考答案之外的其他可接受的答案,也应该给分;简答题允许一定程度的灵活性,可设定完全正确、可接受和不正确等评分标准;书面表达题的评分标准应兼顾评价内容的达意度、词汇语法的准确性与得体性,以及语篇的流畅性。这三句话几乎可以直接改写成本文评分表的观测点。

石俊敏(2021)进一步把《中国高考评价体系》的"一核四层四翼"引入了试题分析:一核回答"为什么考"(立德树人、服务选才、引导教学),四层回答"考什么"(核心价值、学科素养、关键能力、必备知识),四翼回答"怎么考"(基础性、综合性、应用性、创新性)。该文并提供了可迁移的"what—how—why"三维解读法:what 对应语篇的主题意义和主要内容(主旨要义、具体信息、推理判断),how 对应语篇的结构、文体特征、语言特点和修辞手段(文章结构、推断词义),why 对应作者的意图、情感态度或价值取向(作者意图观点态度)。同时提到 2020 年高考英语全国 I 卷阅读理解第一节 15 道小题中有 10 道考查推断、归纳和概括等高阶阅读能力,占比较往年提高。[来源:石俊敏《从课标和高考评价体系的视角分析2020年高考英语全国Ⅰ卷试题》,《中小学外语教学(中学篇)》2021年第1期,第61—64页]这为评判阅读理解的"认知层次分布"提供了可直接对照的锚点。

(二)测试有效性模型:确立质量的维度

宋德龙(2012)运用 Bachman & Palmer(1996)的测试有效性模型,对 2011 年江苏高考英语卷书面表达题作了六维度分析:信度(Reliability)、结构效度(Construct Validity)、真实性(Authenticity)、交互性(Interactiveness)、可行性(Practicality)、试后影响(Impact)。[来源:宋德龙《2011年江苏高考英语卷书面表达题的评价及其启示》,《中小学外语教学(中学篇)》2012年第5期]这六个维度有三个特点值得注意:

第一,它把信度从"分数的稳定"扩展为"过程的可控"。该文指出高考信度的评定主要从命题过程的可靠性和评卷的一致性入手:提示信息清晰、评分档次界定清晰、双独立评分且误差超过 3 分时自动触发三评(三评仍相距超差则交组长四评),这些制度设计本身就是信度的一部分。

第二,它把效度从"考到了没有"推进为"建构效度"。该文借用 Purves 等(1984)的考题任务量纲(对象 Audience、作者角色 Role of writer、文章风格 Tone/style、文章长度 Length、时间限制 Time allowed、提示信息 Prompt wording、誊写方式 Transcription mode),逐项比对试卷任务变量与课程标准的对应内容,从而判断"七个变量是否都指向课标要求的能力"。这是一种极佳的可迁移方法。

第三,它把"试后影响"纳入质量本身。该文引用舒运祥(2001)指出:反拨作用通常有正面和负面两个方面,正面的反拨能够鼓励教师在实际教学中采用先进、合理的教学方法,负面的反拨则起到相反的作用。这与中国高考评价体系"引导教学"的核心功能是一致的。

要点:评价一套试卷,不能只问"题出得对不对",还要问"提示清不清楚、评分尺子准不准、考生能不能投入、资源配不配得上、考完之后课堂会不会变好"。

(三)真实性评价:确立情境与任务的判据

王笃勤(2008)以 2007 年全国 19 个省市高考英语试题为样本,系统分析了高考英语试题的真实性,提出真实性评价对测试的五项要求与一项原则。[来源:王笃勤《基于真实性评价的高考英语试题研究》,《中国考试》2008年第8期,第23—28页;转载于人大复印资料《中学外语教与学》2009年第1期]

1. 文本真实。真实文本是现实中真实的说话人或作者为真实的听众和读者说的和写的、用于传达某种真实信息的文本。该文列举了广告、通知、照片、图表、时刻表、菜单等来源。

2. 任务真实。引用 Bachman(1996):任务真实性指目标语言使用任务特征与测试任务特征的一致性程度。该文指出当时选择题的真实性相对较低,做答题比重太小,"研究发现主观性题的信度要高于客观选择填空"(引雷新勇,2006)。

3. 情景真实。情景真实指考生完成测试任务的情景与现实生活中完成类似交际任务的场景的相似程度。该文对若干省份 2007 年写作题点名批评:有的要求以"谁是你的偶像"为题写短文,"为什么要用英语写作,为谁而写作,试题没有交代";有的要求给同窗好友写英文毕业留言,而"为同窗好友留言没有必要使用英语"。

4. 评分标准真实。评价标准指评价中的价值客体的属性满足价值主体需求的程度。该文批评客观选择题普遍采用统一赋值,"高考却普遍使用统一的赋值标准,要么都是一分,要么都是二分,客观选择题的评分标准不符合真实性评价的要求",建议按认知要求差异化赋值。

5. 结果解释真实。测试要提供的不是分数,而是分数的说明;应采用质性的描述或等级描述。

6. 主体适应原则。所谓主体适应,指测试应关注考生的认知特点与多元差异。该文由此指出:写作题若以读图或读后写的形式呈现,考查的就不只是写作能力本身,"不符合测量目标的单维要求",会因阅读理解能力差异造成部分考生主体不适应。

可迁移的判据:检查一道写作题,先问三个问题——他是谁(作者身份)?写给谁(读者对象)?为什么必须用英语写(交际必要性)?三个问题答不上来,任务真实性即为不合格。这一条同时被宋德龙(2012)印证:该文批评 2011 年江苏卷书面表达"没有清楚地点明考生所写文章的读者对象",导致考生要么缺乏读者意识,要么把读者限定在阅卷教师身上,从而"只关注语言的准确性,不关注内容的真实性"。

(四)SOLO 分类理论:确立思维层次的标尺

郑晓影、俞红珍(2019)以 Biggs & Collis 的 SOLO 分类理论(Structure of the Observed Learning Outcome)为基础构建概要写作评价量表。[来源:郑晓影、俞红珍《基于SOLO分类理论的概要写作评价》,《中小学外语教学(中学篇)》2019年第7期]该理论把学习结果分为五层:

前结构层次:缺乏厘清问题线索的能力,回答不是同义反复就是逻辑跳跃。

→ 对应概要写作"水平一":无法归纳要点,逻辑混乱,表达生硬。

单点结构层次:只能联系和概括单一事件来解决问题,只依据某一点就迅速得出结论。

→ 对应"水平二":只能提炼其中一个要点。

多点结构层次:联系多个有限而孤立的事件来解决问题,因而过快地得到问题结论,解答不完整。

→ 对应"水平三":抓住局部信息,归纳部分要点,要点之间缺少逻辑关联。

关联结构层次:综合运用问题线索、相关素材以及相互关系解决问题,能在具体情境中利用相关知识进行概括。

→ 对应"水平四 / 水平五":纵观全局,要点齐全,逻辑清晰。

抽象扩展结构层次:能进行演绎和归纳,并将解决路径迁移到新的问题情境中。

→ 该文认为概要写作不要求表达个人观点与迁移,故不予考虑。

该量表还有两点方法论上的示范意义:其一,维度与权重明确——从语言、要点、组织三维度评价,参照上海中考作文"语言 8 分、内容 8 分、结构 4 分"的设定,分别赋予 40%、40%、20% 的权重;其二,留出一个"反馈"栏,用于补充标准中没有体现却需要学生注意的细节(该文案例中,教师用反馈栏提醒学生注意"事实类信息与观点类信息混淆")。这一设计思路完全可以移植到本文的写作评分表甚至整个试卷的评价报告模板中。

(五)经典测量学:确立分数的读法

1998 年高考英语评价报告提供了一组仍然适用的经验值:

① 全卷难度控制在 0.50—0.55 之间(NMET1998 理科为 0.54),被视为"理想的难度控制"。

② 各大题难度区间:NMET1998 为单项填空 0.55、完形填空 0.63、阅读理解 0.52、单词拼写 0.56、短文改错 0.45、书面表达 0.53。

③ 区分度:NMET1998 依次为 0.613、0.642、0.681、0.627、0.690、0.663;另从全卷题目层面看,区分度很好的项目占 37%、较好者占 41%、一般者 20%、较弱者仅 2%。

④ 全卷词量:1994 年 2291 词、1995 年 2700 词、1996 年 2650 词、1997 年 3055 词、1998 年 2976 词,其中不重复单词量 706 词(1998)。

要点:难度回答"多少人对",区分度回答"有没有把人分出层次"。一套难度合适但区分度低的卷子(所有人都七十分),同样是不合格的工具。

三、试卷质量评价标准的总体框架

综合上述四条线索,本文提出"六维三层"的总体框架。六维是全卷层面的一级评价指标;三层指评价可以在三个颗粒度上展开:全卷层(本文第三部分表 1)、题型层(本文第四部分表 3—表 6)与单题层(针对争议题目作个别论证)。

表 1 高中英语试卷质量评价标准总体框架(全卷层,满分 100 分)

一级维度

权重

核心评价问题

主要判定依据

一票否决项

D1 价值导向

10

试题是否落实立德树人?有无价值偏差、文化误读、身份敏感或公平性瑕疵?

课标"强化育人导向"原则;一核之立德树人;"敎育性"情境属性

存在政治性、价值观或歧视性错误

D2 内容效度

20

考的是不是课标规定了要考的?考查要求是否不超过学业质量水平二?

课标学业质量水平表;主题语境三级框架;Purves 任务量纲比对

出现学业质量水平三以上的考查要求

D3 真实性与交互性

20

文本、任务、情景是否真实?作者身份、读者对象、交际目的是否明确?考生能否投入?

真实性评价五个"真实"+主体适应原则;Bachman 交互性

写作题无明确读者对象与交际必要性

D4 认知层次结构

15

高阶思维题占比是否足够?what / how / why 三层是否齐备?

what—how—why 三维论;SOLO 五层次;高考评价体系"四翼"

全卷高阶低于 40%,或全是信息查寻题

D5 测量学性能

25

难度是否落在 0.50—0.55?区分度是否达 0.40 以上?

难度 P、区分度 D、标准差、信度系数;NMET1998 经验区间

全卷难度 <0.35 或 >0.75;区分度 <0.20 的题占比超 25%

D6 评分标准与结果解释

10

评分标准是否随题下发且界定清晰?可接受答案是否有口子?结果能否被解释为学业水平?

课标"评分标准的制定";SOLO 水平锚;双评仲裁机制

主观题无成文评分标准或无可接受答案条款

注:D1—D6 的权重依次递减,D5 因可直接由统计数据算出、证据最硬,故给到最高权重;D4 虽权重不高,但为近年命题导向的核心,实际评议时应与 D5 并重。

(一)三级标尺与结论换算

每个维度按 A(优秀,85—100)/ B(合格,60—84)/ C(不合格,0—59) 三级评分,再按表 1 权重加权得到全卷总分。评分时遵循"证据优先、从低从严"原则:凡无证据支撑的优点不予采信,凡存在争议的项目按低档计。

表 2 总分换算与处置建议

总分区间

等级

结论

处置建议

85 分及以上

一等

测量工具性能优良,命题取向正确

可直接使用;建议作为区域样卷留档并撰写评介

75—84 分

二等

整体可用,局部有待修补

按清单修改后使用;核对、修订须留痕

60—74 分

三等

存在结构性缺陷,勉强可用

须重大修改并重新送外部评审后方可使用

60 分以下

四等

不合格的测量工具

不得使用;成绩不得计入任何评价性统计

(二)前置红线核查清单

在进入正式评分前,须先过一遍不可协商的红线。任何一条不满足,直接判为"四等",不再进入后续评分:

R1 存在意识形态、国家形象、法律法规、民族宗教方面的表述问题。

R2 出现超纲的核心考查要求(高于学业质量水平二)。

R3 出现科学性、事实性错误(含英语语言本身的错误:语法、搭配、用词、标点)。

R4 答案不唯一或有第二个可接受的答案而未明示可接受;或存在"答案指向原文以外才能获得"的情况。

R5 题之间存在答案线索互泄(做对上一题即可推出下一题,或反之亦然,或做错一题必错两题)。

R6 存在性别、地域、城乡、身体、家庭背景等维度的偏见或刻板印象。

R7 阅读或完形的关键设题处原文存在歧义,或改编时被改动(语法填空"只删不改"原则被破坏)。

R8 主观题无成文评分标准。

四、四类核心题型的专项标准

上述六维框架解决"这套卷子总体行不行"。但在评议现场,教研员真正要动手改的是具体的题目。因此还需要四张题型层评分表。四张表的原始分值合计亦为 100 分(阅读 30、完形 25、语法填空 25、写作 20),便于与全卷层互相印证:全卷层看取向与数据,题型层看编制技术。

(一)阅读理解

1. 语篇层

阅读理解的一半质量在选材。评判语篇,第一看主题语境的覆盖面——全卷阅读部分是否覆盖人与自我、人与社会、人与自然三大语境,且不少于三个二级主题群(课标"材料结构"要求)。第二看语篇类型的多样性:记叙文、说明文、议论文、应用文至少三类,且含一篇非连续性或图文语篇。第三看文本真实性:这是最容易被忽略的一项。为了使"生词率达标"而把原文改写成一串简单并列句,等于把真实的阅读行为改成了假阅读;王笃勤(2008)提醒我们警惕两类偏差:一类是话题过于专业而与学生的生活经验脱节;另一类是为了压低生词率把原文的语体和句式过度简化——二者同样偏离真实文本的要求。第四看完整性:删节不得破坏论点链或情节链,首尾段必须保留。

2. 考点层

石俊敏(2021)的 what—how—why 三维论提供了便捷的归类工具:what 类题对应主旨要义、具体信息、推理判断;how 类题对应文章结构与推断词义;why 类题对应作者的意图、观点和态度。一套阅读卷若 15 道题全部落在 what 层面,即使每道题都"出得没问题",它的认知层次也是残缺的。可资对照的锚点是:2020 年高考英语全国 I 卷阅读理解第一节 15 题中,有 10 题考查推断、归纳、概括等高阶能力,占比约 67%。据此,本文将"高阶题占比不低于 60%"作为 A 级的必要条件。

3. 题目层

题目层最见编制功夫,也最容易出错。有效干扰项的设计原则是:它必须足够接近正确项,以至于不细读原文的考生会选它。一个"一看就错"的凑数选项,等于给那道题打了折扣——它实际只有三个选项,或者更少。此外还需系统性核查四个选项的形式平行(同一词性、同一语法形式、长度相差不超过三词)与答案分布(A/B/C/D 各项占比在 20%—30% 之间,不得连续三题同字母),这两项虽属技术细节,却是近年区域统考卷最常见的硬伤。

表 3 阅读理解质量评价表(30 分)

观测层

观测点

判定标准(达到即给分)

分值

得分

语篇层

主题语境

全卷阅读覆盖人与自我、人与社会、人与自然,且不少于 3 个二级主题群

2

语篇类型

记叙文/说明文/议论文/应用文至少 3 类;含 1 篇非连续性或图文语篇

2

词数与生词率

单篇 280—350 词;生词率 ≤ 3%,超纲词均可由上下文推断

2

文本真实性

语体、修辞、衔接手段得以保留;删节未破坏论点链或情节链,首尾段完整

2

考点层

微技能覆盖

主旨要义、具体信息、推断词义、推理判断、篇章结构、作者态度意图六项中至少覆盖 5 项

3

高阶占比

推断、归纳、概括、鉴赏类题目 ≥ 60%(参照 2020 年全国 I 卷 10/15)

3

what—how—why

每篇至少一题指向 how 或 why 层面,不是通篇"找信息"

2

题量与文序

每篇 3—4 题;题目顺序与文本顺序基本一致

1

跨段整合

每篇至少一题需要跨段提取或整合全文信息

1

题目层

题干自足

题干独立可读,不依赖其它题的答案;不含未被考查的生词

1

题干长度

平均 ≤ 25 词;无冗长表述与双重否定

1

正确项有据

正确项在原文有可定位的证据句;不能凭常识直接作答

2

干扰项有效

每个干扰项都有明确的干扰方式(偷换概念/张冠李戴/以偏概全/无中生有/过度推断);无"一看就错"的凑数项

2

形式平行

同一题四选项同一词性、同一语法形式,长度相差 ≤ 3 词

2

答案分布

A/B/C/D 各项占比 20%—30%;无连续三题同选项

2

禁用形式

无"以上都对/都不对";否定式题干 ≤ 1 且 NOT/EXCEPT 已加粗

1

题間独立性

各题之间无线索互泄;错一题不会必然连带错另一题

1

合计

30

阅读理解常见缺陷清单:① 四篇体裁同一(全说明文);② 高阶题低于四成;③ 干扰项明显离谱,实际只有两个选项;④ 选项长短悬殊,出现"三短一长";⑤ 答案 C 占比过半;⑥ 题干只是照抄原文句子,没有设置推断要求;⑦ 为压生词率把原文改写为浅白并列句;⑧ 一题" According to the passage" 却在全篇找不着定位句。

(二)完形填空

1. 语篇层

完形的构念是"在语篇中综合运用词汇、语法与语篇知识",因此它首先必须是一篇完整的、去掉十个词仍然可以被理解的文章。首句不设空是行业通例——它承担交代背景的功能,抽掉它等于让考生在前二十秒无所适从。删词密度同样有讲究:相邻空格平均间隔不少于 12 词,同一句不设两个空格,否则复原难度会陡增,考到的就不再是词汇与语境的推理,而是近乎猜谜。

必须执行的一道校验:答案回填重建校验。把标准答案按空号顺序回填到挖空文本,与改编前的原文逐字符比对,必须完全相等。这道校验能抓出两类隐蔽错误:一是答案本身写错(如某一空的答案并非原文用词),二是答案与原文已有成分错位(如原文是 "from the ___",而答案写成 "the Renaissance",回填后变成 "from the the Renaissance")。这是我在语法填空与完形的命题实践中被反复证明最有效的一步,实践反复证明,这是最有效的一步,建议列为完形与语法填空共同的强制环节。

2. 选项层与考点层

选项层的四条硬规则:同性同形(四个选项同一词性、同一语法形式,都是现在分词或都是过去式)、互不包容(不得出现语义上一个包含另一个的情况,否则产生第二答案)、干扰有效(干扰项必须与上下文词网有关,放进空格"读得通")、分布均衡(A/B/C/D 各占 20%—30%,不得连续三题同字母)。

考点层的关键是语境层次。若十个空全部能在同一个句子里找到答案("句内线索"),考到的其实是词汇辨析而非语篇能力。本文要求:依赖句间、段间或全文线索的空格不低于一半,其中跨段依赖的空不少于两个。此外,实词考查不低于 80%,固定搭配题不超过两题。

表 4 完形填空质量评价表(25 分)

观测层

观测点

判定标准(达到即给分)

分值

得分

语篇层

完整性

首句不设空并交代背景;情节或论证有推进与收束,结尾无突兀中断

2

词数

15 空约 250—320 词,20 空约 300—400 词

1

删词密度

相邻空格平均间隔 ≥ 12 词;同一句不涉及两个及以上空格

2

可复原性

答案回填后与原文逐字符比对完全一致(重建校验通过)

2

删除对象

不删数字、专有名词、时间,以及在前文无线索可寻的词

1

选项层

同性同形

每题四个选项同一词性、同一语法形式(时态与单复数一致)

2

互不包容

选项之间无包含关系、无同义重复,不出现两个都可接受的答案

2

干扰有效

干扰项与上下文词网相关、放进空格"读得通",不是荒谬词

2

答案分布

A/B/C/D 各占 20%—30%,无连续三题同字母;无 all/none of the above

2

唯一性

放回原文有且仅有一个选项成立

1

考点层

实词主导

名词/动词/形容词/副词考查 ≥ 80%

2

词类均衡

名词、动词各不少于 2 题,避免某一词类独占

1

搭配适度

固定搭配与习语题 ≤ 2 题

1

语境层次

依赖句间、段间或全文线索的空格 ≥ 50%,其中跨段依赖 ≥ 2 题

3

构念纯度

不以完形形式考拼写、标点或纯粹的语法术语

1

合计

25

完形填空常见缺陷清单:① 首句设空;② 同一句两空;③ 十个空全是句内线索;④ 某一选项是另两个选项的上位词;⑤ 干扰项是明显的低频生僻词,等于给提示;⑥ 答案 A 连续五题;⑦ 靠跨段才能推出的句子在删节时被截掉;⑧ 删节删掉了空格所需的跨段语境,使某个空无从推断。

(三)语法填空

1. 改编原则:只删不改

语法填空的立题之本在于语篇真实。课标在"填空题"要求中写明:"在所给图表或语篇中留出空白,由学生填写词语……填空题要提供相对完整的语境。"由此派生出一条铁律:只删不改。一旦为了凑某个考点而改动原文措辞,语篇的真实性就被破坏,答案也可能随之失真。与之配套的是答案逐字取自原文:答案必须是原文中真实出现的形式,不得改写、不得词形变换。

2. 空位设计与考点分布

十个空的比例需遵循提示词 : 无提示词 = 7:3 或 6:4。提示词题(给出词根要求变换形式)与非提示词题(纯语境填虚词/冠词/代词等)承担着不同的构念,比例失衡会使整道题退化为词汇操练或退化为纯虚词填空。

考点多样性是最难守、也最见功底的一条。实践中反复出现的偏差是虚词空过多与考点重复:一篇里出现三个介词空,或两道题都考-ing 形式,不但浪费了十个宝贵的空位,也使整道题的考查面变窄。本文据此设置硬性控制:介词空 ≤ 1 个,形容词/副词比较等级 ≤ 1 个,冠词必须设空;同时优先保留高价值考点——被动语态 be + done、关系代词与关系副词、分词作前置定语、非谓语动词作状语、名词性从句引导词等。

难度底线的两条反向判据:其一,拒绝送分考点。以纯并列连词(and/but/or)、一眼可见的 to do、"rather than" 之后的原形等作为考查点,不足以区分考生的语法运用水平,应予替换。其二,拒绝过易空格。与语境无实质关联的虚位 it、不用读上下文就能填出的最高级形式,都属于应被替换的过易空。每一个空格都应当要求考生依据语境作出判断,而不是依据局部句法反射。

表 5 语法填空质量评价表(25 分)

观测层

观测点

判定标准(达到即给分)

分值

得分

语篇层

改编原则

只删不改,答案逐字取自原文;回填后与原文字字相符

2

词数

180—240 词(长篇拆篇时同理)

1

生词率

≤ 6%,超纲词均可由语境推测或已加注释

1

语境完整

首句交代话题,通篇可推断,非通篇简单句

2

句式多样性

至少含 1 处从句、1 处非谓语或特殊结构

2

空位层

空数与比例

共 10 空;提示词 : 无提示词 = 7:3 或 6:4

2

布空密度

同一句不超过 1 个空;相邻空格间隔 ≥ 8 词

2

答案长度

每空答案 ≤ 3 词,绝大多数为 1 词

1

唯一性

每空答案唯一;确有多个可接受答案时,在评分标准中逐条列明(课标要求)

2

考点层

冠词必考

至少 1 空考查冠词(a/an/the)

1

动词考点质量

涉及时态语态、主谓一致、非谓语至少 2 类;被动语态 be + done 优先保留

2

从句与关系词

关系代词/关系副词/名词性从句引导词至少 1 空

2

词性转换

至少 1 空考查词性转换(含名词/形容词/副词的派生)

1

虚词控制

介词空 ≤ 1 个;纯并列连词或以单纯不定式形式出现的固定搭配不作为考查点

2

形容词控制

形容词/副词比较等级 ≤ 1 个空

1

难度底线

无"与语境无关的功能词 it""一眼可见的最高级"等送分空;全部空格须依赖语境判断

1

合计

25

语法填空常见缺陷清单:① 为凑考点改写原文;② 提示词比例失衡(5:5 或 8:2);③ 三个介词空;④ 冠词缺席;⑤ 同一句两个空;⑥ 答案需两词以上且无明示;⑦ 用 and/to do 凑数;⑧ 空位答案与原文已有成分错位(靠回填校验发现)。

(四)书面表达

1. 任务设计的三要素

写作题的评价核心是任务而非题目。宋德龙(2012)使用 Purves 等(1984)的考题任务量纲,把对象(Audience)、作者角色(Role of writer)、文章风格(Tone, style)、文章长度(Length)、时间限制(Time allowed)、提示信息(Prompt wording)、誊写方式(Transcription mode)七个变量逐一比对课程标准,从而判断这道题是否考查了预想的能力。这套方法值得每位教研员复制:拿到一道作文题,先填一张七变量表,再比对课标。

其中最重要的是前两项,王笃勤(2008)与宋德龙(2012)从两个方向得出了同一结论。前者批评若干省份写作题"试题没有交代为什么要用英语写作、为谁而写作";后者指出缺乏明确读者对象时,考生"要么缺乏读者意识,要么将读者限定在阅卷教师上",从而"仅仅关注语言的准确性,不关注内容的真实性"。两篇文章还各自触及了提示信息量的问题:宋德龙引 Brossell(1983)的研究指出,当测试的提示信息量处于中等水平时,考题质量最好,好于过多或过少提示信息;该文据此认为约 150 个汉字加一幅图、考生可在 3—5 分钟内完成审题,属于恰当的中等提示量。

2. 评分标准:从五档到水平锚

评分标准不是给阅卷者看的说明书,它是写作构念的操作化定义。宋德龙引 McNamara(1996)指出:写作测试的评分标准往往直接或间接地反映了命题者的命题理论依据,"一个不能准确鉴定出考生能力差异的评分标准会严重影响整个测试的质量"。2011 年江苏卷书面表达的评分标准给出了可参照的样板:25 分制、五个档次(21—25/16—20/11—15/6—10/1—5)、每档从任务完成度、要点覆盖、语法结构与词汇、连贯与得体、写作目的达成度五个方面描述,并配套七条操作细则(词数少于 130 或多于 170 减 2 分;英美拼写均可接受;内容要点可用不同方式表达;对紧扣主题的适当发挥不予扣分;书写较差以致影响交际降低一个档次等)。

郑晓影、俞红珍(2019)提供了另一条可叠加的思路:把 SOLO 的五个层次锚定到评分档次上——关联结构及以上为一等(纵观全局、要点齐全、逻辑清晰、表达顺畅),多点结构为合格(抓住局部信息、要点不够完整、缺少逻辑关联),单点与前结构为不合格。该量表还示范了两件事:三维度权重(语言 40%、要点 40%、组织 20%)与独立的反馈栏(用于补充标准未覆盖却需要提示的细节,例如"事实性信息与观点类信息的区分")。

3. 评分实施:信度的制度保障

再好的评分标准,没有执行机制也只是纸面文件。宋德龙(2012)记录的江苏卷流程构成了完整的闭环:评分人员由具有多年高三教学经验的一线教师与大学英语教师共同组成;正式评分前经历标准解读 → 试批 → 协商调尺三步;阅卷采用双独立评分,两份评分误差超过 3 分时系统自动分派第三位阅卷者;若三位分数均相距超差,提交阅卷组长四评。该文同时指出流程中的风险点——部分阅卷人员为提高速度而给出 13—17 分的"保险分",这会同时损害信度与效度。这提示评议者:评价一套卷子,还要评价它的阅卷方案是否可行。

表 6 书面表达质量评价表(20 分)

观测层

观测点

判定标准(达到即给分)

分值

得分

任务层

三要素明确

作者身份、读者对象、交际目的在题面中明确给出

2

用英语的必要性

情景明示了"为什么必须用英语写"(真实交际需要,而非考场要求)

2

提示信息中等

提示信息量中等,考生 3—5 分钟可完成审题(Brossell, 1983)

1

文体与词数

文体明确,词数要求明确,已给开头是否计入已交代清楚

1

单维与开放

构成单维测量(若采用读图/读写结合形式,须在设计说明中交代如何剥离其它构念);开放度足以拉开差距

2

评分标准层

档次清晰

五档给分区间与要求界定清晰,档次差异为行为化描述而非形容词堆砌

2

维度与权重

内容、语言、语篇结构三维度齐全,建议权重 40/40/20

2

水平锚定

各档描述锚定到 SOLO 层次(关联结构及以上为一等;多点结构为合格;单点/前结构为不合格)

1

容错条款

英美拼写与词汇用法均可接受;内容要点可用不同方式表达;紧扣主题的适当发挥不予扣分

1

评分方式

整体评分法定档 + 分析评分法微调;词数不足、书写影响交际有明确处理口径

1

反馈栏

标准预留"反馈"栏,用于记录标准未覆盖但需提示的细节

1

实施层

人员与培训

评分标准解读 → 试批 → 协商;评分员含一线骨干与高校/专业教师

1

双评与仲裁

双独立评分;分差超阈值(25 分制下 3 分)触发三评;三评仍超差交组长仲裁

2

过程抽检

阅卷组长不间断抽检;并向教学侧提供班级薄弱项统计

1

合计

20

书面表达常见缺陷清单:① 无读者对象;② 无写作的英语必要性(同窗留言、中文语境下的演讲);③ 提示信息过多,等于让考生翻译要点;④ 词数、文体、开头是否计入交代不清;⑤ 档次描述全是"较好/一般/较差",无行为化描述;⑥ 无容错条款,英美拼写、不同表达方式被误扣;⑦ 无双评仲裁机制;⑧ 开放度过高,导致评分无抓手。

五、标准的实施流程与评价报告的写法

标准要落地,还需要一套流程。建议采用五步法,并在每一步留下可追溯的记录。

第一步 前置红线核查。对照 R1—R8 逐条打勾。任何一条不满足,判定终止,直接出具"不得使用"的结论并说明理由。此步应在 30 分钟内完成。

第二步 静态评分。两名评议人各自独立使用表 1 与表 3—6 打分。两人同一维度得分差超过 10 分的,必须协商或提请第三人仲裁,不得简单取平均。

第三步 题型层专项核查。除打分外,执行三项必做的技术校验:答案回填重建校验(完形、语法填空)、答案分布统计(阅读、完形)、干扰项有效率初判(预期应有 ≥70% 的干扰项在中等及以上水平考生中有 5% 以上的选中率)。

第四步 考后测量学统计。施考后补充难度、区分度、标准差与信度。参照 NMET1998 的经验区间:全卷难度宜落在 0.50—0.55;各大题难度宜在 0.45—0.65 之间;区分度 0.40 以上的题目不少于 70%;区分度低于 0.20 的题目不超过 10%(该年度报告中,"很好"与"较好"合计占 78%,"较弱"仅占 2%)。

第五步 出具评价报告并跟踪反拨。报告采用结论—证据—归因—建议四段式:结论先给出等级与处置意见;证据必须指向具体题号与具体数据;归因要区分"命题技术缺陷"与"教学薄弱点"两类,不能把考得差一律归因于学生;建议要落在可执行的动作上(替换第几篇的第几道题、补一条怎样的评分细则)。

一条重要的边界提醒:试卷评价完成,质量分析才刚起步。正如张小萌(2011)所强调的,很多教师把质量分析等同于试卷分析,罗列优良率、合格率、得分率便认为完成了工作;真正的质量分析还需要学生情感态度分析、纵向分析(与以往同期比较)、横向分析(同一卷不同项目之间比较)、原因分析、改进措施、以及对学习困难学生的个体分析共七个环节,并遵循"实在、实际、实干"三条原则。试卷评价是这七个环节的专业前置,而不是它的替代品。

六、标准的应用示例(假设情境)

为使上述标准的使用方法可见,下面构造一个假设的评议情境。须说明:以下数据与卷名均为演示用虚构数据,仅用于演示计分与报告撰写的方法,不指向任何真实考试。

假设某高三年级模拟考试英语卷,两位评议人独立评分后协商,全卷层得分如下:

表 7 假设案卷的全卷层评分结果

维度

满分

得分

主要扣分依据

处置

D1 价值导向

10

9

选材积极,但有一处对中国乡村生活的描述略显刻板

微调表述

D2 内容效度

20

16

两处考点明显高于学业质量水平二

替换 2 题

D3 真实性与交互性

20

13

写作题无明确读者对象;两篇阅读改写痕迹过重

重写任务 / 换篇

D4 认知层次结构

15

9

高阶题占 47%,低于 60% 的 A 级线

改造 3 题

D5 测量学性能

25

18

全卷难度 0.62,偏易;完形第 47 题区分度 0.11

调整 4 题

D6 评分标准与结果解释

10

6

语法填空未列可接受答案;写作无档差行为化描述

补足标准

合计

100

71

判为三等:须重大修改后重新送审

重新送审

题型层的核查会给出更具体的手术刀。假设备忘录记录如下:阅读理解得 21/30,扣分项集中在"高阶占比""干扰项有效"两项——第 24、27、31 题的干扰项平均被选中率不足 3%,形同虚设;完形填空得 18/25,回填重建校验未通过:第 45 空答案为 the Renaissance,而挖空句原文已有 "from the ___" 中的冠词位置错位,回填后出现 "from the the Renaissance";语法填空得 16/25,存在两个介词空、一处冠词缺席,且第 63 空以纯并列连词作为考查点,属典型送分考点;书面表达得 13/20,任务要求"以你的亲身经历写一篇短文",未交代读者对象与投稿场景。

表 8 假设案卷的评价报告(摘选,四段式)

段落

示范文本

结论

本卷判为三等(71 分),存在结构性缺陷,须完成本次清单所列 11 处修改并重新送审后方可使用。成绩的赋分。

证据

① 高阶思维题占 47%,低于 60% 的合格线;② 完形第 45 空回填后出现 "from the the Renaissance",答案与原文成分错位;③ 语法填空出现 2 个介词空且冠词未设,第 63 空以并列连词作为考点;④ 写作题未交代读者对象;⑤ 预测区分度低于 0.20 的题目有 4 道,占比 8%。

归因

①②③ 属命题技术缺陷,非学生学力问题;④ 属真实性意识不足;⑤ 需在教学侧进一步核实:若果真为教学薄弱点,应写入下一阶段的补救清单。

建议

替换阅读第 24、27、31 题的干扰项;更正完形第 45 空答案为 Renaissance 并重新做回填校验;语法填空将其中一个介词空改为关系代词空,并在评分标准中补列可接受答案;写作题面补一句"你将向校英文报 New Horizons 投稿"。以上修改完成后 5 个工作日内复评。

七、结语

本文试图回答一个看似简单的问题:一套高中英语试卷,凭什么说它好或者不好。回答的路径是把四个层面的学理资源拧成一股:以课程标准的目标与学业质量标准划定边界,以测试有效性模型确立六个质量维度,以真实性评价与 SOLO 分类处理情境、任务与思维层次的判据,以经典测量学的难度与区分度提供分数的读法。由此形成的"六维三层"框架,再下探到阅读理解、完形填空、语法填空、书面表达四类核心题型的评分表,最终把"我觉得这套卷子不太好"转化为"第几道题在哪个观测点上扣了几分、为什么扣、怎么改"。

标准本身也需要被检验。建议使用者在三个方向上继续打磨:一是本土化——不同区域的学情不同,高阶题占比、难度区间等临界值应依本地常模校准;二是权重校准——六个一级维度的权重本文依据专家经验设定,有条件时应结合区域实测数据做回归检验;三是工具化——把五张表做成可自动计分、自动生成四个段落报告的小工具,让标准真正走到教研员的手边,而不是停留在文件柜里。

归根结底,试卷评价不是为了给命题人打分,而是为了让每一道进入课堂的题,都经得起"考什么、为什么考、考得准不准"这三问。

参考文献

[1] 教育部. 普通高中英语课程标准(2017 年版 2025 年修订)[M]. 北京:人民教育出版社,2025:42-62.

[2] 教育部考试中心. 中国高考评价体系[M]. 北京:人民教育出版社,2019.

[3] 1998 年高考英语试卷评价组. 1998 年度普通高考英语试卷评价报告(上)[J]. 中小学外语教学,1999(4).(转载于人大复印资料《中学外语教与学》1999 年第 4 期;《中学外语教与学》1999 年第 4 期同文收录)

[4] 宋德龙. 2011 年江苏高考英语卷书面表达题的评价及其启示[J]. 中小学外语教学(中学篇),2012(5).

[5] 王笃勤. 基于真实性评价的高考英语试题研究[J]. 中国考试,2008(8):23-28.(转载于人大复印资料《中学外语教与学》2009 年第 1 期)

[6] 郑晓影,俞红珍. 基于 SOLO 分类理论的概要写作评价[J]. 中小学外语教学(中学篇),2019(7).

[7] 石俊敏. 从课标和高考评价体系的视角分析 2020 年高考英语全国Ⅰ卷试题[J]. 中小学外语教学(中学篇),2021(1):61-64.

[8] 张小萌. 怎样利用终结性评价进行质量分析[J]. 中小学英语教学与研究,2011(5):19-21.

[9] Bachman L F,Palmer A S. Language Testing in Practice[M]. Oxford:Oxford University Press,1996.

[10] Biggs J B,Collis K F. 学习质量评价:SOLO 分类理论(可观察的学习成果结构)[M]. 高凌飚,张洪岩,译. 北京:人民教育出版社,2010.

附 录:文献来源清单(本地文件)

本文引用的全部文献均来自以下本地文件,文中以[来源:…]标注处即对应相应篇目:

[1] …/Message/MessageTemp/1dce7397ae152417a676eb05e98af50d/File/(4)普通高中英语课程标准日常修订版(2017年版2025年修订)(2).pdf

[7] …/01中小学外语教学(2009-2022)/中小学外语教学 20-22年/2021/中学篇2021-01/从课标和高考评价体系的视角...20年高考英语全国Ⅰ卷试题_石俊敏.pdf

[4] …/01中小学外语教学(2009-2022)/中小学外语教学(中学版)2009年-2014年/中小学外语教学(中学版)2012年/05/03 2011年江苏高考英语卷书面表达题的评价及其启示.pdf

[5] …/03中学外语教与学(1999-2018)/中学外语教与学2009/200901/基于真实性评价的高考英语试题研究.doc

[6] …/01中小学外语教学(2009-2022)/中小学外语教学(中学版)2019年/中小学外语教学(中学版)2019年07刊/10 基于SOLO分类理论的概要写作评价.PDF

[8] …/02中小学英语教学与研究(2009-2022)/中小学英语教学与研究2011年/05/05 怎样利用终结性评价进行质量分析.pdf

[3] …/03中学外语教与学(1999-2018)/中学外语教与学1999/199904/1998年度普通高考英语试卷评价报告(上).doc;另见复印本 …/04人大复印论文/高考英语/1998年度普通高考英语试卷评价报告(上).doc(两份文件内容相同)

说明:[]内的篇目编号与"参考文献"相对应;上述路径均位于孙三五的知识库(核心期刊论文目录)或用户指定的微信接收文件夹内。

相关学习资料