ARTICLE · 1064249
期刊好文推荐|高中英语写作人机协同智能评分的实践探索









摘 要

为回应人工智能时代英语写作评价精准化与育人价值的双重需求,研究以 402 份江苏省高中生英语文本为样本,实证比较自动作文评分系统(AES)、生成式人工智能(AIGC)与教师评分的效度差异。结果显示:机器评分均值显著高于教师评分且分布更为集中;AES 在语言规范性识别上精准度较高,AIGC 在篇章结构与语义诊断方面表现更优,而教师在思想深度、情感匹配及文化意识等维度保持不可替代的优势。基于此,研究构建“AES 初评—AIGC 深诊—教师终评—学生反思”四阶协同机制,通过技术赋能与人工决策的有机融合,为高中英语写作智能化评价提供实证支持与实践范式。
关键词:人机协同;高中英语写作教学;智能评分;评价效度
一
引 言

《普通高中英语课程标准(2017 年版 2020年修订)》将“信息技术与英语教学深度融合”列为课程实施核心诉求,并指明多元评价须“贯穿教学过程,兼顾形成性与终结性,突出思维品质与文化意识成长”[1]。然而,现有高中英语写作评价仍停留在“教师一次性终结”范式,反馈周期长、维度窄化。伴随自动作文评分系统(Automatic Essay Scoring,AES)与生成式人工智能(Artificial Intelligence Generated Content,AIGC)的迭代,机器评分在语言准确率、篇章衔接检测上虽已超越人工批阅,却暴露出“重形式—轻意义”“重规范—轻文化”的结构性偏倚,与新课标“以人为本、素养导向”的评价伦理存在差距。围绕人机协同能否突破“效率—育人”二元困境,构建兼顾技术精度与教育温度的写作评价新范式,本研究试图为高中英语写作评价改革提供实证支持与可操作的实践范式。
二
高中英语写作评分现状

当前高中英语写作评价深陷三重结构性矛盾,制约了写作教学质量的提升与学生核心素养的发展。
(一)教师评价效能困境:高负荷与低质量的恶性循环
教师批改负担过重是导致评价效能低下的根本原因。以每名教师承担两个教学班的教学工作计算,每周需批改约100篇作文,单篇耗时7分钟以上,仅基础批改每周即需投入10小时以上。这种高负荷衍生出两大痛点:其一,反馈质量缩水。大部分教师被迫采用模板化评语,评语内容重复率高、针对性弱,学生难以从中获得具体改进建议。其二,反馈严重滞后。学生写作如果没有得到及时反馈和纠错,很难取得理想的教学效果[2]。
(二)智能评分的价值局限:技术精度与教育温度的失衡
以“批改网”、WE Write 为代表的 AES 与以ChatGPT、DeepSeek 为代表的 AIGC 虽在效率上优势显著,但存在难以克服的结构性局限。首先,评价维度表层化。徐莎莎对 58 名高中生的跟踪研究发现,学生基于自动评阅系统的自我修改基本集中在语法和词汇错误,对语篇层面的修改较少[3],该研究印证了自动评阅系统反馈对深层写作的引导力薄弱。其次,文化意识缺失,对“情节连贯、情感匹配、主题凝练”识别率不足,与高考“合理即给分”原则冲突。白丽芳和王建的研究认为 AES 评分的反馈质量有待提高,只能作为教师或同伴反馈的补充[4]。夏春来的实践也表明,批改网在篇章结构、内容逻辑性和连贯性层面的帮助有限,仍需教师进行人工补充评价[5]。
(三)人机协同机制实证研究空白:从理论倡导到实践落地的鸿沟
尽管 Yao 等学者呼吁构建“教师主导、AI 辅助”的中学写作人机协同评分框架[6],但现有研究多局限于高校智能评分效度验证或针对单一工具、单一方向进行对比[7],针对基础教育的研究占比严重不足,而且人机协同机制构建缺乏系统性。现有研究多关注技术性能验证,对“何时用 AI、何时用教师、如何衔接各评价环节”等操作性问题缺乏精细化设计。徐晓艺和陆祎明确指出,教师在运用 AIGC 时应审慎把握技术局限并适时干预,但如何干预、干预哪些环节仍待探索[8]。文秋芳和梁茂成进一步强调,人机互动协商能力是 AI 能否充分发挥其功能的关键[9]。只有建立科学化的高效人机协商机制,方能实现技术潜能向教学效能的转化。
据此,本研究聚焦三大核心矛盾提出递进式研究问题:第一,如何通过人机分工摆脱效率与育人的二元困境,在保障评分效率的同时落实素养导向评价目标?第二,怎样实现机器精准形式评判与教师深刻内涵评判的优势互补,提升写作评价整体效度?第三,如何构建技术赋能与人文引领统一的技术与人文协同机制,让智能评分兼具科学性与教育温度?围绕上述问题,本研究开展实证比较并设计可操作的协同评分路径,为高中英语写作评价改革提供实践方案。
三
高中英语写作人机协同智能评分的实证研究

本研究于 2025 年 4 月选取江苏省高中生“整本书阅读与写作”活动的 402 份参赛作品为实证样本,采用分层抽样与去标识化处理,建立研究数据库。评分主体涵盖 AES 组(WE Write、“批改网”)、AIGC 组(DeepSeek、ChatGPT)与教师组。AES 采用系统默认评分;AIGC 主要侧重从字数合规、语言规范、内容深度与原创性等维度评分;教师组由两名具有 10 年以上教龄的高中英语骨干教师实施双盲评阅,组内相关系数ICC=0.86,p<0.01,表明评分一致性良好,信度符合教育测量标准。本研究依托 SPSS 27.0 统计软件对三组数据进行量化对比,并结合师生深度访谈数据开展质性分析,重点考查语言能力(语法 / 词汇)、篇章结构(连贯性 / 逻辑性)与内容建构(思想深度 / 创新性)三大维度的评价差异。
结果表明(表 1、表 2),AES 与 AIGC 评分集中且稳定,但 AES 的反馈聚焦表层语言,学生对此的认可度偏低;AIGC 能提供逻辑优化与内容重组建议,促进学生自主改进,认可度中高;教师评分分布差异大,但其反馈最能激发学生的批判性思维与元认知反思,认可度最高。三者差异既体现局限性,也显示互补价值,为构建人机协同智能英语写作评分系统提供了依据。
注:成绩等级划分标准依据黄光扬的学业评价分级标准[10]:高分组 84—10分,中分组 44—83 分,低分组 1—43 分。 
本研究实证结果揭示的三类评分主体的评价差异,其本质是写作评价中效率与质量、形式与意义、技术与人文的核心矛盾。四阶协同评价机制的环节顺序遵循矛盾转化逻辑科学设计。AES 语言精准、评分高效,可快速完成批量初评,帮助教师摆脱高负荷工作困境,故置于首要环节;AIGC 擅长篇章逻辑与语义诊断,承接 AES 的初评结果开展深层次诊断,契合“从表层到深层”的认知规律;教师在文本思想解读、情感体悟挖掘、文化内涵阐释等维度具有技术工具无法替代的人文价值,参与终评可弥补智能评分工具在人文性、思辨性评价上的短板;评价环节最后依托学生的反思实现评价结果的内化。整体评价按“自动到人工、表层到深层、评价到内化”的顺序递进,既保障了效率,又坚守了育人导向,形成逻辑自洽的协同闭环。
四
高中英语写作人机协同智能评分的实践路径

基于上述研究结论,本文提出一条由三方协同驱动的高中英语写作智能评分系统优化实践路径。该路径由四个阶段构成:AES 初评(语言6层面修正)—AIGC 深诊(结构与内容优化)—教师终评(人文价值把关)—学生反思(元认知能力培养)。这一四阶段人机协同机制既契合写作教学中“工具性与人文性并重”的目标要求,又为高中英语写作教学的智能化、系统化改进提供了可操作的实践模式。
(一) AES 初评:语言层面修正
由表 1 可见,AES 在评分稳定性方面优于AIGC 与教师评分,标准差为 14.69,显示出高度一致性。此外,表 2 显示,AES 在表层语言错误的检测上表现更为突出,识别率约为 95%,表明其在写作初评中具有较高的可靠性。“批改网”依托大规模语料库与系统化语言规则,可在 30 秒内完成对单篇作文的自动标注,相较于人工批改节省约 60% 的时间。这一高效性不仅显著提升了初评速度,还减轻了教师在基础语言错误检查上的负担,使其能够将精力集中于作文内容的逻辑性与思想深度评价。具体而言,“批改网”覆盖语法、词汇和语言形式三个层面(表 3):在语法层面,它可提示动词使用错误及主谓一致问题;在词汇层面,它可识别常见搭配错误及易混词;在语言形式层面,它可发现大小写、连接词及标点规范问题,能够帮助学生养成规范书面表达习惯。综上,AES 作为初评工具,不仅能够高效保障语言准确性,还为后续逻辑连贯性及内容深度的分析提供了坚实基础,能为英语写作教学与智能化评价提供可行的技术支持。

(二) AIGC 深诊:结构与内容优化
为进一步验证 AES(如“批改网”)和 AIGC(如 DeepSeek)两个系统对篇章内在逻辑与结构内容的感知能力,本研究实施了两种结构干预实验。其一,删除承担总结与主题升华功能的结尾段,实验结果显示,“批改网”评分未变,表明其对“缺失总结”所致的逻辑缺陷与思想深度弱化未能有效识别,而 DeepSeek 评分由 75 分降至68 分。其二,将首段移至末段,“批改网”评分仍未变,而 DeepSeek 评分下降达 10 分,并立即指出“The structure is disjointed,with abrupt shifts between ideas.(结构错位,观点切换突兀。)”,同时标注逻辑断裂节点、提供修改建议及重写示例。
综上,DeepSeek 在结构性错位问题识别上显著优于“批改网”。进一步分析显示,DeepSeek 亦能在语言表达与思维层面同步优化。例如,针对学生原句“Simple and unstoppable love has controlled his right and wrong,and also made it cross the sky of a past area in a magnificent manner.”,DeepSeek 能够识别学生在句子表达上的模糊性问题,并提供优化建议(图 1),如将“controlled”替换为“guided his sense of right and wrong”,并以现在分词结构重构句式,完善伦理语境,强化因果逻辑与表达连贯性。此外,DeepSeek 能剖析文本人物特质及其关系网络,引导学生进行深层分析。

由此可见,AES 与 AIGC 在写作评价中可形成互补机制:AES 保障语言规范,AIGC 则在逻辑结构、语言表达与思维深度上提供系统支持,实现从语言准确性到思维深化的系统优化。
(三)教师终评:人文价值把关
在高中英语写作教学中,教师终评需超越语言形式层面,深入人文价值维度,引导学生实现语言能力与思想深度的双重提升。本研究以一篇学生《了不起的盖茨比》读后感习作样本为例,提出以下具体操作方案。
1. 构建多维评价量表
教师设计包含内容深度、文化意识与创新思维三个维度的多维评价量表。在评价学生读后感时,内容深度维度考查学生对文本主题的挖掘能力,可肯定学生引用原著语句为自己的表达点睛的写作方式,这类表达更深刻地揭示了盖茨比的精神内核与悲剧命运,如学生习作语句“We continue to forge ahead, sail against the current, and continue to be pushed back until we return to the past.”。文化意识维度评价学生聚焦跨文化比较能力,如对比百年前的北美社会与当代社会。创新思维维度关注个人观点的独特性,如结尾对power and intrigue 的批判性发问。量表采用分级评分描述,分值区间为 1—5 分,同时为每个评分层级提供典型范例。
2. 实施“3+1+1”评语模式
针对每篇习作,教师反馈包含三个具体写作优点、一个改进建议与一个人文价值追问。例如,写作优点为“通过动词短语 forge ahead、sail against、be pushed back、return to 的连续使用营造出动态节奏,模拟了奋斗与对抗的过程”,改进建议为“需增强段落间逻辑过渡”,人文价值追问为“你认为纯真情感在当代社会是否必然脆弱?”。这种模式既肯定学生的成就,又指引提升方向,更通过提问促进学生深度思考。
3. 深度对话与价值引领
教师需依托深度师生对话落实价值引领,敏锐识别文本中的价值观倾向,引导学生辩证思考。例如,针对该读后感习作,可赞赏其对物质主义的批判,认可“no pure land left in the heart”这类真实深刻的感悟,同时通过追问引导学生认知升华,启发学生思考“盖茨比的伟大是否仅在于追逐梦想的勇气,抑或是对当代青年也有启示意义?”。此类对话将写作评价转化为素养培育的契机,培养学生的批判性思维与跨文化鉴别能力。
依托上述评价策略,教师终评不再是简单的优劣判定,而是成为融合语言指导、思维启迪与价值引领的教育实践,精准契合新课标对英语学科育人价值的要求。
(四)学生反思:元认知能力培养
依托 AES、AIGC 与教师的反馈,本研究构建了“修改日志”任务链,要求学生逐条记录对三类反馈的采纳情况并阐释修改理由(表 4 选取部分学生修改日志内容进行节选呈现,直观展示学生实际修改案例与反思总结情况)。本研究增图 1 AIGC(DeepSeek)内容优化示例8设了为期 12 周的准实验前后测,实验班采用四阶人机协同评分机制,对照班采用传统教师单一批改模式,以《中国英语能力等级量表》[11]、 《批判性思维技能问卷》[12]检验该评分机制的育人效果。前后测结果显示,实验班元认知监控与批判性思维得分显著高于对照班,组间差异具有统计学意义(p < 0.05),为“学生内化”的育人效果提供了量化支撑。

学生修改日志的追踪数据显示,该任务链显著提升了学生的元认知水平:82% 的受试者能够借此精准定位写作薄弱环节,如逻辑断层、词汇贫乏等。表 4 的个案分析印证了上述结论。某学生在日志中采纳了“批改网”的基础语言修正、DeepSeek 的情节补充建议,以及教师关于人物心理与主题深度的意见。同时,本研究以“批判性采纳”作为元认知提升的核心标志,区分被动接受与主动论证。典型案例如下:案例 1,学生拒绝 WE Write 的词汇替换建议,批注称其“查了《经济学人》阅读材料,材料里面明确用了collision of cultures,认为 collision 比 conflict 更能体现两种文化碰撞时的张力与不可预测性,故不采纳”,这体现了基于课外阅读的理性取舍。案例 2,学生对 DeepSeek 提出的“应将‘伟大’与‘人生深刻诠释’融合展开”的观点持保留态度,并给出论证依据,展现出自主逻辑决策能力。上述过程呈现出“识别建议—分析合理性—自主决策”的高阶内化路径,证明元认知冲突真实发生。本研究的前后测数据与修改日志形成证据闭环,表明四阶机制可推动学生由被动修改转向主动评判、自主建构,切实落实批判性思维与元认知发展的育人目标。
五
结 语

本研究以402份江苏省高中生“整本书阅读与写作”作品为样本,采用混合研究设计,系统比较AES、AIGC与教师评分的效度、信度与维度差异,并验证“AES初评—AIGC深诊—教师终评—学生反思”四阶协同模型的可行性与增效机制。主要结论如下:第一,智能评分在语言规范层面具有显著效率优势,可节省约60%的基础语言批改时间,可承担基础性语言修正任务,但在情节合理性、情感契合度及文化意识等高阶维度上存在一定的误判率,难以替代教师的专业判断。第二,教师评分虽易受工作负荷与主观性制约,但其在激发学生批判性思维与元认知反思方面具有不可替代的教育价值,其反馈深度整体优于智能评分系统。第三,四阶协同机制通过“技术—人文”的结构化分工,既缓解教师批改压力,又保留写作评价的教育温度,实现评价效率与育人功能的动态平衡。
本研究构建的四阶人机协同机制具备较强的实践适用性,但仍存在适用边界与潜在冲突。在适用条件上,该机制对记叙文、读后感、常规议论文等结构化写作任务适配性良好,对高创造性、文学性写作易出现评价失效,智能系统难以精准把握个性化表达与审美意蕴。在潜在冲突方面,AIGC 深度诊断侧重形式优化与逻辑规整,教师终评则立足思想深度与文化价值导向,二者可能出现评价分歧。对此,应确立教师主导、AI 为辅助的裁决原则,以育人目标与写作意图为核心调和分歧。同时,本机制暂未覆盖说明文、应用文等类型,后续研究可拓展评价维度与工具适配范围,提升机制的普适性与稳健性。
综上所述,本研究进一步回应了《普通高中英语课程标准(2017 年版 2020 年修订)》关于“信息技术与教学深度融合”与“多元评价体系建构”的相关要求,为基础教育阶段英语写作评价改革提供了可复制、可扩展的实践范式。未来研究可扩大样本区域与年级范围,引入眼动仪、反思日志等过程性数据,深入探讨人机协同评价模式对不同写作水平学生的长时影响;同时,还需关注算法伦理、数据隐私及教师数字素养提升,确保技术赋能始终服务于学生英语学科核心素养的全面发展。
参考文献

[1]中华人民共和国教育部 . 普通高中英语课程标准:2017 年版 2020 年修订[M]. 北京:人民教育出版社,2020:72,80-81,52-53.
[2]傅山云 . 英语作文智能批改与教师批改对比研究[J]. 中小学外语教学(中学篇),2019,42(2):57-59.
[3]徐莎莎 . 自动评阅系统在过程性写作中的应用研究[J]. 中小学外语教学(中学篇),2017,40(5):13-16.
[4]白丽芳,王建 . 近 20 年英语作文自动反馈有效性研究综述[J]. 外语研究,2019,36(1):65-71,88.
[5]夏春来 . 基于批改系统的高中英语写作智慧课堂的实践探索[J]. 中小学外语教学(中学篇),2018,41(2):45-48.
[6] Yao Yuan, Zhu Xinhua, Xiao Longhai,et al. Secondary school English teachers’ application of artificial intelligence-guided chatbot in the provision of feedback on student writing: An activity theory perspective[J]. Journal of Second Language Writing,2025(67): 101179.
[7]陈茉,吕明臣 .ChatGPT 环境下的大学英语写作教学[J]. 当代外语研究,2024(1):161-168.
[8]徐晓艺,陆祎 . 生成式人工智能助力初中英语写作教学的实践探究[J]. 中小学英语教学与研究,2024(4):49-53.
[9] 文秋芳,梁茂成 . 人机互动协商能力:ChatGPT 与外语教育[J]. 外语教学与研究,2024,56(2):286-296, 321.
[10] 黄光扬 . 教育统计与测量评价新编教程[M].2 版 . 上海:华东师范大学出版社, 2020:33-36.
[11]中华人民共和国教育部,国家语言文字工作委员会 . 中国英语能力等级量表:国家语言文字规范 GF 0018-2018[S]. 北京:高等教育出版社, 2018.
[12]徐子媛,吴姝颖,马新宇,等 . 高中生英语阅读中批判性思维研究——基于 T 市高中生的问卷调查[J]. 教育观察,2022,11(11):97-99,103.
作者简介

王琤,文学博士。主要研究方向为应用语言学、第二语言习得、英语教育。
居欣怡,主要研究方向为英语教育 / 数字化教育。
宋琼,教育硕士,中学高级教师,主要研究方向为高中英语教育。
本文选自:《教育传播与技术》2026年第4期
引用格式:王琤,居欣怡,宋琼.高中英语写作人机协同智能评分的实践探索[J].教育传播与技术,2026(4):3-9.
○点击以下图片订阅期刊