乐于分享
好东西不私藏

AI批改作文,到底行不行?

AI批改作文,到底行不行?

今年我参加了 2026 年的人工智能应用案例征集,报的是"创AI"赛道。我做的东西不复杂——基于 Coze平台,搭了一个 AI 批改作文的助手。

结果,省上没评上奖。

说实话,刚看到结果那会儿,有点失落。但冷静下来想想,我没觉得委屈,反而更想聊聊这件事:一个一线语文老师自己鼓捣出来的 AI 批改工具,到底管不管用?

我不是来给 AI 唱赞歌的,也不是来泼冷水的。过去一年,我把这个助手真刀真枪用在了课堂上,攒下了一堆数据;与此同时,7 月 8 日人民网"人民直击"栏目发了一篇调查《AI批改作文,什么评分标准?》,把 AI 批改的种种问题摆上了台面。

一边是我的课堂数据,一边是媒体的尖锐追问。今天就把这两头摊开,老老实实说一句:AI 批改作文,到底行不行。

我的痛点:110 个学生,批改要两周

我在初中教语文,带两个班,学生总数 110 出头。

作文批改,是全套教学工作里最磨人的一环。一篇作文,细读、圈画、写旁批、写总评、打分、录入——一轮走完,通常要 1 到 2 周。等学生拿到反馈,早忘了自己写的是啥,讲评效果大打折扣。

我也试过市面上的智能批改工具。毛病很明显:一次只能改一篇,没法班级批量;批改维度写死,调不了;没有可视化,学生不知道自己"字词""立意""结构""情感"到底哪弱;结果还导不出来,想做学情分析照样费劲。

于是我动了念头:既然生成式 AI 和大模型这么火,能不能自己做一个?

我做了什么:一个"全栈"的作文批改助手

我选了国产的 Coze 平台。它有个"全栈网页应用"能力,前端界面、后端工作流、数据存储一把抓,还能自定义域名部署,适合在学校长期用。

技术上,我拉了三个模型来分工:

豆包 1.6 视觉理解模型,负责把学生拍的手写作文图片识别成文字;
豆包 1.8 深度思考模型,做内容深度分析和多维打分;
DeepSeek V3.2,负责逐句批注、写总评和修改建议。

整个流程跑下来是:批量上传图片 → 识别文字 → 逐句批注(好句蓝色高亮、待改进句加粗)→ 多维打分 → 生成个人雷达图 → 一键导出全班 Excel 成绩单、给每位学生打包一份 Word 批改报告。

最让我得意的是"批量"两个字。它一次能传 100 张图,自动从文件名里认出是哪个学生。老师要做的,就是上传、点"开始批改"、然后下载。

顺便说一句:整个应用,从界面到工作流,我都是靠大模型辅助编程搭出来的。我一个非计算机专业的语文老师都能复现,还写了保姆级教程——这本身也是我想说的:门槛,没那么高。

数据说话:52 篇作文,20 分钟

光说没用,上数据。以九年级一次单元习作《春天的色彩》为例:

我把全班 52 名学生的作文图片一次性传上去,设好要求,点"开始批改"。大约 20 分钟后,52 篇全部批完。

对比一下:传统人工批改这 52 篇,我得花 5 到 7 天。节省时间超过 96%。

不止快。我随机抽取 10 篇,请教研组另一位高级教师复核。结果:AI 总分和人工评分的相关系数达到 0.92,好句/待改进句的标注准确率超过 90%。那位老师原话是"批注有针对性,总评有指导价值"。

学生的反应更直观。课后问卷里,86% 的学生说"喜欢这种带彩色标注的批改报告";79% 认为"雷达图让我清楚知道哪里要补强"。最让我意外的是二次提交率——往年学生改作文二次提交不到 20%,用了这个助手后,涨到了 65%。不少人主动对照批注改作文、再交一遍。

再往后看成绩:那次九年级诊断测试,我带的班作文平均分排到同年级第一,比上学期期末提升 4.2 分,优秀率(≥40 分/50 分)提高了 12 个百分点。

这些数字,比一张奖状让我踏实。

但是,媒体说的那些问题,是不是真的?

说完好话,得说点扎心的。

人民网那篇调查,问的是"AI 批改作文,什么评分标准?"记者测了市面上 6 款产品,发现同一篇作文跨平台打分,分差普遍在 8 到 15 分,有的超过 20 分。更离谱的是,同一篇作文、同一个平台,上午判"一类文",下午再传一遍居然变"良",差了 10 分——原文一个字没改。

记者多次致电批改产品运营企业,咨询评分算法细则、分级评判标准、训练数据源。截至发稿前,仅有一家平台客服回复,尚无一家给予完整答复。
——人民网《人民直击|AI批改作文,什么评分标准?》(2026-07-08)

一线老师的顾虑也很实在:AI 批改快、覆盖全,但缺情感、缺主观洞察。孩子写乡下外婆的菜园,写自己的心里话,AI 可能批一句"语言平淡、缺少修辞、逻辑松散"给个低分;反过来,开篇"时光荏苒岁月如梭"、中间堆排比、结尾升华哲理的"流水线范文",反而轻松拿高分。这股"AI 味儿",把童真表达误杀,把套路空话抬举。

还有政策的红线。教育部《教师生成式人工智能应用指引(第一版)》说得很清楚:教师不得将 AI 对作文、开放性作业的自动批改结果,作为学生最终评价直接使用。

我承认:这些担忧,我的助手一个都逃不掉

看到这些,我没资格嘴硬。

我那个助手,底层也是大模型,同样会"误判"童真;同样给不出真正走心的鼓励;同样是个算法黑箱,学生看见分数却不知道凭什么。它一次批 52 篇很爽,但单篇的深度共情,它做不到。

还有更现实的问题:Coze 每天送的免费额度有限,批 50 篇以上就得充值会员,或者分两三天慢慢来。这在真实课堂里,是个真麻烦。

所以回到开头那个问题——

AI 批改作文,到底行不行?

我的答案是分两半的:

作为"助教",它行。批改错别字、标点、语病,做结构诊断,批量处理、可视化分析、生成共性报告——这些标准化、重复性的活,它比人快、比人稳。宜昌市一位语文教研员算过一笔账:一个班 50 篇,全手批要近 4 小时;AI 先把语法错别字搞定,老师再人工评改,单篇不到 3 分钟。省下来的时间,够老师做面批、做课程设计。

作为"判官",它不行。作文不只是字词句,它是孩子和自己对话、和世界对话的方式。学生更在意的,往往是老师写在作文本边上那几行字——那是情感沟通,是育人的温度。北大语文教育研究所所长汪锋说得直接:AI 的角色始终是工具,它无法共情文字的温度、读懂孩童的创意。

一句话:让机器做标准化的批改,让人做启发性的教育。效率提升的本质,不是用 AI 取代老师,而是把老师从重复劳动里解放出来,回到"育人"这件事本身。

没拿奖,但我收获了更值钱的

回到那个省上的奖。没评上,我复盘过原因——可能是创新性、规模、推广性上还有差距,也可能评委更看重别的东西。这都正常。

但我心里有底。那个"二次提交率从不到 20% 涨到 65%"的数字,比奖状金贵。它说明一件事:当反馈来得够快、够具体、够好看(没错,彩色标注和雷达图真的有用),孩子是愿意改作文的。而"愿意改",才是作文教学真正的起点。

写在最后:给同行,也给平台

如果你也是一线老师,被作文批改压得喘不过气——别怕,门槛没你想的高。像我这样非专业出身,靠 AI 辅助也能搭出趁手的工具。先从一个小工作流开始,让 AI 帮你做最重复的那些事。

如果你在做 AI 教育产品——请"立规矩"。公开评分逻辑,划定能力边界,做"白名单"准入,把可进入的场景(错字查改、结构诊断、共性分析)和不可越的界(直接当最终评价)写清楚。推行"AI 初步诊断—教师复核—档案留存"的人机协同流程。还有数据安全,那是硬杠杠。

AI 批改作文,行不行?
它已经能当好老师的"助教",但永远不该成为孩子的"判官"。把判断留给人,把效率交给机器——这事儿,真行。


📖 🌟 💡

感谢阅读,希望这篇文章对你有帮助!

如果觉得有用,欢迎 点赞 · 收藏 · 转发

👇 点击关注,获取更多精彩内容