ARTICLE · 1079607
一道8分的解答题,AI是怎么给分的|数学过程分判分逻辑拆解
同一道 8 分的解答题,
两位老师一位给了 5 分,一位给了 6 分。
不是谁不认真——
"过程分"这件事,人判起来天然有波动。
而 AI 判一道解答题,每一步都留痕。

数学解答题的评分标准,从来不是"答案对就满分"。一道 8 分的题,标准答案会把分值拆到步骤上:列式得几分、变形得几分、计算得几分、结论得几分。这就是过程分——它衡量的是推理过程,不只是结果。
问题在于执行。一位老师批一份解答题平均一两分钟,要在一两分钟内完成"读题—对照标准—定位步骤—判断给分"四个动作。批到第 60 份和批到第 3 份,宽严尺度很难完全一致;两位老师之间,差异更大。这不是态度问题,是人的判断天然有波动。
AI 批阅一道解答题,不是"看一眼答案给个分",而是四个动作走完一条流水线:
① 认——手写识别。把纸上的字迹变成机器能处理的文字和符号,数学公式、分式、根号,都在识别范围内。
② 切——步骤切分。把整段作答按推理链切段:哪几行是列式,哪几行是变形,哪一行是结论。
③ 比——逐步比对。对照评分标准,逐个得分点匹配:这一步和标准写法等价吗?结果对吗?
④ 归——错因标注。错了不只是一个叉,而是标注错在哪一步、属于哪类错:概念、计算、还是审题。
四个动作里,最有价值的是第④个:它把"错"变成了一条可定位、可归类的信息。下面用两道演示例题拆开看。
题目:解方程 2x² − 5x − 3 = 0。
学生作答(关键步骤):用因式分解,写成 (2x − 1)(x + 3) = 0,解得 x₁ = 1/2,x₂ = −3。
对照标准:正确分解应为 (2x + 1)(x − 3) = 0,解为 x₁ = −1/2,x₂ = 3。
AI 的判分:6 分。选择因式分解方法、写出两个因式、两个根的形式——方法分和过程分给足;扣掉的 2 分全部落在因式分解的符号上,导致两根的值出错。
注意这个归因的含金量:它告诉老师,这个学生不是不会解方程,是符号处理不稳。如果全班有 15 个人都扣在这同一处,讲评课只需要讲透"十字相乘的符号规则"这十分钟,而不是把整道题重讲一遍。
题目:证明两个三角形全等,并得出对应边相等。
学生作答:结论正确,全等判定写的是"边角边",但证明过程中没有写出两组对应边相等的依据,直接引用了结论。
AI 的判分:6 分。判定定理选择正确、推理方向完整,得 6 分;扣掉的 2 分是"推理缺依据"——数学证明的分值一半在"怎么说理"上,跳过的每一步依据都是得分点。
这类错误最容易被快速批改放过:结论对了,顺手给高分。但"跳步"恰恰是几何丢分的第一大原因,只有步骤级的判分能把它稳定地抓出来。

干货文要写诚实。三类情况,AI 不强行下结论:
极端字迹。识别置信度低的作答,自动标记,交由老师复核——误判比慢判代价大得多。
非常规解法。学生用了标准答案之外的正确路径(比如用几何法解代数题),系统不认识的写法会被送进复核队列,而不是直接判错。判断权始终在老师手里。
开放性表述。需要情境理解或价值判断的作答,AI 给参考意见,老师定最终分数。
一句话概括这套机制的设计逻辑:机器做确定的事,把不确定的交给专业的人。这既是技术边界,也是产品伦理。
判分快只是表层收益。步骤级判分真正改变的是教学信息的颗粒度:
过去老师知道的是"这道题全班错了 20 个人";现在知道的是"错在移项变号这一步的有 12 个人,错在漏检验的有 5 个人,根本没动笔的有 3 个人"。
前者只能决定"这道题要不要讲";后者能决定"讲什么、不讲什么、给谁讲"。这就是过程分从阅卷标准变成教学依据的过程——也是精准教学里"以测助学"最具体的一个落点。
回到开头那个 5 分和 6 分的分歧。
分歧本身不是问题——问题是分歧之后,谁也说不清那 1 分到底差在哪一步。而当每一个得分点、每一个失分点都有据可查时,分数就不再是老师手感的产物,而是一份师生都能看懂的、可追溯的作答档案。
— HARMOSS INTELLIGENT TECHNOLOGY —
哈墨思智能科技 · AI 智慧批阅