ARTICLE · 1070356
【实证】AI 生成反馈何以阻碍或助力学习:基于时序网络分析的学习动态异质性研究

How AI-Generated Feedback Hinders or Helps Learning: A Heterogeneous TNA Study of Learning Dynamics

生成式人工智能可以在学生答错后即时反馈,但“反馈是否有效”不能只看它有没有给出提示,还要看反馈如何嵌入学生后续的理解、尝试和再次作答过程。López-Pernas、Misiejuk与Saqr研究了约13,000名一年级学生在多模态数学环境中的学习日志,分析学生答错后收到何种GPT-4.1反馈、随后采取了哪些行动,以及这些互动序列最终是否以正确答案结束。
研究围绕两个问题展开:第一,错误作答之后,学生—生成式AI互动过程具有什么结构,成功与失败序列有何差异;第二,哪些反馈动作或重复出现的互动模式与正确结果相关。研究把831,955条反馈实例进行归纳编码,并以异质转换网络分析(Heterogeneous Transition Network Analysis,HTNA)和序列模式挖掘刻画反馈与学生行动之间的时间关系。
结果表明,反馈类型不能脱离序列单独解释。成功的再次作答更常紧跟澄清性反馈(Clarify),在整体序列中,“Clarify → Question → Retry”是最明显地与成功相关的模式;失败序列则更常直接出现问题式反馈(Question)、命令式反馈(Order)或退出提示(Quit)。当系统没有提供反馈(Void)时,学生下一次恢复成功的可能性也更低。
这并不意味着“提问式反馈一定有害”。当问题建立在前面的概念澄清之上时,它可能促进学生继续思考;当问题直接替代澄清,或者命令式反馈把AI塑造成权威时,低龄学生可能只是服从、跳过或重复错误,而没有真正理解任务。
一、研究背景与问题

◆ 1. 从“反馈结果”转向“反馈过程”
自动反馈是人工智能教育应用中最常见的功能之一。过去的智能辅导系统依赖学习者模型,根据学生的历史作答推断知识状态,再提供提示、纠错和建议。生成式AI的出现带来了更灵活的自然语言反馈:系统可以根据任务内容、学生的作答和交互过程即时生成解释、提示或问题。
但反馈不是一次性事件。有效反馈至少要回应三个问题:学习者要到哪里去、当前做到什么程度、下一步怎样推进。学生真正能否从反馈中获益,取决于他如何理解反馈、是否重新检查任务、是否再次尝试,以及反馈是否与前一轮错误的来源相匹配。
如果只比较“有AI反馈”和“无AI反馈”的最终正确率,就无法解释成功是怎样发生的,也无法判断某种反馈为什么在一个序列中有效、在另一个序列中无效。尤其是在低龄学生的数学学习中,学生可能还没有能力独立诊断自己的概念误解,系统的提问、命令或解释会改变他们接下来把注意力放在哪里。
◆ 2. 多模态数学任务增加了反馈难度
研究场景不是单纯的文字或算式练习。学生需要处理图像、空间关系、序列、数量比较、部分—整体关系、数字匹配和数轴等早期数感任务,同时接收音频形式的任务说明,并通过点击、选择等方式提交答案。
在这种环境中,AI反馈必须同时理解视觉任务、语音指令和学生的操作行为。一个“你应该选择中间的图片”的命令,可能并没有解释“中间”在这个题目中的关系含义;一个“你觉得第十张图表示什么”的问题,也可能把错误诊断责任完全推回给还不能清楚表达自己困惑的一年级学生。
◆ 3. 研究问题
论文提出两个研究问题:
1. RQ1: 学生答错后,学生—生成式AI互动过程具有什么特征?最终成功与最终失败的序列,在AI反馈结构和学生后续行动上有何不同?
2. RQ2: 哪些具体行动或反复出现的互动模式,与学生最终得到正确答案相关?
这两个问题把分析单位从“某种反馈的平均效果”推进到“反馈—行动—结果”的动态过程。
二、理论与概念基础

◆ 1. 反馈是连续的调节过程,而不是一次性纠错
论文借鉴反馈研究中的过程观,把反馈理解为连接学习目标、当前表现和后续行动的调节环节。AI反馈的作用不能仅由语言是否礼貌、解释是否冗长或答案是否正确来判断,而要看它是否帮助学生理解任务关系、识别错误来源并采取合适的下一步行动。
◆ 2. 人工智能反馈具有拟人化和权威化风险
生成式AI经常以接近人类对话的方式说话。学生可能把系统理解为教师、伙伴或具有社会地位的行动者,并因此更容易接受系统的命令和问题。
在低龄学习者中,这种拟人化可能带来两种后果:一是学生把AI输出当作权威而不再质疑;二是命令或评价性表达引发焦虑、服从或退出。问题式反馈本来可以促进思考,但如果学生缺少相关概念基础,问题可能变成额外的诊断负担。
◆ 3. 从网络关系中理解学习动态
时间序列分析关注事件按什么顺序发生,网络分析则关注不同事件之间如何连接。转换网络分析(TNA)把“收到某种反馈”“再次尝试”“答对或答错”等事件视为节点,以有方向的边表示从一个事件转向另一个事件的条件概率。
本文进一步使用异质转换网络分析(HTNA),因为AI反馈和学生行动是性质不同的事件:反馈由系统产生,Retry、Skip、Right和Wrong等行动由学生完成。HTNA在同一网络中保留两类事件的差异,同时分析它们之间的转换、反馈回路和序列依赖。
◆ 4. 反馈类型与互动序列必须区分
论文区分两种分析视角:
- 类型视角: 某条反馈是命令、问题、提示、纠错还是澄清。
- 序列视角: 这些反馈以什么顺序出现,学生在反馈之后是否重新阅读说明、再次尝试或跳过任务。
同一种反馈在不同上下文中可能发挥不同作用。例如,Question直接跟在错误之后,可能要求学生自己诊断概念问题;Clarify → Question则可能先把关系词、空间关系或任务规则解释清楚,再用问题让学生继续思考。因此,单独比较Question的出现频率,可能把两种完全不同的教学过程混在一起。
三、研究设计与方法

◆ 1. 学习环境与任务
约13,000名来自两个国家的一年级学生,在Levebee数字数学学习环境中完成一次性评估。评估覆盖16项基础早期数能力,包括逻辑推理与分类、空间和序列方向、数量比较、部分—整体关系、数字匹配和心理数轴意识。

每项能力通过多个任务变式测量。任务采用多模态呈现:学生需要结合视觉问题表征、音频指令和交互式点击操作来作答。系统记录学生的每一次尝试、时间戳、题目技能和对应的AI反馈。
学生答对时,系统记录Right,并可能给予Praise;学生答错时,系统通过GPT-4.1生成音频反馈,学生可以继续处理任务、Retry再次作答,或选择Skip跳过。
◆ 2. 数据规模与分析单位

研究日志包括:
1. 约13,000名学生的学习过程;
2. 12,898名学习者进入回归模型;
3. 831,955条反馈实例;
4. 7,685条不同的反馈文本,因相同文本可能在不同学生和不同时间重复出现;
5. 252,125条用于回归分析的观察;
6. 16项数学技能对应的多轮作答与反馈事件。

研究把一次尝试定义为从Start、Instruction开始,经过Attempt,再到Right或Wrong;若Wrong之后收到反馈,则继续追踪至下一次Right、再次Wrong或Skip。RQ1主要分析从Wrong开始到下一次结果的互动过程,RQ2进一步比较成功和失败序列中的具体模式。
◆ 3. AI反馈的归纳编码
两名研究者采用开放编码和迭代修订方式,从数据中归纳反馈类别,而不是预先规定分类。最终由一名主要编码者对7,685条独特反馈文本完成编码;部分反馈同时包含多个类别,并保留类别在原句中的出现顺序。
第二名编码者独立编码随机抽取的768条反馈,约占数据集的10%。Cohen’s κ的中位数为0.92,说明编码一致性较高。
◆ 4. 统计与过程分析
RQ1使用HTNA估计整体互动网络,并分别估计最终成功和最终失败的网络。研究通过自助法检验单条边的稳定性,通过置换检验比较网络之间的转换概率,并使用序列分布图呈现不同时间位置的事件构成。
RQ2包括三层分析:
1. 用卡方独立性检验比较不同反馈或学生行动在成功、失败序列中的出现情况;
2. 用序列模式挖掘识别高频子序列及其与正确结果的关联;
3. 构建三类回归模型,分别以互动频率、互动是否出现、以及具体序列模式预测成功结果。
四、研究结果分析

◆ RQ1:错误之后,成功与失败的互动过程有什么不同?
1. 整体过程:学生答错后最常收到命令式反馈
在总体互动网络中,学生先经历Start、Instruction和Attempt。Attempt之后,答对的转换概率为0.76,答错的转换概率为0.24。答错之后,系统最常提供Order(转换概率0.36),其次是Question(0.22)、Hint(0.16)、Correct(0.12)、Clarify(0.08)、Quit(0.04)和Praise(0.01)。

反馈之后,学生最常Retry。Retry之后,下一次仍然Wrong的转换概率为0.52,Right为0.48。也就是说,反馈之后再次尝试并不等于已经理解,整体上成功与失败接近各半。
这组结果首先提醒我们:AI反馈不是“给出反馈—自动纠正”的线性链条。系统给出反馈之后,学生是否重新理解说明、是否抓住关键关系、是否再次尝试,都会影响结果。
2. 成功序列更常出现澄清、提示和再次尝试
将最终Right与最终Wrong的序列分开比较后,成功的再次作答更常包含Hint、Correct、Clarify、Instruction和Attempt;失败的再次作答更常包含Question、Order和Quit。
在成功序列中,初次Wrong之后更可能先出现Clarify,Clarify之后再出现Question。成功序列中Clarify与后续Question的转换概率差异为0.09,说明澄清后提问是一个较有辨识度的过渡。
在失败序列中,初次Wrong之后更可能直接出现Question,差异约为0.08。这意味着问题式反馈的作用与它所处的位置有关:如果问题直接要求学生解释自己哪里错了,它可能增加诊断负担;如果前面已经解释了关键概念,问题则可能成为继续思考的支架。
3. 失败序列更常见命令、退出和重复问题
在失败序列中,学生更常遇到Question和Order,且Quit的出现更突出。系统建议Quit之后,失败序列中的学生更少继续完成有针对性的学习行动,而更容易跳过任务或以较弱的方式结束尝试。

论文没有把这一结果解释成“命令永远无效”或“退出提示永远错误”,而是强调低龄学习者可能把AI视为具有权威的社会行动者。命令式声音可能引发服从,却未必促成理解;问题式声音可能看似更具启发性,却把错误诊断责任转移给了学生。
4. 成功与失败序列在多模态任务中还有一个重要差异
失败序列中的学生在后续位置更常重新查看Instruction,说明他们可能需要回到任务要求,但此前反馈并没有充分解释视觉关系、空间概念或题目规则。成功序列中,反馈更可能围绕Hint、Correct、Clarify与Retry形成连续过程。
这也揭示了多模态AI反馈的特殊困难:系统不仅要生成语言,还要准确理解图像、空间关系、点击行为和音频任务说明。若AI没有识别错误来自哪个表征系统,反馈即使语言流畅,也可能无法降低学生的理解负担。

◆ RQ2:哪些反馈和序列模式与成功结果相关?
1. Clarify和Hint的成功率高于总体基线
所有序列的总体成功率基线为0.46。包含Clarify的序列成功率为0.68,包含Hint的序列为0.50,均高于基线。Retry本身也与成功相关,因为真正恢复正确往往需要学生再次作答。
但Clarify的成功率为0.68并不意味着68%的澄清都有效。作者特别指出,超过40%的相关尝试仍未成功,说明在复杂视觉环境中,AI要准确澄清学生的关系词、空间位置和任务要求仍然困难。

2. 频率模型和出现模型给出相对一致的方向
在以互动频率预测成功的模型中,Clarify与成功呈正向关联;Attempt和Retry也呈强正向关联。Question、Quit和Void(技术原因导致没有获得AI反馈)呈负向关联;Order和Praise也表现为较低的成功可能性。
在只看某类互动是否出现的模型中,Attempt、Clarify和Retry仍与成功正向相关,Question、Quit和Void仍与成功负向相关。Hint在出现模型中表现为小幅正向关联,而Instruction与成功没有显著关系。
模型解释的方差有限:频率模型R²=0.122,出现模型R²=0.118。这说明互动类型能够解释部分成功差异,但不能把成功完全归因于某条反馈。学生先验知识、题目难度、视觉复杂度、注意力和教师/环境因素仍可能发挥作用。
3. 序列模式比单一反馈类型更能揭示条件性作用

序列模型中,与成功正向相关的模式包括:
- Clarify → Question → Retry;
- Correct → Hint → Hint → Retry;
- Correct → Instruction → Retry;
- Hint → Retry;
- Order → Instruction → Retry;
- Quit → Skip → Instruction → Attempt。
其中,Clarify → Question → Retry的估计系数为1.514,是表3中最突出的正向序列模式之一。
与失败相关的模式包括:
- Question → Question → Retry;
- Question → Order → Retry;
- Question → Retry;
- Order → Question → Retry;
- Void → Retry;
- Quit → Retry。
Question → Question → Retry的估计系数为−1.186,Void → Retry为−1.002,说明连续提问或没有反馈后直接再次尝试,并没有形成有利于恢复的学习路径。

4. “提问有害”是对结果的过度简化
如果只看反馈类型,Question在失败序列中出现得更多,回归模型中也呈负向关联,很容易得出“不要用问题式反馈”的结论。但序列分析显示,Clarify → Question → Retry却是最明显的成功模式之一。
更合理的解释是:问题式反馈需要概念澄清作前置支架。澄清先解决“题目中的关系词和规则是什么意思”,随后问题再引导学生自己检查或迁移;若问题直接承担澄清功能,低龄学生可能没有足够的知识和语言能力完成自我诊断。
五、研究结论与分析

◆ 1. 论文的中心结论
研究的核心结论不是“AI反馈有效”或“AI反馈无效”,而是:AI反馈的教育价值取决于反馈被嵌入怎样的互动序列,以及学生能否在序列中获得与错误相匹配的概念支架。
成功的互动更接近“错误—澄清—适度追问—再次尝试”;失败的互动更接近“错误—直接提问/命令—再次尝试或退出”。
◆ 2. 对AI反馈设计的启示
第一,反馈系统应优先澄清学生可能误解的概念、关系词和任务规则,再要求学生采取行动。对多模态数学任务而言,“中间”“旁边”“更大”“相同”等词的关系含义可能比简单纠错更重要。
第二,系统不应把Question当成默认的高级反馈。问题只有在学生已经获得足够信息时才可能促进建构;在概念未稳定时,连续提问会把诊断责任转移给学生。
第三,命令式反馈需要受到限制。Order可能快速告诉学生“下一步做什么”,但如果它没有解释为什么,学生可能服从指令,却没有理解错误来源。尤其对一年级学生,AI的语音和拟人化表达可能放大其权威感。
第四,反馈系统应设计序列级规则,而不是只优化单条回答。可以在系统层面设置“先澄清、再追问、最后鼓励再次尝试”的约束,并根据学生的重复错误动态调整反馈,而不是让语言模型自由生成一串互不连贯的提示。
第五,AI反馈需要和教师、同伴支持互补。研究显示,即使即时反馈能够维持学生继续尝试,也不能证明AI已经具备教师或同伴所提供的情境敏感性、情感理解和稳定解释能力。
◆ 3. 对低龄学习者AI素养的启示
低龄学生可能把AI当作“会说话的老师”,因此需要尽早发展基础AI素养:知道AI可能出错,理解反馈不是答案本身,能够回到题目、检查图像关系,并在不理解时寻求教师或同伴帮助。
AI素养不是额外的技术课程,而应嵌入日常任务:让学生比较AI提示与题目要求,指出反馈中不清楚的地方,解释自己为什么选择某个答案,并逐步学习不盲目服从AI的命令。
López-Pernas, S., Misiejuk, K., & Saqr, M. (2026). How AI-Generated Feedback Hinders or Helps Learning: A Heterogeneous TNA Study of Learning Dynamics. Journal of Computer Assisted Learning, 42(4), e70285. https://doi.org/10.1002/jcal.70285


