乐于分享
好东西不私藏

多所大学因准确性担忧放弃AI检测工具 学术诚信评估面临困境

多所大学因准确性担忧放弃AI检测工具 学术诚信评估面临困境

越来越多高校正在关闭 Turnitin 的 AI 写作检测功能,或明确要求教师不要把 GPTZero、Copyleaks 等工具当作定案证据。

范德堡大学、耶鲁大学、约翰斯·霍普金斯大学、加拿大滑铁卢大学、南非开普敦大学和澳大利亚科廷大学,都已限制或停用相关功能。

高校仍在追查学术不端,但“一个概率分数能否证明作弊”的证据标准正在收紧。

AI检测页面显示文本可能完全由人类撰写

多所大学关掉的是 AI 判断,不是查重

这些学校采取行动的时间不同,范围也不完全一样。共同点是:保留传统的文本相似度检查和学术诚信程序,但不再让 AI 检测分数直接推动处分。

学校
时间
具体变化
范德堡大学
2023 年 8 月
关闭 Turnitin AI 检测,校方称工具缺少透明度,可靠性仍有疑问
耶鲁大学
目前
Turnitin 仍可生成文本相似度报告,但 AI 检测功能处于关闭状态
约翰斯·霍普金斯大学
已实施
因误报报告和错误指控风险,关闭 Turnitin AI 检测
开普敦大学
2025 年 10 月起
停止使用 Turnitin AI Score 等工具识别机器生成作业
滑铁卢大学
2025 年 9 月起
停止提供 Turnitin 的 AI 检测功能
科廷大学
2026 年 1 月起
所有校区关闭 AI 写作检测,但继续使用 Turnitin 的文本匹配功能

这不是一次同步发生的“集体弃用”。更准确的说法是,过去三年中,多所大学先后得出相似结论:AI 检测可以提示异常,却不足以独立证明学术不端。

Turnitin 自己也在使用指南中承认,模型可能误判人类文本、AI 文本和经 AI 改写的文本,不应成为对学生采取不利行动的唯一依据。

范德堡大学关于停用Turnitin AI检测功能的页面配图

一场诉讼暴露了高分数背后的程序风险

争议在 2026 年初进入司法程序。

纽约阿德菲大学一名学生的历史论文被 Turnitin 标为“100% AI 生成”。学生提交了另外两款检测工具给出的“人类写作”结果,校方仍维持学术不端认定。

纽约州法院随后撤销该认定,要求校方清除相关记录。判决重点是大学没有遵循自己的纪律程序:学生没有获得充分回应证据的机会,同一名管理人员参与了初次决定和申诉处理。

这起案件没有从技术上证明 Turnitin 的判断一定错误,却说明概率分数一旦进入处分流程,证据审查和申诉程序不能被省略。

检测工具之间给出 100% 与 0% 的相反结论,也暴露了另一个问题:不同产品采用不同模型、阈值和训练数据,“AI 率”并不是可以跨工具比较的统一测量值。

误报会集中落到部分学生身上

2023 年,斯坦福大学研究团队用 7 款检测器测试 91 篇非英语母语者撰写的 TOEFL 作文。平均有 61.22% 被误判为 AI 生成;91 篇中有 18 篇被 7 款工具一致误判,89 篇至少被一款工具标记。

这项研究没有测试 Turnitin,不能把结果直接套到某一款商业产品上。但它揭示了检测方法的结构性风险:许多系统依靠“可预测性”等语言统计特征判断文本来源,词汇和句式相对简单的写作更容易被误伤。

英国高校的规则又不统一。对 163 所英国学位授予机构的调查发现,41% 没有公开可访问的 AI 政策;有些规则藏在登录页面后,有些链接已经失效。

与此同时,英国高等教育政策研究所 2026 年调查了 1054 名全日制本科生:

  • • 95% 至少以一种方式使用 AI;
  • • 94% 用生成式 AI 辅助评估作业;
  • • 12% 曾把 AI 生成文本直接放入评估作业;
  • • 42% 因担心被误判作弊而减少使用 AI。

高校既要处理真实存在的违规使用,也要避免把合规使用和独立写作卷入误报。

值得注意的是,部分二次报道把爱丁堡纳皮尔大学一项 6600 多人调查概括为“32% 承认未经许可使用 AI”。原始报道显示,32% 指的是完全没有在学习中使用 AI 的受访者;在经常使用 AI 的学生中,5.2% 表示即使明确不允许,也会在“大多数时候或总是”使用。两组数据不能混为一谈。

评估开始从识别文风转向验证过程

关闭检测器并不会让学术诚信评估变得更轻松。高校需要收集能说明学生如何完成作业的证据,同时把允许和禁止的 AI 用法写进每一项任务。

评估方式
能验证什么
主要代价
分阶段提交选题、提纲和草稿
观点和文本如何逐步形成
教师需要持续反馈
保留版本记录和引用过程
修改路径、资料来源与 AI 使用范围
涉及平台、隐私和保存规则
口头答辩或随机追问
学生能否解释论点、方法和取舍
大班教学的人力成本高
课堂限时写作或实操
学生在受控环境中的基础能力
覆盖复杂任务的能力有限
AI 使用声明与输出附件
工具、提示词和人工修改边界
必须先明确什么使用是允许的

贝尔法斯特女王大学负责教育与学生事务的 Judy Williams 提出的核心问题是:学校究竟想评估什么?

如果目标是判断学生是否理解知识、能否形成论证并为自己的选择负责,那么草稿、答辩、版本记录和现场任务通常比一个不透明的百分比提供更多信息。

检测工具的退场不会终结作弊,也不会自动解决教师工作量。它只让高校更难回避一个长期问题:学术诚信需要可解释的规则、可核验的学习过程,以及能让学生真正申诉的程序。

来源

  • • Financial Times:《Universities drop AI detection tools over fears about accuracy》
  • • 新浪财经、环球市场播报:《多所大学因准确性担忧放弃AI检测工具 学术诚信评估面临困境》
  • • Resultsense:《UK universities drop AI detection tools over accuracy fears》
  • • 范德堡大学、耶鲁大学、约翰斯·霍普金斯大学、滑铁卢大学、开普敦大学与科廷大学相关校方说明
  • • Turnitin:《Using the AI Writing Report》
  • • Stanford Electrical Engineering:《James Zou, et al, warn on the objectivity of AI detectors》
  • • Higher Education Policy Institute:《Student Generative AI Survey 2026》《What UK university AI policies actually do》
  • • Times Higher Education:《Majority of students deny using AI when forbidden, study finds》

推荐阅读