乐于分享
好东西不私藏

4 名复旦学生出题,顶尖 AI 整套试卷考出 0 分!这场期末考颠覆所有人认知

4 名复旦学生出题,顶尖 AI 整套试卷考出 0 分!这场期末考颠覆所有人认知

导语

别人期末埋头刷题答题,复旦这群学生却化身考官出题 “考 AI”;51 套原创试卷里,仅有 4 人成功让一款顶尖 AI10 道题全错、直接拿整卷 0 分。授课教授直言:传统考试在 AI 时代已经彻底失效,未来真正不可替代的能力,藏在 “看穿 AI 短板” 里。

图1:肖仰华教授课堂实拍

一、颠覆传统!复旦开考:学生出题,AI 当考生

这场出圈的考核来自复旦大学计算与智能创新学院肖仰华教授的《数据挖掘技术》课程,彻底推翻 “学生做题、老师阅卷” 千年模式,规则简单却极具颠覆性:

  1. 1.全员出题:全班 51 名学生,每人独立原创 10 道数据挖掘专业计算题;
  2. 2.硬性标准:每道题必须拥有唯一标准答案、完整推导步骤,出题学生需自行验算无误;
  3. 3.三大 AI 考生:统一使用 DeepSeek、MiniMax、Claude 三款主流大模型作答;
  4. 4.特殊打分逻辑:AI 答错题目越多、难倒的 AI 模型越强,出题学生期末分数越高,满分 100 分,认真完成题目即有 60 分保底。

图2:完整考核流程与评分规则图解

  • 阶梯加分细则(文章内可加粗标注)

    • DeepSeek V4-Flash:答错 1 题 +1.5 分
    • MiniMax M2.7:答错 1 题 +2 分
    • Claude Sonnet(全场最强模型):答错 1 题 +3 分

    总分 = 60 基础分 + AI 答错加分,上限 100 分,核心考核目标:检验学生是否吃透知识、精准捕捉 AI 逻辑盲区。

二、最终成绩出炉:仅 4 人实现 AI 全卷零分

全班 51 份试卷数据一览:

  1. 1.50 名学生至少难倒一款 AI、让其答错至少 1 题,仅 1 名学生完全没能找出任何 AI 漏洞;
  2. 2.全场高光:仅 4 名学生,设计出整套 10 道原创题目,让单款 AI 全部答错,拿下整卷 0 分;
  3. 3.实力壁垒显现:三款模型中性能最强的 Claude Sonnet,无任何学生能实现全卷零分;
  4. 4.班级整体水平优秀:平均分 85.7 分,成绩中位数 88 分。

很多人好奇:同样是上课学数据挖掘,为什么只有 4 人能把 AI “考翻车”?答案藏在大模型天生的底层缺陷里。

图3:大模型逻辑推理缺陷科普示意图

三、AI 拿 0 分的真相:它只会 “模仿文字”,不会真正思考

大语言模型本质是概率文字生成器,没有自主验算、逻辑纠错能力,4 名高分学生正是精准抓住三大短板设计考题:

  1. 1.多层连续计算连锁出错
    AI 处理多步嵌套、迭代推导时极易数值跑偏,出现错误后不会回头自查,反而编造看似专业的推导强行圆错;
  2. 2.只背网络题库,原创题型直接 “失忆”
    课本、网上现成习题 AI 能轻松满分,但学生打乱参数、交叉融合多知识点、设计全网无同款的定制化题目,AI 立刻大面积幻觉式答错;
  3. 3.无法区分题干陷阱,只会模板套用
    仅仅更换变量、调整约束条件,模型就无法迁移解题逻辑,看似流畅的回答全是逻辑漏洞。

简单说:AI 擅长标准化、有海量例题的固定题型,一旦脱离训练数据,立刻暴露逻辑硬伤。

四、教授核心观点:AI 正在拉开学生能力差距

肖仰华教授一句话点透教改底层逻辑:

“老师出标准算法计算题,AI 比任何学生算得更快、准确率更高,用这套题目考核学生,等于拿学生短板对标 AI 长处,完全没有意义。”

他提出两个关键判断:

1.只会刷题背题型的人,极易被 AI 替代

仅改动课本例题数字、照搬现有题库出题的学生,AI 能轻松满分,期末得分偏低;
  1. 2.能驾驭、甄别、纠错 AI 的人,拥有不可替代竞争力
    高分学生需要吃透底层原理,自主搭建复杂交叉题型,精准预判 AI 会在哪一步出错 —— 这种 “看透 AI 局限” 的思辨创造能力,是 AI 永远无法复刻的。

五、这场特殊考试,给所有人的时代启示

  1. 1.标准化应试时代落幕
    刷题、套公式、机械计算不再是人才核心标准,考试评价体系正在全面转向高阶思维;
  2. 2.未来学习目标彻底改变
    学习不再只为 “答对题目”,更要学会设计问题、识别错误、校验 AI 输出、驾驭人工智能工具
  3. 3.人机分工清晰化
    基础计算、标准化信息检索交给 AI;人类负责原创设计、逻辑审查、复杂场景综合判断。

很多网友评论:“这才是 AI 时代该有的大学课堂。” 当 AI 能轻松完成所有基础答题任务,真正拉开人与人差距的,从来不是重复劳动,而是独属于人类的深度思考与创造。

文末互动话题

  1. 你平时使用 AI 时,有没有发现过它明显的逻辑、计算错误?欢迎评论区分享!
  2. 图文来源于网络。