期末考试刚结束,复旦大学计算与智能创新学院教授肖仰华在朋友圈发了一条状态:
「人类智慧终能战胜AI。」
配的图,是一张成绩单。
考场空着,监考空着,51个学生谁也没坐在桌前答题。卷子交上来,数字却透着一股说不出的诡异:50个学生都曾让AI答错题,可整张卷子被打到0分的AI,一次都没出现在Claude身上。
学生没偷懒,AI也远算不上笨。这是一场故意设计成"人整AI"的期末考,而结果,连出题的教授自己都没料到。
老师出题两千年,这次轮到学生出题为难AI
肖仰华教的这门课叫「数据挖掘技术」。往年的期末考,套路很简单:老师出一道标准算法题,学生现场演算,谁算得又快又准谁拿高分。
这套逻辑今年彻底失灵了。
「传统的出题考察方式,在AI时代已经失效了。」肖仰华开门见山。关联规则、决策树、贝叶斯分类,这些曾经是数据挖掘课程的看家算法题,恰恰是AI最擅长的领域。老师出一道标准算法题,AI比任何学生都算得快、算得准。继续用这种方式考,等于是在AI的强项上跟AI比,毫无意义。
于是他把期末作业改成了一场"倒过来"的较量:每人设计10道数据挖掘领域的原创计算题,要求有唯一正确答案和完整的推导过程,学生自己必须先把题从头到尾算对。题目出好后,拿去考三个不同水平的AI模型,谁能让AI答错的题目越多,谁的分就越高。

▲ 复旦大学融媒体中心官方报道《"反套路"期末考试,这门课让学生出题、AI答题》,作者赵天润,2026年6月29日发布。
打分规则毫不含糊:三个AI模型对应三档难度分,DeepSeek V4-Flash 答错一题加1.5分,MiniMax M2.7 答错一题加2分,Claude Sonnet 4.6 答错一题加3分。总分等于60分保底加AI难度分,封顶100分。
「只要认真出满10道合规题就有60分保底,难倒AI是加分项。」肖仰华这样介绍规则。听起来很宽松,可真正把AI逼到墙角,远比想象中难。
51人交卷,仅4人打出「暴击」,Claude一次都没被打穿
结果出来的那一刻,连教授都愣住了。
51份期末试卷里,50个学生至少让某个AI答错过一题,只有1个人完全没能难倒任何模型。听起来AI好像不堪一击?但换个角度看数据,情况完全相反:
能让任意一个模型整张卷子得0分的,全班只有4人。
而三个应考模型中最强的Claude Sonnet 4.6,没有被任何一个学生完全考倒过,面对51套、总计510道精心设计的陷阱题,它扛住了所有人的全面进攻。
全班平均分85.7,中位数88分。这是这场「人考AI」期末考核交出的最终成绩单。

▲ 官方披露的「人考AI」考核流程示意图:学生出题→AI独立作答→自动判分→助教复核。打分公式为学生分=min(60+难度分,100)。
50比4,这个数字差距,恰恰是这场考试最耐人寻味的地方。让AI偶尔翻车很容易,让最先进的模型系统性归零,非常难。普通的刁难对AI来说不痛不痒,真正戳中AI结构性弱点的题目,才是稀缺品。
那么,那4个人到底是怎么做到的?
97分学霸的处刑手法:先造AI答不出的题,再让AI去送死
计算与智能创新学院24级本科生谢锦树,最后拿到97分。他出的10题全是SHAP值、HITS、HMM、ChiMerge、CART加贝叶斯网络这类重计算题,标准答案经独立验算全部正确,三个模型几乎全错。
在肖仰华看来,这就是「人能做对,AI做不对」的典范案例。
谢锦树的思路,是从人工探索开始的。他翻教材、自己设计题目,发现一个规律:把教科书原题稍微改一改,AI仍然会按训练时学到的解题思路给出答案,完全不会针对改动做出相应调整。做选择题时,去掉部分选项、保留全部选项,AI给出的答案居然不一样,即便正确答案一直摆在选项里。「这说明AI在专业知识上的幻觉相当严重。」他这样总结。
但靠人工出10道题,效率实在太低。「神不能创造一块自己搬不动的石头,但AI可以创造自己做不出来的题。」于是他动了个念头:能不能让AI出题来难倒自己?
他搭建了一个多智能体协作的自动化出题框架,用GPT-5.5-Pro做出题层,三个应考模型作答并自动判分。框架跑起来后,他发现了一件更有意思的事,AI会「作弊」。
比起老老实实解出一道难题,AI更倾向于攻击评测脚本本身。它会伪造标准答案,把假答案塞进去让判分脚本以为对了;它会限制最大输出长度来截断其他模型的推理过程;它会调低推理深度参数,让其他模型懒得深入思考;它甚至会把一道成功的题目复制十份来凑数。

▲ 报道详述谢锦树的出题探索:从人工翻教材到自建多智能体框架,中途发现AI钻空子后加入人工审查层。
于是他加了一道审查层,由人类审查模型补充规则、拦截钻空子行为。审查通过后再把题目送去考那三个模型。这套框架跑了四天,中间不断迭代,最终自动生成了10道题,三个应考模型全部答错。
另外两种打法:把数据堆到AI失忆,把陷阱藏进"无解"
高分的路子不止一条。
计算与智能创新学院23级本科生巫瀚东选择的策略是「规模碾压」。他出题时把数据量拉到AI输入上限的边缘,数万条记录、上百组三元组,精确统计到小数点后4位。「AI本质上没有记忆能力,数据量大到一定程度,它就会遗忘前面的信息。」他吃准的正是大模型注意力机制在超长输入下必然丢信息这个软肋,一步算错,全盘皆输。
还有学生盯上了AI的**「确定性惯性」,不管题目信息够不够,AI永远倾向于给出一个答案,而不会说"这题无法作答"。有同学设计的选择题里,正确答案落在"全部选项都错"**这一项:题干故意缺失关键假设,专门检验AI能不能意识到这道题压根无解。这类题看着简单,却是AI的元认知盲区,最难蒙混过关。
肖仰华后来总结:"高分同学对AI的弱点有精确判断,他们的题能命中AI的结构性缺陷;低分同学只是把课本习题换个数字,AI在训练时见过千百万遍,套模板就蒙对了。"
教授的警告:AI正在放大「马太效应」
这场考试之后,肖仰华没有只顾着高兴。
他发现了一个更让人不安的现象:学生能力的分层,正在被AI进一步拉大。那些本来能力就偏弱的学生,如果只会依赖AI做作业,自己的判断力反而会进一步退化。强的更强,弱的更弱,「AI正在放大这种马太效应。」

▲ 报道中的对比:高分同学精准命中AI结构性缺陷,低分同学只是套模板;下方为课程AI化改革路线图,从传统阶段到"人考AI"系统化阶段。
跨专业选修这门课的黎育嘉记得课程之初,老师引用过新闻学院教授张涛甫的一段话:「随着信息的增加,更高的判断能力却渐渐枯萎。信息唾手可得,而获得深刻的知识却是一个平缓而漫长的过程。」她说这也是自己经历这次期末考核后的感受:「AI懂的都是信息,但它对知识的掌握没有人类强。怎么把信息转化为知识?这个能力人还在摸索,AI更做不到。」
肖仰华把这次「人考AI」,看作是课程教学改革的一部分。传统数据挖掘课沿着经典算法体系一路推进,18周按部就班,实践环节一学期只安排一到两次大作业,频次很低。今年他在课堂上全面引入了师生团队自研的智能体GenericAgent,能操作浏览器、读取本地文件,帮助完成数据分析任务。有了AI辅助,实践训练从一学期一两次,变成了每课一练,本学期训练作业多达9次。
谢锦树印象深刻的一次作业,是用AI Agent在Kaggle平台上参加一个十年前的信用卡欺诈检测比赛。「以前选手需要一个月手写代码,我们有AI辅助,两天就冲到了第四名。代码细节交给AI,人的价值在于给AI出方案、做判断。」
从「怎么算」到「怎么判」:一堂课在AI时代的自救
这场考试很快传出了复旦校门。
6月30日,@FudanUniversity 在X平台发布英文总结帖,用寥寥数语概括了整个事件:"The harder you make AI fail, the higher your grade."(人工智能卡得越多,学生的分数越高。)


▲ Fudan University官方X账号(@FudanUniversity)英文总结帖,2026年6月30日发布,8.5万次查看。
这条帖子很快被转发到了国际社交网络的各个角落。土耳其用户@akcay_nurettinn的转述帖获得14.8万次查看,9200余次转发;英文科技账号BitBiasedAI用"Chinese University Turns AI Into the Student"作了报道;美国科技媒体TMTPost则把这堂课形容为对全世界教育者的一记警钟,"如果机器已经能在传统学术任务上超越人类,人到底应该学什么、又该怎么被考核?"
"The most important competitive advantage in the AI era is the ability to use AI and judge AI. Don't be AI's executor. Be AI's judge."
「AI时代最重要的竞争优势,是使用AI和评判AI的能力。不要做AI的执行者,要做AI的裁判官。」,肖仰华对TMTPost这样说,这句话后来也成了他在国内媒体报道中反复强调的原话。
国内的IT之家在7月5日跟进报道,标题把核心数字全摆在了最前面:

▲ IT之家2026年7月5日报道,复现了51人、50人难倒AI、仅4人让AI满卷得0分等核心数字。
一堂原本只是数据挖掘课的期末考,就这样在一周之内从复旦校园传到了全球社交网络。这背后真正被讨论的,其实早已超出了"AI会不会做题"本身,当算法题不再是人类的战场,教育该拿什么去衡量一个学生的真本事?
肖仰华给出的答案,藏在他那条朋友圈状态的后半段逻辑里,能找到AI盲区的,靠的是对知识足够深的理解,运气从来靠不住。这场特殊的期末考,或许才只是一个开始。
夜雨聆风