ARTICLE · 1156303
AI 帮数学家丘成桐算了题,为什么帮文学博士编了假文献?|循证局观察
【摘要】同一个 AI,一边进了数学家的致谢栏,一边成了文学博士论文被举报的证据。区别不在工具有没有用,在使用者做了什么。而这套"只防抄、不防编"的核验体系,医生们同样身处其中——论文、课题、职称材料,过的都是同一套流程。
先说一件刚发生的事。
2026年9月24日,数学预印本平台 arXiv 收录了一篇论文:《Positive Sectional Curvature on All Smooth 7-spheres》。它宣称解决了一个悬置 70 年的微分几何问题——七维空间中 28 种球面,每一种都能配上截面曲率严格为正的度量。
三位作者里,最后一位是数学家丘成桐。
这里有两个时间,需要分开说:问题本身悬置了 70 年——从 1956 年美国数学家米尔诺(John Milnor)构造出第一种“怪球”算起;而它被丘成桐亲手写进自己的问题清单,是 1982 年,排第二位,距今 44 年。
引发学界讨论的,不只是结论,还有论文的致谢栏。里面写着这样一段话:
论文致谢原文
The authors are grateful to AI models, specially ChatGPT 6 Astra and Claude Pro, for valuable assistance with the exploration of some of the proof strategies and calculations. That said, we take responsibility for the human verification and exposition.
译:感谢 AI 模型,特别是(原文 specially)ChatGPT 6 Astra 和 Claude Pro,在部分证明策略的探索和计算中提供了有价值的帮助;但人工验证和论文表述的责任,由作者自己承担。
两周后,另一件事。
2026年10月9日,河北大学官网发布情况通报:针对网络上对该校博士毕业生康某某学位论文涉嫌学术不端的反映,学校“第一时间成立工作专班,启动调查程序”,并强调对学术不端“零容忍”。
被举报的论文是《辽代碑志文研究》。举报指出的问题包括:虚构参考文献、出版社名称造假、基本史实错误、AI句式特征明显。
举两个具体例子:
论文参考文献中列出了——“辽宁省文物考古研究所:《辽宁阜新辽萧氏家族墓发掘与多学科研究报告》,《考古》2020年第5期,第102-105页”。
《考古》2020年第5期里,没有这篇文章。
还有三本“专著”——刘浦江《辽金史论》(中国社会科学出版社,2007)、冯永谦《辽代新出墓志辑校》(辽宁民族出版社,2024)、祝尚书《宋代文体研究》(中华书局,2023)。
澎湃新闻的报道原话是:这三本“所谓‘现代专著’也均无出版信息”。
值得一提的是,刘浦江是辽金史学界公认的名家。恰恰是这种“作者确有其人、书目貌似正规”的假文献,最难被外行识破。
把这两件事放在一起,同一个问题就浮出来了:
都是AI,为什么一边是致谢栏里的名字,一边是举报信里的证据?
先说明一点:河北大学那件事目前仍处于调查阶段,校方的表述是“涉嫌”,结论有待核实。这篇文章不对个案作认定,只讨论一个可以被查证的问题——AI在这两件事里,到底干了什么不一样的事。
一先把AI在两件事里的角色,分开看
丘成桐那篇,AI的位置写在致谢里,写得很具体:“探索部分证明策略”和“计算”。
翻译成人话:AI参与的是策略试探和计算核实——它帮作者试了一些证明路线,也帮着做了一些计算。这个构造涉及大量曲率不等式的精确估计,逐一人工核查的代价很高。
而论文紧接着补了一句,是整段致谢里最关键的一句:
人工验证和论文表述的责任,由作者自己承担。
这一句,把AI放回了它该在的位置——工具。
这里还有一个细节值得留意。就在三年前,丘成桐对AI的态度还是另一句话。2023年4月,他在复旦大学演讲时说:“AI不可能对最尖端的数学家有任何影响。”到2025年7月,他仍表示AI对自己的研究冲击不大。
而2026年9月,他的论文致谢里写上了两个AI模型的名字。
同一个人,三年之间
2023.04
复旦演讲:“AI不可能对最尖端的数学家有任何影响”
2025.07
仍表示AI对自己的研究冲击不大
2026.09
论文致谢里写上两个AI模型的名字
同一个人,同一个领域,三年之间态度松动。这不是“打脸”,这是前沿学者对工具能力变化的正常反应。而这个转变本身,恰好说明了一件事:AI在这三四年里,确实从“不能做”走到了“能帮着做”。
河北那篇,被指控的位置在参考文献里。按举报的说法,AI被用来生成“看起来像文献的东西”。
注意这里的区别:参考文献不是“想”出来的,也不是“算”出来的。它是用来证明“我说的话有出处”的凭证。
所以两件事的差别,不在“用没用AI”,在这一步:
一个是“用工具做研究”,一个是“用工具造凭证”。这是两种完全不同的行为,本来就该有不同的对待。
但如果文章只说到这里,那就等于什么都没说。因为下面这个问题还没回答:
假文献,是怎么走到“已毕业”这一步的?
二假文献能通过的四道关口,每一道都不查这个
一篇博士学位论文,从写作到授予学位,要过四道关口。我们把每一道在“查什么”列出来:
这张表里最要紧的一点是:查重系统不查文献真伪。
知网学术不端文献检测系统的核心功能是文本相似度比对——看你的文字和别人重复了多少。它对参考文献的处理方式是:识别参考文献部分,整体排除,不拿去比对数据库。
这不是推测。同济大学图书馆在其面向师生的查重服务说明里写得很直白:
“参考文献在检测过程中是自动排除不检测的,需明确标示参考文献。”
同一份说明里还有两条技术要求,恰好反证了这一点:参考文献字符数不能超过全文字符数的 1/2;英文参考文献不能过长、换行过多,否则会导致参考文献区块中断,无法被系统自动排除——系统之所以要规定这些,是因为它真的在识别、在剥离这个区块。
也就是说,一篇格式规范的假文献,不但不会被查出来,还会因为“格式正确”而被系统自动排除。
假文献天然是查重的盲区。
盲审呢?盲审专家的评阅周期通常只有一到两周,而且要评的是整篇论文的学术水平。没有人会在两周内,去逐条核验一篇 10 万字论文里上百条参考文献是否存在。
这不是谁失职,是这套流程在设计上,就没有“核验引文真实性”这个动作。
它只防“抄”,不防“编”。
需要说明的是:这个判断说的是常规流程。少数高校在答辩或学位论文抽检环节,会组织人工抽查参考文献,个别导师也会逐条核验。但这些是附加动作,不是制度性关口——它取决于学校、院系、导师的具体做法,不是一道必须过的关。对于一篇绕过了常规流程的论文,指望“某个环节碰巧有人抽查”,和指望“有人碰巧去翻《考古》2020年第5期”,是同一类运气。
这两件事在性质上完全不同——抄,是拿走别人写过的东西;编,是创造一个从来没存在过的东西。查重系统能抓第一种,对第二种完全无感。
三那么,“编文献”这件事,为什么现在才变得这么容易
答案在AI的能力边界上。
过去的伪造是“粗糙的”,所以容易被发现。编一条假文献,要做到格式对、卷期对、页码对、作者对——需要真功夫。而且人工编出来的东西,往往有破绽:年份对不上、期刊名错一个字、页码格式不对。外行看不出,内行一眼就穿。
AI改变了成本和质量的对比。
现在生成一条假文献,成本几乎是零,而且格式可以完全规范——期刊名、年份、卷期、页码、出版社,一应俱全,比真的还整齐。
这不是推测,是已经在发生的事。 2026年5月发表于《柳叶刀》的一项研究,逐条核查了 250 万篇生物医学论文的 1.25 亿条参考文献,筛出近 3,000 篇含“无法溯源至任何正规出版物”的引用。其中2025年含伪造引文的论文数量,是2023年的12倍。 研究合著者、哥伦比亚大学研究员 Maxim Topaz 说,他们筛出的“只是真实乱象的下限,如今只窥见了冰山一角”。
250 万篇
被核查的生物医学论文
1.25 亿条
被逐条核查的参考文献
12 倍
2025年含伪造引文论文是2023年的倍数
《柳叶刀》2026年5月研究
这里要说明白一件事:这项研究证明的是“伪造引文在激增”,不是“这些引文是AI编的”。 研究者自己就点明了——“这些虚假引用究竟是AI生成还是人为编造,目前尚无定论。但问题增速如此之快,足以说明生成式AI是重要诱因。”
增长本身,才是最有说服力的部分。
同期《自然》的一项分析判断,2025年全球约 1.6% 的论文至少含一条看似不存在的参考文献;针对三场计算机会议近 1.8 万篇论文的统计显示,含“幻觉引文”的论文比例从 2024 年的 0.3% 升至 2025 年的 2.6%。
这就产生了一个危险的倒挂:
识别AI编造的假文献,成本远高于生成它。
举报里提到的“AI句式特征明显”,是另一个层面的线索——内容本身的表达方式也会留下痕迹。但要注意:句式特征只能提示“可能用了AI”,不能证明“文献是假的”。判断文献真伪的唯一方法是去核对——而核对这件事,前面那四道关口都不做。
更麻烦的是,冷门领域是重灾区。
《辽代碑志文研究》——辽代碑志是一个从业者极少的断代史方向。全国真正懂这个领域、能在审阅时发现“这篇《考古》文章好像不存在”的人,数量非常有限。而盲审专家是按二级学科匹配的,未必匹配到最懂辽代碑志的那几个人。
越窄的领域,就越依赖“信任”;越依赖信任,就越容易被伪造击穿。
这一点不只发生在历史学。
医学里同样如此。罕见病的文献、小众亚专科的指南、新上市药物的临床研究——谁会去逐条核对一条参考文献是否存在?你的论文、课题申报书、职称材料,引用的也是同一套文献体系,过的也是同一套不查真伪的流程。
那医生能做什么?至少有三件事是自己可控的:
1第一,自己别踩这条线。
用AI整理资料、润色语言、翻译、检查格式,这些都在合理范围内;但让AI直接产出文献条目、直接生成论述结论,就是把风险引到自己身上。判断标准很简单:AI给的每一条文献,你都要能在数据库里点开原文。点不开的,不进参考文献。
2第二,教学生这个动作。
如果你带研究生,让他们交论文时附一句承诺:“本文所有参考文献均可溯源,已逐条核验。” 这句话不解决全部问题,但它把“核验”从无人负责,变成了有一个具体的人签了字。
3第三,材料自查要当成习惯。
课题申报书、职称评审材料、成果鉴定——这些材料里如果掺了假文献,风险不由你决定,由它被发现的时间决定。而它被发现的方式,往往是最难堪的那种:被同行在评审桌上认出来。
期刊和评审环节要不要补一道核验,是另一个需要讨论的问题。但在这道关补上之前,每个人都是自己的最后一道关。
四回到那个问题:为什么一个成了致谢,一个成了指控
现在可以回答了。
不是AI有区别,是使用的人做了三件不一样的事:
第一,用在哪个环节。
丘成桐用它探索思路、做计算——它参与的是“产生”。被指控的那篇,据举报是在参考文献上——它参与的是“声称”。前者是研究工具,后者是伪造手段。
第二,有没有说出来。
丘成桐把AI写进了致谢栏,明确说明用途,并声明验证责任归作者。这一步看起来小,但它把工具的使用变成了公开可核查的事实。
第三,有没有人核验。
这是最根本的一条。丘成桐的论文发表后,学界会去验证那个证明——数学的结论是可以被检验的,别人会算一遍。
而被指控的假文献,四道关口一道都不查——它需要在某个“意外”的时刻(比如有人真的去翻《考古》2020年第5期),才会被发现。
所以真正的区别是:
一边是“公开使用、接受验证”;一边是“隐藏使用、没有验证”。
AI没有参与这个区别的制造。它只是让伪造变得太便宜了。
五一个必须正视的错位
这件事里,还有一个更值得注意的细节。
据澎湃新闻和多家媒体报道,河北大学本科毕业论文已经在做AIGC检测。学校教务处明确要求,论文指导教师需“引导学生正确认识人工智能在论文撰写中的辅助作用,明确AIGC使用边界与规范,避免过度依赖”。
也就是说:这所学校,在本科层面已经有了AI使用的边界规范。
而博士环节,出了这样的事。
这里要先排除一个容易产生的误读:这不是“本科查、博士不查”的覆盖率问题。 博士论文该有的检测环节一道不少,真正的问题在别处——这套已经铺开的检测,只能查“像不像”,查不了“是不是”。
那这个错位说明了什么?至少说明一件事:问题不在“有没有规则”,而在规则能覆盖到哪一层。
本科有AIGC检测,说明学校有技术手段、有规范意识。但技术手段能覆盖的范围,和它需要覆盖的范围之间,有一道缝——AIGC检测能看出文风,看不出出处;能提示“疑似生成”,提示不了“查无此文”。
哪怕一个学生被AIGC检测标记了,只要他的文献是真的,性质就不是学术不端;反过来,如果文献是假的,哪怕检测没标记他,性质也一样严重。
核心从来不是“像不像AI”,是“是不是真的”。
结 语
回到开头那个问题:AI 帮丘成桐算了题,为什么帮别人编了假文献?
答案是:AI没有帮谁编假文献,是有人用AI编了假文献,然后把它藏进了参考文献。
工具是中性的。区分使用者的,是他们怎么用、说不说、以及有没有人在后面核验。
所以本文不打算说“AI是洪水猛兽”,也不打算说“AI无所谓”。我想说的是另一件事:
当一个工具的生成能力,已经远远超过整个体系的核验能力时,真正需要升级的不是工具,是核验。
现在能把一条假文献做得比真的还规范。而“核对文献是否存在”这个动作,在学位论文的四道关口里,一道都没有。
这不是AI造成的漏洞。这是AI照出来的漏洞。
信源
1. 丘成桐等论文《Positive Sectional Curvature on All Smooth 7-spheres》致谢原文及论文信息(三位作者:Yang-Hui He、Ziran Liu、丘成桐;2026年9月24日提交 arXiv,编号 2609.29426):https://arxiv.org/abs/2609.29426 ;中文报道见量子位《丘成桐新论文致谢了GPT和Claude》(2026年10月2日)2. 河北大学《情况通报》(2026年10月9日,河北大学官网)3. 河北大学康某某博士学位论文被指涉嫌学术不端的具体举报细节(虚构参考文献、出版社名称造假、基本史实错误、AI句式特征;《考古》2020年第5期及三本“专著”的核查情况):澎湃新闻2026年10月报道,文章《言短意长|别让AI“辅助”变“主角”,博士论文作者只能是自己》:逐字载有“...《考古》2020年第5期,第102-105页”并不存在于这一期期刊中,以及“刘浦江.辽金史论[M].北京:中国社会科学出版社,2007.”“冯永谦.辽代新出墓志辑校[M].沈阳:辽宁民族出版社,2024.”“祝尚书.宋代文体研究[M].北京:中华书局,2023.”等多本所谓“现代专著”也均无出版信息;并载有河北大学本科AIGC检测要求:https://m.thepaper.cn/newsDetail_forward_34219835 ;央广网2026年10月10日河北大学情况通报报道:https://www.toutiao.com/article/7694900867891249674/ ;央视网2026年10月9日报道:https://news.cctv.com/2026/10/09/ARTIsNvqDkeKNwmSNLCfzMDb261009.shtml (说明:本文仅用“康某某”,不与实名报道做交叉链接,以降低对当事人的检索可及性。)4. 学位论文查重系统功能定位及“参考文献自动排除”机制的出处:同济大学图书馆《硕博士学位论文查重服务介绍》:“参考文献在检测过程中是自动排除不检测的,需明确标示参考文献”;并载明“参考文献字符数不能超过全文字符数的1/2”“英文参考文献不能过长、换行过多,否则导致参考文献中断,无法被系统自动排除”:https://www.lib.tongji.edu.cn/index.php?classid=11979&newsid=31093&t=show ;其他佐证:中国青年网《知网论文查重你知道多少?》(2019年5月9日)“知网会自动识别出参考文献,识别出的参考文件不参与正文检测”:https://d.youth.cn/newtech/201905/t20190509_11949355.htm ;博士论文重复率红线(多数高校 10%–15%):各高校研究生院现行学位论文评阅通知(示例:上海交通大学研究生院《博士/硕士学位论文盲审/抽检常见问题解答》、四川农业大学《关于2026年上半年学位论文评审的通知》、武汉大学水利水电学院《关于2026年上半年博士学位论文答辩及学位申请的通知》)5. 盲审送审专家数(博士不少于3位,部分院校5位)、评阅周期(一般15天至8周)及评阅关注点:同上各高校通知6. 教育部《高等学校预防与处理学术不端行为办法》(2016年施行),“伪造科研数据、资料、文献、注释,或者捏造事实、编造虚假研究成果”应认定为学术不端7. 河北大学本科毕业论文AIGC检测要求及教务处对指导教师的要求:澎湃新闻(同上注3),原文为“河北大学针对本科毕业论文(设计)已在进行学术不端检测与AIGC检测。学校教务处明确要求,论文指导教师需‘引导学生正确认识人工智能在论文撰写中的辅助作用,明确AIGC使用边界与规范,避免过度依赖’”8. 丘成桐对AI态度的公开表述变化:2023年4月复旦大学演讲“AI不可能对最尖端的数学家有任何影响”(第一财经,2023年4月);2025年7月仍表示冲击不大;2026年9月接受采访称“AI为基础科学带来了看不清楚的变数”,并由其担任总编筹办《AI辅助数学杂志》(计划2027年创刊)(腾讯新闻/量子位,2026年9月29日):https://news.qq.com/rain/a/20260929A0A3K5009. 丘成桐论文相关背景(七维空间28种球面、1982年列入其问题清单排第二位、2020年Goette-Kerin-Shankar推广至非负曲率、本文实现正曲率):量子位《arXiv最严新规!每人每月最多提交2篇》(2026年10月2日):https://news.qq.com/rain/a/20261002A062SW0010. “幻觉引文”规模数据:《柳叶刀》研究(2026年5月9日):对 250 万篇 PubMed Central 生物医学论文的 1.256 亿条参考文献做合规性审计,筛出 2,564 篇含 1–2 条伪造引文、246 篇含 3 条以上;2025年含伪造引文的论文数量是2023年的12倍;问题论文中仅 1.6% 被撤稿或更正。研究者的限定表述:“这些虚假引用究竟是AI生成还是人为编造,目前尚无定论。但问题增速如此之快,足以说明生成式AI是重要诱因。”(正文引用时已同时呈现该限定)论文DOI:https://doi.org/10.1016/S0140-6736(26)00603-3 ;中文报道见科学网:https://news.sciencenet.cn/htmlnews/2026/5/564441.shtm ;《自然》新闻团队与 Grounded AI 联合分析(2026年4月):2025年刊发论文中约 1.6% 至少含一条看似不存在的参考文献;据估算全球约 700 万篇中逾 11 万篇存在AI编造的无效参考文献;针对三场计算机会议近 1.8 万篇论文的统计显示,含幻觉引文比例从 2024 年 0.3% 升至 2025 年 2.6%。据人民网转载《科技日报》报道。11. 人工智能模型名称:致谢原文中的 “ChatGPT 6 Astra” 与 “Claude Pro” 系按论文致谢逐字引用,未作改动。
洪瑞麟
医生数字资产概念提出者,《医生的数字资产》作者,「循证局」主理人
主任编辑,深耕医疗传播多年。近年关注医生专业知识的结构化与AI应用——把临床判断、沟通话术、患教经验这些行业最核心的隐性知识,用AI技术变成医生真正“拥有”且能持续积累的资产。
循证局观察
基于公开信息的行业深度观察 · 信源可查证