ARTICLE · 1107396
AI不只会解题,开始出题了:453份手稿、2312页,它推翻了一篇论文里的猜想
AI 技术与科研科普
你让AI做一道题,它给你一个答案;你让它提一个问题,它可能给你一片荒地。有个公开项目正在试这件事,目标不是把题做对,而是先想清楚哪道题值得做。它的仓库里已经堆了453份数学研究手稿、2312页内容,其中6篇被明确标注为AI提出的猜想,还有一次,它把一篇论文里的猜想推翻了,原作者回信确认。

📋 摘要
一条猜想从提出到可复核的四步
生成答案与生成议程,考的不是同一件事
它解决的问题不是把题做对,而是找出哪道题值得做
AI做数学,你可能已经见过不少:解竞赛题、补证明的漏洞、把一个定理拆成几步推导。这类工作有共同点,题目已经在那儿了,AI只是把它做完。而AI Has Taste盯的正是前面那一段——题目本身还没有。
白话解释一下『猜想』:它是一个看起来成立、但还没被证明的数学命题。举个例子,『所有大于2的偶数都能写成两个质数之和』这种话就是猜想,读起来顺,但至今没人证明过。提出一个猜想和证明一个猜想,是两种完全不同的本事。
说白了,出题比答题更考验判断力。答题有标准答案兜底,出题要面对的是『这个方向值不值得花三个月』这种没人能拍胸脯的问题。
换个类比:把AI当成一个不会累的选题助理
想象一家编辑部开选题会。主编定方向——这一期聊什么、什么算好稿子;助理负责翻资料、列十个可以做的角度、把明显跑不通的先划掉。这个项目给自己定的分工,差不多就是这样。
按项目公开的定位,人负责目标、价值判断与最终责任;AI承担大规模搜索、验证、失败管理和候选研究方向生成;形式化工具与公开证据负责让结果可以被复核,而不是仅凭一个分数就宣称有所发现。
你可能会想:这跟我做产品和运营有什么关系?关系在分工逻辑上。你把『谁定目标、谁扫候选、谁留证据』写清楚,很多AI项目的问题就解决了一半。反过来,让模型既出方案又给自己打分,等于没有复核。
核心机制:从一条猜想走到可复核证据,中间有四道关
按项目自己的说法,这条链路可以拆成四段:先由人定目标与价值标准,再由AI做大规模搜索与候选方向生成,接着用形式化工具把候选写成能被机器检查的命题,并且把结论、推导和失败记录一起放进公开仓库。前一段不给后一段兜底,任何一段塌了,后面都白跑。
这里要解释一个词:形式化工具,就是把数学命题和证明写成计算机能逐行检查的代码。它的好处是检查结果不依赖人情和印象——机器说这一步不成立,就是不成立,你没法用『我觉得差不多』糊过去。
但问题来了:能被机器检查的,往往只是命题的一部分。数学里大量判断依赖『这个方向有意思』『这个类比也许能推广』,这类东西写不进检查器。所以这套链路能保证的是可复核,不是正确,更不是重要。
项目公开了哪些证据,还没公开什么
项目公开仓库目前记录453份数学研究手稿、2312页内容,其中6篇被明确归类为AI提出的猜想。在一次测试中,AI把一篇论文里的猜想推翻了,原作者回信确认。这是目前最硬的一手信号。
口径要讲清楚:以上数字来自项目公开仓库与媒体报道,不是同行评审论文中的实验数据。453份手稿记录的是产出体量,不等于453项发现;6篇的分类来自项目自己的标注规则,换一套标准去数,结果可能不一样。
你可能会问:原作者回信确认,不就等于数学界认可了吗?不等于。一封回信说明这位作者认为推翻成立,但一个案例无法告诉我们这套方法在多少比例的问题上会失手。项目也没有公开错误率和全量复现数据,所以现在的判断只能停在『值得观察』。
想自己复现一次:输入输出大致长什么样
下面是可迁移的模板,不是项目原文,你可以按自己的场景改:输入是一个明确的研究问题,加一批可检索的已有文献或数据;中间产物是十到二十个候选方向,每个都附一句『什么情况下它会被推翻』;过滤环节把写不成可检查形式的候选先剔掉;输出是一份带失败记录的候选清单,每条都能追到具体推导或数据。
期望结果长这样:清单里过半候选带着明确的证伪条件,并且换一个同事按你的记录重跑,能得到接近的候选集合。如果重跑结果对不上,问题通常不在模型,在你记录信息的方式。
验证分两层。第一层是自检:同一批输入隔一天重跑,候选集合稳不稳定。第二层是对外:把清单拿给领域内的人看,问一句『这里面哪几条你一眼就知道不行』——能迅速指出不行的,恰好是你最需要的反馈。
验收标准与失败边界:怎么判断这套流程有没有跑通
验收标准可以压成三条:这条命题能不能被证伪;这个过程换个人重跑能不能复现;有没有第三方或原作者做过独立确认。三条里缺一条,就先别把它当成果往外讲。
失败边界更值得盯着。把生成量当成绩,是最常见的翻车方式——453份手稿听着多,但能被独立验证的部分才是硬通货。把这套项目自述直接当成同行评审结论,是第二种。第三种是拿单点确认去推概率。项目目前也没有公开错误率与全量复现数据,所以有一个判断只能算推断:它在生成候选这件事上看起来跑通了,筛选出真正重要的问题这一关,证据还不够。
对做产品和管理的人来说,这件事的可迁移价值不在数学。它会先出现在那些候选很多、验证很贵的地方:分子筛选、材料配方、策略测试。谁能把生成和复核拆成两条彼此独立的流水线,谁就能少交学费。
🔬 RESEARCH · 结论与边界
如果今天只做一件事:挑一个你最近让AI产出的方案,写下一句『什么情况下它会被推翻』。写不出来的,先别急着上会。这类流程真正难的地方不在模型选型,而在你有没有一套愿意长期维护的复核记录——自己摸一遍能省下一次试错的钱,但把失败记录、复算规则和对外确认这三件事同时做扎实,通常需要有人在旁边提醒你哪些坑已经踩过。
ABOUT PARSENOVA · 宇析智能
把前沿论文,讲成人人都能懂的技术故事
ParseNova 宇析智能成立于2021年,服务覆盖新媒体、制造、教育、电商、物流等20+行业,深耕欧洲及中国市场,已为100+海内外客户提供AI定制化方案;在欧洲多地设有办公地点,海外业务覆盖瑞士、德国、荷兰、法国等地。
客户案例
线路规划与排班自动化;在线超市客服系统AI化改造。
搭建AI数字媒体内容与运营流程,支持多语言分发。
海外AI自动营销;商品视频、图片等资料自动生成。
关注「宇析智能」,持续获取真正能用的 AI 内容
关注「宇析智能」公众号,持续获取最新 AI 资讯、实战教程和可复用的方法模板。我们会免费分享 AI 实战资料,并不定期发放 AI 工具使用福利,帮你少走弯路,把新技术真正用起来。
看完这篇,你有什么想法?
欢迎在评论区聊聊你的观点、使用感受,或者你正在推进的 AI 需求与业务场景。小编会认真阅读,并在能力范围内尽可能帮大家一起拆问题、找路径。
官网:www.parsenova.com
关注「宇析智能」公众号

长按关注我们,获取最新AI资讯及AI教程
添加 AI 专家微信

长按和专家聊,定制专属AI方案