夜雨聆风学习资料网

ARTICLE · 1107396

AI不只会解题,开始出题了:453份手稿、2312页,它推翻了一篇论文里的猜想

AI不只会解题,开始出题了:453份手稿、2312页,它推翻了一篇论文里的猜想
EXECUTIVE BRIEF2026-09-30 · AI技术研究科普

AI 技术与科研科普

你让AI做一道题,它给你一个答案;你让它提一个问题,它可能给你一片荒地。有个公开项目正在试这件事,目标不是把题做对,而是先想清楚哪道题值得做。它的仓库里已经堆了453份数学研究手稿、2312页内容,其中6篇被明确标注为AI提出的猜想,还有一次,它把一篇论文里的猜想推翻了,原作者回信确认。

高管视角落地方法风险边界2026-09-30 · 全文约2902字 · 阅读7分钟
💰研究问题AI生成答案和AI生成研究议程是两种能力,前者比正确率,后者
🧭核心机制项目目前公开的是仓库记录与自我定位,不是经过同行评审的论文结
🛡已知边界想让这套流程在自己的场景里跑通,关键不在模型多强,而在你愿不

📋 摘要

一句话结论AI生成答案和AI生成研究议程是两种能力,前者比正确率,后者比的是能不能提出一个可被证伪、可被复核的问题。
实验发现项目目前公开的是仓库记录与自我定位,不是经过同行评审的论文结论,453份手稿与6篇AI猜想都属于项目自身口径。
现实意义想让这套流程在自己的场景里跑通,关键不在模型多强,而在你愿不愿意为失败记录和复核规则留出位置。
🔁 流程设计

一条猜想从提出到可复核的四步

定目标由人说明研究什么、什么算有价值,这一步不交给AI
找候选AI在已有文献与结构里做大规模搜索,产出多个可能方向
写成可检查用形式化工具把候选写成机器能逐行检验的命题
留证据把推导、失败记录与结论放进公开仓库,供他人复算
⚖ 方案对比

生成答案与生成议程,考的不是同一件事

生成答案比正确率,答对就结束,错了可以重来
生成议程比可证伪性,必须说清什么条件下它会被推翻
生成答案结果通常是一次性的,对错当场见分晓
生成议程结果要靠可复核的过程和失败记录撑着
壹

它解决的问题不是把题做对,而是找出哪道题值得做

AI做数学,你可能已经见过不少:解竞赛题、补证明的漏洞、把一个定理拆成几步推导。这类工作有共同点,题目已经在那儿了,AI只是把它做完。而AI Has Taste盯的正是前面那一段——题目本身还没有。

白话解释一下『猜想』:它是一个看起来成立、但还没被证明的数学命题。举个例子,『所有大于2的偶数都能写成两个质数之和』这种话就是猜想,读起来顺,但至今没人证明过。提出一个猜想和证明一个猜想,是两种完全不同的本事。

说白了,出题比答题更考验判断力。答题有标准答案兜底,出题要面对的是『这个方向值不值得花三个月』这种没人能拍胸脯的问题。

💡 管理层提示答题有标准答案兜底,出题要面对的是『这个方向值不值得花三个月』。
贰

换个类比:把AI当成一个不会累的选题助理

想象一家编辑部开选题会。主编定方向——这一期聊什么、什么算好稿子;助理负责翻资料、列十个可以做的角度、把明显跑不通的先划掉。这个项目给自己定的分工,差不多就是这样。

按项目公开的定位,人负责目标、价值判断与最终责任;AI承担大规模搜索、验证、失败管理和候选研究方向生成;形式化工具与公开证据负责让结果可以被复核,而不是仅凭一个分数就宣称有所发现。

你可能会想:这跟我做产品和运营有什么关系?关系在分工逻辑上。你把『谁定目标、谁扫候选、谁留证据』写清楚,很多AI项目的问题就解决了一半。反过来,让模型既出方案又给自己打分,等于没有复核。

💡 管理层提示让模型既出方案又给自己打分,等于没有复核。
叁

核心机制:从一条猜想走到可复核证据,中间有四道关

按项目自己的说法,这条链路可以拆成四段:先由人定目标与价值标准,再由AI做大规模搜索与候选方向生成,接着用形式化工具把候选写成能被机器检查的命题,并且把结论、推导和失败记录一起放进公开仓库。前一段不给后一段兜底,任何一段塌了,后面都白跑。

这里要解释一个词:形式化工具,就是把数学命题和证明写成计算机能逐行检查的代码。它的好处是检查结果不依赖人情和印象——机器说这一步不成立,就是不成立,你没法用『我觉得差不多』糊过去。

但问题来了:能被机器检查的,往往只是命题的一部分。数学里大量判断依赖『这个方向有意思』『这个类比也许能推广』,这类东西写不进检查器。所以这套链路能保证的是可复核,不是正确,更不是重要。

💡 管理层提示这套链路能保证的是可复核,不是正确,更不是重要。
肆

项目公开了哪些证据,还没公开什么

项目公开仓库目前记录453份数学研究手稿、2312页内容,其中6篇被明确归类为AI提出的猜想。在一次测试中,AI把一篇论文里的猜想推翻了,原作者回信确认。这是目前最硬的一手信号。

口径要讲清楚:以上数字来自项目公开仓库与媒体报道,不是同行评审论文中的实验数据。453份手稿记录的是产出体量,不等于453项发现;6篇的分类来自项目自己的标注规则,换一套标准去数,结果可能不一样。

你可能会问:原作者回信确认,不就等于数学界认可了吗?不等于。一封回信说明这位作者认为推翻成立,但一个案例无法告诉我们这套方法在多少比例的问题上会失手。项目也没有公开错误率和全量复现数据,所以现在的判断只能停在『值得观察』。

💡 管理层提示一封信说明这条路走通了一次,说明不了它走通的概率。
伍

想自己复现一次:输入输出大致长什么样

下面是可迁移的模板,不是项目原文,你可以按自己的场景改:输入是一个明确的研究问题,加一批可检索的已有文献或数据;中间产物是十到二十个候选方向,每个都附一句『什么情况下它会被推翻』;过滤环节把写不成可检查形式的候选先剔掉;输出是一份带失败记录的候选清单,每条都能追到具体推导或数据。

期望结果长这样:清单里过半候选带着明确的证伪条件,并且换一个同事按你的记录重跑,能得到接近的候选集合。如果重跑结果对不上,问题通常不在模型,在你记录信息的方式。

验证分两层。第一层是自检:同一批输入隔一天重跑,候选集合稳不稳定。第二层是对外:把清单拿给领域内的人看,问一句『这里面哪几条你一眼就知道不行』——能迅速指出不行的,恰好是你最需要的反馈。

▪输入:一个明确的研究问题,加一批可检索的文献或数据
▪中间产物:十到二十个候选方向,各附一句证伪条件
▪过滤:写不成可检查形式的候选先剔掉,别心疼
▪输出:一份带失败记录的候选清单,每条可追溯
💡 管理层提示重跑结果对不上,问题通常不在模型,在你的记录方式。
陆

验收标准与失败边界:怎么判断这套流程有没有跑通

验收标准可以压成三条:这条命题能不能被证伪;这个过程换个人重跑能不能复现;有没有第三方或原作者做过独立确认。三条里缺一条,就先别把它当成果往外讲。

失败边界更值得盯着。把生成量当成绩,是最常见的翻车方式——453份手稿听着多,但能被独立验证的部分才是硬通货。把这套项目自述直接当成同行评审结论,是第二种。第三种是拿单点确认去推概率。项目目前也没有公开错误率与全量复现数据,所以有一个判断只能算推断:它在生成候选这件事上看起来跑通了,筛选出真正重要的问题这一关,证据还不够。

对做产品和管理的人来说,这件事的可迁移价值不在数学。它会先出现在那些候选很多、验证很贵的地方:分子筛选、材料配方、策略测试。谁能把生成和复核拆成两条彼此独立的流水线,谁就能少交学费。

💡 管理层提示生成量是最容易堆出来的指标,可复算才是最难伪造的。

🔬 RESEARCH · 结论与边界

如果今天只做一件事:挑一个你最近让AI产出的方案,写下一句『什么情况下它会被推翻』。写不出来的,先别急着上会。这类流程真正难的地方不在模型选型,而在你有没有一套愿意长期维护的复核记录——自己摸一遍能省下一次试错的钱,但把失败记录、复算规则和对外确认这三件事同时做扎实,通常需要有人在旁边提醒你哪些坑已经踩过。

ABOUT PARSENOVA · 宇析智能

把前沿论文,讲成人人都能懂的技术故事

ParseNova 宇析智能成立于2021年,服务覆盖新媒体、制造、教育、电商、物流等20+行业,深耕欧洲及中国市场,已为100+海内外客户提供AI定制化方案;在欧洲多地设有办公地点,海外业务覆盖瑞士、德国、荷兰、法国等地。

AI定制化方案Agent与自动化工作流AI技术咨询数据与RAG知识库

客户案例

荷兰物流 · 德国零售

线路规划与排班自动化;在线超市客服系统AI化改造。

瑞士娱乐 · AI数字媒体

搭建AI数字媒体内容与运营流程,支持多语言分发。

深圳与杭州电商 · 自动化增长

海外AI自动营销;商品视频、图片等资料自动生成。

关注「宇析智能」,持续获取真正能用的 AI 内容

关注「宇析智能」公众号,持续获取最新 AI 资讯、实战教程和可复用的方法模板。我们会免费分享 AI 实战资料,并不定期发放 AI 工具使用福利,帮你少走弯路,把新技术真正用起来。

看完这篇,你有什么想法?

欢迎在评论区聊聊你的观点、使用感受,或者你正在推进的 AI 需求与业务场景。小编会认真阅读,并在能力范围内尽可能帮大家一起拆问题、找路径。

官网:www.parsenova.com

关注「宇析智能」公众号

长按关注我们,获取最新AI资讯及AI教程

添加 AI 专家微信

长按和专家聊,定制专属AI方案

相关学习资料