ARTICLE · 1136216
OpenAI公开722篇数学手稿:我更关心,小团队能少走多少弯路
AI经营实验室 · 经营观察

文 / 兔八哥
大家好,我是兔八哥,一个AI深度玩家。
如果AI能一口气给你十套获客方案,你会更容易做生意吗?
我的答案是:未必。两个人的团队,原来只能做一套,现在眼前摆了十套。人没增加,预算没增加,先做哪个,反而更难选。
OpenAI公开722篇数学手稿,让我想到的就是这个问题。AI往更复杂的问题走,我们当然应该关注。但站在AI经营实验室的角度,我更想追问:新能力进入业务以后,能不能帮我们减少一次错误投入?
我愿意押注的,是小团队更快弄清楚什么值得做,并且付得起弄清楚这件事的成本。
01|722篇背后,有一件事比数量更值得看
OpenAI在2026年10月6日公布内部前沿模型产生的数学成果。仓库收录722篇手稿,分为372组相关成果;验证进度不同,并非全部配有Lean形式化证明,模型也尚未公开发布。因此,不能说“AI已经解决了722道独立难题”。

让我在意的是这批成果的来处。OpenAI解释,已有数学评测的表现趋于饱和后,他们扩大了对开放研究问题的评估。[2]
这与让AI完成一道有标准答案的习题有区别。研究问题的答案需要被探索,提出结果以后,还要继续检查它能否成立。
所以,讨论这次进展,不能只数手稿。公开结果、供人检查、记录修订,这些也是理解成果的一部分。OpenAI同步公开部分Lean形式化证明,让计算机可以检查按形式规则写出的证明。[1]
仓库还说明,评估中向模型提出了约4000个问题,经过成果归组与重要性筛选才形成这份目录。[2] 这提醒我关注尝试过程:公开成果数量不能直接当作解题成功率,筛选标准、归组方式和验证状态都要一起看。

我不具备逐篇判断这批数学成果的专业能力,也不会据此宣布某个重大猜想已经得到公认解决。
但这里有一个值得经营者借鉴的思路:提出答案之后,得有办法让答案接受检查。
02|生意里没有标准答案,检查反而更麻烦
数学有严格的证明要求。生意里,你写下一套逻辑自洽的方案,客户也可能不买。
假设你判断:产品没卖好,是因为客户看不懂价值。于是AI帮你把卖点、案例、文案都改了一遍。文字确实更清楚,订单仍然没变化。
原因可能在别处:接触到的不是目标客户,需求不急,预算不够,或者交付方式不合适。也可能是观察时间太短,你还不能判断。
商业方案讲得通,只是一个起点。客户行为会不会按你预想发生,需要另外验证。
这也是数学进展不能直接换算成经营能力的原因。经营环境会变,人会变,竞争对手也会动;一次试验得到的结果,还可能只适用于某类客户、某段时间。
所以,“AI已经能研究数学,当然也能替我经营公司”,这个推导我不接受。
我更愿意做一个克制的尝试:用当前可用的AI协助整理证据、提出几种解释、设计检查办法。至于它能做到什么程度,就拿具体任务来测。

03|我担心的,是方案越来越多,试错仍然很贵
一份方案生成以后,要占用什么资源?
做一个新产品,要访谈、打样、交付。试一个新渠道,要准备内容、跟进线索、等客户决定。团队每选择一条路,就暂时放下了其他事情。
AI可以降低部分准备和生成成本,却不会自动消除这些执行成本。即使模型能力提升,这笔账仍然要算。
如果我们只追求方案数量,可能会出现一种尴尬:电脑里积累了很多分析,团队依然不知道下一步做什么。
对小团队,我的判断是:当方案越来越容易获得,值得投入的能力,是从中筛出少数有依据、能验证、承担得起的尝试。
这也会改变我们使用AI的提问方式。
“帮我想十种办法”可以用于打开思路。到了做决定的时候,我会继续问:每种办法假设什么是真的?手里的材料支持哪一条?什么结果出现时,我们应该承认这个办法不适合?
最后一个问题尤其有用。不给自己留下判断失败的条件,再漂亮的方案都能被解释成“还需要再坚持一下”。
04|拿“报价后不成交”,把这件事走一遍
下面是一个假设的小团队场景,用来说明方法,不是我的客户实测。
一家服务团队发现,最近有些客户拿到报价后没有继续推进。负责人想让AI写一套促单话术。
我会先停一下。我们还不知道,对方为什么没推进。直接写话术,相当于提前认定“沟通方式”就是原因。
第一步,整理已有记录。把需求、报价范围、沟通节点、客户反馈和后续状态放在一起。只用有权限的材料,先处理敏感信息。没回复的客户,原因就写“未知”,别替他填上“嫌贵”。
让AI在这些材料里找可能的解释,并附上对应记录。比如价格超预算、交付范围不清、决策人未参与。每一种解释都应区分:有直接反馈支持,还是仅仅值得调查。
第二步,挑一个能验证的解释。
假设记录显示,有些客户反复询问交付到底包含什么。我们可以提出一个假设:报价单的范围说明不清,增加了客户决定的难度。
注意,这还没有证明“改报价单就能成交”。我们只找到了一个有材料支持、改动成本较低的方向。
第三步,把假设变成小试验。
暂时保持价格和服务不变,增加交付项、排除项和示例说明。提前确定适用客户、观察周期和跟进方式,由负责人审核后使用。条件允许时保留可比的旧版样本;条件不允许,就承认前后比较可能受到客户构成和时间变化的影响。
先看客户是否更容易理解范围、是否愿意进入下一步,再继续记录成交情况。不能因为“少问了两个问题”,就宣布收入增长。
如果结果不支持这个假设,保留记录,调整判断。不要让AI帮我们补一段“为什么其实已经成功”的解释。

这一轮,AI参与的是材料整理和试验准备。事实核对、客户使用、异常处理和最终判断,都有明确的人负责。
结果可能只是发现“这条路暂时不值得继续”。对于资源有限的小团队,尽早得到这个结果,也有价值。
05|少走弯路,也要有一笔诚实的账
这类尝试怎么判断值不值?我会同时记录两件事:我们知道了什么,以及为此花了多少。
“知道了什么”,可以是某个解释获得更多支持,某种改动没有达到预期,或者材料太少,目前无法判断。未知就保留为未知。
“花了多少”,包括整理、生成、核查、执行和复盘的时间,加上工具费用与试验投入。不能只记AI输出花了几分钟。
这里还有一个容易夸大的地方:一次小试验让你放弃了某个计划,不代表原计划的全部预算都成为了“节省收益”。你并不知道它最终一定会失败,也可能原本就不会把钱全花出去。
可以诚实地写:“投入了这些成本,获得了这些证据,因此暂缓这项投入。”有可核实的实际节省,再算节省。

如果任务发生频率低,材料零散,结果又长期看不出来,搭建一套AI流程未必划算。先做一次人工判断,可能更合适。
同样,生成更多解释也会增加核查负担。让AI先提出少数几种、逐条列证据,通常比堆一长串可能性更便于团队讨论。效果仍然需要在自己的业务里验证。
我更想看到,小团队也能负担得起探索
722篇数学手稿让我产生期待的地方,是AI参与复杂问题探索的可能性。至于这批研究的具体价值,还需要专业检查和后续讨论。
这种期待进入经营,应该落到小一点的地方:一次报价为什么没推进,一个渠道值不值得投入,一种需求有没有值得交付的产品。
不必把每个问题都包装成宏大的战略。把材料弄清楚,提出几种解释,用承担得起的办法检查,再据此做下一步决定,这已经很有用。
我希望AI经营实验室持续做的,就是把这样的过程讲透。既看AI帮上了什么,也看它添了哪些麻烦;既记录结果,也承认还不知道的部分。
比起拿到一份更漂亮的方案,我更关心:我们有没有因此做出一个更有依据的决定。
你现在最想验证的一个经营判断是什么?欢迎留言,把它写成一句“我认为……是因为……” 。
兔八哥 · AI经营实验室把AI用进业务,把效果算清楚。
资料来源与说明(核验于2026年10月7日)
[1] OpenAI官方公告:OpenAI官方公告
[2] OpenAI数学成果仓库:OpenAI数学成果仓库