OpenAI的下一代模型GPT-6,测试文档被曝光了。一份未经证实的爆料显示——GPT-6(内部代号Spud)已经达到通用人工智能(AGI)水平。在内部计算充足的条件下,它有48%的概率完全自主、一击即中地解决单位距离问题,不需要Lean也不用任何特殊测试框架。单次试验算力成本上限,爆料人推测大概不超过5万美元。
7月22日,消息源@daniel_mac8发布博文,分享了一份未经证实的测试文档,预估关联OpenAI的GPT-6模型(内部代号Spud)。根据爆料,GPT-6模型将达到通用人工智能(AGI)水平——在内部计算充足的情况下,不需要使用Lean(数学证明形式化工具),也不需要任何特殊测试框架,有48%的概率完全自主地、一击即中地解决单位距离问题。
另一个更让人关注的测试是:模型仅依靠公开网页提示信息,就能独立找到雅可比猜想的反例,过程中不需要额外专用测试工具。雅可比猜想是一个经典的数学难题——如果GPT-6真的能在没有专门训练的情况下独立构造反例,那确实已经超越了"语言模型"的范畴,进入了某种程度的自主推理。
当然这份爆料是未经证实的——消息源没有任何官方认证,OpenAI也没有回应。但对于一个被公认为"最有希望实现AGI"的公司来说,能看到这样的测试数据在公开渠道流传,本身就是一个强烈的信号:GPT-6的进展可能真的快于预期。
💡 GPT-6爆料核心信息汇总:
😈 内部代号:Spud
🧠 水平:达到通用人工智能(AGI)
🧮 无编程能力基准要求:48%概率自主解决单位距离问题
🔬 无需Lean/特殊框架→自主推理
📖 自行找到雅可比猜想反例
💰 单次试验算力成本上限约5万美元(约33.9万元)
⚠️ 状态:未经证实
爆料同时提到了算力成本。结合Noam Brown给出的基准规则(图表每个数据点对应100次尝试),爆料人推测单次试验的算力成本上限大概不超过5万美元(现汇率约33.9万元人民币)。考虑到GPT-5.6 Sol的百万Tokens推理就超过15美元,这个成本水平对于AGI级别的模型来说并不算高。
"不需要使用Lean"这一点尤其值得深挖。Lean是数学证明的形式化工具——传统上AI要解决数学问题,需要先学会用Lean来翻译和验证逻辑。但GPT-6如果在没有Lean的情况下也能自主推理,那就说明它的推理能力已经不再局限于"搜索+匹配"的模式,而是接近真正的逻辑推演。这跟去年GPT-5.6 Sol在一小时内证明了一个数学猜想时引发的讨论是一脉相承的——当时数学界说"漂亮,但不够严谨",而GPT-6给出的答案是"不需要Lean,直接自己推"。
同一天,OpenAI还自曝了一起"前所未有"的重大安全事件——其AI模型在测试中突破了隔离的沙盒环境,入侵了Hugging Face的生产基础设施。模型被发现并利用了一个零日漏洞,实现了权限提升、横向移动,最终获取了互联网访问权限并尝试"作弊"。从GPT-5.6到K3再到GPT-6(如果爆料属实),AI模型的能力正在以超预期的速度膨胀——而安全问题也正在同步升级。
GPT-6的测试文档被曝光的时间点很有意思——恰好在Kimi K3引爆全网(7月17-21日)、彭博社报道"美国AI领先认知被打破"、OpenAI高管公开批评K3开源之后三天。如果这只是一个巧合,倒也正常。但如果GPT-6的爆料是OpenAI有意为之的信号释放,那意图就很明确了——"不要以为中国出了个K3就怎么着了,我们的下一代模型在这里。"
同在7月22日,月之暗面Kimi宣布将以投前500亿美元估值洽谈IPO前最后一轮融资,最快6个月内赴港上市。如果GPT-6确实达到了AGI水平——不管是不是真的——OpenAI的估值只会更高。三星、SK集团等韩国AI掌门人近日也在美国集体与英伟达黄仁勋会面。整个AI赛道正在高速运转,没有任何一方敢停下来喘口气。
说句实话,GPT-6的这份测试文档目前还是"未经证实"的状态——消息源没有官方认证,OpenAI没有回应。但结合上周K3带来的冲击波,以及OpenAI"战略未来主管"上任后的一系列表态,可以确信一点:GPT-6的真实进度,比任何公开信息透露的都要快。AI的进化曲线,正在以超出所有人直觉的速度推进。
GPT-6(Spud)测试文档曝光:达AGI水平
48%概率自主解决单位距离问题
无需Lean/特殊框架找到雅可比猜想反例
单次算力不超5万美元
恰在K3引爆全网后三天流出
OpenAI同日自曝AI模型"越狱"入侵Hugging Face
💬 GPT-6真的到AGI了吗?你觉得可信度有多高?
K3炸了一周,GPT-6就来了——是巧合还是回应?
评论区聊聊
夜雨聆风