乐于分享
好东西不私藏

OpenAI秘密代号“Doug”曝光!预训练困局两年后突然破解,AI军备竞赛最大变量来了

OpenAI秘密代号“Doug”曝光!预训练困局两年后突然破解,AI军备竞赛最大变量来了

8月7日深夜,X用户Haider发布了一张深色背景的幻灯片截图,声称:OpenAI已经克服了预训练瓶颈,一个代号为“Doug”的更大模型正在推进中。 这条消息并非来自OpenAI官方或华尔街分析师。

▲ 引发讨论的原帖,配图以幻灯片形式列出核心传闻

看上去像一条普通的科技八卦对吧?但如果你理解过去两年围绕OpenAI预训练问题的那场旷日持久的暗战,你就知道,这个代号背后,可能藏着AI竞赛中最大的一次变量翻转。

两年悬案:OpenAI的预训练,到底"卡"了没有?

要听懂这个故事,得先搞清一个基础问题:大模型是怎么"长大"的?

简单来说,分四步第一步叫预训练,把互联网上的海量文本、代码喂给模型做"下一个词预测",让它学会语言结构和世界知识,产出一个什么都懂一点、但什么都不太听话的"毛坯房"。第二步是后训练,通过人类反馈、强化学习等手段把毛坯精装修成产品。第三步第四步涉及推理时多想一会儿、工具调用等等,暂且不表。

关键在于:过去两年,行业里最刺激的进步几乎全部来自第二步。 o1的长思维链、o3的推理突破,都是后训练和测试时计算的功劳。预训练呢?从GPT-4到GPT-4o再到GPT-4.5,用户的直观感受是:聪明是聪明了一点,但再没有ChatGPT刚出来时那种"天塌了"的震撼。

于是,一个危险的判断开始在社区出现,"预训练到头了。"

这个判断的重要来源是半导体研究机构SemiAnalysis他们在一篇关于Google TPU竞争力的长文中声称:OpenAI的顶尖研究者自2024年5月GPT-4o发布以来,尚未完成一次被广泛部署为新一代前沿模型的成功全规模预训练。

▲ 科技媒体OfficeChai转述SemiAnalysis的判断

这句话经OfficeChai、AIBase等媒体转载,经Hacker News讨论放大,迅速成为AI圈的一个"共识性焦虑",全世界最有钱、最有人才的AI公司,居然有可能在最基础的预训练上卡壳了?

但反驳的声音同样尖锐有评论者指出:GPT-4.5本身就是一次大规模新训练,只是没有全量推给所有用户、更多用作高阶服务和蒸馏的教师模型。"没部署给最广泛用户"和"没成功预训练",是两码事。

现有证据支持一个更微妙的解释

钱花到哪儿了:为什么GPT-5反而更"省"

如果只看一篇文章来理解这两年发生了什么,我推荐Epoch AI在2025年9月的那篇分析:《为什么GPT-5的训练算力比GPT-4.5还少(但GPT-6可能不会)》

▲ Epoch AI的算力分析文章,标题本身就是一个故事

Epoch认为,预训练依然有效,只是后训练的回报太诱人。 当你发现三倍后训练算力的收益,可以媲美甚至超过三倍预训练算力的效果,任何一个理性的产品团队都会选择把预算挪到回报更高的地方。所以GPT-5看起来"更小",源于他们选择在一个相对较小的底座上,把后训练推到了极限

这就像一个厨师发现,先把调味和烹饪技法练到极致,带来的回报远高于花十倍价钱升级食材。食材依然管用,厨艺的性价比却高得多。

但Epoch同时做出了一个意味深长的预测:当后训练的边际收益开始递减,行业将不得不回到"更大预训练"的老路上。 下一代旗舰模型,很可能重新吃掉比GPT-4.5更多的训练算力。

这个预测,与Doug传闻的逻辑,完美吻合

"修好了":一句玩笑,两层真意

有趣的是,在Doug传闻出现前七周,社区里已经响过一次"预训练修好了"的号角。

2026年6月18日,Noam Shazeer,Transformer论文的核心作者之一、稀疏专家模型的关键推动者,宣布加盟OpenAI。研究者Nathan Lambert随即评论:"OpenAI just fixed their supposed 'scaling pretraining problem'."

▲ Lambert以半开玩笑的口吻宣告"预训练问题修好了"

这当然是玩笑但玩笑里藏着真意:当你挖到了这个星球上最懂预训练扩展的人之一,你的扩展问题至少在人才维度上,确实"修好了"一半。

而到了7月,OpenAI工业算力负责人Sachin Katti在公开场合正面回应了"预训练放缓"的说法,原话掷地有声,"There is a perception that maybe pre-training has slowed down. That's not true."扩展定律在多个维度仍然成立,需要继续扩展训练算力。

▲ Katti公开否认预训练已经放缓

两位高层、两个时间点、同一个信号,OpenAI在预训练方向上,正在重新踩油门。

Astra浮出水面:Doug的兄弟,还是Doug本人?

就在Doug传闻发酵前几天,OpenAI员工侧公开了另一个名字:Astra

Noam Brown等人透露,Astra的一个内部版本已经在量子复杂性、理论计算机科学和纯数学等方向上解决了多项长期悬而未决的开放问题。

▲ OpenAI研究者公开Astra在科学推理方面的突破性进展

这里有一个所有人都想问但没人能确认的问题:Astra和Doug是否属于同一个项目?

目前的公开材料里,没有任何交叉指认Astra是员工在公开渠道使用的名字,Doug则来自一条未经证实的传闻。它们可能是同一计划的不同代号,可能是不同规模的不同项目,也可能一个是真的一个是讹传。

但有一点可以确定:OpenAI确实在推进"下一主系列"模型,而且这个系列在科学推理上已经展现出惊人的能力。

big deal:双引擎同时点火

让我们回到最初那个问题,为什么一个二手传闻能让人如此兴奋?

因为它指向了一个此前被认为不太可能的场景:预训练扩展和后训练强化,同时踩下油门。

过去两年的故事,本质上是一个此消彼长的故事,后训练越来越甜,预训练被暂时搁置。但如果OpenAI真的重新打通了预训练的管线,那意味着什么?

想象一下:一个更大、更强的毛坯房,叠加上已经验证过的o系列推理配方、强化学习后训练、测试时计算,效果会形成乘数叠加,两个乘数同时变大

Ethan Mollick在评论其他实验室时说过一句意味深长的话:Meta的Llama 4、xAI的Grok 4都掉进了"令人失望的下一代巨型模型陷阱",唯一没有在这个陷阱里严重受伤的,是OpenAI的Orion/GPT-4.5

▲ Mollick指出:只有OpenAI相对躲开了"巨型模型失望陷阱"

这句话的潜台词很重:更大的模型可以做,但风险极高。 GPT-4.5训练播客里那些细节,两年规划周期、torch.sum的bug污染了40%的训练行程、数据可用性比算力更成瓶颈,每一条都在说:大规模预训练如同在刀尖上跳芭蕾,远非拧开水龙头加水那么简单。

▲ GPT-4.5预训练过程中的工程挑战清单,每一条都触目惊心

所以,"修好预训练"更可能来自一整套系统工程能力的成熟,数据中心的并行策略、万卡集群的故障率控制、数据管线的质量保障,全部被压到了可完工、可上线的水平。

最后一个问题:我们该信几分?

说到底,Doug目前仍然只是一个未经证实的代号发布者是个人账号,配图是幻灯片截图,互动量很低,尚无主流媒体交叉核实或OpenAI官方确认。

在AI行业的八卦史上,这种模式太常见了,从"草莓"到"猎户座",几乎每个后来成真的代号,最初都是以这种"看起来不太靠谱"的姿态出场的。 当然,也有无数代号最终证明只是噪音。

但有一件事是确定的:无论这个模型叫Doug、Dogue还是Dougie,无论它和Astra是什么关系,OpenAI正在重新瞄准预训练扩展这条赛道。 从人才引进到高管表态,从Epoch的算力预测到员工侧的科研突破,所有信号都指向同一个方向。

AI军备竞赛的下半场,可能迎来预训练扩展和后训练强化并行推进的新阶段。

而当世界上最擅长后训练的公司重新拿起预训练这把旧武器时,所有人都该重新算算,自己手里的牌还够不够打。