一个代号,像一颗石子扔进了深水区
2026年夏天,一条看似不起眼的X帖子在AI圈迅速发酵,有人声称,OpenAI已经克服了困扰自身长达两年的预训练瓶颈,一个规模远超现有模型的新底座正在训练中。它的内部代号,叫Doug


▲ 入口帖截图:发帖者称OpenAI已修复预训练问题,代号Doug的更大模型正在推进中
公开材料里既看不到白皮书和模型卡,也找不到可以追溯的官方出处。发帖者只附了一张深色背景、白色衬线字的幻灯片式配图,上面孤零零写着:OpenAI has overcome their pre-training issues, and a much larger model code named "Doug" is actively in the works.
这条短短的消息,戳到了整个行业过去两年最敏感的那根神经。
两年了,OpenAI的"大底座"去哪了?
要理解Doug为什么炸锅,你得先知道一件被行业反复咀嚼、却始终没有盖棺定论的事:自2024年5月GPT-4o发布以来,OpenAI可能从未成功完成过一次全新的、被部署为前沿产品的大规模预训练。
这个判断最初来自产业分析机构SemiAnalysis。他们在一篇讨论Google TPU与NVIDIA GPU的硬件长文中,把"能否跑通前沿预训练"写成了芯片平台的毕业考试,然后话锋一转,OpenAI的顶尖研究者,已经有相当长一段时间没通过这场考试了。
OfficeChai等媒体迅速跟进转述,AIBase的表述更尖锐:多次尝试扩大参数与数据规模,但因收敛困难或性能退化而中止。 Hacker News上的开发者们,甚至开始拿模型知识截止日期当佐证,"你看,它知道的事情就停在那个时间点,说明底座确实没更新过。"

▲ OfficeChai的转述文章标题直指核心:OpenAI自GPT-4o以来未完成成功的全规模预训练
与此同时,Google DeepMind那边正在高调宣传Gemini的代际跃迁,"从没见过这样的飞跃"。两相对照,"谁还跑得动大预训练" 变成了行业地位的象征问题。而OpenAI,一度成了被质疑的那一个。
预训练只是"睡着了"
但故事没这么简单
如果你只看这两年OpenAI发布的东西,o1、o3、GPT-4o mini、GPT-5,你会发现一个诡异的现象:模型在变强,但底座在变"小"。
这背后藏着一场静悄悄的路线切换科普一句:训练一个大模型,通常分预训练(砸钱砸数据打地基)和后训练(用强化学习、人类反馈来"塑形")两步。过去两年的魔法,几乎全来自第二步
Epoch AI的分析认为:GPT-5很可能是GPT系列中训练算力低于上一代GPT-4.5的异类。 后训练诱人的投入产出比,让大底座暂时退到了次要位置。

▲ Epoch AI指出GPT-5训练算力可能低于GPT-4.5,OpenAI选择在更小底座上把后训练推到极限
Philipp Schmid在2024年就转述过一个惊人数字:RL加数据,在某些场景下可以替代大约30倍的预训练算力。 Epoch的研究给出更保守的区间,5到30倍。这样的效率,让公司可以在一个"够用"的底座上借助精巧的后训练配方榨出接近的能力,省去耗时数月的巨型预训练。

▲ Philipp Schmid引用OpenAI与Epoch的研究:RL+数据可替代5-30倍预训练算力
于是整个行业陷入了一种集体催眠:预训练死了,后训练万岁。
OpenAI研究员、Transformer论文共同作者Łukasz Kaiser在一次访谈中给出了更内部的视角:扩大预训练仍能提升模型,但已处在S曲线顶部;出于经济约束,公司转向更高效的路线;GPT-4时期算力几乎全给训练,ChatGPT爆火后大量GPU转向推理服务。但他的结论是,there is no wall,没有墙。


▲ Dan McAteer摘录Kaiser访谈要点:预训练处于S曲线顶部,但"没有墙";2026年更多算力将上线
Bunnyhopping上的深度分析文更是直接把标题写成了一句英式冷幽默:Pre-training isn't dead, it's just resting,预训练没死,只是在打盹。
为什么"醒过来"会成为大事
现在你知道了背景,再来看Doug这个代号的分量。
单说"OpenAI要训一个更大的模型",并不稀奇。戏剧性来自一个乘法公式:如果底座变大,而过去两年积累的RL和后训练配方仍然有效,两者叠加的效果可能远超一次简单升级。
2026年7月发表在arXiv的一篇研究(arXiv:2607.16097)为这个判断提供了实验依据。研究者在国际象棋等可控环境中做了系统性实验,拟合出预训练与RL的联合扩展定律。核心发现让人倒吸一口凉气:
更强的预训练底座,会让RL本身扩展得更好。 给定RL预算能达到的性能上限,很大程度由预训练质量决定。


▲ Hugging Face研究者Lewis Tunstall解读联合扩展定律:预训练质量决定了RL的天花板
社区研究者tokenbender把这翻译成了更扎心的话:一个被过度蒸馏、过度刷榜的模型,可能看起来很强,却是贫瘠的土壤,在下一轮RL中长不出新能力。 他提出了一个概念叫"未来可学习性",我们通常只比较模型现在多强,但也许更该问:它还能变多强?


▲ tokenbender的论文笔记强调:参数量相近的模型可能有完全不同的"RL可塑性"
Doug最诱人的地方就在这里过去两年,OpenAI因后训练和推理扩展受到称赞,底座停滞也招来质疑。如果底座重新开始生长,那些已经被验证有效的RL配方将站在一个更高的起跑线上,能力曲线可能随之陡峭上扬。
代号的魔咒:Spud教过我们的一课
但请先别急着兴奋
2026年上半年,社区曾长期追踪另一个代号,Spud。所有人都以为它就是GPT-6,是那个"全新的、史诗级的大底座"。结果呢?它以GPT-5.5的名义发布了那些被Sam Altman放进"GPT-6"营销口径里的酷炫能力,记忆、个性化,有一部分先塞进了5.x产品线。
Doug可能重演同样的剧本它也许只是内部某个项目的名字、某次数据配比实验的代号,甚至只是那张幻灯片作者的概括用语。评论区的画风也说明了一切,有人调侃"内部其实叫Dogue",有人说"dougie这名字挺好听"。几乎没有人在认真做技术质询

▲ 评论区画风:有人玩笑称内部其实叫"Dogue",信息增量约等于零
暗流:人才布局已经在"剧透"
不过,还有一条比代号本身更关键的线索。
2026年6月,Noam Shazeer,Transformer论文共同作者、Google传奇研究员,宣布加入OpenAI。独立研究者Nathan Lambert转发时只留下一句简短评论,语气像是在讲一个全行业都心知肚明的冷笑话:
"OpenAI just fixed their supposed 'scaling pretraining problem'."

▲ Nathan Lambert引用Noam Shazeer加盟消息,借一句调侃说明"预训练问题"已成行业梗
这当然是黑色幽默但挖一个大规模预训练领域的顶级专家,在一家被质疑"跑不动大预训练"的公司,这件事本身就是一种信号,你不会为一个已经放弃的方向去抢人。
如果Doug是真的,棋盘怎么变?
让我们做一个思想实验
第一,推理成本可能大幅下降 今天的推理模型之所以贵,是因为它往往要展开漫长的"思考链",底座不够聪明,就得靠多想来补。一个更强的底座,可能用更短的思考就达到同等质量。这关系到每一个API调用背后的美元成本。
第二,竞争格局会被重新洗牌 SemiAnalysis一类机构早就把"能否完成前沿预训练"写成了组织能力的试金石。如果OpenAI拿出一个令人信服的新底座,"后训练公司"的帽子就会被一把摘掉。
第三,也是最让人不安的一点: 如果联合扩展定律成立,那些在现有底座上已经展现出强大RL能力的团队,一旦拿到更大的底座,能力曲线可能再次陡峭化。眼前看似进入了"渐进改良"时代,或许仍是暴风雨前的宁静。
但所有这些,前提都是"如果" 截至目前,OpenAI既未确认Doug的存在,也未发布任何"预训练瓶颈已修复"的正式声明。
最后一件事
每一次行业宣布某条扩展轴"已死"的时候,后来总会有人把它挖出来。2010年代深度学习早期,人们说数据会撞墙;大模型时代初期,说人类文本会耗尽;2024到2025年,说预训练到顶了。
每一次"死亡",后来都只是在打盹
Doug也许只是打盹者翻了个身时发出的声响。但在这个行业里,光是翻身的声音,就已经足够让所有人屏住呼吸了。
夜雨聆风