乐于分享
好东西不私藏

OpenAI秘密代号“Doug”曝光!两年预训练噩梦终结,史上最大底座模型正在狂奔

OpenAI秘密代号“Doug”曝光!两年预训练噩梦终结,史上最大底座模型正在狂奔

一个代号,撕开了硅谷最讳莫如深的伤疤。

过去两年,整个AI圈都在窃窃私语同一件事,OpenAI的预训练,是否跑不动了? 自2024年5月GPT-4o发布以来,这家曾定义"大力出奇迹"的公司,再没有成功部署过一个全新的frontier预训练底座o1靠推理链惊艳世界,GPT-4.5砸下天量算力却反响平平,GPT-5甚至被曝训练算力低于上一代,所有迹象都指向一个令对手窃喜、令投资人不安的结论:OpenAI的"地基",裂了。

然后,“Doug”出现了

▲ 社区流传的原始帖文与幻灯片:OpenAI已克服预训练问题,代号"Doug"的更大模型正在推进

一张幻灯片,炸开一个行业

这条在X上流传的帖子措辞短促,却句句踩在火药上:帖子声称OpenAI已经修好了预训练问题,一个规模远超现有模型的新底座正在训练,内部代号“Doug”。 配图是一张深色背景、白色衬线字体的幻灯片,只有一行要点,像会议室里泄出的最后一页PPT。

发帖者特意强调了为什么这件事重要,过去这些年,OpenAI的巨大进步几乎全部来自强化学习(RL)和后训练如果预训练底座能再次做大,就可能产生乘法效应:更强的地基,叠加已经炉火纯青的RL配方,能力曲线可能再度陡峭到令人窒息。

评论区的反应倒是轻松得多有人玩笑说"内部其实叫Dogue",有人调侃"dougie这名字还不错"。

▲ 有网友调侃:内部其实叫"Dogue",在缺乏官方口径时,代号本身也成了社交货币

但轻松的表皮下,是一条绷了两年的舆论钢缆。

"自GPT-4o以来,没有一次成功的全规模预训练"

要听懂Doug的分量,你得先明白"预训练卡住"这个故事是怎么立起来的

产业分析机构SemiAnalysis在讨论Google TPU与NVIDIA GPU的长文中,写下了一句被全行业反复引用的判断:OpenAI的顶尖研究者自2024年5月GPT-4o以来,尚未完成一次被广泛部署为新frontier模型的成功全规模预训练。

▲ OfficeChai转述SemiAnalysis观点:自GPT-4o以来,OpenAI未完成一次成功的全规模预训练

这句话像一根刺,扎进了所有后续讨论里。OfficeChai转述了这一判断,AIBase进一步概括为"多次尝试扩大参数与数据,因收敛困难或性能退化而中止",Hacker News上开发者们把它和模型知识截止日期等蛛丝马迹放在一起反复咀嚼。

与此同时,Google DeepMind那边高调宣称预训练仍在带来"从没见过的跃迁"。两相对比,"谁还跑得动大预训练"变成了行业地位的象征问题,这场争夺超出了学术讨论,也牵动着千亿美元估值。

GPT-4.5的冷场与GPT-5的"降级":大底座一度成了赔本买卖

故事最尴尬的一章,属于GPT-4.5

这是OpenAI明确定位为"无监督学习范式扩展"的产品,换句话说,就是要证明"把底座做大仍然有用"。结果呢?发布观感偏冷,改进幅度不及预期,很快被更便宜的推理模型比下去,社区甚至出现了"弃用GPT-4.5"的讨论。Bunnyhopping上的深度分析文章《Pre-training isn't dead, it's just resting》指出:GPT-4.5在纯预训练算力的坐标上未必违背扩展趋势,问题在于,同期后训练和推理扩展实在太有效了,"只把底座做大"在性价比上显得无比尴尬。

▲ 深度分析文章认为:预训练没有死,只是在"休息",经济约束暂时压过了科学规律

到了GPT-5,事情更微妙Epoch AI的研究指出:GPT-5很可能是GPT系列中训练算力低于上一代的异类。

▲ Epoch AI:GPT-5训练算力可能低于GPT-4.5,但GPT-6大概率不会

原因并不神秘大约2024年9月前后,推理模型相关的后训练技术让"三倍后训练算力"在某些任务上至少可比肩"三倍预训练",甚至存在一个数量级的预训练成本节省想象空间。既然如此,何必花几个月占满整个集群?在更小的底座上把后训练推到极限,先把产品做出来,这是务实选择,却也让外界愈发确信:OpenAI正在用后训练的"创可贴"掩盖预训练的"骨折"。

一位Transformer之父的加盟,被解读为"预训练已修复"

2026年6月,一则人事变动被社区玩成了行业最大的梗。

Noam Shazeer,Transformer论文共同作者、Google传奇研究员,宣布加入OpenAI。消息一出,独立研究者Nathan Lambert立刻引用其声明,只写了一句:

"OpenAI just fixed their supposed 'scaling pretraining problem'",OpenAI刚刚修好了他们所谓的"扩展预训练问题"。

▲ Nathan Lambert的辛辣点评:把人才争夺与技术标签焊在了一起

这当然是黑色幽默,一个人的加入不等于一个工程问题的解决。但它精准地捕捉到了行业心态:在公开舆论里,"预训练问题"已经成为OpenAI的固有标签,任何风吹草动都会被拿来做注脚。

科学硬核:为什么底座规模仍然关键

Doug传闻的分量,在于最近的研究揭示了一个反直觉的深层机制预训练质量会同时影响模型当前的能力和后续RL的潜力。

arXiv上一篇论文《Understanding Reasoning from Pretraining to Post-Training》,在国际象棋等可控环境中做了预训练与RL的联合算力扫描,拟合出了一条联合扩展定律。Hugging Face的Lewis Tunstall在读书会笔记中总结了三条核心洞见:

▲ Lewis Tunstall介绍预训练-RL联合扩展定律:更强的底座让RL本身扩展得更好

第一,更强的预训练会让RL本身扩展得更好,给定RL预算能达到的性能上限,很大程度由预训练损失决定第二,总预算较低时应把更多算力给预训练;预算升高后,RL的最优占比可从约20%升到近30%。第三,RL更提升"一次答对"的可靠性,对"多候选覆盖"帮助有限。

社区研究者tokenbender把这翻译成了更扎心的工程语言:两个参数量相近、甚至初始基准相近的模型,可能因预训练路径不同而有完全不同的"RL可塑性"。 一个被过度蒸馏、基准分数漂亮的底座,也可能是一片贫瘠的土壤,你往上面浇再多的RL肥料,也长不出参天大树。

▲ tokenbender的论文笔记:预训练质量决定了模型的"RL可塑性",过度蒸馏的底座可能是贫瘠土壤

这就是Doug传闻的戏剧张力所在,如果OpenAI真的训出了一个更健康、更大的预训练底座,那么过去两年在o1、o3等推理模型上积累的所有RL配方,将获得一个全新的、更肥沃的生长基质底座抬升后再叠加后训练,可能形成双重增益。

代号政治:从Spud到Doug,名字背后的命名混乱

但在兴奋之前,有一个前车之鉴值得所有人冷静三秒。

2026年上半年,社区曾长期把代号Spud的预训练底座当作"准GPT-6"来期待。结果它以GPT-5.5的名义发布,Sam Altman此前放在"GPT-6讨论框架"里的记忆、个性化等能力,被拆散塞进了5.x产品线。外界解读永远比内部路线图噪声更大。

Doug可能重演同样的剧本:它也许只是内部项目名、数据配比实验的代号,甚至只是某张幻灯片上的概括词。把一个泄漏代号等同于产品发布时间表,证据远远不够。

更稳妥的阅读方式:Doug仍待证实,大预训练是否回归

让我们把镜头拉远

OpenAI研究员、Transformer共同作者之一Łukasz Kaiser在访谈中给出过一个更内部的判断:扩大预训练仍能提升模型,但已处在S曲线顶部;出于经济约束,公司转向更高效的模型;GPT-4时期算力几乎全给训练,ChatGPT爆火后大量GPU转向推理服务;2026年会有更多GPU上线

▲ Łukasz Kaiser访谈要点摘要:预训练在S曲线顶部,但"there is no wall",没有墙

他的结论被摘要者浓缩为四个字:there is no wall,没有墙。

Epoch AI的前瞻也指向同一方向:当后训练的边际收益开始回落、而GPU供给继续扩张时,训练总算力的增长将重新向"更大的最终训练运行"回归。他们预期后续旗舰,无论叫GPT-6还是别的什么,很可能比GPT-5、甚至比GPT-4.5吃掉更多训练算力

Doug传闻值得认真对待,因为它提出了一个关键问题:整个行业是否正在经历从"后训练独大"到"双轮驱动"的范式回摆。

2022到2023年,预训练规模是主旋律,ChatGPT的RLHF证明后训练能改变产品形态。2024到2025年,推理模型与RL成为新主轴,预训练被宣判"死亡"。而2026年的传闻场里,有人重新喊出了大底座回来了

这轮变化源于算力账单逼出来的路径切换智能的生产函数有多个自变量,短暂优化其中一个,不代表其他变量被物理删除。预训练从来没有"死",它只是在经济学的暴风雪里冬眠了一阵。

而现在,可能有人正在试着把它叫醒