

一个叫Doug的东西,正在让整个AI圈失眠。
它既非神话或天文术语,也谈不上酷炫:就叫Doug,一个你在美国加油站收银台后也可能遇到的平常名字。可它在2026年8月的第二个周末,却搅动了整个AI社区。
核心爆料只有一行,来自半导体与AI算力领域研究机构SemiAnalysis:
"OpenAI has overcome their pre-training issues, and a much larger model code named 'Doug' is actively in the works."
翻译过来:OpenAI解决了困扰他们许久的预训练难题,一个规模远超以往、代号“Doug”的模型正在紧锣密鼓地推进。
这行话未提参数量、上线日期或产品画面,释放的信息却足以改写许多人对2026年下半年AI竞争格局的预判。

▲ SemiAnalysis 8月7日公开长文中引用的7月9日机构备忘录,黄色高亮处是Doug关键原句
备忘录出现后的四十八小时
故事要从预训练这个词说起
如果把大模型比作一个人,预训练就是“读万卷书”,用海量数据把底子打厚。而后训练(微调、RLHF、推理强化)则是“行万里路”,让模型学会听话、学会思考、学会安全地回答问题。过去两年,OpenAI在"行万里路"上大放异彩,o系列推理模型惊艳全场;但在"读万卷书"这件事上,外界一直有个挥之不去的疑虑:自GPT-4o之后,他们还能不能稳稳当当地完成一次全新的、更大规模的底座训练?
代号Orion的那次尝试,被业内广泛视为昂贵但收效不匹配的教训。后来的Spud扳回一城,成了GPT-5.5的底座。但"预训练引擎是否修好了",始终是悬在OpenAI头上的达摩克利斯之剑。
所以,当SemiAnalysis在一篇讨论Google DeepMind人才流失的长文中,以旁注的姿态轻轻丢出那行"预训练问题已克服+更大模型Doug正在推进"时,社区很快把它读成了一个信号:那把悬着的剑,似乎终于被摘下来了。

▲ SemiAnalysis文章《Gemini is Cooked but GCP is Cooking》,Doug只是一篇万字长文中的一句旁注,却成了全文最大的新闻
谁先喊的?谁更正了?谁在添油加醋?
8月8日,X平台上的AI情报账号@ChrisGPT率先发帖:GPT-5.5不会是OpenAI最后一次重大预训练;年底将有一次史上最大规模的预训练,代号Doug;它将让Anthropic的Fable 5看起来像个原始人。

▲ @ChrisGPT 的首帖,其中声称新模型将让Fable显得“原始”
这条帖子很快引来大量讨论不到48小时,ChrisGPT自己发了更正帖。

▲ 与SemiAnalysis和Cerebras人士交流后,ChrisGPT修正了自己的说法
更正的核心信息是:Doug可能只是Astra预训练阶段的内部代号,而Astra才是面向用户的模型/家族名。 他还说,自己六月以来一直提到的那个"年底怪兽级预训练",发生在Doug之后。
换言之,Doug可能还没走到这条训练线的尽头。Doug后面,可能还有一个更大的
与此同时,另一个信息密度极高的账号@iruletheworldmo给出了迄今最详细的非官方"路线图":Spud对应5万亿token的Sol家族,Doug对应10万亿token的Astra,后面还有一个15万亿token级别的Dougtrio。他声称OpenAI为了推进这三条并行训练线,甚至砍掉了Sora等项目的资源。

▲ @iruletheworldmo 给出的Spud/Doug/Dougtrio三级结构图,信息密度极高但仍属非官方来源
于是,公共讨论中同时漂浮着至少三种互不兼容的读法:Doug是年底的超级大模型;Doug只是Astra预训练的代号;Doug之后还有更大的每一种都有人信誓旦旦,每一种都没有OpenAI官方盖章。
唯一的硬锚点:Astra
在这场代号狂欢中,OpenAI官方自始至终只说了一个名字:Astra。
8月1日,OpenAI发了一篇极为硬核的研究帖,他们用Astra的内部版本,解决了十个长期悬而未决的数学与理论计算机科学问题,并用Lean写出了形式化证明。搜索这些解的token成本?大约2000美元
8月7日,更重磅的信号来了OpenAI发布安全评估说明,称对Astra的内部测试显示,在智能体编程与网络安全领域,"不能排除"其已达到《准备框架》中网络安全能力的Critical级别,这是此前任何已部署模型都未触及的阈值。

▲ OpenAI官方账号关于Astra安全评估的声明,"Critical"一词的分量不言而喻
这个发布策略颇有特点:OpenAI跳过传统发布会和价目表,用"解了十道数学难题"与"安全等级可能破表"让Astra以能力展示+风险分级的姿态进入公众视野。 这既是秀肌肉,也是打预防针
那些有趣的灵魂
当然,比路线图更抓人的,永远是人
有人在评论区怒吼:"Astra与GPT-6不能直接画等号!别发错误信息!" 因为GPT-5.5的前身Spud曾一度被社区期待成GPT-6,结果以更低的编号落地,这让"编号进步主义者"们至今心有余悸。
有人哲学发问:"为什么不能叫个酷一点的名字,比如Phoenix?为什么非得是Doug?"

▲ 灵魂拷问:为什么不叫Phoenix,为什么必须是Doug
还有人留下这句评论:"If it can't do the Dougie it's not AGI."(不会跳Dougie舞的就不算通用人工智能。)

▲ 社区从不缺幽默,AGI的终极测试原来是街舞
而冷静派的声音同样值得记录博主@SulkaMike发了一条长帖,核心论点朴素得令人清醒:"我们本就应该默认OpenAI一直在训练下一个模型吧?"

▲ @SulkaMike 的冷水:Astra都还没到手,我们就已经在聊它后面的东西了
烟雾里永远有一个更大的名字
让我们把镜头拉远
前沿实验室通常会并行工作 ChrisGPT更正帖中透露的"5至7月存在多轮重叠预训练,甚至在GPT-5.6发布前就已有模型就绪",揭示的正是这种工业现实。只盯着"发布日"这一条时间轴,容易让人觉得"Astra还没到手怎么又冒出Doug"不可思议;改用训练管线作为时间轴,"烟雾里永远有一个更大的名字"反而很常见。
而Doug泄露的信息量,关键落在底座上。
过去两年,行业一度流行一种论调:预训练撞墙了,堆数据堆参数的老路走到头了,未来是后训练和推理扩展的天下。OpenAI自己的表现似乎也在印证这一点,o系列模型靠"多想一会儿"换来的能力跃迁,远比换底座来得立竿见影。但SemiAnalysis那句话背后的潜台词是:底座引擎从未熄火,它只是在维修。现在修好了
如果预训练扩展与后训练强化这两台引擎真的同时重新点燃,那2026年下半年的AI竞争格局,可能比任何人预想的都要剧烈。

▲ 社区声音:如果OpenAI真的修好了所有问题,并在大多数基准上超过Fable 5,那将是一次令人震惊的回归
写在最后:你该相信多少?
让我们诚实地排列一下信息的可靠度:
第一梯队:OpenAI官方博客白纸黑字写的"Astra",以及它解了什么题、触发了什么安全阈值。这是硬事实
第二梯队:SemiAnalysis公开发文中可直接核对的Doug原句。这是署名机构的判断,有声誉背书,但仍是一句旁注。
第三梯队:高互动知情向账号的帖文,尤其要注意,连发帖者自己都在48小时内做了实质性更正。
第四梯队:5T/10T/15T的参数传闻、"跑在Vera Rubin上"的硬件猜测、"十一月上线"的时间表。这些目前全部属于社区猜测,尚无实测基准支撑。
机构备忘录里的一行表述,经过一两个高互动账号的加工,48小时内就能长出完整的"路线图图解"。 信息转述时可能丢失限定词,"as far as I know"消失了,"actively in the works"变成了"已启动","codename for pretraining"变成了"下一代产品"。
但话说回来,烟雾之所以让人兴奋,是因为它意味着火已经点着了。
至于那把火烧出来的东西,是叫Doug、叫Astra、还是叫一个我们现在根本猜不到的名字,也许根本不重要。重要的是,那台沉寂了太久的底座引擎,似乎真的重新轰鸣起来了。

夜雨聆风