夜雨聆风学习资料网

ARTICLE · 1122673

OpenAI 研究加速:内部编码代理使用数据

OpenAI 研究加速:内部编码代理使用数据

内部编码代理开支曲线 + RSI 日

9 月 6 日,OpenAI 在自家网站上挂出一份报告,标题叫《Research acceleration: The view inside OpenAI》。报告不长,配图也不多,但有一张折线图被独立博客作者 Simon Willison 单拎出来讨论——它把"一名研究员每天在 AI 上的美元开销"画成了一条时间序列:

  • 2026 年 2 月:接近 0
  • 4 月:约 50 美元
  • 6 月:约 150 美元
  • 7 月:150–165 美元
  • 7 月底到 8 月:陡升到约 600 美元

四个多月,涨了十几倍。这条曲线是这篇文章想聊的对象——不是为了渲染"AI 多烧钱",而是去问一句:它到底在记录什么。

报告里说了什么

这份报告的角度和外界通常看到的 OpenAI 发布不一样。它不在讲模型,而是在讲"OpenAI 自己的研究员怎么用模型"。

报告里有几个要点。研究员整日都在用编码代理,而且常常是并发多会话——一个研究员一天里挂着几个任务,让 A 跑实验、让 B 写工具、让 C 改 bug,这种"并行分身"的工作方式被反复提到。总用量在加速增长,而且增速超出了 OpenAI 其他团队。换句话说,这条曲线不只是"全员都在涨",研究这条线涨得最猛。研究者写代码更快、跑的实验更多、能接手的任务也越复杂;代理的成功率比早期显著提升,能完成的任务类型在扩展。

听起来像在吹自己?但报告里还有一句话几乎被略过:"AI 研究是多瓶颈复杂过程,整体进展速度可能跟不上这些指标。"

这一句才是关键。报告自己承认:研究员跑得快,不等于研究跑得快。

那条曲线怎么读

0 → 50 → 150 → 600 这条曲线,配合时间点一起看,是有意思的。

2 月到 4 月从 0 跳到 50,是研究员把编码代理接进日常工作流的过程——试用、磨合、铺开。4 月到 6 月从 50 涨到 150,可以理解为覆盖率和并发数都在提升,研究员开始真的把任务甩给代理。7 月到 7 月底的 150 → 600 这一截,是 Simon Willison 在 9 月 6 日的解读里特别标注的拐点。他推测这个跃迁对应"OpenAI 内部开始使用后来作为 GPT-6 Astra 发布的模型"。

这里要提醒一句:这是 Simon 的推断,不是 OpenAI 在报告里明说的。报告并没有点名某次模型升级与曲线的对应关系。"拐点对得上某次模型发布",目前还只是合理猜测,而不是已确认的事实。

这条曲线还有一个容易忽略的细节:纵轴是"美元",不是 tokens 也不是调用次数。这意味着它把模型升级、并发数提升、任务变复杂这几件事,全部压成了一个数字。600 美元这个位置,是"用得更狠 + 模型更贵 + 任务更重"合在一起的乘积,不是单一变量的曲线。

OpenAI 在报告里还提到了一个内部测量的难题:研究者贡献的代码量是容易统计的,但它和研究进展之间的关系并不确定;任务成功率这类更可能反映进展的指标,反而难定义、难稳定测量。所以这份报告给出的"加速",到底在测什么,本身就还在被 OpenAI 自己讨论。

RSI 日与一份内部叙事

Simon Willison 把 9 月 6 日称作"RSI 日"——因为 OpenAI 当天发了两篇东西,一篇是《An Alien Mind》,一篇就是这份《Research acceleration》,两篇都提到了 RSI(Recursive Self-Improvement,递归自我改进)。

RSI 这个提法最近在 OpenAI 内部被反复使用,作为对 AGI 的一种新表述。它比"通用人工智能"那种宽泛词要具体,比"超级智能"那种科幻词要收敛。在 9 月 6 日这天,OpenAI 同时讲"模型在自我改进"和"我们的研究员在用模型加速",两条线拼在一起,就是他们想对外讲的故事:研究循环在变快。

但需要直接说出来的是——这份数据是 OpenAI 自报。样本范围——是全公司研究员、是某个团队、还是某种抽样——没有披露;测算口径——是 API 账单、是内部成本核算、还是包含 GPU 分时摊销——同样没有披露。任何把"600 美元"直接理解成"OpenAI 研究进展速度"的读法,都越过了 OpenAI 自己在报告里画的那条线。

这条曲线的真正问题

600 美元不是终点,也不是答案。它更像是一份压力测试——当一家公司把"研究员每天花多少美元在 AI 上"这种数据公开,意味着它愿意让外界用这个口径来衡量自己。

但这个口径有它先天的窄。

AI 研究是 Simon 在另一篇里也提到、OpenAI 报告自己也承认的"多瓶颈"过程。算力、数据、问题定义、想法、评估方法、人才密度、协作流程——每一项都可能卡住一项研究的进展。研究员跑得更快,能撬动其中一部分瓶颈,但撬不动另外几个。把"代理使用量"和"研究进展"画等号,是过去两年最常见的误读之一。

更稳的判断也许是:这条曲线告诉我们,OpenAI 内部在工具层面完成了一次深刻迁移——研究员的工作方式已经被重塑。Simon 自己在博客里也强调,这并不意味着研究突破的速度已经被外推出去。他更像是在提示:曲线本身值得看,但不要忘了它测的是"使用量",不是"成果"。

另一个值得记下来的背景是,这次发布不是孤立的。同一周,OpenAI 的研究员还出现在公开访谈和工程博客里,反复讲"代理写代码、代理跑实验、代理读论文"这种已经在内部常态化的流程。600 美元一天是其中一个数字切片,但切片背后的日常是——研究员的工作表里大部分时间,旁边的 AI 都在跑东西。这和一年前 OpenAI 内部流传的"我们不用 AI 写我们自己的研究代码"那种氛围,已经不是同一个世界。

我们能确认的是两件事:从 2 月到 8 月,OpenAI 研究员的 AI 日开销涨了十几倍;从 9 月 6 日起,OpenAI 愿意把这个数字公开。这两件事都已经发生。

至于"加速"是否等于"接近 AGI"——那是另一篇文章该回答的问题。

相关学习资料