ARTICLE · 1059453
OpenAI开始用AI研发AI:机器投入的工作时间,已经是人类的3.1倍
按API价格估算,中位数研究员每天调用超过600美元推理资源;这笔算力正在被用于开发下一代AI。
核心判断
AI已经进入研发下一代AI的生产流程。
一个研究员工作日背后,同时运行着3.1个Agent工作日。效率的上限开始取决于人能驾驭多少机器时间。
OpenAI内部的三个信号
日均调用量(按API价格估算)
中位数研究员超过600美元
高使用组(按API价格估算)
每天超过7000美元
研究组织整体机器工时
每1个人类工作日 = 3.1个Agent工作日
AI自我迭代链路
更强模型 → 承担更多研发任务 → 并行更多实验 → 开发下一代模型
OpenAI最近公布了一组很夸张的内部数据。
到今年8月,一名普通研究员每天使用的AI推理资源,按API价格计算已经超过600美元;使用量排名前10%的研究员,一天会消耗超过7000美元。
更关键的一组数字是:每投入一个人类研究员工作日,OpenAI内部同时运行着3.1个Agent工作日。
这些Token没有被用来写邮件、整理会议纪要。它们被投入了OpenAI最核心的工作:开发下一代AI。
AI正在进入研发自己的流水线。
过去靠人推进的实验,现在Agent可以并行跑
开发一个新模型,需要经过一条很长的研发链路。
研究员先决定研究方向,设计模型改进方案;接着编写实验代码、准备数据、运行训练和评测;实验结束后,还要分析结果、排查异常,判断这个方向是否值得进入下一轮。
其中大量工作都很耗时间,却不一定需要最顶尖的研究判断。
一次训练失败,研究员可能要花半天查日志;一个新想法需要先写评测工具、修改基础设施;实验跑完,还要从大量结果里找出异常值。过去这些工作由研究员亲自完成,或者等待其他团队协助。
Coding Agent出现后,这些环节开始被并行处理。
研究员可以同时启动多个Agent:一个写实验代码,一个检查数据,一个运行评测,另一个分析失败原因。人负责提出假设、选择方向和判断结果,Agent负责把大量中间工作快速跑完。
这也解释了每天600美元的Token消耗。
OpenAI买到的,是研究员身后多出来的机器工作时间。
OpenAI已经有了“AI研究实习生”
OpenAI把AI研发拆成六类工作:决策、设计、构建、运行、分析和沟通。
年初时,Agent主要负责写研究代码和基础设施代码。到了8月,它们已经大量进入实验运行、结果分析、技术支持和系统监控。
这种变化正在改写OpenAI内部的协作方式。
过去,一些团队需要定期举办答疑时间,帮助研究员排查实验环境和基础设施故障。随着Agent承担更多故障诊断,相关咨询持续下降,其中一个团队甚至停止了答疑,把时间转向其他系统建设。
实验数量也在上升。2026年,每位活跃研究员运行的实验持续增加,8月达到2025年开始统计以来的最高点。
OpenAI据此宣布,公司已经实现去年设定的目标:在2026年9月前拥有一个“自动化AI研究实习生”。
这个“实习生”可以在人类指导下完成边界明确的研究任务,其中一些原本需要熟练研究员工作数天。OpenAI接下来的目标,是在2028年3月前发展出“自动化AI研究员”。
这才是原文里最值得关注的信息。
AI对研发效率的提升,正在从“把同一件事做快一点”,变成“让更多实验同时发生”。
自我迭代是怎样形成的
这套机制一旦跑起来,会形成一条很特殊的反馈链:
更强的模型,能够承担更复杂的研发任务;更多研发任务被自动化后,研究团队可以运行更多实验;更多实验又会加快下一代模型的开发。
AI开始参与改进AI本身。
这就是OpenAI在文章中反复提到的RSI,也就是递归式自我改进。
它还无法脱离人类独立运行。Agent的高层规划占比依然很低。面对预计需要人类工作4至8小时的复杂任务,即使最终成功,超过一半仍需要人类至少介入一次。
研究方向由人选择,实验结果由人判断,模型是否继续扩大训练也由人决定。
但研发系统的中间部分已经发生了变化:过去受限于研究员时间的工作,现在越来越受限于算力、Agent并发量以及人类能够审核多少实验结果。
瓶颈正在向上移动。
一个人的效率,开始取决于他能调度多少机器工作
OpenAI的案例不适合直接复制到普通公司。前沿模型研发的单项成果价值极高,每天投入600美元甚至7000美元,只要能够提前找到一个有效的模型改进方向,这笔成本就可能成立。
但它提供了一种理解AI效率的新方式。
过去,公司衡量员工效率,通常看一个人完成了多少任务。Agent进入工作流后,还要看这个人能否把工作拆清楚,交给多个Agent并行执行,再从结果里找出真正值得继续的部分。
写Prompt只是最基础的一层。更重要的是拆分可验证的任务、配置数据和工具、识别错误结果,并及时停止无效消耗。
这也是为什么Token消耗增加,未必代表浪费。
如果600美元只换来更多代码和更多文档,它当然昂贵;如果它让研究员一天完成过去数天才能完成的实验闭环,Token就成了生产资料。
OpenAI正在展示一种新的工作形态:人设计问题、调度机器、筛选结果。
当AI开始帮助人类开发下一代AI,研究效率的上限,已经从一个人能工作多久,变成一个人能驾驭多少机器时间。
参考资料:
OpenAI:Research acceleration — The view inside OpenAI
OpenAI:The Hugging Face incident and the road ahead
OpenAI:Pacing model development in an era of cyber-critical capabilities