一个问题,憋了无数开发者好几年:明明大家都在同一个订阅档位,凭什么有人手里的模型永远比你新一步?
7月9日,这个问题被当面怼到了OpenAI核心产品负责人脸上。他没有打太极,给出的答案第一次把「谁能提前拿到新模型」这件事,从玄学变成了可以拆解的标准。
直播间里,他说了大实话
科技日播节目 TBPN 是硅谷开发者圈的固定信息源,主持人说话向来不留情面,懒得兜圈子。7月9日这期节目连线了 OpenAI 负责 Codex 与 ChatGPT 核心产品方向的 Thibault "Tibo" Sottiaux(@thsottiaux)。
镜头切成经典三分屏:两位主持人分坐左右,笔记本上贴着标志性的 CONSOLE 贴纸;中间是远程连线的 Tibo,深色上衣,背景是虚化的办公室。屏幕下方一行绿色字幕写着他的身份:Member of Technical Staff, OpenAI。
主持人抛出的问题很尖锐:模型还没对所有人开放的时候,凭什么把「圈外」的试用权给某些人?
Tibo 张口就答,没有丝毫迟疑:
When we give access to folks outside of OpenAI, [we look for someone with] high-bandwidth engagement, good feedback, and someone who's shown to be unbiased in the past. Someone who has talked honestly about all sorts of model harnesses.
「当我们把访问权限开放给 OpenAI 以外的人时,我们找的是:高带宽互动、能给出优质反馈、且过往表现得不偏不倚的人,那种会诚实讨论各种模型 harness 的人。」
这条切片视频的浏览量不算惊人,一万九千多次观看,83个赞,收藏数却明显偏高。收藏多于转发,通常意味着读者觉得这段话以后用得上,而非单纯的情绪转发。它更像开发者圈悄悄传阅的一份内部说明书。


▲ TBPN直播画面,中间为远程连线的Thibault Sottiaux,身份标注为OpenAI技术团队成员,约1.9万次观看、83个赞
有读者立刻在评论区追问:@jambronner 想弄明白,「高带宽互动」到底等不等于「用心写反馈」?

▲ 网友追问:high-bandwidth engagement到底指什么?
这个追问问到了点子上。三条标准听起来简单,拆开看,每一条都藏着行业这两年才形成的新逻辑。
拆开看:三条标准到底在筛什么
第一条,高带宽互动。
「带宽」这个词借自通信工程,指单位时间内能传输的有效信息量。放到内测场景里,它跟「聊得勤」关系不大,更接近四件事叠加:把没公开的模型接进真实工作流去用,而非玩一下demo就走;能复现bug,给得出线程编号、日志、harness版本,而非扔下一句「感觉变笨了」;愿意跟工程师持续来回沟通,对方不用反复翻译需求;能在命令行、网页、第三方工具等多个场景里对比模型表现。
说白了,一万条星级评分对OpenAI用处有限,他们真正缺的,是少数能把模型在真实场景里的失败,翻译成工程师能看懂的问题单的人。
第二条,优质反馈。Tibo 自己的推文记录就是活教材。有用户指出 Codex 存在拖垮SSD的bug,他回复:「Codex had a bug. Fixed. More feedback. Better product. Keep it coming.」,问题修了,还主动喊话继续提。

▲ Tibo公开回应用户反馈:bug已修复,更多反馈,更好产品,继续提
差反馈和好反馈的区别其实很直观:前者只会说「变弱了」,后者会讲清楚在哪个仓库、哪个版本、哪类任务上,失败率从多少变成了多少,附上日志。前者只晒通关截图,后者连惊喜和翻车都一起报。这种反馈才配得上「燃料」两个字,WIRED 采访里 Tibo 提到,OpenAI 选择小步快跑式发布,因为承受不起一次大动作还做错。缺了好反馈,小步快跑就会变成安静地瞎改。
第三条,也是最有2026年行业特征的一条:公正,并且对各种model harness都说真话。
一个绕不开的新词:harness
普通用户可能没听过「harness」这个词,但它已经决定了同一个模型在不同地方表现天差地别。
简单理解:模型是发动机,harness 是包在外面的车身和仪表盘,负责组织上下文、串联工具调用、管理权限沙箱、处理记忆压缩,是那层让模型真正能干活的运行时外壳。
2026年,常见的 harness 有 OpenAI 自家的 Codex、Anthropic 生态的 Claude Code,还有 Pi、OpenCode、Cursor、Aider 等一票第三方产品。Tibo 自己在推文里承认过一个数字:约5%的生产流量跑在 Pi 上,另外约5%在 OpenCode 上,他鼓励用户可以用同一个 ChatGPT 账号接入这些第三方工具。这意味着差不多十分之一的真实用量,发生在 OpenAI 自己都管不全的壳子里。

▲ LangChain博文《Your harness, your memory》配图:模型被harness的多个环节层层包裹
打个比方,同一款手机芯片装进不同品牌的手机里,拍照效果和发热情况可以完全两样。真要评价这颗芯片,不能只听一家品牌的发布会。Tibo 想要的反馈者,是那种会说「这个模型在 Pi 上工具调用更稳,换到某个IDE插件里却会看错文件路径」的人,而非永远只在一个壳子里打十分的人。倘若内测者只在自家壳里夸模型,样本就会系统性低估模型换壳之后的真实表现,「unbiased」这个词在这里,指的正是评测层面的公正,而非空泛的道德标签。
别搞混了:提前拿到模型,其实有四条不同的路
Tibo 这段话被截成十几秒的切片传开后,很容易被简化成一句「OpenAI决定谁能用新模型」。但仔细拆开,提前接触新模型这件事,实际上同时存在好几条并行的分配机制。
Tibo 在 TBPN 说的这套,主要针对的是产品圈外的个人反馈者,私密邀请、一对一对接工程团队,目的是在正式发布前找出真实工作流里的问题。这跟订阅档位滚动是两码事:Plus、Pro、Business 用户分批看到新模型或新功能,免疫学家 Derya Unutmaz 就提到过作为 Pro 社区成员提前体验了新语音功能,这更多关乎容量和商业化节奏,着眼点跟「找批评者」不太一样。
这也跟机构层面的「受信任合作伙伴」是两码事。GPT-5.5 发布时,OpenAI 明确写过,在正式对外之前收集了近200家受信任早期访问合作伙伴在真实场景下的反馈,配合内外部红队测试。到了 GPT-5.6 系列,官方账号又发帖强调:相信广泛开放访问的理念,但当前先在 Codex 和 API 上,对一小群受信任合作伙伴做有限预览。
这句话的语法和 Tibo 完全不同。Tibo 说的是「我们找什么样的人」,官方这条推文说的是「先给什么样的伙伴集合」。前者优化的是反馈质量,后者优化的是风险和容量。两条轨道同时运转,互不替代。
还有第四条路,是研究者和红队的专项申请,主要用来评估能力边界和滥用风险,跟产品体验反馈基本不搭边。
「只给大号」的抱怨,一半真话一半误会
标准摆得再明白,也压不住舆论里的另一种声音。有用户在社交媒体上坚称,内部员工私下说过,早期访问只给企业客户和粉丝量大的账号。

▲ 有用户声称,员工私下表示early access主要给企业和大号账号,这是匿名转述,非官方政策
这条帖子代表了一种真实存在的舆论情绪,出处却是匿名员工的二手转述,可信度存疑,更像「拼关系」心态的一种投射。类似的讨论早在2023年就已经在 OpenAI 开发者社区里反复出现,有人猜测靠 API 消费等级,有人猜测靠 Azure 使用量、插件贡献、论坛信任等级、企业关联,甚至有人观察到新注册的 Plus 账号突然就拿到了 DALL·E 3 的访问权,纯靠运气。
这些民间猜测和 Tibo 的三条标准之间,其实存在部分重叠:日活跃度确实接近「高带宽」里「使用密度」这一层,提交过 evals 或插件确实接近「结构化贡献」。但民间清单里几乎没人提到「跨 harness 公正评测」,这恰恰是 Tibo 这次补上的、2026年才真正成立的新维度。这种错位说到底:社区长期在琢磨怎么被系统看见,Tibo 说的却是怎么被工程师珍惜,两者相关,却各有各的算法。
一个网红工程师的标准,为什么值得信
Tibo 有资格说这番话,和他本人的经历分不开。WIRED 今年6月的一篇人物报道写到,他2015年就在谷歌做地图相关工作,后来转到 DeepMind 做研究基础设施,让研究者能用得上工具,而非埋头写论文。ChatGPT发布后,他形容自己受到刺激,DeepMind 眼睁睁看着机会溜走近两年却没做出对应产品,于是搬去旧金山加入 OpenAI,一开始做内部工具,几个月后开始搭建后来的 Codex。
在开发者社区里,他也是出了名的「愿意回复」的工程师:亲自回复bug报告,偶尔还会手动帮用户重置用量限额。他甚至把自己的产品哲学写成过一个循环公式,发布、收反馈、再发布、再收反馈,中间免不了「翻车、重置、再来」。

▲ Tibo在推文里将产品哲学总结为一个永续循环:发布、反馈、再发布
这种长期示范,让「标准公开化」这件事显得像顺理成章的延伸,不像临时公关话术。WIRED 提到他今年已经升任核心产品负责人,统管 ChatGPT 与 Codex 的融合方向,汇报线一路到 Greg Brockman。这意味着他这次说的话,分量不只停留在一个小团队的内部习惯上,很可能会影响 ChatGPT 主线未来的发布节奏。
写给普通开发者:你也可以成为「高带宽」的那一个
标准讲清楚了,不代表人人都能拿到内测名额,OpenAI GPT-5.5 那近200家合作伙伴,算的是机构数量,真正落到具体操作者手里的个人席位,可能只有几十个。系统容量摆在那儿,名额终归有限。
但标准本身给普通开发者提供了一个可以对照的方向。想象两种反馈者:一种人每天在社交媒体发「新模型太强了」,配一张聊天截图,版本号、失败案例统统拿不出手,他很愿意站台,但工程师没法从中提取出任何能修的问题,他占的是声量的位置,带宽上却几乎不产出。另一种人一周之内,在多个工具里跑完真实任务,复现出同一个工具调用失败的场景,把线程编号、模型版本、系统时间、相关日志整理成一份能搜索的报告,还写明白在哪类任务上比上一代更省资源、在哪个环节会陷入循环。前者粉丝可能更多,后者才是工程师愿意回复的人。
把这份画像落成清单也不难:环境信息钉死,任务描述让别人也能复现,讲清楚预期行为和实际行为的差距,附上日志和对照结果,公开渠道里绝不泄露敏感信息。对照下来会发现,Tibo 说的好反馈,几乎就是开源社区里一份合格 issue 模板的样子。
结尾:发布日之前,早就有人替你踩过雷
OpenAI 没有在7月9日发明「早期访问」这件事,它一直存在。这次不同的是,借着 Tibo 在直播间的一段大实话,一部分原本只在公司内部走廊里意会的筛选逻辑,第一次被翻译成了可以公开讨论的语言。
标准背后拿不出公开申请表,也见不到名单或量化门槛,透明度依然只打开了一半。但至少现在能看清一点:那些在正式发布前几周就摸到新模型的人,靠氪金撬开门缝的极少,靠关系户传闻兑现的也没几个,真正管用的,是能不能把模型在真实场景里的表现,翻译成工程师看得懂、改得动的信息。
新模型的第一批用户,很少是运气更好的消费者,更像是带宽更高的传感器。你在发布日看到的「第一次」,往往已经是别人的第无数次。
夜雨聆风