解禁日那天,总有人已经用了三周。截图九连发,配文「这次真的不一样」。剩下的人排在公开版发布倒计时里,边刷边骂:凭什么是他?
这个问题在开发者社区里憋了好几年。有人说要花钱,有人说要认识内部员工,还有人干脆归结为运气。7月9日,答案第一次被OpenAI自己的人,用大白话说了出来。
一个问题,憋了三年
2026年7月8日,产品博主Peter Yang在自己的X账号上转发了OpenAI的官方公告,GPT-5.6系列的Sol、Terra、Luna即将在周四公开,全球范围内的预览也在扩大。他只回了一句:
"So what is the qualification criteria for folks to get early access to this model?"
「所以到底要满足什么条件,才能提前拿到这个模型?」
这条推文没有得到官方回应,却引来了240多个赞、69条回复、8万多次浏览。评论区几乎变成一场大型脱口秀:有人说要"有钱有名",有人说要"永远只给好评",还有人干脆甩出一行Math.random(),意思是这事儿全靠命。
一条回复稍微严肃了一点:@haider1声称听内部员工私下说,这一次之后early access会因为监管收紧而变得更难申请。这条消息没有任何官方来源支撑,但转发量不小,没人愿意接受"标准不透明"这件事本身。

▲ Peter Yang引用OpenAI官方公告发问:"到底谁能拿到提前访问权?",评论区随即涌入大量调侃与猜测。
回马枪:一个人的大白话
一天之后,转折来了。
科技日播节目TBPN放出一段访谈切片:OpenAI负责Codex与ChatGPT核心产品的Thibault "Tibo" Sottiaux(@thsottiaux),第一次用近乎聊天的口气,回答了这个憋了几年的问题。
视频卡片上完整写着他的原话:
"When we give access to folks outside of OpenAI, [we look for someone with] high-bandwidth engagement, good feedback, and someone who's shown to be unbiased in the past. Someone who has talked honestly about all sorts of model harnesses."
「当我们把访问权限开放给OpenAI之外的人时,我们会找高带宽互动(high-bandwidth engagement)、反馈质量高(good feedback)、过往表现公正(unbiased in the past)的人。是那种会诚实讨论各种model harness的人。」
四个短语,没有印在KPI表格上,也够不到Help Center的政策页面,就是一个产品负责人在镜头前的口述。但恰恰是这种不正式,让它显得可信。


▲ TBPN发布的访谈切片,完整引用Tibo对外部early access标准的四条描述,视频时长1分26秒。
这条视频的互动量并不惊人,83个赞,1.8万次浏览。但它戳中的东西比数字重的多:它第一次把"谁能提前玩到新模型"从一个只能靠猜的黑箱,变成了一句可以被复述、被讨论、被验证的话。
主贴下唯一一条回复来自@jambronner,他追问:
"Can you break down 'high bandwidth engagement' for us? Does that just mean folks who are thoughtful in how they give feedback and engage with the product?"
「能不能拆解一下"高带宽互动"到底怎么算?会不会就是说那些认真反馈、认真用产品的人?」

▲ 唯一一条回复追问"高带宽"的确切含义,这也是整场讨论真正的概念缺口。
这个追问问对了方向,但还没问到点子上。
他是谁,为什么这句话有分量
要理解这四条标准值不值得信,得先知道说这话的人是谁。
Tibo出身比利时,学的是应用数学。2015年前后他在谷歌伦敦做地图相关的工作,后来进了Google DeepMind,负责研究基础设施与工具链,那正是AlphaGo那代团队最依赖工具文化的时期。ChatGPT爆红之后,他跳去了OpenAI,一开始也是给内部研究员做工具。
然后他做出了Codex,OpenAI增长最快的业务线之一。2026年年中,他被推到了更大的位置:统筹ChatGPT与Codex的核心产品,公司内部把这条路线称为"super app"、"personal agent"。

▲ WIRED对Tibo的专访标题是《认识这位正在带领ChatGPT完成最大转型的工程师》,文中提到OpenAI正把ChatGPT改造成能处理生活与工作任务的个性化agent。
WIRED的这篇专访里,Tibo自己讲过:你很难承受"大张旗鼓却做错"的成本,所以他更愿意做一连串小发布,边走边收反馈。这个说法能解释他为什么会在意"good feedback",这套逻辑,撑起了他管理产品节奏的方法论。
更能佐证这一点的,是他去年在LinearB的Dev Interrupted播客里说过的话,播客标题干脆就用了它:
Scaffolding is coping not scaling
「脚手架是在应付局面,谈不上规模化。」
他反复强调模型与harness(脚手架/挽具)要垂直整合,这也解释了为什么他给出的第四条标准专门点名"model harnesses"。能让他真正认可的,是能聊明白脚手架、工具循环、评测框架的人;只会喊"模型好强"的人,入不了他的眼。
拆开这四条标准,到底在挑什么
高带宽,不等于话多
"带宽"这个词借自通信理论:单位时间内能传输的信息量。放到人和产品团队的协作里,意思是,同样一小时的沟通,你能交换多少有价值的信息。
一个低带宽用户可能会说:"感觉这次变笨了。"
一个高带宽用户会说:在某个monorepo里开启子代理之后,第12步工具调用对路径的处理和上一代模型不一样,导致十次任务里有三次在写文件阶段失败,附件是最小复现和日志。
后者能让模型团队、产品团队、评测团队同时动起来;前者只能进情绪看板。真正的高带宽,往往属于那些很忙、但沟通极有效率的专业用户;天天刷屏、随时在线的人,反而常常够不上这个标准。
好反馈,得能被拿去改产品
Tibo自己的公开行为就是范例。2026年6月24日,他在回应一个Codex的bug讨论时写道:
"Codex had a bug. Fixed. More feedback. Better product. Keep it coming."
「Codex出过一个bug,修好了。更多反馈,更好的产品。continue。」

▲ Tibo公开回应Codex的bug已修复,并鼓励用户持续提供反馈,反馈驱动修复,在他的账号上反复出现,公关团队写不出这种语气。
好反馈通常具备几个特征:能行动(团队听完知道改哪里)、能对比(相对上一代模型或不同脚手架)、覆盖失败(不只秀成功案例)、守时间纪律(不把内测资格当成人营销素材乱用)。
过往公正,是四条里最戳社区痛处的一条
社区的反应很诚实:Peter Yang帖子下面,大量回复认为现实恰恰相反,要拿到access,得永远打好评。
@tunguz用一句玩笑代表了这种情绪,把资格描述得像某种社交网络的梗,压根够不上一张正经的申请表单。

▲ 社区对"资格标准"的调侃回复,代表了大量用户的真实体感:这套标准在他们眼里更像一场无法参透的游戏。
Tibo把"unbiased"说出口,等于在公开否认这套交易结构,至少在价值主张的层面。这句话有没有被完全执行是另一个问题,但社区体感和官方口径的落差,本身就值得摆在一起看,谁也别急着单方面选边站。
诚实谈harness,是这四条里信息量最大的一条
这里有必要科普一下:什么是model harness?
在2025到2026年的agent/coding语境里,harness(挽具/脚手架)指的是包在基础模型外面的一整套运行装置:工具调用协议、权限沙箱、多代理编排、检索与记忆机制、评测脚本,以及IDE、CLI、桌面App这类交互壳。
同一个模型权重,换一套harness,体感能差出一个世代。所以OpenAI要的外部测试者,不能只会打分"模型聪不聪明",得能分辨:这次是模型真的变强了,还是harness把失败藏起来了?换掉默认脚手架,能力还剩多少?
这跟Tibo在播客里谈的"移除脚手架、追求真正的agent自治",是同一套想法的两面。2023年大家还在讨论提示词技巧,2024到2025年进入工具调用,2026年多代理编排已经是默认战场。同一个模型配不同的harness会变成完全不同的产品,评测榜单也可能被harness技巧刷分。诚实谈harness因此够不上学究趣味的标签,它是防止整个行业自我欺骗的品德要求。
三条轨道,别搞混
如果只看到Tibo这四条,很容易误会成"只要反馈好就能进内测"。真实情况分成三层,每一层拍板的人都换了一拨。
第一层,机构级的可信伙伴预览。OpenAI官方博客在2026年6月26日已经写明:
"We're beginning a limited preview of the GPT‑5.6 series: Sol, Terra, and Luna… At their request, we are starting with a limited preview for a small group of trusted partners… We don't believe this kind of process should become the long-term default."
「我们正在启动GPT-5.6系列(Sol、Terra、Luna)的有限预览……应对方要求,我们从一小群可信合作伙伴开始……我们不认为这种流程应该成为长期默认做法。」
这一层筛选的是企业和机构,看的是场景是否真实、合规是否可控、能不能承受责任,跟个人测试者标准完全是两套逻辑。
第二层,就是Tibo说的个人测试者标准,高带宽、好反馈、过往公正、诚实谈harness。这一层看的是信号质量,像气象站选址。
第三层,Researcher Access Program,面向研究负责任部署、风险缓解的研究者,可以申请最高约1000美元的API额度,每季度评审一次。这是研究补贴通道,解决的是研究预算问题,跟能不能抢先玩到旗舰模型没有关系。
三条轨道并行存在,把它们分清楚,才知道自己该羡慕哪一个、该申请哪一个、该彻底放弃哪一个。
一句大白话,为什么值得当回事
有人可能会说,这不就是"要认真用产品、好好反馈"的车轱辘话吗?
未必。把这句话放回2023年那个语境里再看,分量完全不同。当年OpenAI开发者社区有一个流传很广的帖子,标题是How to Gain Early Access to OpenAI's Latest Features?,楼主归纳出一堆可能因素:API累计花费、Azure生态使用、插件上架数量、提交的评测数量、社区等级、是否是企业客户、ChatGPT日活,甚至有人怀疑纯粹是抽签。

▲ community.openai.com上一则历史讨论,楼主列出账户花费、社区等级、企业身份等一长串"猜测因素",反映了三年来社区始终缺乏官方口径的真实处境。
三年过去,社区列出的仍然是账户属性和商业贡献这类东西,而Tibo这次给出的是行为质量和认知诚实。这两套标准可能同时成立,公司先用账户层级和商业关系筛出候选池,再用行为标准从池子里挑真正被信任的深度测试者。但公开场合第一次把后半段挑明,这本身就是变化。
一个产品一号位人物,用可以被复述的短句公开描述筛选逻辑,这跟三年来的"默示筛选"完全是两种姿态。
这句话背后,是一整套正在被重写的游戏规则
2026年的模型发布几乎变成了内容日历。每一次解禁,都会制造一批"我已经用了几周"的帖子潮,也会制造一种隐性的评测偏置,评测者害怕说真话,怕丢掉下一轮access。
Tibo把"unbiased"和"honest"放进公开表述里,某种程度上是在给这套评测生态松绑:如果access只给永远唱赞歌的人,整个评测市场迟早会失真塌陷。这句话说出口,不能保证执行完美,但它改变了谈判的语言,至少以后有人能拿这句话去当面质问,不必只靠瞎猜。
更值得注意的是,普通网友讨论"谁能提前玩到新模型"时,比的还是谁更幸运、谁认识对的人。而产品团队内部,战场早已经从"模型参数够不够强"移到了"系统工程做得好不好"。会聊harness的人,才是agent时代真正被需要的评审席。
想被这套系统看见,可以做点什么
多数人不必削尖脑袋挤进内测,但如果真的在意,这里有几件比"认识内部员工"更实际的事:
选一条自己真实的生产工作流,固定住harness版本,长期做对比记录。每一个严重问题都写成最小可复现案例,同时区分清楚"是模型的错"还是"是脚手架的错"。公开表达时保留对竞品的对称评价,批评和表扬都做过,才谈得上过往公正。遵守解禁时间窗,不靠提前剧透赚流量。如果是做研究,走Researcher Access Program这条正规通道就好,别惦记什么网红专用入口。
这些技能换到任何实验室、任何开源项目里都通用,谈不上取巧,却是目前唯一被公开承认过的路径。
大多数人这辈子都进不了任何一家实验室的alpha名单。更现实的态度是:关注官方的分阶段发布公告,用好模型公开后最初48小时,那正是容量和功能最不稳定,反馈也最有价值的窗口。把抱怨写成可复现的报告,有时候比苦等一个"神奇的access"更有用。
Tibo这段话最友善的解读是:它试图把"谁配提前玩"从一个只能靠身份、靠关系去猜的神话,往下拉回一个工程协作问题。世界当然不会只剩下工程,关系和结构依然存在。但当公开的话语开始承认反馈质量和诚实的价值时,普通人至少多了一条不必靠自嘲,也能看懂的路。
夜雨聆风