你有没有想过,为什么总有那么一小撮人,能比你早几个星期摸到最新的AI模型?
开发者论坛里吵了好几年。有人说靠充值等级,有人说靠玄学抽签,还有人一本正经地统计自己每天发多少条消息,想找出跟"能不能提前拿到新功能"之间的关系。谁也没能给出一个让人信服的答案。
直到2026年7月9日。
那天中午,OpenAI技术员工Thibault Sottiaux(网名Tibo,负责Codex和ChatGPT相关工作)出现在科技日播节目TBPN的直播镜头里。主持人问了一个所有人都想知道答案的问题:把新模型开放给OpenAI以外的人时,你们到底在挑什么样的人?
Tibo的回答,后来被剪成一条不到一分半的视频,在X上流传开。
那段让所有人愣住的话
视频里,Tibo说了这样一段话:
"When we give access to folks outside of OpenAI, [we look for someone with] high-bandwidth engagement, good feedback, and someone who's shown to be unbiased in the past. Someone who has talked honestly about all sorts of model harnesses."
「我们把权限开放给OpenAI以外的人时,看重的是这样的人:互动high-bandwidth(高带宽)、反馈质量高、过往的评价立得住,而且愿意坦率聊各种模型的harness(脚手架/驾驭层)。」


▲ Thibault Sottiaux在TBPN直播连线中,首次面向大众解释OpenAI挑选外部测试者的标准
这段话,把OpenAI这些年选人的逻辑,浓缩成了四张摸得着的画像,具体到可以对照自己的言行。
这条视频转发和点赞的数字并不算夸张,4次转发,83个赞,浏览量刚过一万九千。真正的分量,在于这段话里塞进了四条标准,足够被反复引用,又不至于失真。
拆开这四条标准,门槛比想象中"软"得多
高带宽,考验的是沟通密度
High-bandwidth engagement,直译是高带宽互动。工程师最熟悉这个词,网络带宽,指单位时间能传输多少数据。搬到人身上,说的是:你和产品团队之间,能不能高频、高密度、少误解地交换有用信息。
这跟"氪金多"完全是两回事。一个每天狂发消息、却只会说"这个模型变笨了"的人,带宽其实很低;一个不常冒泡、但每次都能贴出复现步骤、日志、harness配置的人,带宽反而更高。
有网友专门在评论区追问这个词到底是什么意思。

▲ Jamaur Bronner在回复里追问:这是否就是指反馈更走心、用产品更用心的那类人
追问本身也说明一件事:这个词够新鲜,得专门解释才能懂。
反馈,要能让工程师马上用上
Tibo自己就是"好反馈"这条标准的活教材。今年早些时候,Codex出过一个bug,他在X上大方认了:
"Codex had a bug. Fixed. More feedback. Better product. Keep it coming."
「Codex出了个bug,修好了。反馈越多,产品越好,继续来。」

▲ Tibo在X上公开承认bug并致谢反馈,这条推文成了"好反馈文化"的注脚
什么样的反馈算好?光说"感觉变笨了"没用,得说明白是在哪个任务、哪种设置、哪套harness下,成功率从多少掉到多少,样本链接放在哪里。只站边喊好或喊烂、拿不出复现步骤的反馈,进不了"好反馈"的门槛。
客观,是一种慢慢攒出来的信用
Unbiased in the past,过往评价客观,容易被误解成"永远端水,谁都不得罪"。真实的意思更接近:结论跟着证据走,不因为自己的身份、交情或立场,提前锁死一个模型的评分。
模型发布前后,社交媒体最容易出现拉踩。有人把一款模型捧成唯一真神,也有人把它写得一无是处。如果实验室只把测试资格给永远唱赞歌的人,收回来的信号注定是失真的。
这条标准对内容创作者格外敏感,提前玩到新模型,很容易被当成抢首发好评的特权。评测者一旦被利益或滤镜绑住,反过来会坑了实验室自己的判断。
敢聊各种harness,才是真懂行
Model harness,可以粗暴理解成,把模型装进真实工作场景的那层壳:提示词模板、工具调用、agent循环、检索、代码执行环境、UI包装,等等。同一个底层模型,换一套harness,体验能差出两个产品的距离。
Tibo特意强调"all sorts of model harnesses",暗示他要找的人早就跳出了默认聊天框:自己搭agent、改system prompt、接外部工具是家常便饭,还敢说真话,这次的提升到底来自模型本身,还是来自换了一套脚手架?换一套harness,优势还在不在?
在Codex、Work、电脑操作代理越来越普及的当下,模型和harness已经很难拆开看。能拆解明白的人,天然比只会截图排行榜的人值钱。
官方的另一套说法:机构同样要被筛选
Tibo讲的是"人"的标准。同一时间,OpenAI官网上写的却是另一套逻辑,挑"机构"。
在GPT-5.6 Sol系列的发布文章里,官方话说得干脆:
"During the preview, GPT‑5.6 models will initially be available through the API and Codex to a select group of trusted partners and organizations..."
「预览阶段,GPT-5.6系列模型会先通过API和Codex,开放给一小群精挑细选的可信伙伴与机构……」

▲ OpenAI官网Availability and pricing部分,明确写出预览期先面向select group of trusted partners
一边说想让更多人尽快用上,一边又从一小撮机构起步。这背后是风险管理下的发布节奏,能力越强,越要先窄后宽。
同一天,Tibo自己也在X上官宣ChatGPT Work已经推送给100%的Pro用户,还提醒大家把野心调高一点,说GPT-5.6 Sol跟以前见过的都不一样。新模型、新代理能力、新安全栈,几乎挤在同一个时间窗口里,提前拿到手的人,往往也是第一批踩坑的人。
除了trusted partners,OpenAI还留着两条更早就存在的通道。一条从2024年底就已经开放,面向安全与安全研究者,鼓励他们申请提前接触下一代前沿模型,做红队测试与风险评估;另一条是2025年11月公开的第三方外部测试体系,找独立机构做能力评估、方法审查,以及领域专家用真实任务做压力测试,还配了保密协议,报酬也不跟评估结论挂钩。
三条通道拼在一起,才是"谁能先摸到新模型"的全貌:个人测试者靠软实力,机构伙伴靠信任关系,安全评估靠专业使命。
论坛老哥们猜了好几年,方向可能一直偏了
在Tibo开口之前,开发者社区已经猜了很久。有一条2023年11月就开始的长帖,罗列了一堆可能因素。

▲ OpenAI开发者社区长帖,网友罗列出API消费等级、论坛信任等级、企业关联等猜测
帖子里的猜测五花八门:API账单花了多少钱、用不用Azure生态、上架过ChatGPT插件没有、论坛账号有没有混到信任等级三、企业客户身份算不算加分项。还有人举例说,自己没怎么花钱,DALL·E 3却在某个新Plus账号上莫名其妙解锁了,怀疑背后有随机抽签的成分。
这些猜测有一个共同点:全都是可以量化、可以自己操作的变量。多充钱、多混论坛等级、多签企业合同,听起来像一份能照抄的作业。
Tibo的回答,恰好把这份作业撕掉了。他强调的高带宽、反馈质量、历史客观、harness诚实,没有一条能靠砸钱或刷等级换来。用量能证明你愿意花钱,证明不了你能不能提供有用的信息。一个消费不算多、却每次都能精准复现问题的人,可能比账单很高、却说不出具体现象的大客户更有价值。
民间偏爱能量化的消费和身份,Tibo偏爱难以量化的协作质量,这个错位,大概是这次访谈最值得玩味的地方。
为什么这次的坦白,值得被认真对待
把四条标准往深了看,能读出几层没有明说的逻辑。
实验室拿出的是最稀缺的东西:算力、泄密风险、公关风险。换来的是关于真实世界的信息。高带宽提升沟通效率,好反馈提升信息结构,客观降低偏差,harness诚实降低测量误差,四条摆在一起,几乎是一套工程师写出来的选人公式,只是被翻译成了人话。
如果资格只发给永远唱赞歌的人,实验室收到的更像一间回音室,很难代表真实世界的信号,这种风险在研究里有个专门说法,叫评测者俘获(evaluator capture)。"过往客观"被单独列成一条,正是对这种风险的提前防御。
Harness诚实同样值得多想一层。当发布越来越依赖基准跑分和demo演示,能把"这次进步到底来自模型,还是来自脚手架"这件事拆解明白的人,正变得比只会截图排行榜的人稀缺得多。谁能拆穿演示里的魔术,谁就更值钱。
高带宽的本质,是资源分配的现实:产品团队的注意力有限,早期名额说到底是把这份稀缺的关注,分给预期能带来最多信息增量的人。实验室想要的,是能来回对话、能追问校正的传感器。
新模型还会一批批地先给一小撮人,这件事大概率不会变。算力有上限,安全需要观察真实世界的分布,长尾问题也只有真实用户才能挖出来。
这一次不一样的地方在于,挑人的逻辑第一次被讲成了人话,高带宽、好反馈、客观、敢聊harness,四条具体到可以对照的画像,取代了"可信伙伴"这类场面话。
高带宽、好反馈、客观、敢聊harness,砸钱抄不到,但普通人对照着这四条去改进,方向是清楚的。名单会继续存在。至少现在,你知道自己该往哪个方向努力了。
夜雨聆风