同一个星期,同一个模型,X上却吵成了两个世界。
一边是「Sol真的很强」「以后默认换它」的体验贴,一群人正围着一个还没公开发布的GPT-5.6版本反复安利。另一边,有人翻着这些好评冷笑一声:怎么又是这几个人先玩到?凭什么是他们?
7月9日晚上,答案自己冒出来了。
科技访谈节目TBPN放出一段大约1分26秒的视频。OpenAI负责Codex、目前统管核心产品方向的Thibault "Tibo" Sottiaux,第一次以负责人的身份,对着镜头讲明白了一件事:公司把还没公开的新模型交给外部人时,到底在找什么样的人。
"When we give access to folks outside of OpenAI, [we look for someone with] high-bandwidth engagement, good feedback, and someone who's shown to be unbiased in the past. Someone who has talked honestly about all sorts of model harnesses."
「把权限开给OpenAI以外的人时,我们看的是这个人有没有高带宽的互动(high-bandwidth engagement),能不能给出好反馈(good feedback),过去有没有公正待人,还有,有没有诚恳聊过各种模型的harness(工具外壳、代理框架)。」


▲ TBPN@tbpn发布的采访片段,Tibo居中回答提前体验模型的筛选逻辑,发布数小时内已有近两万次查看。
四条标准,没有一条和粉丝数字挂钩,更不提夸没夸过公司。这几乎像是对同一周舆论场的一次正面回应,尽管Tibo未必是冲着回应去说的。
Tibo是谁,凭什么他说了算
Thibault Sottiaux出生在比利时,应用数学背景出身。2015年前后,他在Google/DeepMind做基础设施和研究工具,参与过支撑AlphaGo那类项目的工程环境。ChatGPT爆火之后,他去了旧金山加入OpenAI,先做内部研究工具,很快把一条产品线做成了后来的Codex。
WIRED今年6月的人物报道提到一个细节:他在开发者社区有种小名人式的存在感,会亲自在X上回复bug,偶尔还会帮工程师重置周额度。这段花边并非无关紧要,它说明两件事。
第一,他自己就是"高带宽互动"的实践者,清楚什么样的外部信号对值班工程师有用。第二,当他谈"要找过去公正、聊harness诚恳的人"时,听众更容易把这当成一线工程负责人的采购标准,不像是品牌部门写的口号。

▲ WIRED于2026年6月发布的Tibo专访,标题围绕ChatGPT超级应用改造展开。
2026年年中,他的权责从Codex负责人扩大到核心产品,ChatGPT与Codex一并纳入他的管辖,向Greg Brockman汇报。他偏好一连串小规模发布来换取持续反馈,WIRED引用他的原话是,这个领域经不起一次高调登场却判断失误的代价。当负责人亲口谈筛选标准,谈的其实是他自己正在运营的那台反馈机器该往里放什么料。
Sol消失的一周
把镜头切回到7月的第一周。
Every团队把GPT-5.6 Sol放进真实工作大约一个月:收件箱整理、营销落地页、长项目线程。然后因为审查流程,access断了整整一周。Austin Tedesco形容那种落差,感觉像换回旧模型后,手里的篮球突然重了一倍。


▲ Every总结近一个月的真实工作体验:团队失去Sol的early access一周后,换回旧模型像在投一个重了两倍的篮球。
access恢复以后,Every写出长文《Vibe Check》,末尾附上一句披露:OpenAI给了他们提前体验GPT-5.6的机会,但没有过问这篇评测怎么写。文章里既有夸,也写了失败案例,比如计划过度构建、遵循过期指令这类毛病。
同一时间,开发者KOLTheo发帖:"Apparently I'm allowed to talk about GPT-5.6 now?"(看来我现在可以聊GPT-5.6了?)紧接着他补了一句更关键的:

▲ Theo:唯一的限制是正式长文、视频、播客要等到周四才能发,内容本身随便说,还顺带点名夸了OpenAI early access团队。
这条信息容易被读漏。embargo(禁发期)卡的是发布节奏,跟内容要怎么讲没关系。至少在参与者的公开描述里,是这么回事。
四条标准,拆开慢慢看
高带宽互动:反网红条款
评论区有读者追问"高带宽互动"到底啥意思,这是否就是指认真反馈、真心互动的人?结合Tibo一贯的风格,答案大概率偏工程侧:把模型放进真实工作流去写代码、跑agent、改产品,而非只玩demo;出问题能复现、能贴日志、能对比版本前后差异。
这条标准天然偏向工程师、深度媒体、真在写代码的builder,而非纯转发型大号,这也是为什么名单上常见Theo这类既写长文又写代码的人。
好反馈:好听不算数
"好"不等于顺耳。好反馈通常可行动、能对比、带失败案例、指出边界条件。Simon Smith提到,批评过后OpenAI仍会追问具体哪个点不满意,这更像好反馈被认真消费的证据,而非一句公关式的表扬。
过去公正:最容易被误解的一条
这条真正筛的,是你过去对竞品、对自家产品、对不同工具链有没有都说过真话,单纯表达喜欢,反而够不上这条门槛。讽刺的是,社区此刻恰好在怀疑early access人群不敢说坏话。Tibo把这条写进标准,等于承认偏见本身就是要过滤掉的风险,至于筛选有没有真的做到,还得靠公开评测里批评的密度去检验。
对harness诚恳:评测排行榜的下一章
对不熟悉技术的读者,可以把模型想成引擎,harness就是把引擎装进车里的那套支架和控制系统,CLI、IDE插件、agent循环、工具调用、权限沙箱,都算在内。同一个模型换个harness,表现能判若两人。

▲ Tibo在Dev Interrupted播客上的论断:过度堆砌scaffolding只是权宜之计,谈不上把能力真正做大。
Tibo点名harness,等于要求一种能拿来互相比较的评测规矩:把话讲明白,是模型不行,还是工具壳诱导了坏行为;换个harness,结论会不会整个翻过来。对正在把Codex并进ChatGPT、想做"一个界面通向AGI"的OpenAI,这是最值钱的外部信号。
怀疑的人,和替自己辩护的人
标准公开归公开,怀疑照样存在。

▲ Wyatt Walls(@lefthanddraft):以后还能不能继续拿到access,会不会取决于这次推文写得好不好?
这个问题问得挺尖锐。如果答案偏向肯定,那整个评测生态都可能带上系统性偏差。

▲ 曾获early access的从业者Simon Smith回应:对方不控制你发什么推文,批评过之后关系照样在,甚至会追着问细节想办法改进,唯一要守住的规矩是发布之前先保密。
两种说法都站得住脚,也都不能单独盖棺定论。发布前保密,多方都认;会不会因为想续着用而下意识美化自己的评价,外部谁也没法核实。比较稳妥的态度大概是:写死的规矩已经被反复证实存在,软性的自我审查排除不了,只能靠文本本身,写没写失败案例、有没有跨harness对比,去大致判断。
两条轨道,别混成一回事
写到"内测资格"这个说法,很多人会把两套完全不同的机制混在一起谈。
第一条是安全轨道。2024年12月,OpenAI发文邀请安全与安保研究者申请下一代前沿模型的提前测试,作为内部安全评测、红队网络、第三方机构合作的补充,当时的申请窗口公开、有截止日期。2025年11月,官方又发长文,把外部合作拆成独立评测、方法审查、专家探测三类,还讨论了保密与发表条款,这条轨道服务的是公共安全,目标清清楚楚。

▲ OpenAI官方账号发布的安全测试招募推文,是另一条制度化、可申请的通道。
第二条才是Tibo这次谈的builder邀请轨道:面向高信号开发者与部分媒体,邀请制,名单不公开,主要目的是拿产品反馈、真实工作负载、发布前的体感。
还有一条更边缘的研究者额度计划,面向有机构背景的研究人员,提供有限的API额度补贴,服务的是负责任部署与社会影响研究,这条给的是额度补贴,跟提前摸到没发布的模型权重是两回事。
三条轨道,三张不同的船票,压根没登同一艘船。
这场筛选背后,真正值得记住的
Tibo公开这四条标准,某种程度上是在给反馈通道的公信力做一次修补,当external access人群的社会信任下降,他们反馈的价值也会跟着打折,因为外界会说他们不过是托。标准公开了,名单依然看不见,但至少给了外界一把可以核对的尺子。
邀请制天生带着选择偏差:被选中的人,本身就更可能是把模型用到极限、又愿意公开写出来的那一类,他们的分布不等于全体用户的分布。好评潮背后,很可能同时叠着三件事,模型真的更好、样本本身有偏、发布节奏又恰好同步共振。三件事纠缠在一起,单靠"好评多"这一个信号,分不清楚谁占了多少。
失去access一周就让Every觉得像换了个人,这件事还有另一层含义:工作流一旦形成依赖,使用节奏就攥在了供应商手里。这和订阅制涨价、速率限制、旧模型说下架就下架,其实是同一个家族的风险。
你我没有名单,但标准可以先学会
没有官方申请表写着"符合这四条就给你下一代模型"。但把这四条当成行为参照,依然比在评论区反复@官方账号更接近现实:
公开写可复现的内容,记录清楚失败在哪、成功在哪,而非只发几张截图刷存在感。做跨模型、跨harness的对比,并且承认自己判断上的不确定。过去批评过自己喜欢的公司,留一点公正的痕迹。学会harness语言,别只会说"这模型聪明",要能讲明白是在哪种工具链、哪种权限、哪种重试策略下测出来的。真的是研究者,就去走研究者额度或安全项目那条正式通道,不用只盯着邀请制那圈光环。
多数人大概率一辈子都进不了builder名单,这不妨碍谁去做一个高信号的使用者,也不妨碍谁用公开可用的模型做出扎实的工作。
还剩几个问题,官方没说,只能留着:高带宽有没有内部量化指标?批评到什么程度会被移出名单?builder轨道和安全轨道的名单是否存在重叠?ChatGPT和Codex合并成一个入口之后,早期权限会更偏向普通消费者,还是继续偏向开发者?
这些留白,恰恰是这件事最诚实的部分。Tibo给出的,算不上一份内幕名单,更像一把尺子。尺子准不准、公司自己有没有一直照着用,还得靠时间和一篇篇公开文字慢慢量出来。
夜雨聆风