一则只有文字的推文,在48小时内迅速冲进了AI开发者的视野。
发帖的人叫 Thibault Sottiaux,圈内人喊他 Tibo,他的公开简介显示其负责OpenAI Codex与ChatGPT相关工作。8月4日,他发了一则短帖,大意是:
从我最近看到的一些结果来看,Codex已经是一套不错的harness。但两三个月后它就会显得原始。我们即将迎来前沿AI使用方式的又一次重大演进。下一代模型所需的资源,已经超出你的笔记本电脑。

▲ Tibo的原帖:短短一则预告,给出了两三个月的时间表。
这则短帖先肯定Codex当下的harness,紧接着把其有效期压到两三个月。"我最近看到的结果"也暗示他接触到了尚未公开的进展。最后,他把焦点落在开发者桌上的电脑:它可能很快就不够用了。
发帖人就在产品一线,这番话像是造这把武器的人,亲口告诉你它的换代日期。
社区迅速回应:兴奋、不安与服务器清单
反应来得又快又猛烈
知名科技博主、Every创始人 Dan Shipper 回了经典互联网梗"My body is ready",我准备好了。前端开发者 Theo 只丢了一个 👀 表情,没有多作解释。

▲ Theo的回复只有一个emoji,但所有人都读懂了。
开发者 Andrew Peacock 则表达了担忧:"这听起来一点也不不祥啊。难道没人担心吗?" 他把"两三个月后过时"读成了一种近乎不祥的加速度。


▲ 兴奋之外,也有人嗅到了不安。
最硬核的回应来自开发者 Jeffrey Emanuel,他说自己"已经在那了":家里 8台机器 并行跑,云上 15台服务器(多为Rust编译远程构建),部分机器 256GB内存。一个人,活成了一个小型数据中心他用自己的机器清单,提前印证了Tibo对笔记本资源上限的判断。

▲ 有人已经用个人基建提前回答了"需要什么"。
模型升级之外:地基也要换
前端开发者 Jan Stevens 的一段长评把讨论引向了基础设施。他写道:
"两三个月后会显得原始",是今年关于AI工具最诚实的判断。后半段尤其值得反复琢磨:下一次跃迁会依靠你的笔记本从未被设计来提供的基础设施。

▲ Jan Stevens的分析:过去AI变强多是"同一台机器上的升级",这次连"机器本身要变"。
Stevens 点出了一个容易被忽略的关键区分:过去每一次"AI又变强了"的故事,更大的上下文窗口、更聪明的补全、更快的推理,大多发生在同一台机器上。换个模型,改个参数,工作流程仍能维持。Tibo这次暗示的变化会重新定义硬件的角色:你的笔记本,可能从"战场"退化成"遥控器"。
Stevens 的结论像钉子一样扎进每个开发者心里:"眼下最重要的技能,是别对任何工具产生依恋。因为约束每两三个月就会被改写一次,无陟期。"
云端常驻、永不下线:Agent的下一个形态已经浮出水面
如果Jan Stevens提供了哲学层面的解读,那么 Token Gremlin 的推文则画出了一张技术路线图。
他判断,Tibo说的"原始"主要指向harness(驾驭层),与模型权重本身关系不大。下一前沿已经越来越清晰:更长时间运行的agent、更大的工作记忆、持久化的云端环境、更强的工具编排、并行子代理(subagents),以及足够多的远程算力,多到你的笔记本只剩下一个作用:控制面。


▲ Token Gremlin的推演:笔记本退化为"控制面板",主要工作发生在云端。
OpenAI自己的技术博客已经为这番推演提供了现实参照。 一篇名为《Run long horizon tasks with Codex》的开发者文档记录了一次压力测试:给一个空白代码仓库,完整权限,一份设计规格,然后让Codex连续工作25个小时,消耗约 1300万token,生成约 3万行代码。它已经超出了补全import语句的范畴,像一个连续工作了三个大夜班的数字工人。

▲ OpenAI开发者博客:当agent可以连续工作25小时,"工具"这个词已经不够用了。
医学研究者 Derya Unutmaz 在转发中写出了一个画面感极强的想象:合上笔记本、关灯睡觉,agent在云端继续工作,同时跑几十条并行线程,醒来时PR已经写好了。
这个场景听起来像科幻,但OpenAI在2026年2月发表的工程博客《Harness Engineering》已经在内部实验中部分实现了它。文章记述:一个团队从空仓库出发,在"人类不手写业务代码"的约束下工作约五个月,由Codex生成并演进了一个约 百万行规模 的内部产品。人类做什么?拆目标、定约束、搭反馈环、让日志和指标对agent可读。

▲ 百万行代码,零行手写:OpenAI已经完成了这场为期五个月的内部实验。
一个已经在发生的摩擦:模型太强,钱包先撑不住了
Tibo的这则帖子之前已有铺垫发帖前两周,他写过一篇长文,解释GPT-5.6家族旗舰模型 Sol 上线后的用量问题。
问题出在一个反直觉的地方:模型变强了,但用户的额度反而烧得更快了。



▲ Tibo关于Sol用量的长文:能力暴涨,但成本控制还没跟上。
原因是Sol不像旧模型那样"问一句答一句",它更愿意长时间工作,主动发起更多工具调用,跨工具协调,拉起子代理并行处理,甚至在等待过程中继续干别的活。GPT-5.6引入的程序化工具调用(Programmatic Tool Calling) 让模型可以写轻量程序在内存中协调工具、过滤中间结果、边跑边改流程。Ultra模式则默认用多agent并行。
结果就是:中位用户可能觉得更省了,但重度用户做复杂任务时,额度像沙漏一样哗哗往下掉。前Apple工程师 Ray Fernando 直接在回复里喊话Tibo:*请做一个完整的 agentic runtime!现在的harness像用吸管喝智能,*要引导skills、手调subagent数量、配置改来改去,Ultra在简单任务上烧掉大量不必要的token。

▲ "用吸管喝智能",一线开发者对当前harness的精准吐槽。
这恰恰印证了Tibo主帖的潜台词:能力已经跑在了工具链前面。 模型已经够强,连接模型与现实世界的那层"骨架"却还停留在上一代的设计假设里,编排、调度、成本控制和失败恢复都有缺口。他说的"good harness,but will seem primitive"指向了一套为旧世界而生的工具。
暗战已开:云端vs本地,两条路线正面对撞
Tibo的话被大量解读为"前沿将再向云端和重基础设施倾斜一截",但一条充满黑色幽默的引用转发提醒所有人,世界没那么单极。
开发者 Jun Song 把两种判断摆在一起:OpenAI说"下一代所需的算力已超出笔记本的能力范围";而与此同时,开源阵营正在高喊"新的27B模型直接在你笔记本上跑"。闭源重基础设施路线和开源轻量本地路线,在同一条引用链里迎面撞上。

▲ 两条路线正面对撞:一边要你买服务器,一边说笔记本就够。
与此同时,竞争对手 Cognition 的增长负责人 nader dabit 也毫不客气地在引用中做了一波广告:"同意Tibo!如果你不想等,Devin Cloud Agents已经打磨了两年以上。"

▲ 竞品趁势上分:你的"两三个月后",我们两年前就开始做了。
工具换代之后:职业身份也在改写
回到最根本的一层当agent可以连续工作25小时、一个团队五个月不手写一行业务代码、模型主动拉起子代理并行推进,"软件工程师"这个职业到底还意味着什么?
OpenAI的《Harness Engineering》博文给出了一个答案:工程师的核心工作变成了拆解目标、补齐agent的能力缺口、让系统环境对agent可执行可验证,也就是设计agent的工作环境。
日常使用者Zack Proser在2026年的Codex评测中已经描述了这种双轨生活:维护性任务和样板代码批量交给Codex,复杂架构决策和硬核设计留给自己和其他工具。这种人机分工已经进入日常工作
Tibo说的"major evolution in how we use AI at the frontier",翻译成最朴素的大白话就是:前沿团队的岗位说明书和绩效考核标准,正在从"人写人审"迁移到"人定约束和验收标准,agent执行和互审"。
而这一切,按照那条推文的时间表,只有两到三个月的缓冲期。
Jan Stevens的建议很实用:眼下要学会别对任何工具产生依恋。 因为在这条赛道上,你刚爱上的锤子,下个季度就会变成博物馆的展品。
夜雨聆风