昨晚刷推,一张截图把整条时间线看懵了。
冲上GitHub热榜第一的这款插件,发布方让人意外,是OpenAI。
而它的作用,是让你在Claude Code里,把活儿甩给Codex去干。
一家做「大脑」出身的公司,亲手给对家递上了一双「手」。
一条推文,掀开了这层窗户纸
开发者@Lonely__MH 在7月4日晚上发了条推文,配图是GitHub Trending页面的截屏。
推文第一句就把时间线钉死:Fable 5回归后,OpenAI的Codex插件codex-plugin-cc冲上了GitHub Trending第一。
截图里写得清清楚楚:openai/codex-plugin-cc 排在全球第一,当天新增716颗星,一句简介挂在标题下面,
"Use Codex from Claude Code to review code or delegate tasks."
「在Claude Code里调用Codex,做代码审查或者任务委派。」
这条推文两天内涨到1.4万次查看,92个赞,149次收藏。评论区里,一种共识迅速成型,@Lonely__MH自己把这套共识拧成一句:
「让Fable 5负责大脑,让Codex负责执行。」



▲ @Lonely__MH 的推文与配图。openai/codex-plugin-cc 冲上GitHub Trending全球第一,当日新增716星,JavaScript语言榜同样第一
被暂停,又被召回的Fable 5
真正的起点,要往回倒半个月。
6月9日,Anthropic正式发布Claude Fable 5,Mythos-class模型系列里第一个「安全通用版」。官方公告的原话是:能力超过此前发布的任何一款模型,几乎在所有基准上都是当时最强。
好日子没撑过三天。6月12日,Anthropic突然宣布暂停Fable 5和Mythos 5的访问,理由指向安全与容量。官方页面留下的只有一句道歉:
"We are suspending access to Claude Fable 5 and Claude Mythos 5. We apologize for this disruption to our customers and are working to restore access as soon as possible."
「我们正在暂停Claude Fable 5与Claude Mythos 5的访问权限。给客户带来的影响,我们深表歉意,团队正在尽快恢复。」
开发者们等了将近三周。7月1日,Fable 5重新全球可用。三天之后的7月3日,openai/codex-plugin-cc冲上GitHub Trending日榜第一。
时间点严丝合缝。Fable 5一回归,压了半个月的「拿它干什么」的讨论就全冒了出来。冒出来的答案很干脆:把Fable 5摆在指挥位置,让它去调度别的模型干活。

▲ Anthropic官方公告页。6月9日发布、6月12日暂停、7月1日恢复,三个时间节点都被完整记录在同一个页面上
插件葫芦里卖的什么药
codex-plugin-cc的角色是一座桥,把Codex嫁接进Claude Code的工作流,不需要另起一个新模型。
仓库信息摆在那里:24000+星,1500+ fork,Apache-2.0协议开源,12名贡献者,主分支28次提交,最新版本v1.0.5两周前刚更新过。仓库简介,就是开头截图里那句英文原话。
安装只要三条命令:
/plugin marketplace add openai/codex-plugin-cc
/plugin install codex@openai-codex
/codex:setup
装完之后,Claude Code里多出一整套斜杠命令:
/codex:review,让Codex做一次只读代码审查 /codex:adversarial-review,「挑战式」审查,专门挑毛病 /codex:rescue,把任务整个甩给Codex执行,可以指定模型、可以挂后台跑 /codex:status、 /codex:result、/codex:transfer、/codex:cancel,追踪、领取结果、转移会话、取消后台任务
复用的是本地已经装好的Codex CLI,同一套登录信息、同一份配置、同一个代码仓库环境。不用切窗口,不用来回复制粘贴,一条斜杠命令,活儿就派出去了。

▲ openai/codex-plugin-cc 仓库主页。24k星、1.5k fork,README第一行就把用途交代得明明白白
强模型的代价,才是分工的起点
真正把「分工」这件事推向必然的,是Fable 5自己的脾气。
独立开发者Simon Willison拿到Fable 5之后,连续测了5.5小时,写下这样一段话:
"This is something of a beast. It's slow, expensive and has been quite happily churning through everything I've thrown at it so far."
「这家伙算得上一头怪兽。速度慢、价格贵,可扔给它什么活儿,它都乐呵呵地啃得动。」
数字摆在那儿:Fable 5定价每百万input token 10美元,output token 50美元,是Opus 4.8的整整两倍。安全护栏也更严,涉及网络安全、生物化学相关的查询,系统会自动切换到能力稍弱的Opus 4.8兜底,官方给出的触发概率不到5%。
慢,贵,护栏还多。三个词摆在一起,结论只剩一个:让Fable 5从头到尾包办所有活儿,不划算。
但Fable 5真正厉害的地方,原本就不在「手速」上。@Lonely__MH在原帖里列了一串,理解复杂需求、拆解底层任务、制定执行策略、识别潜在风险、控制任务优先级。这些活儿,属于规划层面,跟一行一行敲代码完全是两码事。
写代码、跑测试、Code Review、处理重复性工程,这类体力活交给基于GPT-5.5的Codex来干,反而更划算。
一边贵但会想,一边便宜但能干。插件把两者焊在了一起。

▲ Simon Willison的实测笔记:「这算得上一头怪兽」,慢、贵,却确实强
瓶颈,从模型转移到了人
插件冲榜的同一时间窗口,Anthropic内部Claude Code核心研发@trq212发了条长文,标题叫《A Field Guide to Fable: Finding Your Unknowns》(《Fable使用地图:找到你的未知》)。这条推文6100+赞,172.8万次浏览。
他抛出一个直戳痛处的判断:
"Working with Claude Fable 5 keeps re-teaching me an old lesson: the map is not the territory... Fable is the first model where I find the quality of the work is bottlenecked by my ability to clarify its unknowns."
「和Fable 5一起工作,一次次印证一个老道理:地图终究不等于疆域。地图,是我给它的提示词、技能和上下文;疆域,才是活儿真正发生的地方,代码库、真实世界,以及那些实际的约束。Fable是第一个让我感到,活儿干得好不好,取决于我有没有本事把「未知」讲明白的模型。」
他把认知心理学里的「已知已知/已知未知/未知已知/未知未知」四象限,变成了一套跟Claude协作的具体动作:盲区扫描、头脑风暴、深度访谈、实施计划、实施笔记、交付物打包、事后测验。
翻成大白话:模型越强,越不会犯「听不懂」的错误,却越容易犯「猜错了」的错误。你没交代的部分,它会拿自己的最佳猜测去填。猜得准不准,全看你有没有本事把脑子里那些没写进提示词的假设倒出来。
这解释了插件为什么偏偏在这个节点火。Fable 5负责画地图,把「未知」问出来,把风险拆出来,把计划定下来。这件事需要模型有足够强的判断力,却用不着它同时去啃每一行代码。地图画完,疆域上剩下的活儿,转手交给执行力更强、价格更友好的Codex去跑。


▲ Claude Code核心研发@trq212的长文截图。原文6100+赞,172.8万次浏览,被@Lonely__MH转发总结
数据不撒谎:蓄力三个月的爆发
有人可能会问,GitHub Trending这种榜单,一天上去第二天就掉,能说明什么?
第三方追踪平台Trendshift给出了另一份数据:openai/codex-plugin-cc早在3月30日就拿过JavaScript分类日榜第一,3月31日拿到全站日榜前四。直到7月3日,它才第一次拿下全站日榜第一。
三个月前就已经在小圈子里流传,三个月后才真正破圈,这是蓄力三个月之后的一次爆发。仓库12名贡献者、28次提交、6个正式发行版本,两周前刚更新到v1.0.5,活跃度从没停过。
支持的声音很整齐:未来最强的Agent,一定是强强联合。英文社区里也有类似判断,插件互操作正在赢,比两家互相封锁更有利于开发者。
谨慎的声音同样存在。有人指出,两个强模型来回接力,若是缺一层「工作台」去沉淀需求、风险、改动记录和验收标准,记忆很容易散架,这也是@trq212那套「实施笔记」「事后测验」被反复提起的原因。也有人发现,系统编程、终端重度的场景里,纯Codex或者纯Claude Code依然各有优势,混合也未必是最优解。

▲ Trendshift数据:openai/codex-plugin-cc早在3月30日就拿过JavaScript日榜第一,7月3日才首次登顶全站日榜
比模型更重要的,是那层脚手架
这件事往深处想,指向一个更大的判断:决定一个模型好不好用的东西,正在从模型本身,滑向套在它外面的那层脚手架(harness)。
有基准测试显示,同一个Fable 5,换一个运行环境,表现能天差地别,在某个harness里排名中游,换到另一个环境里就能冲到安全修复类任务榜首。模型没变,变的是「谁在指挥它、怎么指挥它」。
这套路数,历史上演过一次。早年GPT-4、Claude 3那一代,Cursor、Aider这些工具已经证明过:一个「普通」的模型,配上足够好的脚手架,也能榨出超预期的生产力。codex-plugin-cc做的事情,本质上也是脚手架,把另一家公司的agent,变成自己工作流里的一个子代理。
对开发者来说,这套心法比追着哪家模型更强更有用:用强模型做盲区扫描和计划,把体力活交给执行力强、价格友好的模型,再用笔记、测验、issue把「未知」的部分钉下来。
单一模型称霸的想象正在让位于另一种图景,不同角色、不同成本结构、不同工具链,拼成一支队伍。这支队伍里,没有谁是无所不能的孤胆英雄。
夜雨聆风