乐于分享
好东西不私藏

第四篇:Codex和OpenClaw到底有什么区别

第四篇:Codex和OpenClaw到底有什么区别
这篇和上次一样,也是在旅行回来的路上写的。不过这次的返程有点折腾:受上海台风影响,原本订好的卧铺被临时取消,改成了普通动车的坐票,一路坐回来的,还是有点折腾。
🎵 这次推荐后摇歌曲:Neko Nine - *Fireworks Up There*
Neko Nine 是来自俄罗斯雅罗斯拉夫尔的后摇单人计划,由 Seva 于 2009 年创立,风格横跨后摇、后金属与氛围电子。*Fireworks Up There* 收录于 2014 年的合辑《Meet the Forest》--细腻的吉他音墙层层铺开,安静中带着光亮,适合在阅读时循环播放。

这两三周还是挺忙的,不过也把 Codex 完整体验了一把--发现它和 OpenClaw还是有很大不同的。
先打两个比方:
也许现在没什么人说自己「养龙虾」了吧。我坚持用 OpenClaw,图的也是这种乐趣:一个纯原生、不带商业色彩的智能体框架,有点像一台 3D 打印机,你用它做出自己的作品,纯 DIY,享受的是过程本身。而且不少 Claw 类产品的设计里,都能看到 OpenClaw 的影子。
Codex则是另一种体验:它更像一位 AI 顾问,用很专业的方式和你讨论问题、共同完成任务,而且几乎以无错的方式交付。有点像它帮你做完了设计、开好了模,最后按你的需求交付一个成品。

一、交互和使用方式

我和OpenClaw的交互,90% 以上发生在飞书上:下发任务、查看结果、追问修正,全在聊天窗口完成。因为 OpenClaw 部署在云端的 UOS 系统上,只要手机有网,高铁上、睡觉前都能和我的 Agent 贾维斯对话。剩下的不到 10% 是管理类操作--升级、配置新模型、查看关键状态,这些在终端里做更顺手。
Codex则完全是另一种形态。我使用Codex是在MacBook的ChatGPT的桌面应用端上, 我只能打开电脑时候才能使用。因为他需要调用本地的系统资源,因此你需要让电脑每时每刻处于开机状态,才能通过远程控制方式远程使用。除非我后面升级到MacMini,才适合这么操作。Codex+IM的方案没测过,应该也是可以实现远程操控的,但是解决不了操作系统云化,那也白搭。再加上Mac系统不太好云化,基本就没办法实现OpenClaw那种使用效果了。当然可能还有一种方式就是把Codex软件装在windows上。总之:
OpenClaw 更开放,对操作系统依赖小;Codex 更封闭,只有使用它的模型和它的客户端,才是最好的体验。

二、开源和闭源,以及开放性方面

OpenClaw是开源框架,接模型非常自由。我接了七八个厂家、十几种模型,配置好就能用,/model一条命令在同一会话里切换,Agent 立马换一种「人格」。还记得上一篇给大家看过的那个「过度自信」的贾维斯吗?换了模型,就是另一个画风:
同一个贾维斯,换个模型,从「完美!这次100%没问题!!!」的脱口秀演员,变成了严谨的工程师。
OpenClaw的插件和 Skill 也全开放:用官方的、第三方的,或者自己写、自己注册,都行。
Codex官方也支持接第三方模型,但体验最好的还是 ChatGPT 自带的模型,每次会话按任务需求设一下推理强度就够了。官方预置的 Skill 和插件通过 MCP 与第三方应用交互。在官方库里挑插件的好处是绝对的稳定性:只要和第三方平台完成双向认证,它就能直接操作平台,比如编辑 Figma 设计文件等等。

三、项目和任务管理

两者都有 workspace,但管理方式不太一样。
OpenClaw会自己根据任务创建工作目录,名字随模型「心情」来--不同模型命名风格还不一样。虽然可以通过 Agent Prompt(AGENTS.md)强制约定,仍有一定随机性。我的解法是:每天的工作内容和知识总结做向量化,定时构建知识图谱,把记忆持久化下来。这样即使上下文超限被自动压缩(OpenClaw 会在超限时 Compact,早期细节会丢),新会话里让 Agent 搜一遍记忆,任务就能接上。代价是得多问一句:「还记得我们之前做的项目吗?
Codex需要你手工创建项目空间、强制命名,项目之间的上下文和会话完全隔离。好处是严谨,做什么都在自己的管控范围内,而且会话上下文独享,长任务可以放心堆料。
对比一下上下文体验:之前在 OpenClaw 里用 GLM 5.2,跑不到300K就得 Compact,不然会被模型拒绝请求;最近有改善,最长的一个会话跑到了380K--不过里面多少混了些和任务不相关的内容。
而且 300K 以上不只是「能不能跑」的问题。
一旦上下文过了 300K,Coding Plan 的 5 小时请求额度消耗会明显加快--长上下文请求按更高的计费系数算,几轮下来额度掉得很快。
更要命的是幻觉问题开始严重:模型会从长上下文里「捡」到旧指令去执行。我就遇到过,任务执行到一半,它意外触发了 git 知识库总结和 workspace 文件扫描的命令,好好的任务里突然冒出一堆不相干的操作。事后贾维斯自己也交代了:图谱脚本里本来就没有 git 命令,那个git add -A是它在长上下文里自己「脑补」出来的动作。
Codex这边不会有这种焦虑,偶尔出现的问题是推理速度会变慢,因此也建议根据自己的需要,手工执行/compact

四、任务执行结果

OpenClaw执行任务,经常需要我纠正多轮才达到效果,但一旦达标,下次它会照着做。有个任务前后改了十几遍才过关:
同一个文档改出了6个版本,手机里存了一排。
后来我强制让它在交付前调用多模态模型做二次自检。不过要说清楚:Image 模型解决不了审美问题,它能做的只是最基础的重叠、错位这类判断--而且我用的是以大语言为主的多模态模型,不是纯视觉模型,这可能是效果一般的原因之一,也许换成纯 VL 模型会改善。普通文档类检查基本没问题了,但带交互的任务做得还是一般。
Codex每次执行都会自检,交付质量稳定,需要人工干预的次数明显少很多。交互设计上的短板可以用第三方插件补--我最近在试 ChatGPT + Figma,据说是交互设计方面的王炸组合,成果后面再分享。
还有一个有意思的差异,我不确定是模型的问题还是框架的问题:OpenClaw 执行复杂任务时,习惯简单思考后就动手,而且喜欢先做前端;Codex 会先分析透,先干后端,后端基本稳了再干前端。提问风格差得更远--同一个任务,ChatGPT 能问我十几二十个问题,确认清楚再动手;OpenClaw 换上 DeepSeek V4 Pro,问 4 个问题就开干了,而且先干了前端。等于说:
一个问十几二十个问题才动手,一个问四个问题就开始干。

五、一个有意思的边界问题

Codex从不夸你、奉承你,回复里没有「这是个好问题」之类的废话,只关注事情本身。安全边界也很高:不主动要数据,敏感操作都要你亲自授权--这也是为什么你得一直坐在电脑前。我让它帮我生成一份身份证复印件文件,它直接拒绝了,理由是「我不能获取你的身份证信息」(这理由多少有点此地无银三百两的意思)。
再补充一个 Codex 的安全原则:它坚决不会帮你篡改数据,也不会执行违法的事情--这是它的安全红线
同一个任务交给OpenClaw,没有触发安全边界,干了几轮,最后干得还不错。当然准确地说,OpenClaw 也有安全策略,只是默认相对宽松,策略的松紧设置到什么程度,可以自己配置--也就是说,它的安全边界是弹性的

六、简单总结下

简单总结一下这两三周的体验:OpenClaw 胜在开放灵活,模型、插件、部署环境都随你挑,代价是项目和记忆要自己打理;Codex 胜在稳定省心,自检、提问、交付质量都在线,代价是留在它的生态里、坐在电脑前。一个灵活,一个省心。
接下来我打算把 Codex 再深度用一段时间,特别是 Codex Cloud,体验完再聊。OpenClaw 这边还有一些进阶玩法,后面一并分享。另外,最近我在 DIY 一个小工具叫 Calnote--一个轻量的日历工具,用来记录日常的已办和待办事项,后面也会聊一聊。到时候给大家做个总结:什么场景,更适合用哪个 Agent

*作者:Kun|一个AI Cloud从业者*