看懂科技趋势,建立自己的生产系统。AI 正在重新分配普通人的能力。
上周刚写完SpaceX花600亿美元买Cursor。这周,AI编程工具的世界又变了。
6月16日,LogRocket发布了2026年6月版《AI开发工具实力榜》。排名第一的不是Cursor,不是Claude Code,是一个很多开发者还没听过的名字:OpenCode。而OpenAI也在6月初悄然上线了Codex App的GA版本。
我把这个周末花在四个工具上了。
OpenCode:免费的开源黑马
OpenCode是一个终端原生的AI编程代理。不是IDE插件,不是代码补全工具。你打开终端,跟它对话,它直接读你的代码库、理解项目结构、生成代码、运行测试、修bug。
跟其他三个最大的区别:它不绑定任何模型。Claude、GPT、Gemini、DeepSeek、GLM、Kimi、Qwen——75个模型随便换。今天觉得Claude贵了就切DeepSeek,明天有复杂任务切回Claude。厂商锁定?不存在。而且MIT开源,代码全公开,你可以审、可以改、可以自己部署。
我在一个Spring Boot项目上试了三个场景。生成REST接口时,它自动识别了Controller层、Service层、Entity的位置,连MyBatis的XML映射都一起生成了。跨文件重构时,改了一个接口签名,17处调用一处没漏(上周用Cursor做类似操作漏了3处)。修并发bug时,它不仅发现了HashMap线程不安全的问题,还分析了并发度和读写比例,解释了为什么ConcurrentHashMap比synchronized更合适。
160K GitHub Stars,750万月活。上线不到一年登顶LogRocket第一。但坦白说,单次任务性能它比Claude Code慢(有评测说慢78%)。它登顶靠的不是跑分,是开源+免费+75+模型覆盖带来的自由度。开发者用脚投票了。
Codex App:不是CLI,是"虚拟工程师"
Codex App和Codex CLI是两个东西。CLI是终端命令行工具,App是桌面端全功能智能体——你可以理解成一个住在你电脑里的虚拟工程师。6月初GA版本上线后,它多了三个让我觉得"这不再是玩具了"的功能。
Sites:一句话生成全栈应用。你说"给我做一个团队周报数据看板,后端Node.js,前端React,数据库SQLite",它直接生成完整项目并在Sites面板里一键预览。不是给你代码让你自己跑,是直接给你一个能打开的网站。我试了一个简单的周报看板,从描述到能打开的页面大概90秒。环境变量和密钥管理都在侧边栏搞定,对原型验证来说效率提升不是一点半点。
Computer Use:AI操作你的电脑。6月GA版全面支持了Windows,Codex能看你的屏幕、移动鼠标、点击按钮、输入文字。我从手机上的ChatGPT App远程给电脑发了"升级项目依赖并跑测试"的任务,回来一看它自己开终端、敲命令、处理了一个版本冲突、跑完测试还把失败的3个用例贴了出来。听起来有点吓人,但OpenAI加了生物识别锁和操作权限级别。
持久化Goal:你给它一个宏大的工程目标,比如"分析最近一周的Git提交,找出5个安全风险点,逐一重构并跑测试",它自动分解成多个子任务,跨会话持续执行。你可以中途暂停检查、分叉实验不同方案。这个功能适合大规模重构——单次对话搞不定的那种。
有个细节值得注意:Codex的token效率很高。同样的任务,Claude Code用的token大概是Codex的4倍。这意味着在$20/月的订阅档位下,Codex的限额更宽松,重度用户不容易撞墙。但在复杂任务的准确率上,Claude Code的SWE-bench Verified 80.8%仍然领先Codex的56.8%(SWE-bench Pro)。
这三个功能其他三个工具都没有。代价是闭源+绑定OpenAI生态+需要ChatGPT Plus订阅。
Cursor:最快最顺手
Cursor是基于VS Code深度改造的AI原生IDE。它的Tab补全快到我有时候没反应过来代码就写完了,尤其是写Python脚本的时候,经常一次补对整段逻辑。
但有个坑。有两次它补的代码看起来没问题,跑起来才发现依赖的类根本不存在——它幻觉了一个不存在的API。这在Spring Boot项目里特别危险,因为你不会逐行检查import。另外它的跨文件联动不如Copilot,改了接口签名有时不会提示你调用处也需要改。
Cursor最大的优势是IDE体验。如果你习惯了VS Code的工作流,Cursor的迁移成本几乎为零。$20/月,闭源,模型选择有限。上周SpaceX花600亿买的就是这家公司。
Claude Code:最准但最贵
Claude Code是Anthropic推出的终端编程代理,以长逻辑推理和复杂算法处理著称。SWE-bench Verified 80.8%,目前是跑分最高的。
我试了一个并发场景的重构任务——把一个同步的订单处理流程改成异步的。Claude Code不仅给出了正确的CompletableFuture实现,还主动提示了线程池大小需要根据QPS调整,以及异常处理的降级策略。这个深度的推理其他三个都做不到。
300K+的上下文窗口让它在处理超长代码和复杂依赖时有明显优势。但代价也是实打实的:$20/月,闭源,只能用Claude模型。而且速度偏慢,每次慢0.4秒换来11%的准确率提升——值不值看你的任务复杂度。
所以怎么选
不是"哪个工具最好"的问题。是你需要什么的问题。
OpenCode:免费 · 开源(MIT) · 75+模型随意切换 · CLI终端。最大自由度,零成本。
Codex App:ChatGPT Plus $20/月 · 闭源 · GPT-5.5系列 · 桌面App。最强工程能力,全栈生成+远程操控。
Cursor:$20/月 · 闭源 · IDE(VS Code)。最快最顺手,Tab补全体验最好。
Claude Code:$20/月 · 闭源 · CLI终端。最准,复杂任务成功率最高。
我自己的方案:Claude Code做主引擎(准确率最高),OpenCode做日常辅助(免费+灵活),Codex App做原型验证和远程任务(Sites+Computer Use太方便了),Cursor留着偶尔需要IDE深度集成的时候用。
🔧 这个周末跑任务、读LogRocket报告、对比四个工具,差不多花了半天。
💬 你现在的主力AI编程工具是什么?有没有人已经在用OpenCode或Codex App了?留言区交换一下体验。我会挑3条最有启发的评论,送出下期工具实测的提前试阅版。
📌 设为星标,每周六一篇工具实测,帮你找到真正好用的AI工具。
AI / 自动化 / 一人公司
👇 点击下方公众号名片,关注「未来协议」
夜雨聆风