7月快过完了,花了一个下午翻了翻这个月折腾过的AI工具,挑了5个真的在用的,分享一下真实体验。先说一下,我不是那种"每月AI工具大盘点"的号。这5个工具都是我自己装过、用过、有的甚至花钱续费了的。好就是好,不行就是不行,不搞虚的。
第一个,Claude Code内置浏览器。
7月10号Anthropic推的更新,Claude Code桌面版v2.1.202,给IDE里加了个内置浏览器。以前什么流程?遇到不熟悉的API,我得切到Chrome→搜文档→找到调用方式→复制→回来改代码。中间可能还穿插StackOverflow、GitHub Issues、npm README。一折腾,15分钟没了。现在在Claude Code里直接说「查一下axios v1.7的拦截器新写法,按这个帮我重构现有的请求封装」,它自己打开浏览器读文档,读完直接在编辑器里改。我测了一下真实效率。这周重构一个旧项目的HTTP层,涉及27个API调用、17个文件。以前这个活至少要一个下午。用Claude Code浏览器+代码编辑一起搞,2小时20分钟完事。但这东西有个硬伤——浏览器跑在沙箱里,不带你的登录态。如果你要查的是需要登录的内部Wiki或者付费文档,它看不了。Anthropic的意思是你应该用Claude的Chrome插件来解决登录态的问题,但这又回到了"切窗口"的老路子。第二个,Codex CLI多智能体。
OpenAI的Codex 7月把多智能体功能从macOS app搬到了CLI里。说人话就是,你可以在终端里同时起好几个AI代理,各干各的。这东西跟我之前写过的定时脚本自动化不太一样。多智能体的核心场景是「把一个复杂任务拆成几个独立的子任务,同时跑」。举个例子。上周我要给一个Python项目加功能:新增三个API端点、写对应的单元测试、更新API文档。以前做法是一个一个来,改完代码跑测试,写完文档检查格式,来回切。这次我起了三个Codex agent:一个写端点代码,一个写单元测试,一个生成文档。三个agent跑在独立的git worktree上,互不干扰。全部跑完大概18分钟,我只需要最后花10分钟review一遍。但说实话,这个功能目前只适合「任务可以完美拆分」的场景。如果子任务之间有依赖——比如B的代码依赖A的输出——那多智能体的体验就很差,经常出现agent B在那边空等或者拿旧数据干活。另外OpenAI的用量限制是个现实问题。Plus账户一天大概30-150条消息(按复杂度浮动),开三个agent同时跑,几分钟就能烧掉几十条配额。第三个,Cursor云端Agent。
Cursor 7月最大更新不是编辑器功能,是云端Agent——你可以在手机上起一个Cursor agent让它后台干活,不用一直开着电脑。我跟你说一个真实场景。上周日在外面喝茶,突然想到项目里有个性能问题一直没排查——某个查询接口在高并发下会变慢。以前只能在心里记一笔「回去再看」。这次我打开Cursor iOS App,语音输入「排查一下/api/analytics接口在并发场景下的性能瓶颈,看一下N+1查询和慢SQL」,然后继续喝茶。一个小时后手机推了一条通知:agent已生成分析报告,附了4个优化建议,包括两个N+1查询的具体位置和SQL改写方案。这个功能最爽的点不是技术多牛,是它改变了工作节奏。你不用非得坐在电脑前才能推进工作,碎片时间也能用起来。等朋友上菜的十分钟、地铁上的半小时,都可以扔个任务给它。但缺点也明显——云端agent跑在Cursor的服务器上,每个任务大概消耗$2-5的额度(Pro账户有固定配额),不适合拿来跑持续性的重活。而且agent有时候会过度自信,改了一个问题引入另一个问题,review的时候要仔细。第四个,ChatGPT Work长任务模式。
OpenAI 7月9号给ChatGPT加了Work模式,定位是「长任务自动化」。跟普通聊天不一样的地方在于:你可以丢一个复杂需求过去,它自己规划步骤、搜集资料、生成成品。我拿它做了一份AI编程工具竞品分析报告。需求是:「对比Cursor、Codex、Claude Code、GitHub Copilot四个工具,从价格、核心功能、适用场景、优劣势四个维度分析,输出成带表格和引用的报告」。以前做这种事差不多4-5个小时。先搜集信息(两小时),再整理对比(一小时),做表排版(一小时),最后排版(一小时)。这次我从发需求到拿到初稿,36分钟。中间它还问了我两次——「Cursor的企业版价格你是要Pro还是Business?」「Claude Code的SWE-bench分数有两组数据,用哪个?」报告一共12页,包含7张对比表格、每个工具的功能矩阵、价格阶梯和推荐场景。引用来源列了23条,大部分是官方文档和第三方评测。但别指望它完全准确。我审的时候发现3处数据错误(主要是价格和版本号),用了半小时核对修正。所以真实省的时间是4-5小时变成1小时,不是36分钟。第五个,Windsurf。
Windsurf是Codeium公司做的AI IDE,7月份从「AI补全工具」升级成了「全栈AI开发平台」。它跟Cursor最大的区别是——它把AI理解项目上下文的方式做得更激进。具体来说,它读的不是单个文件,而是整个项目的代码结构、依赖图、最近commit记录、甚至你的GitHub Issues。所以当你让它做一件事的时候,它能理解「这个改动会影响哪几个模块」「之前的commit里有类似的修改可以参考」。我试了一个场景:改一个用了三年的老项目的认证模块。项目文档早过时了,好几个关键代码逻辑没注释。Windsurf吃了整个项目之后,给出了一个改动方案,列出了会影响到的6个文件、3个中间件、2个数据库迁移。这个方案基本是对的。Cursor也能做类似的事,但Windsurf的上下文理解更「全局」——它能抓到那种跨模块的隐式依赖,这是Cursor现有的单文件上下文做不到的。缺点:慢。首次索引一个中型项目(500+文件)大概要20分钟。而且付费模式是按token算,深度分析一次大项目可能烧掉几美元。
如果你问我7月这波AI工具最大的变化是什么,我最大的感受是:从「你问AI,AI回答」变成了「你说需求,AI执行」。Claude Code能帮你查文档改代码,但遇到需要登录的内部系统就歇菜。Codex能同时起三个agent干活,但子任务有依赖关系就乱套。Cursor能让你在手机上派任务,但改了A坏了B的情况还是常有。ChatGPT Work能出研究报告,但数据细节你得自己核对。Windsurf能理解整个项目,但索引一次够你喝完一杯茶的。所以结论是:这些工具能省时间,但省的是那种「机械性重复操作」的时间。需要判断力、经验、全局视角的事,还是得你来。以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~/ 作者:Leo / 投稿或爆料,请联系邮箱:wzglyay@virxact.com