
近期DeepSeek发布开源工具DeepSeek Harness押注低价和开发者接入,SpaceX AI也几乎同时发布Grok Bot押注实时信息与Agent执行。ClaudeCode、Codex作为老牌同赛道强者,依旧竞争激烈。
竞争已经从比模型转向抢入口
AI大模型的竞争已经不只发生在榜单上了。
时至今日,OpenAI和Anthropic仍守着高端能力,但还要争开发者入口、工具权限和长期任务。DeepSeek把重点放在低价、长上下文和接口兼容上,Grok则把实时信息、X生态和Agent功能绑在一起。
DeepSeek最近的更新很密集。7月31日,官方API文档公布V4 Flash公开测试,8月13日又上线V4 Pro。两个版本都提供1M的上下文,并接入Responses API和Codex。官方还宣布,API将在北京时间8月16日的16:00起按峰谷时段计费。但对开发者来说,模型便宜只是第一步,能不能稳定接入现有工作流更重要。
马斯克的xAI动作则更像在扩充产品入口。7月16日发布Grok 4.5后,Grok陆续进军网页、X和移动端,又推出Workflows和BuildMode。关于最新的模型,网络媒体8月13日报道了Grok4.6的最新动向,但截至成稿,公开可比测评仍以Grok4.5为主。

横评:价格、Agent Arena、Text Arena和SWE-bench Verified评分
四个产品并不在同一条赛道
众所周知,Claude Code和Codex都是AI编程工具的先驱,但ClaudeCode更靠近本地终端,Codex更像远程执行任务的Agent。
DeepSeek Harness是开源底盘,需要自己组合终端、文件系统、网页和子Agent。GrokBot则把实时信息和自动执行放在一起。
根据各家产品形态不同,定价刀法也很耐人寻味。Claude Code个人方案为Pro每月20美元、Max5x每月100美元、Max20x每月200美元。ChatGPT Plus为每月20美元,Pro为每月200美元。
Grok Bot新出就整大活,它不算在Grok聊天套餐内,也不含付费xAI API。公开接入信息显示,Grok Bot目前通过SuperGrok Heavy、Cursor Ultra和Cursor Teams Premium提供,价格参考为个人每月300美元、企业和团队每月200美元或每席位120美元,没有Free版本额度。之前参与的SuperGrok每月30美元、SuperGrok Plus每月100美元属于普通Grok消费订阅,均不能享受Grok Bot价格栏。

目前的AI客户端,会因为控制权、上下文和成本而走向不同工具
模型榜单排名
截止8月12日的公开快照中,Arena Agent排名为:
Claude Opus 5 High第1,净提升分12.01
GPT 5.6 Sol xHigh第4,10.80
Grok 4.5第15,6.00
DeepSeek V4 Flash High第18,3.89,V4Pro第27,暂无分数
这个榜单测的是模型加配置在真实任务里的表现,不能直接当成四款产品的总排名。
Arena Text的开放对话榜单里:
Claude Opus 5 High第7名、1494分
GPT 5.6 Sol xHigh第18名、1481分
Grok 4.5第34名、1469分
DeepSeek V4 Pro第49名、1458分
SWE-bench Verified同一快照中,Claude Opus 4.8为88.6%,DeepSeek V4 Pro为80.6%,GPT 5.4为80.0%,Grok 4为75.0%。
分数能说明模型在某类任务中的位置,但不能为消费者们省掉权限管理、测试、使用体验等选择权重。

四类工具不是同一张榜单上的四个名次
Claude Code和Codex:一个在本地,一个在云端
Claude Code作为AI编程工具目前的霸主,优势在连续协作:读文件、改代码、跑测试,再根据结果继续改。它适合长期待在一个仓库里工作的开发者,代价是终端权限、上下文和用量都要自己盯着。Codex把任务放进隔离环境,适合查问题、写补丁和跑验证,再回来检查结果。它更像一个远程同事,任务拆得越清楚,交付越稳定。
两者都不是按下按钮就能交付的黑箱。线上配置、权限变更和数据操作,仍然需要开发者确认。
DeepSeek Harness:价格低,底座要自己动手
DeepSeek Harness的吸引力在于便宜、上下文长、模型可替换。V4 Pro在SWE-bench Verified拿到80.6%,但在Arena Agent公开快照里排第27,这个落差说明离线修复题成绩和真实任务体验不是一回事。它适合愿意自己安装、配置和排错的高自定义化用户,不适合无基础或把它当成开箱即用软件的消费者。
Grok Bot:不是聊天窗口
根据x.ai/bot的产品定位,Grok Bot目前还处于Early Beta阶段,能登录用户工具,在云端持续执行任务,相当于同时拥有了一套云开发环境。Workflows、Automations和BuildMode已经把Grok从实时搜索带向应用执行,但权限范围和实际接入工具仍决定使用上限。
这也是Grok Bot价格高于普通Grok订阅的原因。SuperGrok Heavy、Cursor Ultra和Cursor Teams Premium是接入套餐参考,与之前的谈话和API套餐完全不适用。
如何选择?看工作内容
如果主要在本地仓库里写代码,Claude Code更顺手。需要异步处理一批任务,Codex更合适。想用低成本模型自己搭Agent,可以试DeepSeek Harness,但要留出配置和维护时间。需要追踪现场信息,再把任务交给云端执行,Grok Bot的方向更对口。
四款产品很难选出一个总冠军。我更推荐的搭配是:Grok负责找现场,DeepSeek负责低成本试错,Claude Code或Codex负责落地和验证。

夜雨聆风