这两天我集中试了一圈市面上常见的 AI Agent 工具。

说是测评,其实更像一场真实办公环境里的“拉练”:不是看宣传页写得多漂亮,而是把它们真正拉进项目里,让它们写代码、改文档、做 PPT、整理资料、调用工具、处理文件。

这篇文章不做参数表,也不做官方功能复读。只讲我自己的使用经历和体感。

我这次接触和使用过的工具主要包括:Claude Code、OpenCode、Trae、Codex、Cursor、OpenClaw、Marvis、WorkBuddy。

有些工具适合资深程序员,有些工具适合普通用户,有些工具看起来热闹,但真干活时会露怯。下面按我的个人体验逐个说。
## 1. Claude Code:强是强,但门槛也是真的高

Claude Code 是我最早安装的一款 AI Agent 工具。
但这里有一个现实问题:Anthropic 对国内用户并不友好,官方模型基本上很难正常使用。所以我实际使用时,主要是在 Claude Code 上配置国产第三方模型,比如通义千问、DeepSeek 等。
它最大的特点是命令行操作。
对经常写代码、熟悉终端、知道自己要改什么的资深程序员来说,这种方式其实很直接。你给它任务,它在终端里一步步执行,节奏比较工程化。
但对普通小白用户来说,它并不算友好。
尤其是它每次修改文件时,不会像可视化 IDE 那样把具体改动清清楚楚摊在你眼前。它会告诉你“我做到哪一步了”,但你不一定能马上看明白每一步到底改了什么。
所以我的整体感受是:能用,但不轻松。适合有代码基础的人,不太适合刚入门的用户。
个人评价:★★★⯨☆
## 2. OpenCode:思路不错,但折腾成本偏高

OpenCode 这一类工具,整体气质和 Claude Code 有点接近,都是偏工程师向的 Agent 工具。
它的问题也比较明显:对环境、配置、模型接入、终端操作都有一定要求。你如果本来就熟悉命令行、熟悉 API Key、熟悉模型路由,那它可以成为一个可用工具。
它的有点事它有几款开源模型可以免费用,虽然比不上现在市面上的顶尖模型,但是谁不喜欢薅羊毛呢?
但如果你只是想“打开软件,输入一句话,让它帮我干活”,它就不太适合。
我对它的感受是:更像程序员的工具箱,而不是普通用户的生产力工具。
个人评价:★★★☆☆
## 3. Trae:国产 AI IDE 里完成度不错,但高峰期会卡

Trae 是字节团队做的 AI Agent 产品,对标的其实就是 Cursor。你可以把它理解成一个内嵌 AI 大模型能力的 VS Code。
它分国内版和国际版。我的理解是,国内版主要使用国产大模型,国际版可以接入更广范围的大模型,两者账号和权益并不完全互通。所以如果你准备付费,最好先确认自己买的是哪个版本。
Trae 的整体完成度不错,至少不是那种只能演示、不能落地的工具。我实际用下来,它是可以完成项目开发任务的。
但它也有一个比较明显的问题:高峰期容易阻塞。
有时候你提交任务后,它会进入排队状态。排队时间可长可短,体验上有点像你把需求交给同事,对方回你一句:“收到,我先排一下。”
能不能忍,就看你当时急不急。
个人评价:★★★★☆
## 4. Codex:上手最舒服,生态也最完整

Codex 是 OpenAI 旗下的 AI Agent 工具,现在已经和 ChatGPT 体系融合得更深,桌面端也越来越像一个完整的 AI 工作台。目前它已与GPT融合,成为了GPTwork。
它和 Claude Code 最大的区别是:Codex 有桌面应用,有可视化界面,普通用户上手门槛明显更低。
我个人最深的感受是,GPT 原生模型的理解能力确实强。
很多时候我只需要给一段比较完整的提示词,不需要反复解释,它就能自动拆解任务,搭出一个效果不错的 demo。后续只要做少量修改,就能达到比较接近可交付、可上线的水平。
Codex 的另一个优势,是它不是只有文本模型。
在 OpenAI 生态里,它可以联动文本、代码、图片、语音、文件处理、插件、Skills 等一整套能力。尤其是图像生成能力,我个人非常看重。它生成产品介绍图、海报、人物形象图时,对提示词的贴合度高,图面中文字也更不容易乱。
当然,Codex 并不便宜。如果你只是做简单文本任务,用它有点“拿航母送快递”的意思。但如果你要做完整项目、完整内容资产、完整工作流,它的综合能力目前还是很强。
个人评价:★★★★★
## 5. Cursor:如果只写代码,它仍然是第一梯队

Cursor 本质上是一款内置 AI 大模型能力的 VS Code,也就是 AI IDE。
如果你的需求非常明确:写代码、改项目、调试工程,那 Cursor 依然是我个人非常推荐的选择。
它的优势在于模型选择丰富。你买了它的会员,就相当于获得了一批顶级模型的调用入口。对国内用户来说,这也是间接使用国外大模型的一种路径。
Cursor 的工作模式也比较成熟。它每一次修改都可以追溯,你可以从历史进度里看到具体改动,方便撤回、对比和调整。
它还有一个对国内用户比较友好的点:可以用支付宝购买,少了很多中间折腾。
但 Cursor 也不是没有缺点。
首先,它仍然需要稳定的网络环境。其次,偶尔也会出现网络中断。它的设置里有网络诊断功能,最好每一项都显示通过,使用体验才稳定。
我的结论是:如果你的主要需求就是写代码做项目,不做多模态内容、不做复杂办公流,那 Cursor 仍然是首选之一。
个人评价:★★★★⯨
## 6. OpenClaw:安装这一步,就能劝退一批人

OpenClaw 我用得不多。
原因很简单:安装和启动过程比较折腾。它需要通过控制台启动,中间步骤不少,而且不同电脑配置可能遇到不同问题。
更让我谨慎的是,它的一些 Skill 来源和实现方式不够透明,存在一定安全隐患。对普通用户来说,这类工具不是不能玩,而是最好别拿重要文件、隐私资料、核心项目去试。
在 Codex 桌面端出来之后,OpenClaw 对我的吸引力就大幅下降了。
个人评价:★★★☆☆
## 7. Marvis:界面可爱,但干活不够靠谱

Marvis 是腾讯旗下的一款 AI Agent 产品。
它的界面挺有意思:像一个办公室,里面有很多“牛马”在电脑前工作。第一眼看过去还挺可爱,有点 AI 打工人小剧场的感觉。

但真正用起来,我的体验并不好。
它最大的问题是:每个 Agent 的角色被限定得太死。
有的负责决策,有的负责写代码,有的负责查资料,有的负责整理文件。看起来像一个团队,实际用起来却有点僵。
如果你让它做非常标准、边界清楚的任务,它还能跑一跑。可一旦任务变得综合、多元、需要跨能力协作,它就开始吃力。
我曾经让它把 Word 文档里的资料整理成 PPT。它确实整理了,但格式、排版全都不对:文字块比页面还大,大量文字溢出到页面外,它也不会主动复核修改。活干完了,就像打卡下班。
最扎心的是:效果没达到预期,该烧的 Token 一点没少。
这个工作态度,像极了公司里那种“事我做了,结果你自己看着办”的同事。
个人评价:★★⯨☆☆
## 8. WorkBuddy:目前我看到的 Codex 桌面端最佳国产替代

WorkBuddy 同样是腾讯旗下的产品,但它的完成度和使用体验比 Marvis 强了不止一点。
它的整体界面设计和 Codex 桌面端有点像:左侧是菜单栏和项目列表,中间是主会话区。每个项目里,你可以加载智能体、Skill、连接器、MCP、定时任务等功能。
这些概念和 Codex 很接近,上手门槛不高。
它最有特色的一点,是可以加载专家团。
也就是说,你可以在一个项目里配置一个智能体集群,让不同专家一起协作。它不再只是一个 AI 在回答你,而更像一个小团队在帮你处理任务。
当然,这种模式消耗的 Token 也会更多,不能无脑开。
但 WorkBuddy 现在还处在抢市场阶段,初始账号有一定积分,每个月也有免费额度。如果只是轻度使用,免费额度基本够用。
由于它是国产软件,主要面向国内用户,所以模型配置也以国产大模型为主。对不会开魔法、对国外顶级模型没有执念的用户来说,它是一个很现实的选择。
还有一个我觉得挺实用的点:它可以通过微信扫码,实现用手机给电脑端 WorkBuddy 发指令。这个场景很接地气,适合日常办公里随手派活。
目前来看,它是我心里 Codex 桌面端最接近的国产替代品。
个人评价:★★★★⯨
## 总结:别只看模型强不强,要看整条工作流顺不顺
这轮体验下来,我最大的感受是:
AI Agent 工具之间的差距,不只是模型能力的差距,更是产品形态、交互方式、生态能力和任务闭环能力的差距。
如果你是资深程序员,熟悉命令行,可以试 Claude Code、OpenCode 这类工具。
如果你主要写代码,想要稳定的 AI IDE,Cursor 和 Trae 更合适。
如果你想要完整桌面端、多模态、插件、文件处理、图像生成、项目协作能力,那 Codex 仍然是我当前最推荐的选择。
如果你想找国产替代,尤其是不想折腾网络环境、不想接国外模型,那 WorkBuddy 是目前比较值得尝试的一款。
至于 Marvis,它的创意不错,但现阶段我不会把重要任务交给它。
最后给一个非常实用的建议:
不要只听别人说“某某 Agent 很强”。一定要拿自己的真实任务去测。
因为一个 AI Agent 到底好不好用,不是看它演示视频里跑得多丝滑,而是看它能不能在你的文件、你的项目、你的工作流里,把活真正干到能交付。
这才是 AI 工具从“玩具”变成“生产力”的分界线。
夜雨聆风