乐于分享
好东西不私藏

开源 Agent 实测:OpenClaw、Hermes Agent 与 OpenWorker

开源 Agent 实测:OpenClaw、Hermes Agent 与 OpenWorker

前两篇文章分别测试了国内和国外商业 Work Agent 在同一份 PRD 下完成 MVP 的实际效果。

本篇继续采用相同测试方式,选择 OpenClaw、Hermes Agent 和 OpenWorker 三款开源 Agent,验证其在真实开发任务中的交付能力。


01 实验环境

本次测试同样使用 DeepSeek-v4-flash 作为底层模型,并基于各 Agent 提供的主要使用入口完成任务验证。

OpenClaw

github地址:https://github.com/openclaw/openclaw

OpenClaw 提供桌面端应用和 CLI 命令行两种主要使用方式,其中桌面端适合直接使用,CLI 更适合开发者进行自动化任务和能力扩展。

Hermes Agent

github地址:

https://github.com/NousResearch/hermes-agent

Hermes Agent 提供Desktop 桌面端、CLI/ TUI 命令行、Web / Dashboard 等多种使用方式;

OpenWorker

github地址:

https://github.com/andrewyng/openworker

OpenWorker 是 Andrew Ng(吴恩达)团队开源的桌面 AI Agent 项目,于 2026 年 7 月发布,定位为面向日常工作的 AI Coworker。

本次验证统一采用桌面端入口完成测试。


02 OpenClaw 实测结果

OpenClaw 页面效果图
OpenClaw 完成了本次 MVP 开发任务,最终交付包括:
  • • Web 页面;
  • • 数据文件;
  • • 后端服务;
  • • 项目文档。

从项目结构看,代码、数据、服务、页面进行了明确拆分,目录组织较清晰,具备较好的工程规范性。

根据复盘记录:

  • • 完成耗时:约 40~45 分钟;
  • • 人机交互修正:7 轮;
  • • 代码规模:约 2200 行;

本次主要问题集中在工程细节:

  • • 页面路径调整;
  • • 数据源链接处理;
  • • 文件编码修复;
  • • SQLite 数据访问链路优化。

其中 CSV 模式运行正常,SQLite 模式仍需进一步验证。

评估结论:

OpenClaw 能够较完整完成从需求理解到 MVP 交付的开发流程,具备较好的快速构建能力。

但实际工程交付仍需要人工参与验证和修正,尤其是运行环境和数据访问等细节。

完整开发过程见项目复盘:OpenClaw 复盘记录[1]


03 Hermes Agent 实测结果

Hermes Agent 页面效果图

Hermes Agent 完成本次 MVP 开发任务,最终交付包括:

  • • Web 页面;
  • • SQLite 数据库;
  • • CSV 数据文件;
  • • API 服务;
  • • 项目文档。

根据复盘记录:

  • • 完成耗时:约 35 分钟;
  • • 人机交互修正:7 轮;
  • • 总交互轮次:约 25 轮;
  • • 代码及文档规模:约 3800 行;

本次主要问题集中在数据获取环节。

在数据检索过程中,多个搜索渠道受限,最终采用已有公开信息构建数据,并在文档中标注需要人工复核。

另外,部分前端代码和页面功能仍经历多轮修正,包括模板渲染、编码兼容、详情页展示等问题。

评估结论:

Hermes Agent 本次表现出较完整的工程组织能力,能够完成从需求分析、数据建模、页面开发到验收验证的完整流程。

相比单纯页面生成,Hermes 在数据结构设计、文档完善和验证流程方面表现更突出。

但在依赖外部真实数据的场景下,数据获取和真实性仍需要人工审核。

完整开发过程见项目复盘:Hermes Agent 复盘记录[2]


04 OpenWorker 实测结果

OpenWorker 页面效果图

OpenWorker 完成本次 MVP 开发任务,最终交付包括:

  • • Web 页面;
  • • SQLite 数据库;
  • • 数据文件;
  • • API 服务;
  • • 项目文档。

根据复盘记录:

  • • 首次交付耗时:约 23 分钟;
  • • 最终交付耗时:约 34 分钟;
  • • 人机交互修正:4 轮;
  • • 最终代码及文档规模:约 3800 行。

本次主要问题集中在需求解析阶段。

复盘显示,PRD解析过程中未能完整还原原始需求约束,导致后续任务规划基于部分信息展开。

OpenWorker 需求理解偏差

最终虽然完成了查询、对比、来源追溯等功能,但数据范围由需求中的5省扩展为10个城市,出现“功能完成但目标偏离”的情况。

评估结论:

OpenWorker 本次交付速度较快,但复盘显示,问题主要出现在需求解析阶段。

由于 PRD 解析过程中未能完整还原原始需求约束,后续任务规划基于部分信息展开,最终出现数据范围偏差。

这说明 Agent 在快速执行前,需要确保关键业务约束被准确提取并固化,否则容易产生“实现完整但目标偏离”的结果。

完整开发过程见项目复盘:OpenWorker 复盘记录[3]


05 小结

本次测试统一使用 DeepSeek-v4-flash 模型,并基于同一份 PRD 完成 MVP 开发。

测试结果表明:底层模型相同的情况下,Agent 的最终交付效果更多取决于其需求解析、任务规划和验证闭环能力。

从复盘数据看:

  • • OpenClaw:约 40~45 分钟完成交付,代码规模约 2200 行,经历 7 轮人工修正。整体偏快速构建模式,能够快速形成 MVP,但工程细节仍需要人工收敛。
  • • Hermes Agent:约 35 分钟完成交付,代码及文档约 3800 行,同样经历 7 轮修正。执行过程更偏工程化,数据建模、文档和验收流程更完整,但数据真实性仍需人工审核。
  • • OpenWorker:首次约 23 分钟完成交付,最终约 34 分钟,修正轮次较少。交付速度最快,但由于需求约束理解不足,将 PRD 要求的 5 省范围实现为 10 城市,暴露出快速生成模式下的需求校验风险。

综合来看:

三个 Agent 的主要差异并不在代码生成能力,而在需求理解后的任务拆解、执行流程和验证机制

当前阶段,Agent 已具备快速构建 MVP 的能力,但可靠交付仍需要人工参与关键约束确认和结果验收。

引用链接

[1] OpenClaw 复盘记录: https://tgzhu-0531.github.io/04_my-mvp/retro.html?path=21_OpenClaw%2F%E5%A4%8D%E7%9B%98.md[2] Hermes Agent 复盘记录: https://tgzhu-0531.github.io/04_my-mvp/retro.html?path=22_Hermes%2F%E5%A4%8D%E7%9B%98.md[3] OpenWorker 复盘记录: https://tgzhu-0531.github.io/04_my-mvp/retro.html?path=23_OpenWorker%2F%E5%A4%8D%E7%9B%98.md