前两篇文章分别测试了国内和国外商业 Work Agent 在同一份 PRD 下完成 MVP 的实际效果。
本篇继续采用相同测试方式,选择 OpenClaw、Hermes Agent 和 OpenWorker 三款开源 Agent,验证其在真实开发任务中的交付能力。
01 实验环境
本次测试同样使用 DeepSeek-v4-flash 作为底层模型,并基于各 Agent 提供的主要使用入口完成任务验证。
OpenClaw
github地址:https://github.com/openclaw/openclaw
OpenClaw 提供桌面端应用和 CLI 命令行两种主要使用方式,其中桌面端适合直接使用,CLI 更适合开发者进行自动化任务和能力扩展。
Hermes Agent
github地址:
https://github.com/NousResearch/hermes-agent
Hermes Agent 提供Desktop 桌面端、CLI/ TUI 命令行、Web / Dashboard 等多种使用方式;
OpenWorker
github地址:
https://github.com/andrewyng/openworker
OpenWorker 是 Andrew Ng(吴恩达)团队开源的桌面 AI Agent 项目,于 2026 年 7 月发布,定位为面向日常工作的 AI Coworker。
本次验证统一采用桌面端入口完成测试。
02 OpenClaw 实测结果

• Web 页面; • 数据文件; • 后端服务; • 项目文档。
从项目结构看,代码、数据、服务、页面进行了明确拆分,目录组织较清晰,具备较好的工程规范性。
根据复盘记录:
• 完成耗时:约 40~45 分钟; • 人机交互修正:7 轮; • 代码规模:约 2200 行;
本次主要问题集中在工程细节:
• 页面路径调整; • 数据源链接处理; • 文件编码修复; • SQLite 数据访问链路优化。
其中 CSV 模式运行正常,SQLite 模式仍需进一步验证。
评估结论:
OpenClaw 能够较完整完成从需求理解到 MVP 交付的开发流程,具备较好的快速构建能力。
但实际工程交付仍需要人工参与验证和修正,尤其是运行环境和数据访问等细节。
完整开发过程见项目复盘:OpenClaw 复盘记录[1]
03 Hermes Agent 实测结果

Hermes Agent 完成本次 MVP 开发任务,最终交付包括:
• Web 页面; • SQLite 数据库; • CSV 数据文件; • API 服务; • 项目文档。
根据复盘记录:
• 完成耗时:约 35 分钟; • 人机交互修正:7 轮; • 总交互轮次:约 25 轮; • 代码及文档规模:约 3800 行;
本次主要问题集中在数据获取环节。
在数据检索过程中,多个搜索渠道受限,最终采用已有公开信息构建数据,并在文档中标注需要人工复核。
另外,部分前端代码和页面功能仍经历多轮修正,包括模板渲染、编码兼容、详情页展示等问题。
评估结论:
Hermes Agent 本次表现出较完整的工程组织能力,能够完成从需求分析、数据建模、页面开发到验收验证的完整流程。
相比单纯页面生成,Hermes 在数据结构设计、文档完善和验证流程方面表现更突出。
但在依赖外部真实数据的场景下,数据获取和真实性仍需要人工审核。
完整开发过程见项目复盘:Hermes Agent 复盘记录[2]
04 OpenWorker 实测结果

OpenWorker 完成本次 MVP 开发任务,最终交付包括:
• Web 页面; • SQLite 数据库; • 数据文件; • API 服务; • 项目文档。
根据复盘记录:
• 首次交付耗时:约 23 分钟; • 最终交付耗时:约 34 分钟; • 人机交互修正:4 轮; • 最终代码及文档规模:约 3800 行。
本次主要问题集中在需求解析阶段。
复盘显示,PRD解析过程中未能完整还原原始需求约束,导致后续任务规划基于部分信息展开。

最终虽然完成了查询、对比、来源追溯等功能,但数据范围由需求中的5省扩展为10个城市,出现“功能完成但目标偏离”的情况。
评估结论:
OpenWorker 本次交付速度较快,但复盘显示,问题主要出现在需求解析阶段。
由于 PRD 解析过程中未能完整还原原始需求约束,后续任务规划基于部分信息展开,最终出现数据范围偏差。
这说明 Agent 在快速执行前,需要确保关键业务约束被准确提取并固化,否则容易产生“实现完整但目标偏离”的结果。
完整开发过程见项目复盘:OpenWorker 复盘记录[3]
05 小结
本次测试统一使用 DeepSeek-v4-flash 模型,并基于同一份 PRD 完成 MVP 开发。
测试结果表明:底层模型相同的情况下,Agent 的最终交付效果更多取决于其需求解析、任务规划和验证闭环能力。
从复盘数据看:
• OpenClaw:约 40~45 分钟完成交付,代码规模约 2200 行,经历 7 轮人工修正。整体偏快速构建模式,能够快速形成 MVP,但工程细节仍需要人工收敛。 • Hermes Agent:约 35 分钟完成交付,代码及文档约 3800 行,同样经历 7 轮修正。执行过程更偏工程化,数据建模、文档和验收流程更完整,但数据真实性仍需人工审核。 • OpenWorker:首次约 23 分钟完成交付,最终约 34 分钟,修正轮次较少。交付速度最快,但由于需求约束理解不足,将 PRD 要求的 5 省范围实现为 10 城市,暴露出快速生成模式下的需求校验风险。
综合来看:
三个 Agent 的主要差异并不在代码生成能力,而在需求理解后的任务拆解、执行流程和验证机制。
当前阶段,Agent 已具备快速构建 MVP 的能力,但可靠交付仍需要人工参与关键约束确认和结果验收。
引用链接
[1] OpenClaw 复盘记录: https://tgzhu-0531.github.io/04_my-mvp/retro.html?path=21_OpenClaw%2F%E5%A4%8D%E7%9B%98.md[2] Hermes Agent 复盘记录: https://tgzhu-0531.github.io/04_my-mvp/retro.html?path=22_Hermes%2F%E5%A4%8D%E7%9B%98.md[3] OpenWorker 复盘记录: https://tgzhu-0531.github.io/04_my-mvp/retro.html?path=23_OpenWorker%2F%E5%A4%8D%E7%9B%98.md
夜雨聆风