
前几天,我用Hermes跑了一些简单任务。
没过多久,模型费用已经接近40元。
它看起来一直在工作:搜索网页、调用工具、分析结果、失败后重试。但最后回头看,有些图片版本是错的,有些网站一直拒绝访问,有些简单任务被跑成了很长的流程。
这让我意识到一个问题:Agent一直在运行,不代表事情一直在向前推进。
Addy Osmani中午写了一篇文章,讨论一种正在出现的“软件工厂”。
多个AI Agent可以同时接收任务、写代码、运行测试、检查结果,甚至自行决定是否发布。如果整个过程没有人真正查看,他把它称为“黑灯工厂”。
工厂关着灯也能运行,因为里面已经没有人了。

这种模式看起来效率很高。AI不用休息,可以不停地产出代码、报告、图片和文章。
问题在于,生成速度越来越快,人的检查速度却没有同步提高。
AI一分钟可以生成几千行代码,人可能需要几个小时才能看明白。它一天可以整理几百条信息,但其中一个错误来源,就可能让后面的判断全部失效。
产量增加,不等于可靠性增加。
更隐蔽的问题是,人会逐渐失去对系统的理解。
AI修改了配置,测试也通过了,但没人知道为什么这样改;AI整理了知识库,文件越来越多,却没人说得清分类规则;AI每天生成文章,账号更新频率提高了,内容却越来越像同一个模板。
短期看起来一切正常,长期再出问题时,已经很难找到原因。
所以,使用Agent时最重要的问题,不是它能做多少,而是我们能检查多少。
能够快速验证的任务,可以交给AI自动执行。
例如检查链接是否失效、文件格式是否正确、代码能否通过测试、信息日期是否符合要求。这些结果通常明确,错了也容易发现。
但涉及账号权限、付款、隐私、核心配置、文章观点和长期架构的事情,仍然需要人确认。因为这些地方一旦出错,代价很高,也很难依靠一次自动测试发现。
还有一个很实用的经验:不要给Agent太长的任务。
任务步骤越多,上下文堆积越严重,模型越容易忘记最初的目标。一个Agent同时负责搜索、判断、修改、测试、整理和发布,看起来省事,实际上很容易失控。
更可靠的方式,是把任务分成几个短步骤。
先定位问题,再提出方案;备份后修改;修改后测试;最后对照验收标准确认结果。
每一步都能看懂,每一步都能停止,也能知道问题到底出现在哪里。
以后使用Agent,先问自己一个问题:
我能不能快速、便宜、明确地判断它做对了没有?
能够判断,就可以逐步增加自动化。
无法判断,就应该把灯开着。
AI可以替我们执行很多工作,但决定什么算完成、哪些错误不能接受、什么时候必须停下来,仍然是人的责任。

资料来源:Addy Osmani《Software Factories, Light and Dark》,2026年7月20日。
#AI#人工智能#Hermesagent#codex#自媒体
夜雨聆风