AI 是怎样从“会回答”变成“会工作”的?
最近接触 Hermes Agent 时,我有一个很直观的感受:它已经不像只会回答问题的聊天机器人,更像一个能够持续工作的执行者。
它可以调用工具、读取文件、运行命令,并根据结果调整下一步;也能记住经验,把有效方法沉淀成 Skills,在之后继续复用。它不仅会回答,还会行动、纠错、记忆和积累方法。
理解这种变化,可以从一条能力演进路线说起。
第一阶段是 LLM。它更像一个知识丰富的大脑:理解问题、进行推理、生成答案。它可以告诉你代码怎么改、项目怎么部署,但真正打开文件、执行命令和处理错误的人,仍然是用户。LLM 会回答,却不一定会行动。
第二阶段是 ReAct。模型开始调用搜索、终端、浏览器和代码执行器,不再一次性猜出答案,而是边做边看。例如处理程序错误时,它可以读取代码、运行程序、查看报错、修改代码,再重新测试。
它的核心循环是:
推理 → 行动 → 观察 → 再推理
ReAct 的意义,不只是让模型多想几步,而是让 AI 进入环境,通过真实反馈修正判断。它从“给建议的大脑”,变成了拥有“手脚”的执行者。
第三阶段是 Hermes。ReAct 主要解决“下一步做什么”,却没有完整解决经验能否保留、方法能否复用,以及 Agent 能否跨会话长期运行。
Hermes 在 ReAct 的执行内环之外,加入了 Memory、Skills、历史检索、上下文管理、子 Agent 和长期运行机制。一次任务中验证有效的方法,可以被整理成 Skill;下次遇到相似问题时,Agent 可以直接复用。
于是形成两个循环:
快速内环:推理 → 行动 → 观察 → 调整
长期外环:执行 → 总结 → 写入记忆或 Skill → 未来复用
所以,Hermes 并没有抛弃 ReAct。ReAct 是当前任务的执行内环,Memory 和 Skills 则构成跨任务积累经验的外环。
不过ReAct 也不是唯一的推理与决策范式。CoT 强调逐步思考,Plan-and-Execute 强调先规划再执行,ToT 和 GoT 则用于探索和组合多条思路。实际 Agent 往往会混合使用多种模式。
概括来说:
LLM,让 AI 学会回答;
ReAct,让 AI 学会行动;
Hermes,让 AI 开始记忆、复用,并持续工作。
下一代 Agent 的关键,会是更强的模型,还是更完整的记忆、工具与 Skills 系统?
夜雨聆风