不是所有 AI 助手都能自己进化——Hermes-Agent 开源智能体深度体验
数据截至 2026 年 8 月 | 阅读时间约 12 分钟

白色机器人的绿色"眼睛",像不像一个正在观察、正在学习的 AI?
你有没有过这种经历?
跟 AI 助手聊了一个小时,把项目背景、技术栈、踩过的坑全交代清楚了。第二天打开新会话,它一脸茫然:"你好,有什么可以帮你的吗?"
你只能把昨天的话原封不动再说一遍。第三天,再说一遍。第四天……
这就是绝大多数 AI 助手的真相:每一次对话都是从零开始。它很强,但它不记得你。
直到我认真体验了 Hermes-Agent——一个上线约一年就拿到 22 万 GitHub Star(截至 2026 年 8 月)的开源智能体。它最特别的地方,不是某个模型跑分有多高,而是它会记住你做过什么,并把解决过的问题沉淀成自己的"技能",下次直接调用。
这篇文章来自我的真实上手记录。我会拆解它到底怎么"记住"和"进化",以及它和 Claude Code、Codex CLI 这些当红工具的本质区别。
一、先交代背景:Nous Research 是谁
Hermes-Agent 出自 Nous Research——一个总部在纽约的美国开源 AI 研究集体,2023 年由 Jeffrey Quesnelle 和 Karan Malhotra 联合创立。它一开始并不是传统意义上的公司,而是从 Discord 和 Reddit 上自发聚集的研究者社区长出来的。目前公开仓库 89 个,拿过 a16z 的 Open Source AI Grant。
它的成长路径很有代表性:先训模型,再顺手做了一个内部自动化工具,最后把工具开源成产品。
| 2026.02 | Hermes Agent | 从模型跨越到自主智能体框架 |
也就是说,"Hermes"这个名字从语言模型一路用到了智能体。Nous 的路线图很清楚:训模型的终极目标,是造一个会自己沉淀经验、越用越强的 Agent。
二、22 万 Star 的"AI 操作系统"
先看几个硬指标(截至 2026 年 8 月 2 日):
- 224,134 Stars
、43,288 Forks,MIT 协议完全开源 创建于 2025 年 7 月,一年左右冲到这个量级 20,128 次提交,295+ 贡献者 当前版本 v0.17.0,核心语言 Python
22 万 Star 是什么概念?大概跟 Vue.js、React 一个量级。一个出生一年的项目能挤进 GitHub 全站最受欢迎行列,说明它戳中了很多人真实的痛点。
它对自己的定位只有一句话:"The agent that grows with you"——一个会随着你一起成长的智能体。它不是绑在 IDE 里的编程副驾驶,也不是某个 API 的聊天封装。它是一个自主智能体,你用得越久,它越懂你。
如果说 Claude Code 是一个只会在终端里写代码的程序员,那 Hermes-Agent 更像一个跨平台、有记忆、会自我培训的 AI 管家:你可以在 Telegram 上跟它聊天,它能在 Docker 里跑代码,能记住你的偏好,还能把学到的东西存成"技能"下次直接用。
三、它凭什么"进化":记忆 + 技能 + 跨会话搜索
"进化"这个词容易让人想到玄学,其实它的机制非常具体,就三件事:经验固化(技能)、持久记忆、跨会话检索。
1. 技能系统:把"会做的事"变成可复用的文件
Hermes 解决完一个复杂问题后,可以把解决方案自动保存成一个技能文件(SKILL.md),放进 ~/.hermes/skills/。下次遇到同类问题,它直接调用,不用重新摸索。
我本机上的实况:已安装 22 个技能,其中 18 个内置,4 个是本地自己沉淀出来的——比如 publish-blog-post(发布博客文章)、docker-config(配置 Docker 镜像源)这些,都是处理过实际问题后固化成的工作流。
技能按需加载,分三级,避免浪费 token:先只显示名称和描述(skills_list),要用时再加载全文(skill_view),还不够就加载具体引用文件。另外它兼容 agentskills.io 开放标准,技能可以分享、可以社区贡献,还有一个后台 Curator 会追踪技能使用情况、自动归档过时技能。
2. 持久记忆:一份跨会话的"小抄"
每个 Agent 有两份记忆文件:MEMORY.md(Agent 自己的笔记,上限 2200 字符)和 USER.md(你的画像,上限 1375 字符)。每次会话启动时,这两份文件作为"冻结快照"注入系统提示——所以它永远记得你的偏好和约定,而不是靠你重新交代。
我的记忆文件里现在就躺着这些内容:博客仓库地址、kanban 工作流约定、微信公众号 MCP 的配置方式……都是平时聊天或干活时自动沉淀进去的,下次直接生效。
3. 跨会话搜索:能"想起"上周五的对话
这是最惊艳的一层。通过 session_search 工具,它可以全文搜索所有历史会话(SQLite + FTS5),找到相关上下文后自动加载。所以你能对它说"修一下我们上周五追的那个 bug",它真的会去翻周五的记录,而不是问你"哪个 bug?"
这三层加起来,就是标题里说的"自己进化"的真相:不是模型变聪明了,而是它把每次解决问题的经验留了下来,变成了下次出发时的起点。别的 Agent 每次对话从零开始,Hermes 带着一个记忆文件和一个技能库进场——越用越聪明,说的就是这个。

经验像神经元连接一样积累
四、多智能体编排:这篇文章就是它自己组织写出来的
单 Agent 会进化已经很酷了,但 Hermes 更狠的是多 Agent 协作——而且不是花架子,我现在写的这篇文章,就是跑在它自己的 Kanban 任务板上产出的。
Kanban 是它内置的持久化多 Agent 协作系统:基于 SQLite 的任务板,每个任务是数据库里的一行;一个 Dispatcher 每 60 秒扫描一次,负责回收超时任务、把就绪任务提升、原子性领取、生成工作进程。任务之间可以设依赖,子任务在所有父任务完成前保持等待,完成后自动提升。
本次文章的生产流水线是这样的:
orchestrator(总协调) ├── researcher(深度调研,产出素材) ├── image-curator(配图,6 张图全部版权安全) ├── writer(本文作者,撰写) └── reviewer(审核,给出 3 处修正意见)每个角色是一个独立的 profile、独立的操作系统进程、独立的工作空间。reviewer 提的修正意见(比如"Stars 数据要注明时效"、"第三方评测要标明来源"),writer 在下一环逐条落实——这正是任务依赖自动流转带来的效果。
除了 Kanban,还有 delegate_task(同步子 Agent,支持最多 3 个并行,上下文和终端完全隔离)和 Cron 调度(自然语言定时任务:"每 30 分钟"、"每个周一早上 9 点"都行,还支持任务链式依赖)。
*说白了,它把"一个团队怎么协作"这件事,搬进了 Agent 的世界。*
五、架构与原理:四层结构
拆开看,它的架构是四层,非常清晰:
┌─────────────────────────────────────────────┐ │ Gateway(多平台接入层) │ │ ├─ Telegram ├─ Discord ├─ WeChat ├─ CLI │ ├─────────────────────────────────────────────┤ │ AIAgent Core(核心对话循环) │ │ ├─ System Prompt Builder(记忆+技能+环境注入) │ │ ├─ Tool Dispatch(工具路由) │ │ ├─ Context Compression(上下文压缩) │ │ └─ Model Router(多提供商模型路由) │ ├─────────────────────────────────────────────┤ │ 持久化层 │ │ ├─ Memory ├─ Skills ├─ Sessions ├─ Kanban │ ├─────────────────────────────────────────────┤ │ 执行层 │ │ ├─ Terminal Backends(local/docker/ssh/...) │ │ └─ Code Execution(沙盒 Python) │ └─────────────────────────────────────────────┘核心对话循环是一个 while 循环:构建系统提示(注入记忆、技能、环境信息)→ 调 LLM → 有工具调用就分发执行、把结果追加回去继续 → 直到纯文本回复。默认最多 90 轮。接近 token 上限时自动触发上下文压缩,把历史浓缩成摘要继续干活。
几个值得说的工程细节:
- Profile 体系
:同一台机器可以跑多个完全独立的 Agent 实例,各自有独立的 config、密钥、记忆、技能、会话。我写文章用的 profile 和跑博客任务用的 profile 互不干扰。 - 模型无关
:支持 20+ 模型提供商(OpenRouter、Anthropic、OpenAI、Google、DeepSeek、xAI,以及 GLM、Kimi、MiniMax、Qwen 等国产模型),还有认证池自动轮换 API Key 防限流、主模型失败自动切换备用。 - 工具系统
:60+ 内置工具按 toolset 分类(web、browser、terminal、file、vision、image_gen、memory、kanban……),支持任意 MCP 服务器扩展。我这边实测启用了 15 个 toolset,连了 5 个 MCP 服务器(含 12306 查票、高德地图、微信公众号)。

六、一行命令上手:我的实测记录
安装极简,Linux / macOS / WSL2 / 安卓 Termux 都是一行命令:
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash安装器会自动配好 uv、Python 3.11、Node.js、ripgrep、ffmpeg,不用手动折腾环境。装完直接 hermes 进入交互式聊天,hermes setup 有完整配置向导。
我实机跑出来的结果:
$ hermes --version Hermes Agent v0.17.0 (2026.6.19) $ hermes skills list 22 个技能已安装(18 内置 + 4 本地) $ hermes tools list 26 个内置 toolset,其中 15 个已启用 5 个 MCP 服务器已连接上手体验的亮点:
- 模型切换零摩擦
: hermes model交互式选择,或/model provider:model斜杠命令随时切 - 技能即命令
: /plan、/spike、/systematic-debugging这些技能直接作为斜杠命令触发 - Nous Portal 一键订阅
: hermes setup --portalOAuth 登录就能拿到 300+ 模型 + 搜索引擎 + 图片生成 + TTS + 浏览器
当然也有槽点,如实说:
- 概念密度高
:profile、skill、memory、toolset、kanban、cron……一堆概念,有学习曲线 - 配置文件复杂
:config.yaml 配置项多,虽然 hermes doctor能帮忙检查,仍有门槛 - Windows 原生有坑
:部分配置写入会带 UTF-8 BOM 导致 400 错误 - 迭代太快
:我本地版本已经落后 upstream 781 个 commit 了——功能更新快是好事,但也意味着要经常跟上

七、和 Claude Code / Codex 比,差在哪、好在哪
先声明:下面的对比信息综合了公开资料和第三方评测,其中"14/18"数据来自 Towards AI 在 2026 年 5 月发布的 18 项真实任务对比评测,我未独立复现,仅供参考。
几点真实的判断:
纯编程能力,Claude Code 更强。 它在 SWE-bench 这类基准上的成绩有目共睹(具体分值随版本迭代变化,建议以官方最新数据为准)。如果你只想要一个终端里改代码、做 code review 的工具,Claude Code 是成熟选择。
但一旦任务需要"持续上下文",Hermes 翻盘了。 据 Towards AI 2026 年 5 月的评测,在 18 项真实任务中,Hermes 以 14/18 击败 Claude Code 和 OpenClaw。秘诀不是模型更强——是它记得上周二你做过什么,不用把背景重新讲一遍。
定位不同:编程工具 vs AI 操作系统。 Codex CLI、OpenCode 是纯编程工具;Hermes 是一个通用平台——它能编程,但生态位更接近"你的 AI 操作系统":记忆你的偏好、学习你的工作流、跨平台持续运行。AutoGPT 是第一代自主 Agent 的先驱,但缺少结构化的记忆和技能系统,Hermes 在工程化上远超它。
2026 年的 AI Agent 赛道大概分三层:IDE 内嵌(Cursor、Copilot)、CLI 编程 Agent(Claude Code、Codex CLI、OpenCode)、通用自主 Agent——而同时具备持久记忆 + 技能沉淀 + 多平台接入的开源选项,目前基本只有 Hermes。

八、平台与生态:20+ 平台,7 种后端
一个 Gateway 进程,同一套记忆和技能,可以同时接入 20+ 平台:CLI、Telegram、Discord、Slack、WhatsApp、Signal、微信公众号、企业微信、钉钉、飞书、QQ Bot、Matrix、Email、SMS、Home Assistant……也就是说,你可以在 Telegram 上给 Agent 发消息,它在一个云服务器上帮你跑代码。
终端后端有 7 种:local、Docker、SSH、Singularity,以及 Modal、Daytona、Vercel Sandbox 这些云沙盒。后三者支持服务端休眠、按需唤醒——闲置时几乎零成本,用的时候才花钱,很适合跑长期任务。
生态数据也值得一提:据公开数据,2026 年 5 月 10 日 Hermes 登顶 OpenRouter 全球 Agent 排名第一,日生成 2240 亿 tokens(对比同榜第二约 1860 亿)。围绕它还长出了一圈衍生项目,比如用 DSPy 自动优化 Agent 技能的 hermes-agent-self-evolution、由 Hermes Agent 驱动的自主小说写作管道 autonovel。

九、值不值得用?
如果你符合下面任何一条,我建议你花十分钟装上试试:
- 受够了每次跟 AI 重讲一遍背景
——让它记住你,比让它变聪明更省时间 - 经常有"重复劳动"型任务
(发博客、配环境、查资料整理)——一次沉淀成技能,一劳永逸 - 想体验多 Agent 协作
——一个由不同角色分工、自动流转、互相审核的生产流水线,跑起来挺震撼的 - 想要个不绑定单一厂商的通用助手
——MIT 开源、任意模型、任意平台,数据都在自己手里
最后说一句这段时间用下来最大的感受:
AI 的下一个分水岭,不是谁的模型更强,而是谁记得你。每次对话都从零开始的助手,永远只能是个工具;而一个带着记忆和经验进场的 Agent,才配叫伙伴。
Hermes-Agent 用一年时间冲上 22 万 Star,靠的正是这个朴素的道理。它现在还远不完美——概念多、配置烦、迭代快——但"一个会记住你、会沉淀经验的开源智能体"这个方向,我觉得就是未来。
想动手的话:curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash,然后对你说第一句"记得我上次是怎么做的吗"。
参考来源:Hermes-Agent GitHub 仓库与官方文档、Nous Research 官网、SSOJet《12 AI Coding Agents Compared 2026》、Towards AI 18 项任务实测评测。GitHub 数据截至 2026 年 8 月 2 日。
夜雨聆风