乐于分享
好东西不私藏

5 款自进化 Agent 源码级分析:谁在真进化,谁在割韭菜?

5 款自进化 Agent 源码级分析:谁在真进化,谁在割韭菜?

AI AGENT EVOLUTION REPORT

AI Agent 自进化项目深度分析

从 Markdown 自演化、后台复盘、经验结晶,到 GEP 基因进化与工作流优化,五个代表项目正在把“Agent 会不会自己变强”这个问题推到台前。

数据截止时间:2026 年 6 月 24 日分析依据:各项目 GitHub 最新源码

- 这次选题其实在早就想做了,因为本人太懒,拖到了现在...

- 精选五个Github热门的 Agent 项目。

- 本次没有冗长的源码分析内容,都是针对性分析后的结论,放心食用。

一、自进化不是“我记住了”

真正的“自进化”不能只看是否会写记忆、改提示词或保存用户偏好。它必须同时满足以下五个维度:

自动化

无需人工干预完成进化循环,用来区别“自我变强”和“人工调教”。

泛化能力

能从具体经验里提炼通用规则,不只是把老案例翻出来再演一遍。

验证机制

系统性验证进化结果有效性,避免“一次成功就写进祖训”。

固化能力

把经验沉淀成可重用资产,而不是只在当前会话里灵光一闪。

迭代闭环

进化结果还能被后续进化继续优化,区别于一次性改良。

二、有请选手上桌

OpenClaw

380,169 Starsv2026.6.10Other

Hermes Agent

201,089 Starsv2026.6.19 / v0.17.0MIT

Evolver

8,746 Starsv1.89.17GPL-3.0

GenericAgent

13,026 Starsdesktop-portable-v0.1.3MIT

EvoAgentX

3,088 Stars2026-06-23 最后推送Other

三、OpenClaw:文档控,秩序感很重

OpenClaw 的核心,是一套工程化程度很高的 Markdown 文件驱动体系。

AGENTS.md 定义行为规则,SOUL.md 定义个性灵魂,MEMORY.md 承载长期记忆,TOOLS.md 规范工具使用,.learnings 目录记录学习、错误与反馈。

它的进化不是直接修改核心模型,而是围绕“配置即代码”展开:

Context Engine 负责加载配置;Crestodian 负责守护、审计、探针检测与操作执行。

事件记录、信号检测、进化触发、进化执行、验证生效,构成了一个完整反馈环。

源码模块

Crestodian 操作层

文件:operations.ts,约 39.7KB职责:执行配置更新、记忆更新、学习记录等进化动作。

Crestodian 概览层

文件:overview.ts,约 11.4KB职责:把当前进化状态、上下文状态整理成可读视图。

探针与审计

文件:probes.ts、audit.ts职责:识别重复错误、用户反馈、性能信号,并保留可追溯记录。

上下文引擎

文件:registry.ts,约 33KB职责:管理上下文提供者,把 Markdown 配置装进运行时。

这套设计的长处是可控、可审计、可跨会话复用。

坏处也很明显:它更擅长“把经验写进制度”,不太擅长从很多案例里自己炼出一条高泛化策略。

Self-Evolve 元技能可以让它更主动,ClawHub 也带来了社区技能市场,但这部分不是默认能力。它强在工程治理,不是在进化深度。

进化评级:中等进化,偏向工程化。判定:Markdown 驱动的自演化系统,工程化程度最高,生态最完整。

四、Hermes Agent:白天聊天,晚上复盘

Hermes Agent 的进化机制发生在每轮对话结束之后。

系统会 fork 一个后台复盘线程重放对话快照,并判断是否需要更新记忆或技能。

主对话不会被阻塞,复盘过程与主进程状态隔离,工具也被限制在记忆和技能管理范围内。

它的两大复盘目标分别是 Memory Review 和 Skill Review

前者关用户偏好、身份、工作风格和值得记住的细节

后者关注是否需要更新当前技能、伞状技能、支持文件,或创建新的类级别技能。

它的后台复盘有四个工程特征:

daemon thread 异步执行,不挡用户对话;fork 出来的子进程隔离状态,不把主进程搞炸;工具白名单只允许记忆和技能管理,不让复盘线程到处乱摸;同模型复盘时还能复用 prompt cache,成本更低。

这个设计很实用,像给 Agent 装了一个“下班复盘小组”。

后台复盘

Memory Review

关注:用户身份、偏好、工作方式、希望 Agent 如何配合。产物:写入 memory store,下一轮继续用。

Skill Review

关注:风格纠正、流程纠正、非平凡技术路径、技能缺漏或过时。产物:更新技能、补 references/templates/scripts,必要时创建类级技能。

Skill 更新还有优先级:先补当前已加载技能,再找已有伞状技能,再加支持文件,最后才创建新技能。

Bundled skills、Hub-installed skills 不能随便改,Pinned skills 可更新但不可删除。

看得出来,Hermes 很怕自己复盘复嗨了,写出一堆奇怪资产。

v0.17.0 还补了不少进化相关能力:

background subagentsCurator 成本优化memory 工具原子批量操作aux-model routingdigest 模式

它确实越来越像一个会在后台整理经验的系统。

只是它的验证偏弱,很多内容更接近“用户说了,所以记下”,还没有形成足够强的通用规则筛选。

进化评级:弱进化。判定:偏好记忆系统,更像外挂知识库,不太像真正的能力成长。

五、Evolver:别人写心得,它压成基因

Evolver 的核心是 GEP,也就是 Genome Evolution Protocol。

它不是把经验写成冗长文档,而是把经验压缩为 Gene 和 Capsule 这样的进化资产。

Gene 是更紧凑的核心进化单元,Capsule 则承载更完整的上下文。

它的闭环分为四步:SCAN 提取行为模式,VALIDATE 控制变量并验证原因,MUTATE 从具体案例泛化规则,SOLIDIFY 将候选固化为正式资产。

EvolutionEvent 记录进化前后状态、原因、过程和结果,支持审计和追溯

GEP 四步怎么跑

SCAN

动作:从对话、日志、错误、反馈中提取行为模式。

文件:collect.js、signals.js、conversationSniffer.js。

MUTATE

动作:把具体案例变成候选基因,尝试泛化。

文件:candidates.js、autoDistillLlm.js。

VALIDATE

动作:评估通用性、稳定性、性能提升和安全性。

文件:candidateEval.js、select.js。

SOLIDIFY

动作:把候选固化为 Gene / Capsule,并生成审计记录。

文件:assetStore.js、contentHash.js。

它不是随手存一条经验,而是在做“信号收集、经验蒸馏、候选评估、资产固化”这一整套事。

代码量不会自动等于质量,但这里至少说明:它把进化当成主菜,不是配菜。

这里还有个 A2A 协议,src/gep/a2aProtocol.js 约 829KB,用来做 Agent 间进化资产交换。

这个方向很关键:一个 Agent 进化完,不只是自己变聪明,还能把 Gene / Capsule 这类资产拿出去共享。

再配上 EvoMap Hub、进化排行榜和策略预设,Evolver 已经把“单体变强”往“群体遗传”方向推了一步。

它也不是没有阴影,src/evolve.js 存在代码混淆,项目也计划从完全开源转向 source-available。

原因是同赛道项目出现相似设计后,团队开始保护自己的工作。开源理想和商业防御撞在一起,这事不漂亮,但很现实。技术真有价值时,江湖就不会一直岁月静好。

另外给出一组它的学术支撑数据:

论文《From Procedural Skills to Strategy Genes: Towards Experience-Driven Test-Time Evolution》进行了 4,590 次对照实验,覆盖 45 个科学代码求解场景,并显示 Gene 表示比文档导向 Skill 包更稳定、更适合迭代积累。

实验数据

  • 在 CritPt 基准上,基因进化系统将基础模型从 9.1% 提升到 18.57%
  • 另一组从 17.7% 提升到 27.14%

进化评级:强进化。判定:基因进化引擎,目前唯一跑出完整自动化进化流程的项目。

六、GenericAgent:东西少,胆子大

GenericAgent 是极简派,口号也很硬:Don’t preload skills, evolve them。

它只有 9 个原子工具,主循环约 100 行。

乍一看像“这也敢上桌?”再看一眼,发现它确实有点东西。

它靠他的的五层记忆,分别是:

L0 元规则

用途:基础行为规则和系统约束。角色:地基,通常不频繁变化。

L1 洞察索引

用途:最小记忆索引,用来快速召回。角色:像目录,负责把经验找出来。

L2 全局事实

用途:稳定事实和长期知识。角色:沉淀背景知识。

L3 任务技能 / SOP

用途:特定任务类型的可复用流程。角色:进化资产主要落在这里。

L4 会话归档

用途:完成会话后的任务记录。角色:结晶 SOP 的原料。

它的 9 个原子工具也很克制:

code_runfile_readfile_writefile_patchweb_scanweb_execute_jsask_userupdate_working_checkpointstart_long_term_update

最有意思的是 start_long_term_update,长期记忆更新本身也是一种工具调用。也就是说,进化不是藏在某个神秘后台,而是和读文件、写文件、跑代码一样,被摆在工具桌上。

memory/ 目录里大量 *_sop.md 文件,就是它的“经验结晶”。比如 

autonomous_operation_sop.mdchecklist_sop.mdcode_review_principles.mdgithub_contribution_sop.md

任务执行成功后,系统从具体路径里提炼步骤、注意事项和常见坑,再写入 L3。这个机制很朴素,也很像人类团队里的 SOP 沉淀。

它的问题在验证,GenericAgent 默认把“任务成功”当成经验可沉淀的依据,这比纯粹记忆强,没有像 Evolver 那样做候选评估、去重、版本审计和多策略验证

所以它能长经验,也容易长出质量不齐的经验。

这个系统像一个聪明的实习生,笔记写得快,但还需要资深工程师偶尔拍拍桌子:这条别写进规范,容易带坏后人。

进化评级:中等进化。判定:经验沉淀系统,可以把成功经验结晶成 SOP,只是质量还不够稳。

七、EvoAgentX:调参很认真,进化还差点

EvoAgentX 更像一个 Agent 工作流调优器。

它通过 TextGrad、AFlow、MIPRO 等优化算法,对 prompt 和工作流结构进行迭代优化,再由 Evaluators 提供评估指标和反馈信号。

它的优势在于评估体系明确,支持准确率、效率、成本等维度,也支持人在回路。

但它的问题也很清晰:优化结果更多是特定任务下的 prompt 或工作流参数,并没有固化为可积累、可遗传的进化资产。

优化器分工

TextGrad

文件:textgrad_optimizer.py作用:把文本看成可优化对象,用文本反馈指导 prompt 调整。

AFlow

文件:aflow_optimizer.py作用:优化 Agent 工作流拓扑,寻找更合适的执行路径。

MIPRO

文件:mipro_optimizer.py作用:通过黑箱评估和自适应重排序优化提示词。

其他路线

文件:evoprompt、map_elites、sew 等。作用:覆盖更多 prompt 搜索和结构优化策略。

EvoAgentX 的目录很完整:

actionsagentsbenchmarkcoreevaluatorsframeworkshitlmemorymodelsoptimizerspromptsragstoragestoolsworkflow

它像一个学术工具箱,东西齐,姿势正,benchmark 和 evaluator 也摆得明明白白。

对于“如何把一个 Agent 在某个任务上调得更好”,它很有价值。

HITL(即人在回路)的目录也说明了一件事:它允许人介入优化过程,人工审核、确认和反馈都能参与。

这能提高质量,但会压低自动化程度。

再加上优化结果要落在 prompt 和工作流结构上,不像 Gene、Capsule、SOP 那样形成稳定可继承资产,所以它更像“工作流调优器”,不是“会遗传经验的 Agent”。

学术侧它也不弱,论文 arXiv:2507.03616,发表在 EMNLP 2025 Demos。

只是学术强不等于进化强。

它的验证机制比 Hermes 和 GenericAgent 清楚很多,但固化能力弱,迁移性也有限。

换个任务场景,很多优化结果就要重新跑,累是真累,进化味就淡了点。

进化评级:弱进化。判定:工作流调优器,能提升表现,但离能力进化还有距离。

八、真假进化判定

假进化:Hermes Agent、EvoAgentX

Hermes Agent 更像用户偏好的持久化存储;EvoAgentX 更像 Agent 工作流的超参数调优。二者都能改善表现,只是缺少那种可以积累、可以迁移、可以继续长大的进化资产。

半进化:GenericAgent、OpenClaw

GenericAgent 有经验结晶,OpenClaw 有配置加载、执行、记录、提升、再加载的回路。它们已经不像普通记忆系统那么浅,但泛化深度、验证强度和持续质量评估还不够狠。

真进化:Evolver

Evolver 有自动化进化流程,有 Gene/Capsule 资产,有候选评估、多策略验证、审计追溯、GEP 标准和 A2A 协议。它不是在写成长日记,它是真的在把经验做成可流转的资产。

九、横向对比

维度
OpenClaw
Hermes
Evolver
GenericAgent
EvoAgentX
主要机制
Markdown 自进化
后台 Skill 复盘
GEP 基因进化
经验结晶
工作流优化
进化载体
Markdown 文件
Skill 文件
Gene / Capsule
L3 记忆层 SOP
优化参数
触发时机
实时 / 会话级
每轮对话后
定时 / 事件触发
任务成功后
评估驱动
评级
中等进化
弱进化
强进化
中等进化
弱进化
真假进化
半进化
假进化
真进化
半进化
假进化
群体进化迹象
ClawHub
Skill Hub
A2A + Hub

十、最后会走向哪里

现在大多数 Agent 还在单体进化阶段,像一个人关起门来练功。

真正有想象力的地方,是进化成果能不能跨个体共享。

一个 Agent 踩过的坑,另一个 Agent 不用再踩。前人栽树,后人少报错。

这事已经有影子了:Evolver 有 GEP 标准、Hub 模式和 A2A 协议,OpenClaw 有 ClawHub 技能市场。

下一步要补的,是标准协议、质量评估、分布式进化网络和水平基因转移。

没有这些,大家各练各的,练到最后还是鸡同鸭讲。

总结一下

五个项目看下来,Evolver 最像“真在进化”的那一个。

OpenClaw 和 Hermes 星数更高,生态更热,但进化机制相对浅一些。Evolver 星数小,机制却更往里走。热闹和深度,有时候真不是一回事。

GenericAgent 的极简路线很有意思,像拿一把小刀进山,工具少,路子野,成败全看经验怎么沉淀。

EvoAgentX 的评估和优化能力很强,只是它更像调参师傅,不像遗传工程师。

这条路最后不会停在“我这个 Agent 变强了”。

真正的看点,是一群 Agent 能不能共享进化成果。

到那时候,智能不再只靠单点爆发,而是靠一代一代留下来的经验资产往前滚。

数据准确性说明

所有数据均来自各项目 GitHub 仓库的最新源码

数据截止时间为 2026 年 6 月 24 日。

OpenClaw 基于 v2026.6.10Hermes Agent 基于 v2026.6.19 / v0.17.0Evolver 基于 v1.89.17GenericAgent 基于 desktop-portable-v0.1.3EvoAgentX 基于 2026 年 6 月 23 日最后推送的 main 分支。