你跟 ChatGPT 聊了半天项目背景,下次打开新对话,它全忘了。
但你跟 Claude 说了三遍"用 pnpm 别用 npm",第四遍它还是给你敲 npm install。你忍住没摔键盘。
这不是你表达有问题,也不是它蠢,在 2025 年初之前,这些 AI 助手根本就没有记忆。每次对话结束,关于你的一切都从服务器上抹掉了,下次打开又是空白。你跟它说的那些项目规范、个人偏好、踩过的坑,全是白说。
我跟 Claude 有过一段特别崩溃的经历:项目改了架构,API 端口从 3000 挪到 3001,我在 CLAUDE.md 里写了,在对话里说了不下五遍。重建 session 之后它又去连 3000。我问它为什么,它说"我之前没看到你提过端口的事"。你根本没记住,那个瞬间我才意识到:没有记忆的 AI 助手,跟每次见面都要重新自我介绍的朋友差不多,有用,但很累。
2025 年下半年是个转折点。四家主流 AI Agent 不约而同地开始卷"记忆",Claude Code、Codex、Hermes、OpenClaw,几乎在同一年上线了自己的记忆系统。但如果你仔细看,会发现这四家的设计哲学完全不同:系统管理员、软件工程师、AI 研究员和实干家的选择。

Claude Code:我是你的系统管理员
Claude 的记忆体系是最接近操作系统的,分层、分级、可管理。
它的加载体系分五层:企业策略(全公司统一规范)、项目记忆(团队共享的项目知识)、项目规则(按路径作用域拆分的模块化记忆)、用户记忆(你个人的全局偏好)、本地项目记忆(纯本地的个性化配置)。从公司制度到部门规章再到个人习惯,层层递进。
这次升级的核心是 .claude/rules/ 目录。以前所有规则都塞进一个 CLAUDE.md 里,维护起来像灾难,AI 还经常把不该用的规则也加载进来。现在你可以把规则拆成多个 Markdown 文件,并且用 YAML frontmatter 限定作用域,比如只对 src/api/**/*.ts 生效的 API 规范。后端 Java 代码不会被前端 React 规范干扰,既精准又省 Token。
真正让人意外的是它的 Auto Memory。Claude 会在后台自动把观察到的事实写到 ~/.claude/projects/ 下的 Markdown 文件里,还有个叫 Auto Dream 的进程每 24 小时自动整理合并。被 Hacker News 称为"Kairos"的这个设计,本质就是让 LLM 去读、改写、去重自己写的 Markdown 文件。
但它有一个极具争议的决策:不用向量检索。Claude 的做法是让 Sonnet 列出所有记忆文件的列表,读每个文件的 description,然后推理出当前任务需要哪几个,最多挑 5 个直接读全文。被泄露的源码显示整个记忆系统只有 8 个文件共 1736 行代码。
Boris Cherny 在 HN 上的说法是:早期版本用了 RAG + 向量数据库,但很快发现 agentic search(说白了就是 ls + grep)全面胜出。但这个结论只对单用户、单机场景有效,多人协作时它的问题就暴露了。

Codex:我是你的软件架构师
Codex 的记忆设计是四套里最像工程系统的。
它的核心是 AGENTS.md。不像 Claude 记忆系统要一堆后台进程,Codex 直接复用了一个开发者都熟悉的模式:在代码仓库的目录层级里放 AGENTS.md 文件,AI 会像读取 .gitignore 一样从当前目录向上递归找到项目根,然后按从外到内的顺序拼接这些文件,自动理解每层的作用域和优先级。
长期记忆则是另一套机制。Codex 会把完整的会话轨迹保存为 rollout.jsonl 账本,然后后台进程异步地从旧会话中提取知识,提炼后写入 CODEX_HOME/memories/ 文件。
这里面藏着 Codex 最聪明的设计:上下文压缩与记忆提炼两条线分开走。当前对话太长时用 summary 接力,恢复 session 时用 rollout 重建压缩后的历史,未来相似任务则通过 memory prompt 检索长期记忆文件,三种恢复路径,各司其职。
它的 Chronicle 屏幕活动恢复功能在某些地区的合规压力下默认关闭、EU 不可用。合规这把刀悬在头上,Codex 选择主动退让。
Hermes:我是你的 AI 研究员
Hermes 是四套里最激进的。GitHub 星标在开源不到两月就冲到了 11.4 万,靠的不是漂亮话,是实打实的设计:插件化的五层记忆架构。
原生记忆具体包含:冻结的 MEMORY.md 快照 + 自动生成的 Skills 程序记忆 + SQLite FTS5 全量搜索 + 8 个外部记忆插件(Honcho 辩证推理、Hindsight 知识图谱、Mem0 等,可自由替换)+ ChromaDB RAG。核心设计是用冻结系统提示来保护 LLM 前缀缓存,记忆改了不立即更新,下次 session 才生效。插件化的极致之处在于你可以在知识图谱和向量语义搜索之间随时切换,不用改核心代码。
它自带的记忆也分三层:短期记忆用 Redis 存最近 100 条对话,长期记忆用向量数据库支持百万级知识条目,外加一个每日自动压缩存储空间达 80% 的反思机制。
Hermes 还做了四套里最前沿的事:尝试用访问频率衰减来自动遗忘过期记忆,给 AI 装记忆,本质上是在教它遗忘,而遗忘可能比记忆更难。
OpenClaw:我是你的实干家
OpenClaw 的理念最简单粗暴:一切持久状态都是磁盘上的 Markdown 文件。
Agent 的身份、规则、记忆、工具配置,全部以明文 .md 文件的形式放在工作区目录下。你用文本编辑器就能打开看、修改、删掉,没有任何黑盒。
它采用三级记忆架构:短期记忆(memory/YYYY-MM-DD.md,每天一个追加日志,新会话自动加载今天+昨天的日志)、近端记忆(sessions 目录里存完整会话存档)、长期记忆(MEMORY.md 存筛选后的持久知识)。
检索方面用混合方案:SQLite FTS5 做全文搜索 + sqlite-vec 做向量检索,默认权重 70% 向量 + 30% 全文。索引自动增量更新,降级策略也很务实,如果 sqlite-vec 没装上,自动回退到暴力 JS 计算。
最厉害的地方不在技术,在于它这套架构轻到能被提取成独立开源库 memsearch。你用 memsearch 给任何 Agent 框架加上同样的 Markdown + 混合检索方案,几行代码就行。
荒诞的共识
四家架构天差地别,但有个共同点刺眼:全部围绕 Markdown 文件做文章。Claude 用 Markdown 分级管理,Codex 存长期记忆到 Markdown 文件,Hermes 拿 Markdown 当知识快照,OpenClaw 直接让 Markdown 做真相来源。
Oracle 的一篇文章点明了背后的逻辑:文件系统在接口层赢了,LLM 天生就会 ls、grep、读写 Markdown,但数据库在底层赢了,共享、审计、并发写入需要数据库保证。OpenClaw 的混合检索就是对这点的回应:Markdown 给你透明可读,SQLite 给你索引性能。
2026 年 2 月,Amazon Science 发了篇论文叫《Keyword Search Is All You Need》,agentic 关键词搜索在检索任务中达到了 RAG 级别性能的 90% 以上,而且不需要向量数据库。Anthropic 不是在孤军奋战,学术界也在往同一个方向走。

但这四套系统撞上的终极问题不是"怎么记更多",而是 "怎么忘掉该忘的" 。给一个永不停机的 AI 装记忆,本质上是在教它遗忘,目前也只有 Hermes 在尝试这个方向。
夜雨聆风