你好,我是郭震!
很多读者都想知道:让 AI 完成同一个任务,有没有办法少用一些 Token?
尤其是代码分析、资料搜索这类长任务,聊天越往后,AI 每次都要带着前面的代码、日志和要求重新思考一遍。任务还没完成,Token 已经消耗了不少。
今天我来探索一种更省 Token 的方法:给 Agent 加上一套外部记忆,把暂时用不到的长内容先存起来,只把当前真正需要的信息留在对话里。
下面是我在OpenClaw接入此插件前后,消耗Token对比,直接帮我省了55.7%的Token:


更让我感兴趣的是,这个项目不只是给单个 Agent 加记忆。目前团队记忆版本还提供了 Memory Hub,可以把 Chat Memory、Skill、Wiki 和 CodeGraph 统一变成可查看、可审核、可分配的团队记忆资产。
这对一人公司OPC和多 Agent Loop 特别实用:调研 Agent 找到的信息可以继续交给开发 Agent,测试和复盘经验还能沉淀为 Skill。简单来说,一个人也能组建一支会共享记忆、不断积累经验的 Agent 小队。
如下图所示,Memory Hub 不只是展示面板,还能统一管理团队、Agent、记忆资产、版本、权限和绑定关系:

为啥它如此节省Token?经过我这几天的使用发现,它会把冗长的搜索结果、代码和报错日志卸载到外部文件,只在上下文中保留一张轻量的Mermaid 任务图。
实现这个效果,我用到的是腾讯云数据库开源的Agent Memory 插件,截止目前12.1K star:

也是最近我发现的这个宝藏插件,第一时间分享出来,感兴趣的可以看看。
接下来,我会分别演示如何把它接入 Hermes 和 OpenClaw。经常运行长任务、想少花一些 Token 的朋友,可以跟着我一起试试。
1 Hermes接入TencentDB Agent Memory
接入此插件比较简单,先获取源码到本地,切到对应目录,执行下面一行命令:
.\scripts\setup-hermes-memory-tencentdb.bat完成插件本地安装:

需要为此插件配置一个大模型,管理长短任务记忆处理,执行如下命令配置:

8420端口被监听,显示如下界面,证明Agent记忆插件本地安装成功:

最后通过下面命令在Hermes中接入此插件:
hermes config set memory.provider memory_tencentdbOpenClaw接入方法类似,大家按照上面步骤即可。
看到腾讯云数据库开源的这个Agent Memory插件,上手比较容易,它默认使用本地SQLite,个人开发者不需要先购买云数据库,也不用自己搭一套复杂的RAG 工作流,这正是我比较喜欢它的原因。
2 为什么需要TencentDB Agent Memory插件?
可能很多人都会问:Hermes 和 OpenClaw 本来就能保存会话,也有自己的记忆功能,为什么还要再接入一套记忆系统?
确实,它们并不是完全“失忆”。但一旦任务变长,搜索结果、源码和报错日志不断堆进上下文,换个新会话,项目要求可能又要重新交代。
如下图再问它这个项目做什么的,又得几乎从零开始重新查一遍:

积累下来的记忆散落在不同文件和 Agent 里,如Hermes记忆分散在默认目录、会话数据库和各个 Profile 中,如下所示:

腾讯云数据库Agent Memory 插件就是为了解决以上这些问题,把记忆做成了一套可以长期积累的系统。
它主要做了三件事:
第一,把原始对话整理成 L0-L3 四层记忆,逐步提取事实、要求、任务经验和用户习惯。
第二,这些记忆可以跨会话继续使用,让 Agent 不必每次都从零开始。
第三,把大段源码和日志存到外部,只在上下文中保留摘要和任务图,从而减少 Token 消耗。
接下来,我就通过 Hermes 和 OpenClaw,分别实测这三项核心能力。
3 实测TencentDB Agent Memory三大能力
打开Hermes,告诉它我回复偏好,如下Hermes会调用腾讯云数据库Agent Memory插件:

消息发送后,我立即查询了记忆库,可以看到插件已经将这次对话完整保存到了 L0 层:

接着,我又连续发送了几轮消息。插件将“Project-47” “中文输出” “先结论、后证据”等长期要求提取到了 L1 层:

L1层的会话,即使退出当前会话,这些记忆也会继续保留。
到了 L2,插件不再只保存零散信息,而是会按照项目和任务场景自动归类。
如下图所示,它已经把 Excel 可视化项目和 TencentDB Agent Memory 分析任务,分别整理成两个可以继续复用的场景记忆块:


最后到了 L3,插件会根据多轮对话形成相对稳定的用户画像。
如下图所示,它已经总结出我的开发能力、协作方式和工具偏好;与 L1 的单条要求、L2 的项目场景不同,L3 更像是 Agent 对我的长期认识:

以上保存的这四层记忆,腾讯云数据库Agent Memory如使用它们的,为了实测这块,我重新开启了一个会话,让 Hermes 核对 L0-L3 四层记忆:

它实际调用了腾讯云数据库Agent Memory 的搜索工具,并准确找回原始对话、长期要求、项目场景和用户画像:

新会话成功召回 L0-L3,四层记忆均参与回答。
新会话中,Agent Memory 会自动注入项目场景和用户画像,让 Hermes 无需重新搜索,就能恢复我的工作要求和协作习惯:

总结来看,Agent Memory 并不是简单地保存聊天记录,而是把每次协作自动沉淀成可查看、可纠错、可复用的 L0-L3 记忆资产,让 AI 越用越懂你,真正从一次性工具变成会持续积累的长期助手。
除了让 Agent 记得更久,跨会话无需从零开始外,这套插件还解决了长任务中更现实的问题:上下文越来越长,Token 越用越多。
如下是我在OpenClaw进行的一个长任务:

refs 目录:

node_id 保留下来:
node_id 找回原始内容。这就是它减少 Token 消耗的核心逻辑。实际测试中,同一个会话、同一个模型、同一份提示词,压缩前一次调用需要 32,935 Token,如下所示:

开启腾讯云数据库Agent Memory后,下一次降到了 15,974 Token:

我还绘制了一个七轮会话的Token消耗折线图:

可以看到第六次会话发生一次压缩,让后续会话的上下文直接缩短。实测接入前后的Token消耗对比如文章开头所示,不再赘述。
最后总结一下
这篇文章实测了我最近几天发现的一个宝藏插件:腾讯云数据库Agent Memory。它能把每次对话逐层沉淀为 L0-L3 记忆,让项目事实、工作要求和用户习惯都能查看、纠错和复用。
进入新会话后,它还能自动召回项目场景和用户画像,让 Agent 不必重新了解背景,就能接着上次的任务继续工作;面对长任务,它还会把源码和日志卸载到外部,只保留摘要和任务图。
本次对比实测显示,Token 消耗减少约55.7%,我每天都会大量做很多长任务,这样日积月累下来,能实打实的为我节省成本。
此项目是腾讯云数据库完全开源的,感兴趣的可以去看下:
https://github.com/TencentCloud/TencentDB-Agent-Memory
没有记忆的 AI,只是工具;有记忆的 AI,才会随着使用不断升值,真正变成自己的数字资产
夜雨聆风