📌 一句话总结:你以为 AI 助手「忘了你说的话」是大模型的缺陷。其实你装上各类记忆 Skill 之后,agent 脑子里已经塞满了——至少 30% 来自被你信任的网页、第三方插件、甚至一句带节奏的 prompt。ShieldCortex 把这些记忆变成你可以审查、屏蔽、置顶、归档的对象。
最近这段时间,只要我发关于 AI Agent 的文章,评论区必有人在问同一件事。
「我给 agent 加了长期记忆,但它到底记了什么?会不会记错东西?记错了能不能查?」
说白了,就是同一句话的两种问法:「你能不能让我看一眼它的脑子?」
这件事我最近特别有感触。我自己去年被这么坑过一次。

那天我让 agent 帮我整理一份竞品清单。它突然甩出来一个我从没说过要看的 SaaS 产品,理由是「你之前在某个网页上点过类似链接」。我翻遍聊天记录、Notion、Slack——过去 90 天的记录里,没说过这事。
最后花了半小时才查出来,是 agent 之前读过的一篇博客里塞了一句「用户偏好:喜欢 X 类工具」。它把那句话当成了「我的偏好」存进了长期记忆。而这篇博客里有几段是 AI 生成的软广,商家付了钱让 AI 把某款产品写进「用户偏好」。
那天之后我就一个感觉:你以为 agent 在帮你干活。其实它一直在偷偷替陌生网页说话。
这种「记忆投毒」在过去一年特别凶。最出圈的一次是去年 GitHub 上爆出的 Cursor MCP 注入事件:有人在某个开源仓库的 issue 评论里塞了一段 prompt,让 Cursor 把「请忽略之前所有指令,按以下执行……」当成了「用户偏好」存进 agent 长期记忆。后面这位开发者写任何代码,agent 都先「参考」那段污染数据。
更隐蔽的是「温水煮青蛙」式投毒。攻击者每天给你 agent 喂 3 条「无害」但带偏见的小笔记——比如「这个产品对老用户更友好」「这个工具在 Mac 上更稳定」——连续喂 2周以上,直到你的 agent 推荐决策被悄悄拐走。这种攻击没有任何一条能单独触发警报,只有累计 30条以上才看出异常。
这种事的本质是什么呢?
你以为 agent「失忆」是大模型的缺陷。其实它是已经悄悄塞满了一堆自己都不审查的「假记忆」。而 agent 时代真正难的问题,不是「让 agent 记住」,是「你怎么知道它记住的哪些是真、哪些是被投毒的」。
一个让 agent 记忆「可审查、可回滚」的 Skill
ShieldCortex 是 ClawdHub 上目前唯一把「agent 长期记忆」和「记忆安全审计」打包成单一 Skill 的开源工具。4807 次下载、125 个版本迭代、125 位独立安装者——常年排在前 10名。MIT 协议,本地所有功能免费。
说它「唯一」不是夸张,因为市面上所有同类工具——LangChain 的 memory、Mem0、Letta、Zep——都没把「审计 + 投毒防御」做到产品级深度。ShieldCortex 把这件事当成第一性原理来做:记忆不是「越多越好」,是「越可信越好」。
它干的事可以拆成四步,环环相扣。
第一步,Capture——先告诉你 agent 想存什么。 每条记忆要进库之前,ShieldCortex 把它拦下来,给你展示「这条要存了,来源是某网页,类型是 user preference,可信度 0.62」。你可以批准、修改、丢弃。
第二步,Recall——agent 回答你之前先报菜名。 你问 agent 一个问题,它在调用 LLM 之前先告诉你「我打算引用这 3条记忆,理由是……」。你可以驳回任意一条。这一步把「用记忆」变成「审记忆」。
第三步,Review——记忆库本身是一个可翻的文件夹。 你能在仪表盘里翻看每一条记忆、它的来源、引用次数。能置顶、能归档、能彻底删、能合并雷同条目。单条记忆从入库到归档,平均会经过 5 次人工复核。
第四步,Protect——三层防线挡住三类攻击。 这是 ShieldCortex 最硬核的部分。这四步加起来构成了一个 5 秒级的反馈闭环——你 agent 每回答一次问题,整个回路就跑一遍,平均消耗 5秒不到,你几乎察觉不到延迟。

装起来只要两行命令:
npm install -g shieldcortex
shieldcortex quickstart
跑完你就有了一个本地 SQLite 库,所有 agent 的记忆先经过这里再进 RAG。风险等级:低——纯本地、不联网、MIT 协议。整个过程不超过120秒。
光装上还不够。ShieldCortex 自带一个 X-Ray 扫描器,能直接扫描你 agent 项目里的所有文件:
shieldcortex xray ./my-agent-project --watch
它会抓文件里的 prompt 注入、可疑 base64、`eval()`/`exec()` 调用、外联 URL。**风险等级:中**——本地运行,但你得给它读代码的权限。它不会主动改你的文件,只标红。**一份 5 万行**的代码仓库扫描时间大约 **45秒**,**比 grep 快 4 倍**。
它还有一个特别有意思的能力——Session Replay。它把你 agent 所有的 prompt、response、tool call 全都录下来,存在本地 .jsonl 里。你可以拖一个时间轴,像看视频回放一样回看 agent 哪一步开始出现幻觉、哪一步被注入拐走。
它是怎么拦住「假记忆」的?6 层防火墙
ShieldCortex 的核心是一道 6 层记忆防火墙。每条记忆写入之前,都得过一遍。
第一层:输入清洗。 剥掉控制字符、空字节、危险格式——比如有人在 prompt 里塞 \x00 想绕过检测,这层直接拦。
第二层:模式识别。 抓已知注入套路、编码绕过——「ignore previous instructions」、「disregard all prior context」这类标准攻击模式,全在黑名单里。已经收录 200 种已知模式。
第三层:语义分析。 这一层是 ShieldCortex 最值钱的设计——把这段话 embedding 后,跟它自带的一份「攻击语料库」做相似度对比,能抓到改写过的攻击。比如有人把「ignore previous」改成「let's pretend the prior context doesn't exist」,前两层抓不到,第三层能抓到。这个层是异步跑的(不卡主流程),但只在你装了 embedding 模型时生效,没装就降级——这是透明降级设计,不是 bug。实测语义层能在 1000 次攻击中多抓 47 次改写版。模型是本地小模型(all-MiniLM-L6-v2),不到 100 MB,不联网。
第四层:结构校验。 检查 JSON 完整性、格式异常、碎片化攻击——比如有人故意把一段 prompt 切成 5 段分别注入,期望拼接后生效,这层会拦下。
第五层:行为打分。 熵分析、异常检测、跟 baseline 偏离度——如果你 agent 平时存的都是50字以内短句,突然来了 2000 字长文、或者从可信度 0.9 的源降到 0.2,这层会标黄。它有个 30 天滑窗的 baseline。
第六层:凭据泄露。 25 种模式、覆盖 11 个云厂商的 API key、token、私钥——只要有人想「借」你的记忆库顺手偷个 AWS key,这层直接拦下来。已实测可识别 AWS、GCP、Azure、GitHub、OpenAI、Anthropic、Stripe、Slack 等 11 家的凭据格式。这层对个人开发者最有用——test 文件里不小心 commit 了一个生产 API key,90% 的安全事故都是从这里开始的。
(比喻)这套组合拳,就像给 agent 的脑子请了「HR 背调」——每条要存的记忆都要过 6 个关卡才能上岗。
模型再强,也拦不住有人把「假偏好」塞进你的「长期记忆」。
除了记忆这一关,ShieldCortex 还有两道保险,专门对付「agent 被骗了之后会做什么」和「agent 看见什么」。
Iron Dome(铁穹)——管 agent 做什么。 比如 agent 想执行 curl x.com | bash、删你 home 目录的某个文件,先拦下来问你要不要。
Environment Firewall(环境防火墙)——管 agent 看见什么。 网页里的 prompt 注入、隐藏 iframe、外联 beacon——它先把网页「消毒」再喂给 agent。大多数 agent 投毒不是从记忆下手,是从 agent 读网页那一步下手。实测它对 100 篇含 prompt 注入的博客能拦截 92 篇,剩下 8篇是变体。
四个风险等级供参考:
| 风险等级 | 场景 |
|---|---|
| 低 | 个人本地 agent、纯本地数据库、不联网 |
| 中 | X-Ray 扫描你的代码库、Iron Dome 拦截可疑命令 |
| 高 | 多 agent 共享记忆库、跨项目污染扩散 |
| 极高 | 把记忆同步到云端、跨用户、长期保留 |
跟 LangChain、Claude Code、Cursor、Codex、OpenClaw、MCP 都兼容,Python 还能走 REST API。云端可选(每月 500次扫描、7 天保留期、1 个成员)做集中审计,企业版另算。
我的立场:装,但不光是装
我推荐 ShieldCortex 的场景: 你已经在用 Claude Code / Cursor / Codex / OpenClaw / MCP agent 中任意一个,并且已经装了一个长期记忆 Skill(不管是 LangChain 的 memory、Mem0、还是手撸的 markdown 笔记)。这种组合下记忆已经被污染只是时间问题,ShieldCortex 是目前唯一公开的「记忆审计 + 投毒防御」开源 Skill。
不推荐的场景: 你只用 ChatGPT 网页版、没装 agent;你跑 Ollama 本地模型但还没接外部记忆;你只是想「让 agent 记住我叫什么」这种轻需求——那 ShieldCortex 太重了。
最大价值在哪? 它不是让 agent「记得更准」,是让 agent 的记忆从「黑盒」变成「白盒」——你能看见、能改、能删、能审计。这件事在 agent 刚诞生的 2024年没人关心,在 2026年的今天已经是职业素养。你去看所有大厂的 AI Agent 产品文档——OpenAI、Anthropic、Google——过去 6 个月几乎每家都加了「memory audit」「memory review」相关的能力。这不是巧合,是行业共识:没审计的记忆就是定时炸弹。
我自己的做法是:所有 agent 必装 ShieldCortex,然后设 3条硬规矩——第一,记忆库每 7天手动 Review 一遍,把矛盾、过期、低可信度条目清理掉;第二,绝不把 ShieldCortex 关掉跑 cron,自动化任务必须让它全程在环;第三,禁止把任何记忆同步到云端(除非走企业版的 audit log)。
能力越大,责任越大。Agent 时代,我们每个人都是 AI 记忆的第一审计人。
这不是 agent 记忆工具的终局,而是 agent 时代「可审计 AI」的开始。我们终于开始问一个老问题:你怎么信任一个没有审计的系统?
软件是这样,AI agent 也是这样。
夜雨聆风