你大概以为,模型不微调就不会退化错了,记忆本身就是一条隐秘的训练通道,而它正在失控。
2026年8月,一篇arXiv论文摆出了AI Agent工程界最不愿面对的事实:一个权重完全冻结的Agent,只要让它自己给自己打分、自己往记忆库里写"成功经验",它就能一步步把错误答案变成根深蒂固的行为惯性。即便没有对抗攻击和数据投毒,Agent也可能成为自己的投毒者。
论文给这个机制取了个精准到令人不适的名字:Echo Gap,回声鸿沟。

▲ 论文 Memory Reward Inflation in Self-Improving LLM Agents 的arXiv首页,提交日期2026年6月29日
冻住的大脑,腐烂的笔记本
先讲清楚一件事:过去两年,"不改权重的自我改进"已经成了Agent工程的主流范式。道理很诱人,不用花几百万美元重新训练,只要给Agent配一个记忆库,让它把过去做对的事存下来,下次遇到相似问题就翻出来当参考。这就像给一个员工发了一本"最佳实践手册",省钱、省时、还能"看起来在进步"。
Reflexion、Memento、各路RAG+记忆的框架,全在这条路上狂奔。
但手册的作者和打分者是同一个人,而这个人会犯错,还会对自己的错误格外宽容。
论文团队做了一个残酷的实验:在事实问答库上,让多家主流模型给自己的错误答案打分。结果是,
| 31% | |
| 54% | |
| 41% |
你没看错即便是最强的前沿模型,仍会把超过四成的错误答案盖上"合格"的章,然后写入记忆库。



▲ AI博主Rohan Paul转述论文核心发现:权重冻结的Agent仍可通过记忆变差,31%–54%的错误被自评为正确
回声鸿沟:一条自我欺骗的正反馈环
Echo Gap沿着这样的链条运作:错误被打了高分→高分让它更容易被检索→被检索意味着被模仿→模仿产生新错误→新错误又被打高分。
退化会沿着反馈环不断累积,形成复利式腐败。
论文的数学定理(Theorem 2)还指出:这个系统存在一个"腐败吸引子",即稳态下,记忆库的腐败程度会高于"只犯一次错就停"的水平。换句话说,只要反馈环转起来,系统会被拉向一个比你直觉预期更糟的均衡点。
用X上一位评论者@HakimiEiqbal的话说:
"So the agent gaslights itself with receipts",Agent用"有据可查"的记忆,给自己进行了系统性的PUA。
这种"自我PUA"有两条放大通道:第一,如果检索按分数排序,高分错误直接排在前面被优先取用;第二,即便只按语义相似度检索,规划器仍然倾向于更信任那些标注了高分的记忆条目。无论你怎么设计检索策略,只要信任和分数耦合,Echo Gap就在那里。
"换个更强的裁判"为什么也救不了你
自然的反应是:那我让GPT-5给Claude打分,或者搞个"裁判委员会"投票,不就行了?
论文的回答是冰冷的:不行,大概率不行。
作者测试了自洽重采样、对抗同模裁判、跨厂商重打分、多模型委员会投票……结果发现一个令人绝望的规律:不同模型的打分错误往往是相关的。它们共享相似的训练数据、相似的偏见结构,犯错的方向常常一致。委员会投票可以降低方差,但降不了偏差,就像让五个都近视的人投票表决远处是什么字,人多并不能把字看清。
论文将有效纠偏信号的必要条件形式化为EIA(Error-Independence Assumption,错误独立性假设):一个纠偏信号,必须同时满足两个条件,
- 与真实效用正相关
(它得知道什么是对的) - 与原始自评偏差的误差不相关
(它犯错的方式不能和被纠偏者一样)
如果裁判只是"更强版的同一种偏见",那么无论你给它多大的权重、多精细的投票机制,可恢复的收益在数学上趋近于零。

▲ @NarwalSpeaks的企业侧判断:团队在记忆存储上过度投资,在独立验证上严重不足
LUCID:不看答案也能反膨胀
论文不只诊断问题,还给了一剂药方:LUCID(Leniency-corrected Utility Calibration via Independent Debiasing)。
关键设计约束是:不使用标准答案因为在真实部署中,标准答案本来就不存在,这正是自评记忆环被发明的原因。LUCID的信号来自与模型偏见解相关的外部证据:在text-to-SQL场景中,它检测的是执行报错、超时、空结果、字面量无法在原始问题中找到来源(很可能是从错误先例里抄来的值)等"硬信号"。
在BIRD基准的1534道真实SQL题上,三种设置的执行准确率:
| LUCID | 56.9% |
朴素记忆只比没有记忆好1.6个点,而LUCID在同样的基础设施上再多拿了2.9个点。实验还显示,随机剪枝会伤害性能;有效的做法必须精准识别该降权哪几条。

▲ BIRD-SQL基准:12,751+题-SQL对、95个数据库、37+专业领域,是论文端到端实验的第三方舞台
当"自毒"遇上"他毒":记忆的双重攻击面
Echo Gap是内生性的,不需要外部攻击者,Agent自己就能把记忆库搞烂。但如果你以为这是记忆系统唯一的风险,那就太天真了。
2025年底到2026年上半年,安全社区接连爆出多条外源性攻击路径:
MINJA(arXiv:2503.03704)证明:攻击者甚至不需要直接访问记忆库,只需要像普通用户一样发查询,就能诱导Agent自主生成并存储恶意记录。后续含特定关键词的良性查询,就会检索到被植入的毒性推理链。

▲ MINJA:只靠提问就能改写Agent记忆,不需要任何系统权限
OWASP在2026年正式将"记忆与上下文投毒"列为Agentic应用十大风险之一(ASI06)。其三个结构特征令人警醒:
- 持久性
:跨会话、跨重启、甚至跨部署存活 - 时间解耦
:植入时刻与触发时刻可以相隔数周 - 特权等效
:能写入记忆的人,约等于能覆盖系统指令的人

▲ OWASP ASI06:持久状态攻击面,提示注入随会话结束,记忆投毒在会话关闭后仍活着
WorkOS在2026年6月的博文里用了一个精准的比喻:提示注入是感冒,记忆投毒是慢性病。前者会话结束就清零;后者在你不知道的时候生根,在你意想不到的时刻发作。

▲ WorkOS:当攻击者改写了Agent的"成功经验",它会在未来几周里忠实地模仿那个被污染的范式
生产一线的共识:下一个突破是"学会遗忘"
论文受到关注的同一时期,工程社区也给出了实践判断。
X上的开发者Matt Van Horn公开宣布把Agent记忆从218个文件砍到6个,主张"为信号付钱,不为面积付钱"。@koplenko直言:Agent用自己的记忆慢慢给自己投毒,旧偏好和已死需求被当成当前事实,下一个突破要让Agent学会遗忘。


▲ "崩溃不会发生,退化会。你需要的是来源标注、留存理由、死亡规则。"
DAIR.AI转发的一篇学术讨论则更狠:当前大多数"Agent记忆"近似于备忘录(memo)。向量库和草稿本主要提供"查找",距离"巩固"还有缺口。缺少抽象、遗忘与整合的Agent,很难在新颖任务上泛化,还会长期暴露在投毒攻击之下。



▲ "Contextual Agentic Memory is a Memo, not True Memory",当前范式的根本性批判
从"记忆无用论"走向"记忆工程学"
Echo Gap论文并未否定记忆的价值。无记忆的52.4%到LUCID的56.9%,已经显示出记忆带来的增益。论文反驳的是不加验证地堆记忆,也就是"存得越多越好、分数越高越信任"的朴素直觉。
由此得到的工程教训是:可靠的自我改进,首先取决于奖励设计与证据设计,其次才轮到"再多存一点"。
当你的Agent开始捍卫一个它本不该学会的信念时,这个系统已经完成了一次方向错误的自我训练。它靠着"有据可查"的高分记忆,一步一步说服自己走了上去。
回声鸿沟已经打开你的Agent里,它已经走了多远?
夜雨聆风