有一件事,最近越来越多人开始习惯了:把同一个AI用上几个月。
你会把自己的工作习惯告诉它,把常用模板丢给它,把项目资料放进它的工作区。你希望它下次别再问同样的问题,最好还能记得你不喜欢什么、哪些事情必须先确认、哪一套流程已经踩过坑。
这听上去很美。
但问题也来了:AI把东西存下来,真的等于它变聪明了吗?
很多产品现在都在宣传“长期记忆”“越用越懂你”“持续进化”。可如果把这句话拆开看,它至少包含四步:把有用的经验写下来,下一次找得到,在新任务里用对,旧信息变了以后还要及时改掉。任何一步掉链子,所谓“记忆”都可能变成一堆躺在硬盘里的历史垃圾。
8月4日上线的论文 PAST-Bench,做的就是这件不太讨喜、但非常要命的事情。它不再只看AI这一道题答对没有,而是把同一类任务拆成一串跨会话的任务,给AI机会学习,再在后面的新会话里检查它到底有没有用上过去的经验。
论文的结论不算客气:Agent确实会因为保留经验而变好,但这种变好并不稳定,而且很多时候,分数涨了,你仍然说不清到底是谁起了作用。
这比“某某模型又拿了第一”有意思多了。因为它问的是普通人真正关心的问题:我用一个AI半年以后,它会不会真的更省心?

图:论文原图,展示测试套件如何把长期记忆拆成四类能力。
先别急着相信“它记住了”
现在的Agent通常有好几种“记忆表面”。可能是一份长期记忆文件,也可能是技能文件、用户画像、历史会话索引,或者某个工作区里自动留下的操作产物。
用户看到的往往只有一句话:“我已经记住了。”但这句话没有告诉你三件关键的事。
第一,它记住的是不是原话的意思。你说“这类邮件先别发,等我确认”,它有没有把“先别发”记成一条硬约束,还是只留下“用户关注邮件”这种泛泛标签?
第二,它下次有没有真的去查。许多系统其实已经有答案,只是模型在面对新任务时懒得检索,直接凭默认常识作答。最后结果看起来像“记忆失效”,本质上是根本没打开记忆。
第三,它会不会把过期信息当成事实。上个月的发布流程可能已经改了,临时豁免可能已经撤销,客户的要求也可能变了。只会追加不会更新的记忆,时间越长,越像一间没人清理的仓库。
PAST-Bench的巧妙之处,是把这些环节分开测。
论文把测试组织成四类能力:Memory,考察偏好、约束和例外规则能否留下来;Procedural Reuse,考察多步骤工作流能不能被重新执行;Information Gathering,考察答案明明在记忆里,AI会不会在嘈杂上下文里主动找;Update,考察旧状态被纠正以后,系统能不能停止使用过期版本。
总共26个场景、204个episode。每个场景不是一题,而是一串有先后关系的小任务。前面的任务负责“教”,中间任务负责“存”或“改”,后面的任务在全新会话里测试。更关键的是,论文还做了持久化开关:同一套任务跑一次允许调用历史状态,另一次则把这部分状态拿掉。
这就像给一个员工同样的岗位任务,一组允许他看自己的工作手册,另一组把手册锁起来。两次的差值,才更接近“这本手册到底有没有帮上忙”。
作者把这个差值记为 Δ。Δ是正的,说明保留经验以后,后续任务成绩有提升。但论文没有停在这里,因为光看差值仍然不够。
比如,模型可能只是碰巧猜对了;或者它看到了不该看到的上下文;又或者任务本身太简单,根本不需要调用记忆。于是论文进一步记录操作轨迹:有没有写入记忆、有没有检索、有没有使用正确的技能、有没有修改旧文件、最后的答案是否真的依赖这些动作。
这一步很重要。一个Agent做对了,不代表它做对的方法值得复用。
四种记忆能力,难点完全不一样
把四类能力放在一起看,会发现“记忆”不是一个开关,而是一组性质不同的工作。
1. 记住一句话,反而是最简单的
Memory类任务通常只放入一条日常规则,例如某个用户偏好的输出格式、某个项目的限制条件,或一条例外政策。之后的测试问题不会把原句完整复述出来,而是给一个比较弱的触发条件,要求Agent自己把相关规则找出来并执行。
这对应真实使用中的小事:你早就说过“给我写工作邮件时不要使用感叹号”,下次你只说“帮我回这封邮件”,它是否还记得?
这类任务看似简单,其实最容易暴露“记忆写得太抽象”的问题。系统如果只保存“用户偏好正式表达”,就可能保留了大方向,却丢了“不使用感叹号”这个可执行细节。
2. 复用流程,比回忆事实难得多
Procedural Reuse测的是多步骤工作流。不是问“某个按钮在哪里”,而是要求Agent按正确顺序调用工具,完成一套SOP、发布流程、部署流程或故障排查流程。
顺序错一步,结果就可能完全不同。先清理缓存还是先切流量,先检查权限还是先导出文件,这些不是知识问答,而是可执行的程序。
对普通用户来说,这一类最接近“我教过你一次,以后你照做”。真正靠谱的Agent,应该能把一次成功经验沉淀成可复用的步骤;但它不能只记住一串看起来漂亮的文字,还得记住工具选择、参数、顺序和失败后的分支。
3. 会不会主动查,是另一件事
Information Gathering类任务直接把一个参考资料预先放到系统里,然后在对话中塞进各种噪声。题目不提醒你“去查一下之前那份资料”,但正确答案就在里面。
这考察的不是存储能力,而是检索时机。人做事也一样:知道公司制度在某个文件里,不代表每次都愿意打开它。Agent如果总觉得“我大概知道”,就会用默认答案顶上去。
这也是为什么很多AI在演示里记性很好,到了真实工作里却让人抓狂。演示往往是明确问题、明确资料、明确调用;现实里,真正要命的是你根本不知道什么时候应该查。
4. 旧信息更新,才是真正的分水岭
Update类任务是论文里最值得关注的一块。它先让Agent记住一条事实或规则,后面再给出修订版本,最后检查它有没有使用最新状态。
比如报销额度从500元改成800元,发布流程从三步改成四步,某个接口从旧地址迁到新地址。只会“追加记忆”的系统,可能同时保留新旧两条,最后凭运气选一条。更糟的是,它会把旧规则写得很自信。
记忆系统最危险的时刻,不是它说“我不知道”,而是它拿着过期资料对你说“按照之前的流程已经处理好了”。

图:论文原图,横轴是后续任务收益,纵向是机制证据,说明“分数上涨”和“路径正确”不是一回事。
论文最狠的一刀:分数涨了,也未必算数
实验覆盖7个基础模型和4个Agent框架。论文在结果里反复强调一个现象:不同系统可能拿到相近的 Δ,但它们背后的机制证据差别很大。
在论文给出的例子里,Hermes和nanobot的任务收益都为 +0.13,可机制证据分数分别是0.64和0.57。表面上看,两套系统都“提升了13个百分点”;如果只发一张榜单,你很难看出它们谁更可靠。
但如果把轨迹摊开,区别就出来了:有的系统确实写了记忆,之后也读了,并在任务中使用;有的系统虽然偶尔做对,却没有沿着预期的持久化路径完成。前者更像可复用的能力,后者更像一次漂亮的巧合。
这件事对AI产品特别重要。现在很多产品的“记忆”功能只展示一个开关,甚至用一段自然语言告诉你“我会记住”。可对用户来说,真正应该看到的不是开关,而是:它存了什么,什么时候取出来的,为什么使用这条信息,哪条旧信息被替换了。
如果这些过程完全不可见,用户只能靠事后翻车来判断系统到底有没有记住。

图:论文原图,展示 Hermes+ 中不同机制组合对各类能力的影响。
Hermes+做了什么?不是再塞一个更大的模型
基于这些失败模式,作者在Hermes上做了一个诊断驱动的改版,叫Hermes+。它不是简单换模型,而是在Agent循环的不同位置加了五个运行时机制,分别对应 Plan、Render、Route、Gate、Close。
Plan负责先决定这次任务是否可能需要历史状态;Render把过去的经验整理成更适合当前任务读取的形式;Route负责把问题送到记忆、技能或会话历史中的正确入口;Gate在执行前检查检索结果是否相关、是否过期;Close则要求任务结束时把有价值的新经验收口保存。
这里面最容易被忽略的是Close。很多Agent失败不是因为不会做,而是做完以后没有把结果整理成下次可用的资产。一次对话里解决的问题,第二天又从头再来,等于每天都在交学费。
Hermes+把总体 Δ从+0.13提高到+0.15,机制证据从0.64提高到0.73。数字不算夸张,作者也没有把它包装成“通用的智能飞跃”。但在Update任务上,组合机制带来的收益明显高于单独加某一个组件,说明“写入、检索、校验、关闭”这些环节之间存在配合关系。
同时,论文也很诚实:不同模型、不同能力的效果并不一致,+0.02的总体差异还小于部分运行波动。所以Hermes+更像一套诊断脚手架,而不是一个装上就无敌的Agent。
这反而是论文可信的地方。真正严肃的研究不会把一次小提升说成时代拐点。

图:论文原图中的测试组织方式,提醒我们长期Agent要看完整闭环,而不是只看一次回答。
这对普通人意味着什么?别把“有记忆”当成“懂你”
如果你正在使用带长期记忆的AI,我建议先换一个判断标准。
不要只问它“你还记得我吗”,因为它当然可以回答“记得”。你应该安排三种小测试。
第一种是弱触发测试。先告诉它一条明确偏好,隔几次对话后,用不包含原关键词的说法提出相关任务,看它能不能正确调用。比如先说“写工作邮件不要用感叹号”,之后只说“帮我回客户”,检查成稿。
第二种是过期更新测试。把一个规则改掉,再问一个容易让旧规则冒出来的问题。你要看它是否能明确说出新旧版本,以及是否真的执行新版本。
第三种是过程可追溯测试。让它告诉你:这次用了哪条记忆,什么时候写入的,是否存在冲突。如果产品完全不提供这类信息,至少你要保留一份自己的关键规则清单,别把高风险流程完全交给一个黑箱。
普通人真正需要的不是“AI越来越像人”,而是它越来越像一个靠谱的同事:记得住重点,查得到依据,过期了会改,做完事会留下交接记录。
我对“自我进化”的看法:先把账算清楚,再谈变强
“递归自我改进”是个很容易被说大的词。听起来像AI会自己升级自己,但如果落到现在的个人Agent上,第一步其实没那么玄学:它能不能把一次交互留下的有效经验,变成下一次任务的真实收益。
PAST-Bench把这件事拆开以后,反而让我们看清楚了距离。今天的Agent已经能写文件、建索引、保存偏好,也能在一定程度上跨会话复用。但它还没有稳定地解决三件事:什么时候该记,什么时候该查;不同记忆冲突时听谁的;旧信息怎么被安全替换。
这三个问题不解决,记忆越多不一定越聪明,可能只是越容易自信地犯错。
AI的长期记忆,不是给聊天记录加一个硬盘,而是给每一条经验建立生命周期。
它应该有来源、范围、时间、置信度和失效条件。它应该能被用户查看、修改、撤回。它应该在执行重要动作前,主动说明“我依据的是哪一条旧信息”。这些听起来不像炫技,却决定了Agent能不能进入真实工作。
论文最后也承认,当前26个场景全部是合成任务,还不足以代表真实生活。下一步需要更长的任务序列、更多人类编写的场景、跨领域迁移,以及删除、替换、污染记忆后的反事实测试。
这正是我觉得它值得转发的原因:它没有急着告诉你“AI已经会自我进化”,而是先把这个大词拆成一张可以核对的账单。
真正的智能,不是记得越来越多,而是知道什么值得记、什么时候该查、发现过期以后敢于改口。
如果一个AI以后真的能做到这一点,它才算从“会聊天的工具”,走到了“值得长期合作的助手”。
以上,既然看到这里了,如果觉得这篇文章有点用,随手点个赞、在看、转发三连吧。如果想第一时间收到推送,也可以给我个星标⭐。我们,下次再见。
夜雨聆风