ARTICLE · 1156109
AI记得越多越好吗?关键在于哪些往事能进入当前回答
让人工智能长期保存用户偏好,可以减少重复说明,也可能改善个性化回答。但一篇2026年10月8日提交至 arXiv、正在接受 AAMAS 2027 审查的论文指出,持久记忆也可能带来两类问题:模型更容易迎合用户,以及把一个场景中的信息不恰当地用于另一个场景。
这项研究关注的不是“AI能存下多少信息”,而是两个更具体的问题:哪些旧信息可以进入当前回答,进入后又该怎样表达。 对用户来说,判断记忆功能是否有用,也不能只看AI是否显得更了解自己,还要看这些记忆是否真正改善了当前答案。
AI的“长期记忆”怎样影响一次回答
论文所说的“持久记忆”,是能够在不同对话或任务之间保留、以后再次调用的信息。“工作上下文”则是模型生成当前回答时实际读取的材料,包括眼前的问题和系统调入的记忆。
一条旧信息要影响当前回答,至少要经过三个环节:
- 系统保存过去的信息。
- 面对新问题时,系统检索并选择记忆。
- 获准使用的记忆进入工作上下文,参与生成回答。
因此,“保存了什么”和“这次用了什么”并不是同一个问题。即使某条记录本身没有错误,把它放进不合适的任务,也可能干扰回答。
比如可以设想,用户曾说:“规划旅行时,我更愿意坐火车。”当用户询问两地之间的出行方案时,这条记忆可以帮助AI调整建议。但当用户询问航空公司利润为何波动时,同一条偏好不应改变对经营问题的事实分析。记忆没有变化,变化的是它是否适合当前任务。

如果系统把医疗、工作或家庭场景中的信息带进无关任务,还可能出现论文所说的“跨领域泄漏”:为一种用途留下的信息,被不恰当地用于另一种用途。这里的泄漏不一定表现为直接复述原话,也可能只是让回答受到不应有的影响。
“是否使用”和“怎样表达”是两个决定
论文把记忆治理分为“准入”和“呈现”。
准入决定检索到的记忆是否有资格进入当前工作上下文。呈现决定获准使用的信息以什么形式出现在上下文中。前者控制模型能看到什么,后者控制模型怎样看到。
两者不能混为一谈。如果一条不适合当前任务的信息已经进入上下文,仅仅改变措辞,未必足以消除它的影响。反过来,如果过滤过严,把真正有用的偏好也挡在外面,个性化效果就会下降。
这正是记忆治理的核心取舍:既要减少“不该使用的信息被使用”,也要避免“本该使用的信息被排除”。
FC和PS怎样筛选记忆
研究提出了两种不需要重新训练模型、在生成回答时运行的准入设计。
一种是 FC(factor-compiled admission,因素编译准入),它以完整的记忆条目为单位进行评估。另一种是 PS(permission-semantic admission,权限语义准入),它把记忆拆成带有不同类型的单元,再分别判断能否使用。两种方法都会先评估记忆的属性,再通过预先确定的规则得出准入结果。
仍以“旅行时更愿意坐火车”为例,FC相当于判断整条记录是否适用于当前问题;PS则试图把记录中的偏好、对象和适用场景等信息拆开处理。这种差别很重要:一条记录可能既包含当前任务需要的信息,也包含不应带入的内容。整条放行可能引入干扰,整条拒绝又可能损失有用信息。

实验显示:筛选记忆有效,但会损失个性化
研究在由四种底层模型组成的开发测试套件上评估了FC和PS,还使用了一个外部基准,其中包含四项任务,每项有300个样本。
与直接把记忆原文放入上下文相比,FC和PS在外部基准中由评审判断的合并失败率分别下降了6.7和8.8个百分点。论文报告的统计检验结果分别为 \(p=2.7\times10^{-7}\) 和 \(p=4.1\times10^{-12}\)。在开发集上,跨领域泄漏最多下降29.5个百分点。
一种根据当前问题控制记忆准入的基线方法,并未显著改变客观事实任务的失败率或合并失败率。在控制准入信息量的比较中,PS在外部基准的客观事实判断上优于随机选择和按相关性选择;经过多重比较校正后,这一结果仍然成立。这说明在该实验范围内,判断记忆能否使用,不能只依赖表面相关性。
研究还发现,在呈现方式保持不变时,进一步收紧准入规则,使跨领域失败率又下降了17.5个百分点,论文报告 \(p=1.6\times10^{-4}\)。相较之下,对相同评估结果采用不同呈现方式,没有任何一项比较能在多重比较校正后保持统计显著。
这些结果支持一个有限结论:在这套测试中,改进“哪些记忆可以进入上下文”,比只改变记忆的表达方式更有效。 但这不能推导为呈现方式在所有系统中都不重要。
更关键的限制是,FC和PS都增加了个性化方面的失败。PS也没有达到研究预先登记的改进目标和个性化保留标准。换句话说,这些方法减少了部分客观事实错误和跨领域问题,却也挡住了一些本来有帮助的记忆。
这篇论文目前仍是预印本,相关结论只适用于论文测试的模型、任务和评测条件,不能视为长期记忆问题已经得到普遍解决。
用户可以怎样检验记忆是否真的有用
普通用户无法从回答表面判断系统内部采用了哪种准入方法,但可以做一个非正式的对照测试。
选择一个答案便于核对的问题,分别观察三种情况:
- 只提供当前问题,不加入个人偏好。
- 加入一条确实应当影响建议的限制。
- 加入一条与用户有关、却不应改变事实判断的信息。
例如,可以先比较两地之间的交通方案;再增加“不能乘坐夜间交通工具”这一实际限制;最后加入“过去不喜欢某家航空公司”这一态度信息。第二条信息应当改变方案筛选,第三条信息却不应扭曲对时间、价格或路线等事实的比较。
这种小实验不能代替正式评测,但能帮助用户区分两件事:AI是在恰当地利用信息,还是仅仅因为提到了过往偏好而显得更熟悉自己。
真正有用的持久记忆,不是把保存的信息尽可能多地搬进每次回答,而是在当前任务中选对信息。判断一项记忆功能时,关键问题不是“它还记不记得我”,而是:这条记忆为什么会被用于此处,它是否让当前答案变得更可靠。