乐于分享
好东西不私藏

AI智能体记忆功能深度调研报告

AI智能体记忆功能深度调研报告
本报告系统调研2026年AI智能体(Agent)记忆功能的定义、发展历史、产品与技术现状、评测方法、风险挑战与发展趋势,并在结尾给出分角色的落地建议。全文结构与导读如下:
章节
主题
回答什么问题
一、核心结论
10 条关键判断
读完只需记住什么
二、概念界定
记忆的定义、重要性、分类学
什么是"AI 智能体记忆",为什么重要
三、类型学与功能清单
显式/隐式记忆、作用域、功能对照表
记忆功能有哪些类型与能力
四、主流产品盘点
ChatGPT/Claude/Gemini/Copilot + 国内产品 + 编码 Agent
各家产品现在做到什么程度
五、技术实现机制
四种架构、记忆生命周期、MCP
记忆底层是怎么做的
六、记忆评测
LoCoMo / LongMemEval / BEAM 等
怎么衡量记忆好不好
七、风险、挑战与监管
MemGhost 攻击、隐私合规、开放问题
记忆带来什么风险
八、趋势与展望
8 大趋势
接下来往哪走
九、落地建议
个人 / 团队 / 企业
该怎么用、怎么选、怎么建
调研时间2026 年8月(数据截至 2026-08-14) 
调研范围:AI 智能体(Agent /AI 助手/ 编码代理)的记忆功能——包括记忆的概念与类型学、主流产品的记忆能力现状、技术实现机制、评测基准、安全风险与监管动态 调研的主要目的:系统梳理 AI 智能体记忆功能的完整图景(定义、发展历史、产品与技术现状、评测、风险与趋势),为构建个人级与企业级智能体系统提供有帮助的参考资料——在选型记忆方案、设计记忆功能、评估记忆安全与合规时,可作为决策依据与信息支撑。 
数据说明:产品功能与数据来自官方博客/文档、IT之家、InfoQ、极客公园等公开报道,均为截至 2026-08 的信息;部分数据(如记忆条数上限、召回率)来自第三方实测/厂商自报,仅供参考,请以官方为准。

1. 定义、重要性与发展历史

定义

AI智能体记忆功能,是指让智能体跨会话保留、检索、更新和使用信息的一组产品能力,包括"记住(Write)、回忆(Recall)、遗忘(Forget)、更新(Update)、管理(Manage)、共享/隔离(Scope)、可移植(Portability)、审计(Audit)"八个基本环节(详见第二章)。

重要性

先用一个类比——人脑处理信息的方式。人之所以"聪明",不只是因为神经元算得快,更因为它有一套精妙的记忆系统:工作记忆负责处理当下,长期记忆把几十年的经历、知识与经验沉淀下来,在关键时刻随时调用。一个推理能力再强的人,如果"失忆",也无法在复杂工作中表现出色;反之,一个普通人凭借对所在领域长期积累的"感觉",往往能做出比"聪明但陌生"的人更正确的判断。可以说,记忆就是把"能力"与"经历"连接起来的枢纽——没有它,能力再强也只是"每次都从零开始"。

AI 智能体同理。大语言模型本质上是无状态的——每次调用都是一次"全新的开始",相当于"能力很强但严重失忆的大脑"。没有记忆,用户每次都要重复背景与偏好,AI 只是"会说话的搜索引擎";有了记忆,AI 才能从"单次协作助手"变成"越用越懂你的同事"。

个人而言,智能体好不好用、聪不聪明,很大程度取决于一个关键环节——私有个人数据(偏好、经历、项目、个人知识库)的组织:能否把散落在各处的个人信息沉淀为结构化长期记忆,并持续学习、积累数据与智能,做到"越用越懂你"。

企业(尤其是企业级智能体系统)而言更是如此:企业级智能体的价值,本质上是私有企业数据资产的组织与持续积累——把业务文档、代码库、客户知识、流程经验、历史决策等组织成可被智能体检索和调用的记忆与知识,并不断把"一次成功的做法"固化为可复用的智能(程序记忆/技能),让系统越用越聪明。可以说,企业智能体"聪不聪明",取决于它背后数据资产与知识被组织、沉淀到什么程度;记忆功能正是连接"大模型通用能力"与"企业私有数据"的枢纽,也是本报告把记忆视为智能体基础设施核心的根本原因。公开数据(METR、Qodo)同样显示,上下文断裂正是AI编程助手生产力提升不及预期的关键瓶颈。

发展历史简要

阶段
时间
标志性事件
无状态时代
2024年前
智能体靠长上下文硬扛,会话结束即失忆
显式记忆起步
2024-04
ChatGPT上线"已保存记忆";MemGPT论文与Mem0等记忆框架兴起
隐式记忆出现
2025-04
ChatGPT引入Dreaming V0,后台自动整合历史会话
框架爆发
2025–2026
Mem0/MemPalace/Hindsight/TencentDB等开源记忆框架爆发;LongMemEval、BEAM等评测基准落地
大厂标配化
2026
Claude Managed Agents Memory Stores、Gemini记忆导入、Copilot Studio记忆、OpenAI Dreaming V3、Kimi K3架构级记忆
风险与监管入场
2026-07
MemGhost记忆注入攻击公开;《人工智能拟人化互动服务管理暂行办法》施行,豆包/通义下线拟人化智能体

2. 发展现状与现有技术

产品现状

截至2026-08,OpenAI、Anthropic、Google、微软与国内主流厂商(豆包、Kimi、通义/Qwen、元宝、文小言、智谱清言等)全部具备跨会话记忆能力;编码智能体(Claude Code、Codex、Trae)已把记忆做成生产力标配。但主流"平台记忆"本质仍是偏好级记忆(记住"你喜欢简洁、用Python"),而非可整合模式、表达层级关系的知识级记忆——这正是专用记忆框架与MCP记忆服务器的机会(详见第四章)。

技术现状

业界收敛出四种主流架构——滑窗+摘要、向量检索、知识图谱、向量+图混合(2026 年生产共识);记忆生命周期遵循:

"写入 → 存储 → 检索/注入 → 更新/遗忘 → 审计"

记忆接入走向标准化(MCP记忆服务器让任意智能体共享记忆后端);记忆评测形成 LoCoMo / LongMemEval / BEAM 基准体系(详见第五、六章)。

3. 待解决的难题与发展趋势

待解决的难题(详见第七章):

  • 正确性:记忆过时、记忆幻觉与污染——一次写错的记忆会永久污染后续所有检索,"记忆验证(检测并移除虚假记忆)"仍是开放问题;
  • 安全:2026 年曝出的"隐形记忆注入"(MemGhost)——一封邮件即可改写 AI 长期记忆,现有防御几乎全部失效;
  • 隐私与合规:删除权、记忆隔离、敏感信息保护;中国拟人化互动服务监管已直接导致产品功能下线;
  • 工程:成本与延迟、100K+ 记忆规模下"巩固不丢细节"、从结果中学习、评测缺口、灾难性遗忘。

发展趋势(详见第八章):记忆成为智能体的基础设施标配 → 从"向量检索"走向"记忆原生API" → 从"偏好记忆"走向"结构化知识记忆" → 记忆可移植性成为竞争战场 → 记忆与技能(程序记忆)融合、支撑自进化智能体 → 本地优先/逐字存储反叛 → 安全与合规成为一等公民 → 记忆从外部插件下沉到模型架构本身。


一、核心结论

  1. 记忆已从"可选项"变成AI智能体的"标配基础设施"
    2024年大多数智能体还是无状态的;到2026年,OpenAI、Anthropic、Google、微软以及国内主流厂商(豆包、Kimi、通义、元宝、文小言、智谱清言等)全部上线跨会话记忆能力,记忆从一个研究话题变成了产品竞争的主战场。
  2. "记住"不是记忆的全部,"好记忆"有三个标准
    OpenAI 官方定义——①延续有用的上下文(说一次就能跨会话用);②遵循偏好和限制(素食者就该收到素食推荐);③随时间保持最新("七月要去新加坡"应自动更新为"七月去过新加坡")。多数产品在前两点尚可,第三点(记忆过时/陈旧)是当前最大的体验痛点。
  3. 记忆功能分两大类:显式记忆与隐式记忆
    显式(Saved Memories):用户说"记…",系统写入记忆表并注入系统提示词;
    隐式(Chat History):系统后台翻阅全部历史会话,聚类-摘要出用户画像。ChatGPT、Qwen Chat两者兼有;Kimi偏被动隐式;Claude、智谱清言、文小言偏主动显式。
  4. 主流产品的"平台记忆"本质是"偏好级记忆",不是"知识级记忆"
    它能记住"你偏好简洁回答、用 Python",但难以跨会话整合模式、从结果中学习、表达层级化关系——这正是专用记忆框架(Mem0、Letta、Zep、Cognee、Hindsight、TencentDB 等)与MCP记忆服务器的生存空间。
  5. 记忆正在成为"可移植性"战场
    2026年3月 Google上线从ChatGPT/Claude导入完整聊天历史的工具(ZIP 上传,最大5GB),Anthropic三周前也部署了类似导入功能。记忆的可迁移、可导出、可删除正在成为新功能维度,也意味着记忆=用户粘性=商业护城河。
  6. 2026年是记忆架构的升级年
    OpenAI推出Dreaming V3(记忆容量2倍、免费版算力降至1/5,解决陈旧与准确性);Anthropic推出Claude Managed Agents Memory Stores(文件系统式记忆,公开Beta);腾讯混元推出Hy-Memory 插件(用更少记忆量换更高信息密度);Kimi K3从模型架构层面重构记忆(压缩记忆/Delta Attention)。
  7. 技术路线收敛为四种模式
    滑窗+摘要(最常用)、向量检索(基线)、知识图谱(从实验走向生产)、向量+图混合(2026 年的生产共识)。
  8. 记忆带来新的安全风险
    2026年7月南洋理工+约翰霍普金斯提出"隐形记忆注入"(MemGhost攻击)——一封邮件即可向AI长期记忆植入虚假信息,在GPT-5.4/OpenClaw上端到端成功率高达 87.5%,现有防御几乎全部失效;记忆污染、记忆幻觉的"验证"仍是开放问题。
  9. 监管开始介入"记忆+情感陪伴"
    中国《人工智能拟人化互动服务管理暂行办法》2026-07-15 施行,豆包与通义千问同日下线用户自建拟人化智能体并承诺清除历史数据;办法明确要求提供交互数据复制/删除选项、敏感个人信息不得用于模型训练。
  10. 记忆评测基准进入"换代期"
    LoCoMo仍是主基准,LongMemEval、BEAM(百万 token)正在成为新标尺;但现有基准普遍测的是"对话回忆",对工具调用、多步决策、结果学习等真实生产需求覆盖不足,评测本身也在演进。

二、概念界定:什么是"AI 智能体记忆"

2.1 为什么需要记忆:无记忆智能体的痛点

大语言模型本质上是无状态的:每次API调用拿到一个上下文窗口,处理完就结束,调用之间不保留任何东西。对短任务没问题,但对长期协作就成了致命瓶颈。公开数据:

  • METR(2025,arXiv:2507.09089):开发者在使用AI工具处理熟悉代码库时,任务完成时间反而平均增加19%(n=16,样本小,作者明确说明不具普适性)。
  • Qodo(2025,n=609):65% 的开发者表示 AI 在重构、测试、代码评审时遗漏了相关上下文。
  • Shift Magazine(2026):93%的开发者使用AI编程助手,但实测生产力提升仅约 10%——"上下文断裂"是重要原因。

一句话:没有记忆,用户每次都要重新自我介绍;有记忆,AI才能从"会说话的搜索引擎"变成"越用越懂你的同事"。

2.2 记忆的认知科学类比与分类学

业界普遍借用人类认知科学对记忆分类:

类型
含义
对应工程实现
工作/短期记忆
(Working/Short-term)
当前对话上下文窗口
所有 LLM 自带,受上下文长度限制;滑窗 + 摘要管理
情景记忆
(Episodic)
过去交互的时间顺序记录
会话日志、向量检索的事件存储(ChatGPT、Letta、Mem0)
语义记忆
(Semantic)
关于用户/世界的持久事实与偏好
记忆表、知识图谱、向量库(ChatGPT、Claude Projects、Mem0)
程序记忆
(Procedural)
学会的技能/工作流/规则
Agent Skills 标准(Anthropic 2025-10 提出)、技能库
分层记忆
(Hierarchical)
多级上下文按需分页
Letta/MemGPT 的 Core / Recall / Archival 三层

2026 年 1 月的综述《Memory in the Age of AI Agents》(arXiv:2512.13564,200+ 参考文献)给出了更形式化的分类:事实记忆(factual)、经验记忆(experiential)、工作记忆(working),并指出记忆有三种实现载体——token 级(外部上下文)、参数级(权重内化)、潜在级(latent)

另一篇 2026 年 3 月综述(arXiv:2603.07670)用 write-manage-read 三维分类框架梳理了2022–2026的全部工作,并把"持续巩固、因果检索、可信反思、学习遗忘、多模态具身记忆"列为开放挑战。

2.3 一个实用的功能视角定义

把学术界分类落到产品功能上,"AI 智能体记忆功能"可以定义为一组让智能体跨会话保留、检索、更新和使用信息的产品能力,至少包括:

  • 记住(Write):显式保存或自动提取信息;
  • 回忆(Recall):在合适的时机把相关记忆注入上下文;
  • 遗忘(Forget):删除/过期的能力;
  • 更新(Update):随时间和事实变化修订旧记忆;
  • 管理(Manage):用户可查看、编辑、开关;
  • 共享/隔离(Scope):记忆作用域(个人/项目/团队/组织)与多用户隔离;
  • 可移植(Portability):导入/导出、跨平台迁移;
  • 审计(Audit):记忆写入/读取留痕(企业级)。

三、记忆功能的类型学与功能清单

3.1 按触发方式:显式 / 隐式 / 被动

模式
说明
代表产品
显式记忆
(用户主动触发)
用户说"记住……",系统调用内部工具写入记忆表,每次对话注入
ChatGPT 已保存记忆、Claude、智谱清言、文小言
隐式记忆
(系统自动提取)
系统后台翻历史、聚类-摘要出高置信用户画像,自动写入
ChatGPT Dreaming、Qwen Chat、Gemini 默认开启
被动记忆
(混合)
系统自己记住用户偏好,无需用户声明,也较少提供管理界面
Kimi

实测案例(AI星球,2026-02):问"你还记得我们的第一次对话吗?",Kimi、DeepSeek、智谱清言、Z.ai、通义、元宝、文心一言、讯飞星火均回答"不记得";只有 Qwen Chat准确说出了最早交流时间与话题——因为它是少数把隐式记忆落地的产品。

3.2 按作用域:个人 / 项目 / 团队 / 组织

  • 个人级:ChatGPT 账号级记忆、Gemini 个人上下文、豆包长期记忆——跨所有会话生效;
  • 项目级:Claude Project Knowledge、Claude Code 的 CLAUDE.md/MEMORY.md、ChatGPT Projects——记忆限定在项目内,避免跨项目串味;
  • 团队级:TencentDB Agent Memory(Chat Memory / Skill / LLM-Wiki / Code-Graph 四类团队资产)、Copilot Studio 记忆(每用户独立存储)、Claude Managed Agents Memory Stores(工作区作用域)——多智能体/多成员共享与治理;
  • 组织级:Gemini Enterprise Memory Bank、微软Work IQ——结合企业数据源(邮件、会议、文档)提供工作洞察。

3.3 记忆功能完整清单(对照表)

功能点
说明
谁做得最明确
显式"记住"指令
用户主动声明保存
ChatGPT、Qwen Chat、Claude
自动记忆
无需声明自动提取偏好/项目上下文
ChatGPT Dreaming、Claude Code Auto Memory、Gemini
记忆可视化/摘要页
用户可查看 AI 掌握了哪些信息
ChatGPT 记忆摘要页、Gemini Personal Context 记忆列表
记忆编辑/删除
单条增删改
ChatGPT、Gemini、Qwen Chat
一键关闭/临时模式
记忆总开关、临时聊天
ChatGPT Temporary Chat、Claude incognito、Qwen 临时聊天
记忆随时间更新
过期事实自动修订
ChatGPT Dreaming V3、Graphiti 时序演化
记忆导入/导出
跨平台迁移
Gemini(从 ChatGPT/Claude 导入 ZIP)、Claude 导入功能
项目级记忆隔离
记忆按项目作用域
Claude Projects、ChatGPT Projects
团队记忆共享
多 Agent/成员共享与治理
TencentDB Agent Memory、Claude Memory Stores
记忆审计
写入/读取留痕、可回滚
Claude Memory Stores(版本历史)、企业平台
记忆数据本地化
本地存储、数据不出设备
Claude Code 本地 MEMORY.md、MemPalace、GBrain

四、主流产品记忆功能盘点

4.1 海外四大平台

4.1.1 ChatGPT(OpenAI)——记忆功能演进最完整

  • 2024-04:上线"已保存记忆"(Saved Memories)。用户说"记住……"才写入,弱提示不触发;缺点是容易陈旧、准确性有限。
  • 2025-04:引入第一版 Dreaming(做梦)V0——后台流程翻阅聊天历史自动整合记忆,缓解陈旧问题,但当时不足以独立支撑记忆系统。
  • 2026-06-04:推出 Dreaming V3 记忆架构,围绕三大目标评估(延续上下文 / 遵循偏好与限制 / 随时间保持最新):
    • 记忆容量提升至原来的2倍(美国 Plus/Pro 先行);
    • 把 Dreaming 服务免费用户所需算力压低至 1/5,可向免费版推广;
    • 新增记忆摘要页:用户可查看 ChatGPT 掌握的重点、增改个人信息、指示何时提起哪些话题;
    • 典型能力:把"你七月要去新加坡"自动修订为"你 2026 年七月去过新加坡"。
  • 其他记忆相关功能:Projects(项目级上下文)、Temporary Chat(临时聊天,不入记忆)、Chat memory 开关(设置→个性化→记忆,可关闭)。
  • 2026-08-13:Mac版ChatGPT推出 Computer History(取代Chronicle 研究预览)——不再依赖屏幕截图,改用macOS辅助功能记录点击/输入/快捷键/应用切换,把用户 Mac 活动转化为"活动记忆与时间线",供ChatGPT 与 Codex 使用;隐私上自动排除隐私浏览、事件本地暂存最长48小时、生成记忆后即删除原文、纯文字记忆保留本地直至用户清除。先面向 Pro/Business/Enterprise,暂不覆盖 EEA/瑞士/英国。

4.1.2 Claude(Anthropic)——项目知识 + 文件系统记忆

  • Project Knowledge:项目级知识库,用户把文件放入项目即成为模型的持久上下文,作用域清晰(付费功能)。
  • Memory tool(API,2025 起 Beta):让模型通过工具调用保存/检索"记忆"文件,用于跨会话记住用户偏好。
  • Claude Code Auto Memory(2026-02,v2.1.x)
    • 新增 MEMORY.md(区别于用户手写的 CLAUDE.md),由 Claude 自主维护,记录构建命令、调试经验、代码风格偏好、架构约定等;
    • 存储在本地 ~/.claude/projects/,会话启动自动加载前 200 行,更长的按需读取;
    • 默认开启,可用 /memory 命令或配置关闭。
  • Claude Managed Agents Memory Stores(2026-04-22公开Beta)
    • 内置、面向智能体的记忆层,直接挂载到文件系统,Agent 用 bash/代码能力读写记忆(而非黑盒向量库);
    • 记忆即文件:可导出、可经 REST API 独立管理、可预置种子知识、可审计(含版本历史、可纠正写错的记忆);
    • 单条记忆上限约 100KB(~25k tokens),Store 有容量上限;面向企业:作用域权限 + 审计日志 + 全编程控制。
  • 2026 年 3 月:上线从其他平台导入聊天历史的工具(早于Google 约三周)。

4.1.3 Gemini(Google)——个人上下文 + 记忆导入

  • "Past Chats" 更名为 "Memory":在设置→Personal context 中默认开启"你与 Gemini 的过往聊天",用于个性化回复;可随时开关、逐条删除记忆、在 Gemini Apps Activity 管理对话。
  • 2026-03:推出聊天与记忆导入工具——用户可从 ChatGPT/Claude 通过 ZIP 上传迁移完整对话历史(最大 5GB)。媒体称这是"解决了更换 AI 助手最大障碍"。
  • 2026-06(I/O 2026 前后)Gemini Live(语音对话)也接入记忆——能记住过往聊天关键细节(如饮食偏好)与部分 Connected Apps 信息,跨会话生效。
  • 企业侧:Gemini Enterprise Agent Platform 提供 Memory Bank(企业级记忆库)。

4.1.4 Microsoft Copilot / Copilot Studio——租户级记忆

  • Copilot Studio Memory(预览,2026):Agent 可记住交互细节并在后续交互中使用;每个 Agent 为每个用户维护独立记忆存储(一人上下文绝不复用给另一人);群聊和 Teams 频道中禁用用户记忆。
  • 用户可以说"记住我的分支是华沙分支"之类的指令,跨会话生效。
  • 企业侧:管理员可控制;Work IQ(2026-03 预览)把 M365 文件、邮件、会议、聊天等实时工作上下文接入 Agent。

4.2 国内产品

产品
记忆功能现状(截至 2026-08)
关键点
豆包
(字节)
设置→记忆→开启"记住我的偏好";支持显式声明偏好跨会话复用
用户实测记忆条目上限约 20 条,旧记忆会被覆盖;2026-07-15 下线用户自建拟人化智能体(与监管相关,见第七章)
Kimi
(月之暗面)
被动记忆:系统自动记住用户偏好;200 万字上下文
2026-07 Kimi K3 发布(2.8T 参数、1M 上下文),架构层引入 Delta Attention/压缩记忆,"记忆操作系统"路线
通义千问 / Qwen Chat
(阿里)
显式记忆 + 隐式记忆兼备:"记住 xx"最多约 50 条,可管理/忘掉一切;支持临时聊天、会话归档、定制 Qwen
千问 APP 用 Tablestore 构建"短期/长期记忆统一管理、毫秒级读写、数十亿条记忆"的记忆系统(2026 春节活动 9 小时破千万单);Qwen3.8-Max 支持 100 万 token 上下文 + 长序列滑动记忆缓存;2026-07-15 同样下线拟人化智能体
腾讯元宝
三级记忆体系;长期记忆需用户显式触发写入 Tencent-VectorDB
身份信息、行为偏好等跨会话关键事实走长期记忆;单对话控制在 20 万字内防止上下文超限
文小言
(百度)
主动记忆(需用户主动触发),2025-09 上线
记忆条目由用户声明
智谱清言
主动记忆(用户触发)
显式记忆路线
DeepSeek / 讯飞星火
2026-02 实测"不记得",无跨会话记忆
主要靠超长上下文,而非记忆系统
腾讯混元 Hy-Memory
记忆插件(面向 C 端 + OpenClaw/Hermes Agent/Opencode 插件)
主打"反直觉":减少约 70% 记忆量换取约 45% 信息密度提升

监管背景:2026-07-15《人工智能拟人化互动服务管理暂行办法》施行,豆包、通义千问同日下线用户自建拟人化智能体,数百万用户"电子宠物"式 AI 记忆面临迁移/清除——"长期记忆 + 角色设定 + 持续情感互动"被监管明确视为高风险能力(详见第七章)。

4.3 编码智能体的记忆功能(生产力场景)

  • Claude Code
    CLAUDE.md(用户手写约束)+ MEMORY.md(自动记忆)+ 子智能体级 memory 元数据(v2.1.33 起)+ 项目级/全局记忆;被 InfoQ 评价为从"单次协作助手"转向"持续参与项目的虚拟成员"。
  • Codex(OpenAI)
    有会话恢复/项目记忆;ChatGPT Mac 版 Computer History 把桌面活动记忆接入Codex;社区对比认为 Codex 记忆"工程化痕迹更强、偏事后挖掘",Claude Code"人工调校痕迹更多"。
  • 字节Trae
    2026 上半年完成记忆系统重大升级,与 Claude Code 并称"记忆工程最高水平"(腾讯云开发者社区评测)。
  • OpenClaw / Hermes Agent
    依赖记忆插件生态(claw-mem、Hy-Memory、cognee、GBrain 等);Hermes 内置记忆系统。
  • 第三方记忆 MCP 服务器
    claude-mem、mem-port、Memory OS、Basic Memory 等,通过 MCP 给任意 Agent 加持久记忆(见第五章 5.4)。

4.4 记忆框架/平台(与上一份报告衔接)

开发者选型可参考《AI 智能体记忆框架调研报告》:Mem0(通用记忆层,LoCoMo 92.5)、MemPalace(本地逐字存储)、Letta/MemGPT(分层自管理记忆)、Zep/Graphiti(时序知识图谱)、Cognee(图谱记忆 API)、Hindsight(retain/recall/reflect 记忆服务)、TencentDB Agent Memory(团队记忆中枢)、LangMem / LlamaIndex BaseMemory(框架内置)等。本报告不再展开,仅强调一点:平台内置记忆与框架记忆不是二选一——2026 年主流生产模式是"平台原生记忆 + 针对特定场景的专用记忆层"双轨并用。


五、技术实现机制

5.1 四种主流架构模式

模式
原理
优点
缺点
代表
滑窗 + 摘要
近期对话全文保留,更早的用 LLM 压缩成摘要
简单、便宜、稳定
丢失细节
大多数 Chat 产品、LangGraph checkpointer
向量检索
记忆存成 embedding,余弦相似度召回
快速、可扩展
扁平、无关系、无层级
Mem0、Hindsight、Basic Memory
知识图谱
实体/关系/时间属性建模
可表达关系与事实演化
维护复杂、扩展成本高
Zep/Graphiti、Cognee、RAGFlow GraphRAG
向量 + 图混合
向量管广度、图谱管深度
2026 年生产共识
运维负担增加
Mem0(Postgres 长期事实 + 情景摘要)、Cognee 1.0

5.2 记忆生命周期(Write → Manage → Read)

  1. 写入(Write)
    • 显式触发:用户"记住……"→ 内部工具写记忆表;
    • 隐式提取:后台把历史会话做聚类-摘要,产出高置信画像(如"用户编程经验丰富,置信度 0.92");
    • 编码 Agent 场景:从纠正、偏好声明、架构讨论中自动抽取。
  2. 存储(Store):记忆表/JSON(平台)、Markdown 文件(Claude Code/MemPalace/GBrain)、向量库(Mem0/Hindsight)、图数据库(Graphiti/Cognee)、表格型 KV(千问 Tablestore)、SQLite(Memory OS)。
  3. 检索/注入(Read)
    平台记忆通常把记忆块逐条写进 System Prompt(本质是"小抄式"纯文本拼接,靠模型取舍,非向量检索);专用框架则按相关性检索后注入,注入延迟约 100–500ms/查询。
  4. 更新/遗忘(Update/Forget)
    时间感知更新(Dreaming V3、Graphiti 事实有效期)、用户删除、过期清理。
  5. 审计(Audit)
    企业级要求记忆写入/读取留痕(Claude Memory Stores 提供版本历史与 API 审计)。

5.3 关键工程权衡

  • 记忆容量 vs 上下文成本:ChatGPT 记忆被第三方评估为"账号级、约 8000 token 摘要笔记上限、无项目概念"(MemoryLake 2026-05 观点),因此需要 Projects 做隔离;腾讯混元 Hy-Memory 主张"更少记忆量 + 更高密度"。
  • 检索质量 vs 延迟:LoCoMo 上每次检索约 6,956 token,远小于全量上下文 ~26,000 token,省的是推理账单;但检索不准会直接伤害体验。
  • 平台记忆 vs 框架记忆:平台记忆零集成成本、与宿主模型结合紧、UX 好;框架记忆跨平台可移植、Schema 可控、可私有化、可审计。

5.4 互操作性:MCP 记忆服务器与记忆可移植

  • MCP(Model Context Protocol)成为记忆接入标准:2026 年出现大量"记忆 MCP 服务器"(mem-port、Memory OS、claude-mem、Basic Memory、memxp-mcp 等),让 Claude、OpenAI、本地模型等任意 MCP 兼容 Agent 共享同一记忆后端,实现"跨工具记忆"。
  • 记忆可移植性成为产品功能:Gemini 支持从 ChatGPT/Claude 导入(ZIP ≤5GB)、Anthropic 支持导入;导出/删除符合 GDPR/CCPA 删除权要求。

六、记忆评测:基准与现状

6.1 主要基准

基准
定位
规模
备注
LoCoMo
长期对话记忆(事实回忆)
完整版 50 段对话 / 7,512 问;厂商常用子集约 10 段对话 / ~1,986 问
目前的主基准;单跳/多跳/时间推理/开放域
LongMemEval
(ICLR 2025,arXiv:2410.10813)
长期记忆五项能力:信息抽取、跨会话推理、时间推理、知识更新、拒答
各厂商竞相报分
BEAM
(arXiv:2510.27246)
"超越百万 token":检验大上下文下记忆系统是否仍有价值
128K / 500K / 1M / 10M token,2,000 问
讽刺的是:百万 token 上下文让"全量塞入"也能高分,倒逼记忆系统证明自己
AMB
(Agent Memory Benchmark)
Agent 场景:跨工具调用记忆、文档研究知识、偏好应用于多步决策
开发中
更贴近真实生产
WHISPERBENCH
记忆安全:隐形记忆注入全周期评测
108 用例
见第七章

6.2 公开成绩速览(厂商/论文自报,口径不一,仅供参考)

系统
成绩
Mem0(2026-04 新算法,托管版)
LoCoMo 92.5、LongMemEval 94.4、BEAM(1M) 64.1
Mem0(开源版,不同来源)
LoCoMo 91.6、LongMemEval 94.8
Hindsight
LongMemEval 91.4%(2026-01,当时公开最高)
MemPalace(Raw 模式)
LongMemEval 召回率 96.6%(本地逐字)
Memori
LoCoMo 94.03%(自报)
Letta / Zep
LoCoMo 约 74% / ~75%(自报)
Supermemory
LongMemEval 81.6%(GPT-4o)
平台级(估算)
ChatGPT ~75–85%、Claude Projects ~80–90%、Gemini/Copilot ~70–80%(Presenc AI 企业实测估算)

6.3 基准的局限

  • 测的是"对话回忆",不是"生产记忆":真实 Agent 需要跨工具调用、文档链、多步决策中的记忆,现有基准基本测不到;
  • "全量塞入"的作弊空间:百万 token 上下文让简单方案在 LoCoMo/LongMemEval 上也能高分,BEAM 的诞生正是为此;
  • LLM-as-judge 过松:评测者对"编造引用"过于宽容,会虚高分数;
  • 平台记忆很难被公平对比:闭源产品的记忆质量依赖内部实现,第三方只能黑盒估算。

七、风险、挑战与监管

7.1 安全:隐形记忆注入(MemGhost)——2026 年最值得警惕的新威胁

  • 研究:南洋理工大学 + 约翰霍普金斯大学(论文《When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents》)。
  • 攻击原理:持久化个人 Agent = 持久记忆(用户画像/偏好存成文件或向量库)+ 外部环境权限(邮箱/日历/文件)。攻击者只需发一封诱导邮件,Agent 读取后可能把虚假"事实"写入长期记忆;要求:①注入成功(写进持久存储)②足够隐蔽(回复不露馅)③后续生效(未来影响判断)。
  • MEMGHOST 框架:本地影子代理 + 评分奖励训练攻击模型,实现一次性黑盒攻击(只需知道邮箱地址,无需接触目标系统、无需知道其模型与配置)。
  • 端到端成功率:GPT-5.4 + OpenClaw 后台模式 87.5%、前台 75%;Claude Sonnet 4.6 后台 71.4%;跨框架泛化(NanoClaw、Hermes Agent 后台 ~80%);换 Mem0 向量库后端仍有 85.7%。
  • 现有防御几乎失效:输入检测 DataSentinel 漏报 91.59%;AgentDoG 行为审计在 OpenClaw 上漏报 93.46%;Meta-SecAlign 挡不住近一半注入。
  • 结论:持久记忆把"外部不可信内容"内化成"自身可信状态",是架构级的信任边界问题。防御需要来源标记、敏感记忆写入需用户确认、外部信息与核心状态隔离、完整审计日志。

7.2 正确性:陈旧记忆、记忆幻觉与验证难题

  • 陈旧记忆:事实随时间变化(换工作、搬家、项目变更),平台记忆若不做时间感知更新就会越用越错——这是OpenAI Dreaming V3 与 Graphiti 时序演化的直接动机。
  • 记忆污染:一次被写入的幻觉会永久污染后续所有检索,"记忆验证(检测并移除虚假记忆)"仍是开放研究问题。
  • 数据来源可信度:Agent 从邮件/网页/文档中提取记忆时,来源不可信 → 记忆不可信。

7.3 隐私与合规

  • 国际:GDPR/CCPA的删除权要求记忆可删、可导出;企业采购已把"每用户、每组织、可删除、可导出"的记忆治理作为准入标准;记忆可能间接编码受保护属性,存在推断敏感信息风险。
  • 中国:《人工智能拟人化互动服务管理暂行办法》(2026-04-10 公布,2026-07-15 施行):
    • 适用于"模拟自然人…持续性的情感互动服务"(拟人化互动服务);
    • 服务提供者不得向第三方提供用户交互数据(法律另有规定或权利人明确同意除外);
    • 须向用户提供交互数据复制、删除选项(聊天记录等历史交互数据);
    • 用户敏感个人信息的交互数据不得用于模型训练(另有规定或单独同意除外);
    • 需加强安全监测和风险评估、处置安全事件、依法留存网络日志。
  • 行业事件:2026-07-15 豆包、通义千问同日下线用户自建拟人化智能体;官方提供三个月数据迁移缓冲(导出对话/转移至猫箱 App),下线后历史对话数据彻底清除——记忆数据的所有权与可迁移性成为真实的产品问题。

7.4 工程挑战(开放问题)

  1. 评测缺口:现有基准覆盖不了真实生产的记忆需求;
  2. 巩固(Consolidation):100K+ 记忆规模下如何压缩而不丢细节;
  3. 结果学习:大多数记忆只存"发生了什么",不学"是否有效"——基于结果的加权检索几乎未落地;
  4. 图谱可扩展性:混合向量+图增加运维负担;
  5. 信任与验证:记忆幻觉的检测与移除;
  6. 成本与延迟:记忆注入延迟 100–500ms、检索 token 成本、大上下文下的算力开销(OpenAI 把免费版记忆算力压到 1/5 正说明成本是真实瓶颈);
  7. 灾难性遗忘与选择性遗忘:如何"学会忘"(learned forgetting)仍是开放问题。

八、趋势与展望

  1. 记忆即基础设施:从"可选插件"到"必有组件",Agent 框架(LangGraph、CrewAI、OpenClaw、Hermes)都在内置记忆,OpenClaw 生态直接催生 claw-mem、GBrain 等新物种。
  2. 从"向量检索"到"记忆原生 API + 多模态存储":Cognee 1.0 的 remember/recall/forget、Hindsight 的 retain/recall/reflect,把记忆做成语义操作而非数据库操作。
  3. 从"偏好记忆"到"结构化知识记忆":平台记忆只记偏好,下一波竞争点是让记忆能整合模式、表达层级关系、从结果中学习——这是专用框架与 MCP 层的长期机会。
  4. 记忆可移植性战争:导入/导出/跨平台迁移成为新功能维度;"换助手就要重新认识你"的锁定效应正在被监管与竞品共同打破。
  5. 记忆 + 技能(程序记忆)融合:把"一次成功"固化为可复用技能(Anthropic Agent Skills、Voyager 技能库、ExpeL 经验记忆),记忆成为自进化智能体的核心载体。
  6. 本地优先/逐字存储反叛:MemPalace"零 LLM 写入、逐字存储"、GBrain"Markdown 即真相",回应摘要式记忆的失真与成本问题。
  7. 安全与合规成为一等公民:记忆注入攻击、拟人化监管、删除权/可迁移权,将倒逼"来源标记 + 审计 + 用户确认"成为记忆系统的标配。
  8. 架构层记忆:Kimi K3 的压缩记忆/Delta Attention、模型上下文缓存等,正把"记忆"从外部插件下沉到模型架构本身——长期看 token 级外部记忆与参数级记忆会走向协同。

九、总结

给个人用户

  • 主动经营记忆:把姓名、职业、偏好、禁忌一次性告诉 AI,并在关键节点说"记住……";
  • 定期查看记忆摘要页(ChatGPT/Gemini),删除过时或敏感条目;
  • 敏感话题用临时聊天/隐身模式,避免进入记忆;
  • 记忆条数有上限(如豆包约 20 条、Qwen约50条),重要信息要外部备份;
  • 重视"记忆迁移":换平台时优先选支持导入/导出的产品。

给产品/Agent 团队

  • 先明确记忆作用域(个人/项目/团队/组织),做好隔离,避免跨项目串味;
  • 显式 + 隐式双轨:显式保准确,隐式保覆盖,但隐式一定要"可管理"(摘要页/逐条删除/总开关);
  • 重视时间感知更新遗忘机制,防止记忆陈旧化;
  • 记忆写入必须审计 + 来源标记,外部内容不得直接写入核心记忆(防 MemGhost 式注入);
  • 接入记忆框架时优先混合检索(向量 + 图),并关注 LoCoMo/LongMemEval/BEAM 之外的 Agent 场景评测;
  • 平台记忆 + 专用记忆层双轨并用,把"记忆"做成可移植、可导出、可删除的资产。

给企业

  • 采购标准:每用户/每租户隔离、可删除可导出、审计日志、本地化部署选项;
  • 合规:满足 GDPR/CCPA 删除权与《人工智能拟人化互动服务管理暂行办法》的交互数据复制/删除、不得向第三方提供、敏感个人信息不用于训练等要求;
  • 优先选择文件系统式/可治理的记忆方案(Claude Memory Stores、Memori、自托管 Mem0/Cognee/TencentDB),避免黑盒记忆存储。

参考资料

  • OpenAI:为 ChatGPT 记忆打造更强基础(Dreaming V3 官方博客,中文)[1]
  • IT之家:OpenAI 升级 ChatGPT 记忆系统,算力降至 1/5(2026-06-05)[2]
  • DoNews:Mac 版 ChatGPT 新增 Computer History(2026-08-14)[3]
  • Claude:Memory for Claude Managed Agents 官方博客(2026-04-22)[4]
  • Claude Platform 文档:Using agent memory[5]
  • InfoQ:Claude Code 上线自动记忆功能(2026-02-26)[6]
  • Google:Use past chats to get more personalized responses[7]
  • Mashable:Google 移除更换 AI 助手最大障碍(记忆导入,2026-03)[8]
  • Android Authority:Gemini Live memory upgrade(2026-06)[9]
  • Microsoft Learn:Memory(preview)— Copilot Studio[10]
  • AI 星球:Qwen、Kimi、豆包都上线了记忆功能(2026-02-04)[11]
  • 阿里云开发者:揭秘千问 APP 千万级 AI 订单背后的记忆存储实践(Tablestore,2026-04)[12]
  • 极客公园:腾讯混元 Hy-Memory:Agent 记忆越少反而越聪明(2026-06)[13]
  • Mnemoverse:AI Agent Memory: The 2026 Landscape(2026-04)[14]
  • Presenc AI:AI Memory Architectures Compared 2026(2026-05)[15]
  • 安全内参:AI 私人助手会被偷偷篡改记忆——隐形内存注入攻击(WHISPERBENCH/MEMGHOST,2026-07)[16]
  • The Hacker News:MemGhost Attack Plants Persistent False Memories in AI Agents(2026-07)[17]
  • 中国政府网:《人工智能拟人化互动服务管理暂行办法》(2026 年第 17 号国务院公报)[18]
  • Mem0:State of AI Agent Memory 2026(评测报告)[19]
  • Hugging Face:Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers(arXiv:2603.07670)[20]
  • 综述《Memory in the Age of AI Agents》(arXiv:2512.13564);LongMemEval(arXiv:2410.10813);BEAM(arXiv:2510.27246)
  • 工作区关联报告:《AI 智能体记忆框架调研报告》《自进化智能体(Self-Evolving Agents)深度调研报告》

报告部分由AI整理,数据截至 2026-08-14;产品功能与评测数据变动频繁,请以官方为准。

引用链接

[1]OpenAI:为 ChatGPT 记忆打造更强基础(Dreaming V3 官方博客,中文): https://openai.com/zh-Hans-CN/index/chatgpt-memory-dreaming/

[2]IT之家:OpenAI 升级 ChatGPT 记忆系统,算力降至 1/5(2026-06-05): https://www.ithome.com/0/960/187.htm

[3]DoNews:Mac 版 ChatGPT 新增 Computer History(2026-08-14): https://www.donews.com/news/detail/1/6670822.html

[4]Claude:Memory for Claude Managed Agents 官方博客(2026-04-22): https://claude.com/blog/claude-managed-agents-memory

[5]Claude Platform 文档:Using agent memory: https://platform.claude.com/docs/en/managed-agents/memory

[6]InfoQ:Claude Code 上线自动记忆功能(2026-02-26): https://www.infoq.cn/article/QTPQmPZ1DsSBjTTymgK3

[7]Google:Use past chats to get more personalized responses: https://blog.google/intl/en-ca/feed/use-past-chats-to-get-more-personalized-responses/

[8]Mashable:Google 移除更换 AI 助手最大障碍(记忆导入,2026-03): https://in.mashable.com/tech/107682/google-removes-the-biggest-problem-of-switching-ai-assistants-heres-how

[9]Android Authority:Gemini Live memory upgrade(2026-06): https://www.androidauthority.com/gemini-live-memory-personal-intelligence-3679235/

[10]Microsoft Learn:Memory(preview)— Copilot Studio: https://learn.microsoft.com/en-my/microsoft-copilot-studio/agents-experience/memory-overview

[11]AI 星球:Qwen、Kimi、豆包都上线了记忆功能(2026-02-04): https://www.aixq.cc/3721.html

[12]阿里云开发者:揭秘千问 APP 千万级 AI 订单背后的记忆存储实践(Tablestore,2026-04): https://developer.aliyun.com/article/1731409

[13]极客公园:腾讯混元 Hy-Memory:Agent 记忆越少反而越聪明(2026-06): https://www.geekpark.net/news/365698

[14]Mnemoverse:AI Agent Memory: The 2026 Landscape(2026-04): https://mnemoverse.com/docs/research/ai-memory-landscape-2026

[15]Presenc AI:AI Memory Architectures Compared 2026(2026-05): https://presenc.ai/research/ai-memory-architecture-comparison-2026

[16]安全内参:AI 私人助手会被偷偷篡改记忆——隐形内存注入攻击(WHISPERBENCH/MEMGHOST,2026-07): https://www.secrss.com/articles/92116

[17]The Hacker News:MemGhost Attack Plants Persistent False Memories in AI Agents(2026-07): https://thehackernews.com/2026/07/new-memghost-attack-plants-persistent.html

[18]中国政府网:《人工智能拟人化互动服务管理暂行办法》(2026 年第 17 号国务院公报): https://www.gov.cn/gongbao/2026/issue_12806/202606/content_7072472.html

[19]Mem0:State of AI Agent Memory 2026(评测报告): https://mem0.ai/blog/state-of-ai-agent-memory-2026

[20]Hugging Face:Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers(arXiv:2603.07670): https://huggingface.co/papers/2603.07670