Back

大模型记忆算法深度综述:从KV Cache到持久化记忆,AI如何从"过目即忘"到"长期进化"

当 AI 连你上周说过的话都记不住时,再强的推理能力也只是一次性的聪明。记忆,正在成为大模型架构设计的第一性维度。

引言

2026年8月,清华大学联合新加坡国立大学、博世人工智能研究院发布综述论文《Memory for Large Language Models》,首次从模型底层架构与计算机制的视角,对大语言模型中的记忆系统进行了系统性梳理。论文提出了一个核心判断:

记忆正在从计算的副产品,跃升为大模型架构设计的第一性维度

这个判断背后是一个根本性矛盾:模型的上下文窗口在不断扩大(从 4K 到 1M 甚至 10M tokens),但长上下文的物理成本也在急剧膨胀——Llama 3.1 70B 每 token 消耗 328KB KV Cache,128K 上下文需要 40GB 显存,1M 上下文需要 328GB,超过 4 张 H100 的显存总量。同时,上下文窗口再大也无法解决跨会话记忆问题——会话结束,一切归零。

本文系统梳理大模型记忆技术的完整图景:从模型内部的 KV Cache、循环状态、测试时训练,到外部的 RAG、Agent 记忆系统、知识图谱记忆,以及商业落地中的架构选择。

一、记忆的三维分类框架

清华/NUS 综述提出,所有记忆机制都可以沿三个正交维度分类:

维度 类型 含义 代表技术
表示形式 隐式(Implicit) 与前向计算深度绑定,无独立读写接口 KV Cache、RNN 隐状态
显式(Explicit) 独立存储组件,有明确读写语义 向量库、可更新参数、哈希查找表
更新机制 离线(Offline) 仅在训练阶段通过梯度更新 预训练参数、传统 MoE
在线(Online) 推理时动态更新,无需重新微调 Titans 惊奇更新、TTT、Agent 记忆
持久性 短期(Short-Term) 随会话结束而消散 Attention、上下文窗口
长期(Long-Term) 跨会话持久存在 外置数据库、持久化参数

记忆的演进方向清晰可见:从隐式到显式、从离线到在线、从短期到长期。

二、隐式记忆:模型内部的记忆机制

2.1 Attention + KV Cache:最基础的工作记忆

Transformer 的自注意力机制是最基本的内容寻址记忆。每个 token 在推理时生成 Key 和 Value 向量,后续 token 通过 Query 与所有历史 Key 计算注意力权重,加权求和 Value 得到上下文表示。

核心瓶颈

  • 计算复杂度 O(n²):序列长度翻倍,计算量翻四倍
  • 显存占用 O(n):KV Cache 随序列长度线性增长
  • Llama 3.1 70B 每 token 消耗 328KB KV Cache,1M token 需 328GB 显存

主要优化技术

技术 原理 效果
稀疏注意力 只计算重要 token 对,跳过无关计算 复杂度降至 O(n√n) 或 O(n)
StreamingLLM 保留 Attention Sink(开头 token)+ 滑动窗口 支持无限长度流,显存恒定
RadixAttention(vLLM) 自动识别共享前缀,跨请求复用 KV Cache 前缀缓存命中率可达 90%+
KV Cache 卸载 不活跃 KV 移到 CPU 内存/SSD 显存需求降低 5-10 倍
量化 KV Cache INT8/INT4 压缩 Key 和 Value 显存减半至四分之三,精度损失 < 1%

2.2 循环序列模型:线性复杂度的记忆

将历史信息压缩为固定大小的隐状态,将复杂度从 O(n²) 降到 O(n):

Mamba / Mamba-2

  • 选择性状态空间模型(SSM),根据输入动态调整信息保留和遗忘
  • 硬件感知的并行扫描算法,训练时可并行,推理时循环展开
  • Mamba-2 进一步与注意力机制统一,提升多跳推理能力

RWKV-7(2025):

  • 线性注意力 + 状态追踪机制
  • 性能首次在多个 benchmark 上接近同规模 Transformer
  • 完全没有注意力,纯 RNN 架构,推理成本恒定

Gated DeltaNet

  • 将线性注意力中的简单标量衰减升级为通道级动态状态编辑
  • 不同特征通道可以有不同的遗忘速率和更新强度
  • Kimi Delta Attention 在此基础上进一步优化

瓶颈:隐状态容量受隐藏层维度硬性限制(通常数万维),无法独立寻址和编辑特定记忆,适合压缩通用语义但不适合精确事实存储。

2.3 测试时训练(TTT):推理时更新参数

这是 2024-2025 年最有突破性的记忆范式——不再把记忆存在 KV Cache 里,而是直接在推理过程中更新模型参数。

Titans(Google, 2024.12):

Titans 提出了三层神经记忆架构:

  • 短期记忆:标准 Attention,处理局部上下文
  • 长期记忆:一个独立的神经网络,在测试时以梯度下降方式在线更新
  • 持久记忆:冻结的模型参数,存储通用知识

核心创新是惊奇驱动更新(surprise-driven update):模型遇到意外信息(预测误差大)时,才更新长期记忆权重。这模拟了人类记忆的机制——意外事件更容易被记住。Titans 在 3M+ token 序列上表现稳定,且显存不随序列长度线性增长。

TTT(Test-Time Training)(Stanford, 2024):

  • 将 KV Cache 替换为一个小型神经网络(如 4 层 MLP)
  • 推理时,对这个小网络做单步梯度下降来"记住"新信息
  • 处理下一个 token 时,用更新后的网络参数进行前向计算
  • TTT-E2E(2025)实现端到端训练,不再需要两阶段训练

优势:记忆容量远大于 KV Cache(参数空间比 KV 矩阵更紧凑),且可以学习到信息的抽象表示而非原始存储。

挑战:在线梯度更新的计算开销、训练稳定性、以及如何避免灾难性遗忘——这些问题仍在研究中。

2.4 MoE 条件参数激活

混合专家模型可以视为一种隐式长期记忆:不同专家参数"记住"了不同领域的知识,路由网络根据输入按需激活。DeepSeek V4 Pro 的 MoE 架构中,每次推理只激活 21B 参数(总参数 295B),其余参数作为"冷记忆"存在。

三、显式记忆:独立寻址的"外脑"

3.1 RAG:检索增强生成

RAG 是目前最成熟的外部记忆方案:将知识编码为向量存入数据库,查询时检索最相关的文档片段注入上下文。

2026 年的演进方向

从"检索 Top-5 塞给模型"进化为**Hybrid Context(混合上下文)**架构:

用户查询
  → 向量检索 + 关键词检索,宽召回 Top-100(约 50K-100K tokens)
  → Rerank 模型精排,Top-10 放在 Prompt 首尾(利用注意力偏差)
  → 长上下文模型一次性深度推理

相比纯 RAG:召回率大幅提升,不会因漏掉某一段而答错。 相比纯长上下文:成本和延迟降低 90%,噪音更少。

RAG vs 长上下文的成本对比(2026年实测数据):

方案 每次查询成本 延迟 准确率
纯 RAG(GPT-4o, Top-5) $0.012 2s 49.0%
纯长上下文(GPT-4o, 128K) $0.60 60s+ 56.3%
DeepSeek 缓存长上下文 $0.025 5s ~55%
Hybrid Context ~$0.05 5-10s ~54%

长上下文准确率更高,但成本是 RAG 的 50 倍;DeepSeek 的缓存价格让长上下文变得异常便宜。

3.2 HippoRAG:海马体启发的知识图谱记忆

俄亥俄州立大学 2024 年提出,受人类海马体记忆索引机制启发:

  • 将文档中的实体和关系抽取为知识图谱
  • 检索时用个性化 PageRank 算法在图谱上做多跳推理
  • 模拟人脑"从一个概念联想到相关概念"的检索过程
  • 在多跳问答 benchmark 上显著优于传统向量 RAG

3.3 Engram:基于哈希查找的显式存储

  • 不依赖注意力机制,直接通过可扩展哈希表进行 key-value 查找
  • 读写复杂度 O(1),可扩展到数十亿条记忆
  • 类似传统数据库的索引查找,但与模型推理深度集成
  • 代表了"记忆即数据库"的极端方向

3.4 外置记忆:商用唯一可行架构

阿里云开发者社区的分析给出了明确结论:在多租户商业架构下,记忆只能外置,不能写进模型权重。三个硬约束:

  1. 租户隔离:百万用户共用一个模型,记忆写进权重会导致信息串扰
  2. 成本差距:10 万用户的专属 LoRA 年维护成本约 184 万美元,同等规模向量库仅 2170 美元——差 6-7 个数量级
  3. 合规要求:GDPR 和个人信息保护法要求数据可删除,写入权重的信息无法精确擦除

仿生类比:

模型静态权重 = 大脑皮层(通用知识,长期固化)
外置向量库   = 海马体(个人情景记忆,可编辑可删除)
上下文窗口   = 工作记忆(容量有限,用完即止)

这不是技术妥协,而是最接近人脑认知机制的设计。

四、Agent 记忆系统:十大方案全景

Agent 记忆是 2025-2026 年最活跃的工程领域。与 RAG 面向静态知识库不同,Agent 记忆聚焦交互过程中的动态信息积累——用户偏好、任务状态、经验教训。

4.1 十大方案对比

方案 核心机制 创新点 开源
Mem0 事实抽取 + 向量检索 + 重要性评分 性能最优,LoCoMo 92.5分 GitHub
MemGPT / Letta OS 式分层存储 + 中断管理 虚拟上下文管理,主存/外存分页 GitHub
A-MEM Zettelkasten 卡片盒 + 动态链接 记忆间自动关联,网状知识网络 GitHub
Zep 时序知识图谱(Graphiti 引擎) 自动实体抽取,时间维度推理 GitHub
MemoryBank 艾宾浩斯遗忘曲线 时间衰减 + 重要性强化,类人脑遗忘 GitHub
HippoRAG 知识图谱 + PageRank 海马体启发,多跳联想检索 GitHub
MemTree 树形层次结构 从粗到细的记忆组织和检索 -
MemoryOS / MemOS 操作系统式记忆调度 分层缓存、替换策略、记忆调度 -
MemoChat 对话导向记忆 针对多轮对话场景优化 -
LangMem LangChain 官方记忆模块 与 LangChain 生态深度集成 GitHub

4.2 重点方案详解

Mem0:当前性能最强的开源记忆系统

Mem0 的论文发表于 ECAI 2025,在三大基准上取得了最优成绩:

  • LoCoMo:92.5 分(满分 100)
  • LongMemEval:94.4 分
  • 每次查询仅消耗约 6,900 tokens(Full Context 方案的约 1/20)
  • 时间推理能力提升 +29.6 分,多跳推理提升 +23.1 分

工作流程:

  1. 从对话中自动抽取结构化事实("用户喜欢深色模式"、"项目用 pnpm")
  2. 为每条事实生成 embedding 并存入向量库
  3. 新对话时检索相关事实注入上下文
  4. 支持记忆的更新、删除和冲突消解

截至 2026 年 7 月,已集成 21 个 Agent 框架和 20 个向量数据库。

MemGPT / Letta:操作系统式记忆管理

灵感来自传统操作系统的虚拟内存分层:

  • 主存:上下文窗口(容量小但访问快)
  • 外存:外部数据库(容量大但需要显式加载)
  • 中断机制:模型可以主动触发"换页"——将不重要的记忆换出到外存,或将相关记忆换入上下文
  • 模型通过函数调用自主管理记忆,而非依赖外部规则

Letta(MemGPT 的商业化公司)进一步发展了 Agent 状态管理和持久化会话能力。

A-MEM:卡片盒笔记法的 AI 实现

基于德国社会学家 Niklas Luhmann 的 Zettelkasten(卡片盒笔记法):

  • 每条新记忆自动生成结构化笔记:上下文描述、关键词、标签
  • 链接生成:检索最相关的历史记忆,由 LLM 判断并建立关联链接
  • 单条记忆可归属多个关联组,打破单一分类限制
  • 记忆网络随交互不断演化,形成自组织的知识图谱

与 Mem0 的扁平事实存储不同,A-MEM 强调记忆之间的关联和演化

MemoryBank:会遗忘的记忆

受艾宾浩斯遗忘曲线启发:

  • 每条记忆有一个记忆强度值
  • 随时间流逝,强度自然衰减
  • 被检索和使用时,强度增强(类似"复习")
  • 低于阈值的记忆被"遗忘"(归档或删除)
  • 重要记忆通过反复强化进入长期记忆

这是最接近人类记忆机制的设计——不是所有信息都值得永久记住。

4.3 三大评测基准

基准 评测重点 特点
LoCoMo 长对话记忆 10 种记忆类型,跨多会话,首个可复现的记忆基准
LongMemEval 长期记忆召回 事实召回 + 多跳推理 + 时序推理
BEAM 综合记忆能力 2026 年新基准,覆盖更多维度

4.4 尚未解决的三大难题

Mem0 2026 年度报告指出了三个最棘手的开放问题:

  1. 跨会话身份一致性:用户在不同会话中表达了矛盾的偏好("我喜欢素食"vs"帮我订牛排"),系统该信哪个?
  2. 大规模时序抽象:如何从成千上万条时间戳记忆中抽象出趋势("用户最近三个月越来越关注成本优化")?
  3. 记忆陈旧检测:用户换了工作、搬了城市、改了技术栈,旧记忆如何自动检测并更新?

五、商业产品落地

5.1 ChatGPT 持久记忆

  • 2024 年初推出,2025-2026 年持续迭代
  • 自动从对话中提取用户偏好和事实,跨会话保留
  • 用户可查看、编辑、删除单条记忆
  • 2026 年研究揭示了一个关键问题:即使记忆正确注入上下文,模型仍可能"记住了但不行动"(knowledge utilization problem)

5.2 Claude 记忆功能

  • Anthropic 于 2025 年推出跨会话记忆
  • Workspace 级隔离,企业管理员可统一配置记忆策略
  • 与 Prompt Caching 协同:记忆内容作为稳定前缀,同时享受缓存折扣

5.3 红熊 AI MemoryBear:记忆原生路线

2026 年 8 月,红熊 AI 发布了国内最激进的"记忆原生"方案:

  • 三级记忆体系:工作记忆 → 短期记忆 → 长期记忆
  • 从海量对话中萃取有价值的情境记忆,通过知识图谱建立网状关联
  • 混合搜索实现毫秒级匹配
  • 内置遗忘机制和反思能力:自动剔除错误和冗余信息,不是越记越多,而是越记越准
  • 关键差异:记忆不是外挂模块,而是从预训练阶段深度植入自研模型底座
  • 同步发布 OpenBear(记忆型通用大模型)和 CodeBear(记忆型编程大模型),后者能记住开发者个人风格和团队规范

5.4 外置记忆的仿生架构

工业界正在收敛到一个共识架构:

┌─────────────────────────────────────┐
│           用户交互层                  │
├─────────────────────────────────────┤
│     上下文窗口(工作记忆,有限容量)    │
├──────────┬──────────┬───────────────┤
│ 语义缓存  │ Agent记忆│  RAG 知识库    │
│ (秒级)   │ (跨会话)  │  (外部知识)    │
├──────────┴──────────┴───────────────┤
│        向量库 / 知识图谱 / 数据库      │
├─────────────────────────────────────┤
│        大模型权重(大脑皮层,冻结)     │
└─────────────────────────────────────┘

六、RAG、长上下文与记忆系统的关系

三者经常被混为一谈,但定位完全不同:

RAG 长上下文 记忆系统
目标 外部知识检索 单次处理更多信息 跨会话积累和演化
数据来源 静态文档库 动态输入 交互中沉淀的个人化信息
更新方式 重建索引 无需更新 持续增删改
遗忘能力 不支持 不支持 核心能力
个性化 核心价值
典型成本/次 $0.01-0.05 $0.10-0.60 $0.01-0.03
类比 图书馆查阅 一目十行 人的长期记忆

2026 年工业级共识:三者融合而非替代。

RAG 宽召回从百万文档中筛出 Top-100,长上下文做精读推理,记忆系统管理跨会话的个性化信息和经验积累。三者各司其职,构成完整的 AI 认知架构。

七、未来趋势

7.1 记忆成为第一架构公民

从 KV Cache(隐式、瞬态、计算副产品)到独立记忆模块(显式、持久、可在线更新),这是架构层面的范式转移。清华/NUS 综述认为,未来的大模型架构将把记忆作为与注意力、前馈网络并列的核心组件来设计,而非事后补丁。

7.2 遗忘比记忆更重要

MemoryBank 的遗忘曲线、A-MEM 的链接重构、MemoryBear 的反思能力,都指向同一个方向:智能的核心不是存储一切,而是知道什么该记住、什么该遗忘、什么该更新。 人类大脑约 860 亿神经元,每秒都在修剪突触;AI 记忆系统也需要类似的"神经可塑性"。

7.3 在线参数更新的潜力

Titans 和 TTT 代表的"推理时更新参数"路线如果工程成熟,可能颠覆当前"外置向量库"的主流方案。但目前仍面临在线梯度计算开销、训练稳定性和灾难性遗忘等挑战,距离商用还有距离。

7.4 知识利用率是下一个瓶颈

2026 年的多项研究发现了一个反直觉的问题:即使记忆被正确检索并注入上下文,模型也不一定会使用它。这被称为 "knowledge utilization problem"——模型可能"看到"了用户之前说过的话,但在生成回答时忽略了它。这不是记忆的存储问题,而是推理时的注意力分配问题,将成为下一阶段的研究重点。

7.5 记忆即商业壁垒

在模型能力趋同、API 价格趋零的趋势下,用户与产品的交互历史和个性化记忆是不可替代的资产。模型可以换、接口可以迁移,但"这个 AI 跟我聊了一年,知道我的所有偏好和上下文"——这是真正的迁移成本和竞争壁垒。


参考链接

  1. Memory for Large Language Models(清华/NUS/博世综述, 2026.08) https://arxiv.org/pdf/2607.25380

  2. State of AI Agent Memory 2026(Mem0 年度报告) https://mem0.ai/blog/state-of-ai-agent-memory-2026

  3. Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory(ECAI 2025 论文) https://arxiv.org/abs/2504.19413 GitHub: https://github.com/mem0ai/mem0

  4. MemGPT: Towards LLMs as Operating Systems(2023) https://arxiv.org/abs/2310.08560 GitHub: https://github.com/letta-ai/letta

  5. A-MEM: Agentic Memory for LLM Agents(Zettelkasten 卡片盒记忆) https://arxiv.org/abs/2502.12110 GitHub: https://github.com/WujiangXu/AgenticMemory

  6. MemoryBank: Enhancing Chatbots with Long-Term Memory(艾宾浩斯遗忘曲线) https://arxiv.org/abs/2305.10250 GitHub: https://github.com/zhongwanjun/MemoryBank-SiliconFriend

  7. HippoRAG: Neurobiologically Inspired Long-Term Memory for LLMs https://github.com/OSU-NLP-Group/HippoRAG

  8. Titans: Learning to Memorize at Test Time(Google, 2024.12) https://arxiv.org/abs/2501.00663

  9. Learning to (Learn at Test Time): RNNs with Expressive Memories(TTT, Stanford) https://arxiv.org/abs/2407.04620

  10. Mamba: Linear-Time Sequence Modeling with Selective State Spaces https://arxiv.org/abs/2312.00752

  11. 红熊 AI MemoryBear 发布(2026.08) http://cn.chinadaily.com.cn/a/202608/03/WS6a70646aa310d709c2fc1379.html

  12. 为什么大模型不设计成带有记忆的?详解外置记忆最优架构方案(阿里云开发者社区) https://developer.aliyun.com/article/1757757

  13. RAG 和长上下文,正在联手骗你(腾讯云开发者社区) https://cloud.tencent.com/developer/article/2697482

  14. AI Agent Memory 全解析|原理、主流方案、框架拆解与性能实测(火山引擎 ADG 社区) https://adg.csdn.net/6a645186662f9a54cb941b34.html

评论