当 AI 连你上周说过的话都记不住时,再强的推理能力也只是一次性的聪明。记忆,正在成为大模型架构设计的第一性维度。
引言
2026年8月,清华大学联合新加坡国立大学、博世人工智能研究院发布综述论文《Memory for Large Language Models》,首次从模型底层架构与计算机制的视角,对大语言模型中的记忆系统进行了系统性梳理。论文提出了一个核心判断:
记忆正在从计算的副产品,跃升为大模型架构设计的第一性维度。
这个判断背后是一个根本性矛盾:模型的上下文窗口在不断扩大(从 4K 到 1M 甚至 10M tokens),但长上下文的物理成本也在急剧膨胀——Llama 3.1 70B 每 token 消耗 328KB KV Cache,128K 上下文需要 40GB 显存,1M 上下文需要 328GB,超过 4 张 H100 的显存总量。同时,上下文窗口再大也无法解决跨会话记忆问题——会话结束,一切归零。
本文系统梳理大模型记忆技术的完整图景:从模型内部的 KV Cache、循环状态、测试时训练,到外部的 RAG、Agent 记忆系统、知识图谱记忆,以及商业落地中的架构选择。
一、记忆的三维分类框架
清华/NUS 综述提出,所有记忆机制都可以沿三个正交维度分类:
| 维度 | 类型 | 含义 | 代表技术 |
|---|---|---|---|
| 表示形式 | 隐式(Implicit) | 与前向计算深度绑定,无独立读写接口 | KV Cache、RNN 隐状态 |
| 显式(Explicit) | 独立存储组件,有明确读写语义 | 向量库、可更新参数、哈希查找表 | |
| 更新机制 | 离线(Offline) | 仅在训练阶段通过梯度更新 | 预训练参数、传统 MoE |
| 在线(Online) | 推理时动态更新,无需重新微调 | Titans 惊奇更新、TTT、Agent 记忆 | |
| 持久性 | 短期(Short-Term) | 随会话结束而消散 | Attention、上下文窗口 |
| 长期(Long-Term) | 跨会话持久存在 | 外置数据库、持久化参数 |
记忆的演进方向清晰可见:从隐式到显式、从离线到在线、从短期到长期。
二、隐式记忆:模型内部的记忆机制
2.1 Attention + KV Cache:最基础的工作记忆
Transformer 的自注意力机制是最基本的内容寻址记忆。每个 token 在推理时生成 Key 和 Value 向量,后续 token 通过 Query 与所有历史 Key 计算注意力权重,加权求和 Value 得到上下文表示。
核心瓶颈:
- 计算复杂度 O(n²):序列长度翻倍,计算量翻四倍
- 显存占用 O(n):KV Cache 随序列长度线性增长
- Llama 3.1 70B 每 token 消耗 328KB KV Cache,1M token 需 328GB 显存
主要优化技术:
| 技术 | 原理 | 效果 |
|---|---|---|
| 稀疏注意力 | 只计算重要 token 对,跳过无关计算 | 复杂度降至 O(n√n) 或 O(n) |
| StreamingLLM | 保留 Attention Sink(开头 token)+ 滑动窗口 | 支持无限长度流,显存恒定 |
| RadixAttention(vLLM) | 自动识别共享前缀,跨请求复用 KV Cache | 前缀缓存命中率可达 90%+ |
| KV Cache 卸载 | 不活跃 KV 移到 CPU 内存/SSD | 显存需求降低 5-10 倍 |
| 量化 KV Cache | INT8/INT4 压缩 Key 和 Value | 显存减半至四分之三,精度损失 < 1% |
2.2 循环序列模型:线性复杂度的记忆
将历史信息压缩为固定大小的隐状态,将复杂度从 O(n²) 降到 O(n):
Mamba / Mamba-2:
- 选择性状态空间模型(SSM),根据输入动态调整信息保留和遗忘
- 硬件感知的并行扫描算法,训练时可并行,推理时循环展开
- Mamba-2 进一步与注意力机制统一,提升多跳推理能力
RWKV-7(2025):
- 线性注意力 + 状态追踪机制
- 性能首次在多个 benchmark 上接近同规模 Transformer
- 完全没有注意力,纯 RNN 架构,推理成本恒定
Gated DeltaNet:
- 将线性注意力中的简单标量衰减升级为通道级动态状态编辑
- 不同特征通道可以有不同的遗忘速率和更新强度
- Kimi Delta Attention 在此基础上进一步优化
瓶颈:隐状态容量受隐藏层维度硬性限制(通常数万维),无法独立寻址和编辑特定记忆,适合压缩通用语义但不适合精确事实存储。
2.3 测试时训练(TTT):推理时更新参数
这是 2024-2025 年最有突破性的记忆范式——不再把记忆存在 KV Cache 里,而是直接在推理过程中更新模型参数。
Titans(Google, 2024.12):
Titans 提出了三层神经记忆架构:
- 短期记忆:标准 Attention,处理局部上下文
- 长期记忆:一个独立的神经网络,在测试时以梯度下降方式在线更新
- 持久记忆:冻结的模型参数,存储通用知识
核心创新是惊奇驱动更新(surprise-driven update):模型遇到意外信息(预测误差大)时,才更新长期记忆权重。这模拟了人类记忆的机制——意外事件更容易被记住。Titans 在 3M+ token 序列上表现稳定,且显存不随序列长度线性增长。
TTT(Test-Time Training)(Stanford, 2024):
- 将 KV Cache 替换为一个小型神经网络(如 4 层 MLP)
- 推理时,对这个小网络做单步梯度下降来"记住"新信息
- 处理下一个 token 时,用更新后的网络参数进行前向计算
- TTT-E2E(2025)实现端到端训练,不再需要两阶段训练
优势:记忆容量远大于 KV Cache(参数空间比 KV 矩阵更紧凑),且可以学习到信息的抽象表示而非原始存储。
挑战:在线梯度更新的计算开销、训练稳定性、以及如何避免灾难性遗忘——这些问题仍在研究中。
2.4 MoE 条件参数激活
混合专家模型可以视为一种隐式长期记忆:不同专家参数"记住"了不同领域的知识,路由网络根据输入按需激活。DeepSeek V4 Pro 的 MoE 架构中,每次推理只激活 21B 参数(总参数 295B),其余参数作为"冷记忆"存在。
三、显式记忆:独立寻址的"外脑"
3.1 RAG:检索增强生成
RAG 是目前最成熟的外部记忆方案:将知识编码为向量存入数据库,查询时检索最相关的文档片段注入上下文。
2026 年的演进方向:
从"检索 Top-5 塞给模型"进化为**Hybrid Context(混合上下文)**架构:
用户查询
→ 向量检索 + 关键词检索,宽召回 Top-100(约 50K-100K tokens)
→ Rerank 模型精排,Top-10 放在 Prompt 首尾(利用注意力偏差)
→ 长上下文模型一次性深度推理
相比纯 RAG:召回率大幅提升,不会因漏掉某一段而答错。 相比纯长上下文:成本和延迟降低 90%,噪音更少。
RAG vs 长上下文的成本对比(2026年实测数据):
| 方案 | 每次查询成本 | 延迟 | 准确率 |
|---|---|---|---|
| 纯 RAG(GPT-4o, Top-5) | $0.012 | 2s | 49.0% |
| 纯长上下文(GPT-4o, 128K) | $0.60 | 60s+ | 56.3% |
| DeepSeek 缓存长上下文 | $0.025 | 5s | ~55% |
| Hybrid Context | ~$0.05 | 5-10s | ~54% |
长上下文准确率更高,但成本是 RAG 的 50 倍;DeepSeek 的缓存价格让长上下文变得异常便宜。
3.2 HippoRAG:海马体启发的知识图谱记忆
俄亥俄州立大学 2024 年提出,受人类海马体记忆索引机制启发:
- 将文档中的实体和关系抽取为知识图谱
- 检索时用个性化 PageRank 算法在图谱上做多跳推理
- 模拟人脑"从一个概念联想到相关概念"的检索过程
- 在多跳问答 benchmark 上显著优于传统向量 RAG
3.3 Engram:基于哈希查找的显式存储
- 不依赖注意力机制,直接通过可扩展哈希表进行 key-value 查找
- 读写复杂度 O(1),可扩展到数十亿条记忆
- 类似传统数据库的索引查找,但与模型推理深度集成
- 代表了"记忆即数据库"的极端方向
3.4 外置记忆:商用唯一可行架构
阿里云开发者社区的分析给出了明确结论:在多租户商业架构下,记忆只能外置,不能写进模型权重。三个硬约束:
- 租户隔离:百万用户共用一个模型,记忆写进权重会导致信息串扰
- 成本差距:10 万用户的专属 LoRA 年维护成本约 184 万美元,同等规模向量库仅 2170 美元——差 6-7 个数量级
- 合规要求:GDPR 和个人信息保护法要求数据可删除,写入权重的信息无法精确擦除
仿生类比:
模型静态权重 = 大脑皮层(通用知识,长期固化)
外置向量库 = 海马体(个人情景记忆,可编辑可删除)
上下文窗口 = 工作记忆(容量有限,用完即止)
这不是技术妥协,而是最接近人脑认知机制的设计。
四、Agent 记忆系统:十大方案全景
Agent 记忆是 2025-2026 年最活跃的工程领域。与 RAG 面向静态知识库不同,Agent 记忆聚焦交互过程中的动态信息积累——用户偏好、任务状态、经验教训。
4.1 十大方案对比
| 方案 | 核心机制 | 创新点 | 开源 |
|---|---|---|---|
| Mem0 | 事实抽取 + 向量检索 + 重要性评分 | 性能最优,LoCoMo 92.5分 | GitHub |
| MemGPT / Letta | OS 式分层存储 + 中断管理 | 虚拟上下文管理,主存/外存分页 | GitHub |
| A-MEM | Zettelkasten 卡片盒 + 动态链接 | 记忆间自动关联,网状知识网络 | GitHub |
| Zep | 时序知识图谱(Graphiti 引擎) | 自动实体抽取,时间维度推理 | GitHub |
| MemoryBank | 艾宾浩斯遗忘曲线 | 时间衰减 + 重要性强化,类人脑遗忘 | GitHub |
| HippoRAG | 知识图谱 + PageRank | 海马体启发,多跳联想检索 | GitHub |
| MemTree | 树形层次结构 | 从粗到细的记忆组织和检索 | - |
| MemoryOS / MemOS | 操作系统式记忆调度 | 分层缓存、替换策略、记忆调度 | - |
| MemoChat | 对话导向记忆 | 针对多轮对话场景优化 | - |
| LangMem | LangChain 官方记忆模块 | 与 LangChain 生态深度集成 | GitHub |
4.2 重点方案详解
Mem0:当前性能最强的开源记忆系统
Mem0 的论文发表于 ECAI 2025,在三大基准上取得了最优成绩:
- LoCoMo:92.5 分(满分 100)
- LongMemEval:94.4 分
- 每次查询仅消耗约 6,900 tokens(Full Context 方案的约 1/20)
- 时间推理能力提升 +29.6 分,多跳推理提升 +23.1 分
工作流程:
- 从对话中自动抽取结构化事实("用户喜欢深色模式"、"项目用 pnpm")
- 为每条事实生成 embedding 并存入向量库
- 新对话时检索相关事实注入上下文
- 支持记忆的更新、删除和冲突消解
截至 2026 年 7 月,已集成 21 个 Agent 框架和 20 个向量数据库。
MemGPT / Letta:操作系统式记忆管理
灵感来自传统操作系统的虚拟内存分层:
- 主存:上下文窗口(容量小但访问快)
- 外存:外部数据库(容量大但需要显式加载)
- 中断机制:模型可以主动触发"换页"——将不重要的记忆换出到外存,或将相关记忆换入上下文
- 模型通过函数调用自主管理记忆,而非依赖外部规则
Letta(MemGPT 的商业化公司)进一步发展了 Agent 状态管理和持久化会话能力。
A-MEM:卡片盒笔记法的 AI 实现
基于德国社会学家 Niklas Luhmann 的 Zettelkasten(卡片盒笔记法):
- 每条新记忆自动生成结构化笔记:上下文描述、关键词、标签
- 链接生成:检索最相关的历史记忆,由 LLM 判断并建立关联链接
- 单条记忆可归属多个关联组,打破单一分类限制
- 记忆网络随交互不断演化,形成自组织的知识图谱
与 Mem0 的扁平事实存储不同,A-MEM 强调记忆之间的关联和演化。
MemoryBank:会遗忘的记忆
受艾宾浩斯遗忘曲线启发:
- 每条记忆有一个记忆强度值
- 随时间流逝,强度自然衰减
- 被检索和使用时,强度增强(类似"复习")
- 低于阈值的记忆被"遗忘"(归档或删除)
- 重要记忆通过反复强化进入长期记忆
这是最接近人类记忆机制的设计——不是所有信息都值得永久记住。
4.3 三大评测基准
| 基准 | 评测重点 | 特点 |
|---|---|---|
| LoCoMo | 长对话记忆 | 10 种记忆类型,跨多会话,首个可复现的记忆基准 |
| LongMemEval | 长期记忆召回 | 事实召回 + 多跳推理 + 时序推理 |
| BEAM | 综合记忆能力 | 2026 年新基准,覆盖更多维度 |
4.4 尚未解决的三大难题
Mem0 2026 年度报告指出了三个最棘手的开放问题:
- 跨会话身份一致性:用户在不同会话中表达了矛盾的偏好("我喜欢素食"vs"帮我订牛排"),系统该信哪个?
- 大规模时序抽象:如何从成千上万条时间戳记忆中抽象出趋势("用户最近三个月越来越关注成本优化")?
- 记忆陈旧检测:用户换了工作、搬了城市、改了技术栈,旧记忆如何自动检测并更新?
五、商业产品落地
5.1 ChatGPT 持久记忆
- 2024 年初推出,2025-2026 年持续迭代
- 自动从对话中提取用户偏好和事实,跨会话保留
- 用户可查看、编辑、删除单条记忆
- 2026 年研究揭示了一个关键问题:即使记忆正确注入上下文,模型仍可能"记住了但不行动"(knowledge utilization problem)
5.2 Claude 记忆功能
- Anthropic 于 2025 年推出跨会话记忆
- Workspace 级隔离,企业管理员可统一配置记忆策略
- 与 Prompt Caching 协同:记忆内容作为稳定前缀,同时享受缓存折扣
5.3 红熊 AI MemoryBear:记忆原生路线
2026 年 8 月,红熊 AI 发布了国内最激进的"记忆原生"方案:
- 三级记忆体系:工作记忆 → 短期记忆 → 长期记忆
- 从海量对话中萃取有价值的情境记忆,通过知识图谱建立网状关联
- 混合搜索实现毫秒级匹配
- 内置遗忘机制和反思能力:自动剔除错误和冗余信息,不是越记越多,而是越记越准
- 关键差异:记忆不是外挂模块,而是从预训练阶段深度植入自研模型底座
- 同步发布 OpenBear(记忆型通用大模型)和 CodeBear(记忆型编程大模型),后者能记住开发者个人风格和团队规范
5.4 外置记忆的仿生架构
工业界正在收敛到一个共识架构:
┌─────────────────────────────────────┐
│ 用户交互层 │
├─────────────────────────────────────┤
│ 上下文窗口(工作记忆,有限容量) │
├──────────┬──────────┬───────────────┤
│ 语义缓存 │ Agent记忆│ RAG 知识库 │
│ (秒级) │ (跨会话) │ (外部知识) │
├──────────┴──────────┴───────────────┤
│ 向量库 / 知识图谱 / 数据库 │
├─────────────────────────────────────┤
│ 大模型权重(大脑皮层,冻结) │
└─────────────────────────────────────┘
六、RAG、长上下文与记忆系统的关系
三者经常被混为一谈,但定位完全不同:
| RAG | 长上下文 | 记忆系统 | |
|---|---|---|---|
| 目标 | 外部知识检索 | 单次处理更多信息 | 跨会话积累和演化 |
| 数据来源 | 静态文档库 | 动态输入 | 交互中沉淀的个人化信息 |
| 更新方式 | 重建索引 | 无需更新 | 持续增删改 |
| 遗忘能力 | 不支持 | 不支持 | 核心能力 |
| 个性化 | 无 | 无 | 核心价值 |
| 典型成本/次 | $0.01-0.05 | $0.10-0.60 | $0.01-0.03 |
| 类比 | 图书馆查阅 | 一目十行 | 人的长期记忆 |
2026 年工业级共识:三者融合而非替代。
RAG 宽召回从百万文档中筛出 Top-100,长上下文做精读推理,记忆系统管理跨会话的个性化信息和经验积累。三者各司其职,构成完整的 AI 认知架构。
七、未来趋势
7.1 记忆成为第一架构公民
从 KV Cache(隐式、瞬态、计算副产品)到独立记忆模块(显式、持久、可在线更新),这是架构层面的范式转移。清华/NUS 综述认为,未来的大模型架构将把记忆作为与注意力、前馈网络并列的核心组件来设计,而非事后补丁。
7.2 遗忘比记忆更重要
MemoryBank 的遗忘曲线、A-MEM 的链接重构、MemoryBear 的反思能力,都指向同一个方向:智能的核心不是存储一切,而是知道什么该记住、什么该遗忘、什么该更新。 人类大脑约 860 亿神经元,每秒都在修剪突触;AI 记忆系统也需要类似的"神经可塑性"。
7.3 在线参数更新的潜力
Titans 和 TTT 代表的"推理时更新参数"路线如果工程成熟,可能颠覆当前"外置向量库"的主流方案。但目前仍面临在线梯度计算开销、训练稳定性和灾难性遗忘等挑战,距离商用还有距离。
7.4 知识利用率是下一个瓶颈
2026 年的多项研究发现了一个反直觉的问题:即使记忆被正确检索并注入上下文,模型也不一定会使用它。这被称为 "knowledge utilization problem"——模型可能"看到"了用户之前说过的话,但在生成回答时忽略了它。这不是记忆的存储问题,而是推理时的注意力分配问题,将成为下一阶段的研究重点。
7.5 记忆即商业壁垒
在模型能力趋同、API 价格趋零的趋势下,用户与产品的交互历史和个性化记忆是不可替代的资产。模型可以换、接口可以迁移,但"这个 AI 跟我聊了一年,知道我的所有偏好和上下文"——这是真正的迁移成本和竞争壁垒。
参考链接
-
Memory for Large Language Models(清华/NUS/博世综述, 2026.08) https://arxiv.org/pdf/2607.25380
-
State of AI Agent Memory 2026(Mem0 年度报告) https://mem0.ai/blog/state-of-ai-agent-memory-2026
-
Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory(ECAI 2025 论文) https://arxiv.org/abs/2504.19413 GitHub: https://github.com/mem0ai/mem0
-
MemGPT: Towards LLMs as Operating Systems(2023) https://arxiv.org/abs/2310.08560 GitHub: https://github.com/letta-ai/letta
-
A-MEM: Agentic Memory for LLM Agents(Zettelkasten 卡片盒记忆) https://arxiv.org/abs/2502.12110 GitHub: https://github.com/WujiangXu/AgenticMemory
-
MemoryBank: Enhancing Chatbots with Long-Term Memory(艾宾浩斯遗忘曲线) https://arxiv.org/abs/2305.10250 GitHub: https://github.com/zhongwanjun/MemoryBank-SiliconFriend
-
HippoRAG: Neurobiologically Inspired Long-Term Memory for LLMs https://github.com/OSU-NLP-Group/HippoRAG
-
Titans: Learning to Memorize at Test Time(Google, 2024.12) https://arxiv.org/abs/2501.00663
-
Learning to (Learn at Test Time): RNNs with Expressive Memories(TTT, Stanford) https://arxiv.org/abs/2407.04620
-
Mamba: Linear-Time Sequence Modeling with Selective State Spaces https://arxiv.org/abs/2312.00752
-
红熊 AI MemoryBear 发布(2026.08) http://cn.chinadaily.com.cn/a/202608/03/WS6a70646aa310d709c2fc1379.html
-
为什么大模型不设计成带有记忆的?详解外置记忆最优架构方案(阿里云开发者社区) https://developer.aliyun.com/article/1757757
-
RAG 和长上下文,正在联手骗你(腾讯云开发者社区) https://cloud.tencent.com/developer/article/2697482
-
AI Agent Memory 全解析|原理、主流方案、框架拆解与性能实测(火山引擎 ADG 社区) https://adg.csdn.net/6a645186662f9a54cb941b34.html