近年来,大语言模型(LLMs)的性能飞跃主要依靠 Scaling Laws(参数、数据、算力三项的持续扩增)。
然而,随着模型架构的演进,一个同等重要的维度正在凸显——记忆(Memory)。
从 Transformer 里伴随每个前向计算产生的 KV Cache,到线性 RNN / SSM 那类对序列状态进行隐式压缩的结构,再到近期备受关注的 Titans、TTT(Test‑Time Training)以及 Engram 等显式且可持久化的记忆模块,大模型的底层记忆机制正在经历一场深刻的范式转换。
基于这一趋势,清华大学唐杰教授团队、新加坡国立大学(NUS)以及 Bosch AI 联合发布了一篇聚焦大模型记忆架构的前沿综述。该文首次提出了三维记忆分类学(Representation, Update Dynamics, Persistence),并将当前零散的前沿工作统一到一个连贯的理论框架之中,为下一代具备高效、长效学习能力的 LLM 指明了方向。
这里需要特别说明:本文讨论的“记忆”特指模型架构层面的内部记忆(Architectural‑level Memory)——即模型在网络底层对历史信息的表征、压缩与状态更新;而不是近来同样热门的、通过外部 Agent 框架(例如外挂对话日志、本地文件检索引擎等)实现的 Agent 层记忆。

背景:大模型记忆的范式转移
在传统认知里,LLM 的内部“记忆”往往是隐式的、作为计算副产物而存在。Transformer 的自注意力机制提供了一种基于内容的瞬时工作记忆(通过 KV Cache 实现),但其计算和存储开销随着序列长度呈二次方增长,并且严重受制于上下文窗口的大小。
而近期的研究趋势正在说明,一味地“拉长”上下文窗口已经不够。为了让模型具备跨会话的持久学习能力,研究者开始引入显式的、可独立寻址且可持久化的记忆机制(例如那些在推理阶段就能直接更新的参数模块)。
正如作者在文中所指出的:记忆,正从纯粹的计算副产品,跃升为 LLM 架构设计的第一性维度。

Fig. 1. LLM 记忆机制的演进:记忆正从依附于前向计算的隐式状态,逐渐成为具备独立表示、更新与持久化能力的架构设计维度。
核心框架:LLM 记忆的三维“分类学”
面对大量碎片化的架构创新——如注意力缓存、循环状态、测试时自适应、检索模块、条件参数路由等——这篇综述提出了一个统一的三维架构级分类框架,用以理清不同记忆机制之间的边界与共性:

Fig. 2. 全文框架与分类学总览:综述从表示形式、更新机制和持久性三个维度组织模型级记忆,并进一步讨论隐式记忆、显式记忆、混合架构、效率与评测。
表示形式(Representation):隐式 vs. 显式
- 隐式记忆(Implicit):与模型的前向计算深度绑定,没有独立的控制接口(例如注意力机制里的 KV Cache,或者 RNN / SSM 的隐藏状态)。
- 显式记忆(Explicit):具备独立的存储组件和清晰的读写语义,不局限于标准的前向计算流程(例如外部 Datastore、推理时可更新的参数、专用记忆槽等)。
更新机制(Update Dynamics):离线 vs. 在线
- 离线(Offline):仅在训练阶段通过梯度更新(例如预训练参数、传统 MoE)。
- 在线(Online):支持在推理阶段动态更新,让模型即使不重新微调也能吸收新知识(例如 Titans 的“惊奇驱动”更新、Test‑Time Training)。
持久性(Persistence):短期 vs. 长期
- 短期(Short‑Term):随着局部上下文窗口或推理会话结束而消散(例如 Attention)。
- 长期(Long‑Term):信息或其影响能够跨越局部上下文、甚至跨越独立会话而持续存在。

Table I. 代表性工作的分类全景。表格依据主要记忆机制,对相关模型的更新方式、持久性和核心范式进行归纳;部分模型同时具有多个维度的混合属性。
深度解析:隐式与显式架构的设计哲学
在统一的分类学之下,作者以“表示形式”为切入点,对目前主流的两大阵营进行了深度技术拆解:
隐式记忆:计算流中的“过客”(Implicit Memory)
隐式记忆虽然效率极高,但其本质是“计算绑定的瞬时态”。
- 注意力机制:作为一种内容寻址的点状瞬时工作记忆,虽可通过稀疏注意力(Sparse Attention)或滑动窗口(如 StreamingLLM)降低计算开销,但其容量依然受限于短期存储。
- 循环序列记忆(Recurrent Memory):包括 Mamba 等 SSM 架构以及 RWKV、Gated DeltaNet 等线性注意力模型。它们将历史信息压缩为结构化的隐状态(Hidden States)。近期的演进方向(如 Kimi Delta Attention)更是将简单的标量衰减升级为通道级的动态状态编辑。
- 瓶颈与局限:隐式记忆的容量受到隐藏层维度和窗口的硬性限制,而且通常缺少独立可控的读写语义。

Fig. 3. 隐式记忆机制。Attention 保留细粒度 KV 状态,稀疏与选择机制控制访问和保留,而循环序列记忆通过 RNN、线性注意力或 SSM 状态压缩历史。
显式记忆:独立寻址的“外脑”(Explicit Memory)
这是当前最前沿的研究热点,旨在赋予 LLM 更长久的生命力和自适应能力:
- 参数化记忆模块:如 Titans 和 TTT‑E2E,将记忆固化在特定的参数块中,并在推理时执行高频更新。这种“上下文存储”与“通用知识主干”相解耦的设计,能大幅缓解长程灾难性遗忘。
- 基于查找的记忆(Lookup‑based):如 Engram 和 kNN‑LM。信息被存放在非参数化的槽位或数据库中,推理时通过稀疏路由进行检索。这一方式极大地拓宽了模型的容量上限,同时摆脱了密集的计算开销。
- 条件参数记忆(MoE):像 Mixtral 这样的 MoE 架构本质上也是一种显式记忆的变体——通过 Router 在参数空间中执行依赖上下文的检索寻址。

Fig. 4. 显式记忆机制:显式记忆通过独立可写模块、可寻址存储、条件参数路由和多时间尺度更新,将存储与即时前向计算进一步解耦。
走向融合:混合架构(Hybrid)与系统级挑战
显然,没有任何一种单一的记忆范式能包打天下:Attention 召回率高但显存消耗极大;SSM 计算高效却可能丢失细粒度信息;参数化记忆自适应能力强,但又面临优化漂移的风险。
因此,混合记忆架构(Hybrid Memory Architectures) 正在成为主流选择。
一些大家较为熟悉的大模型已经在走这条路线:比如 Kimi Linear 以大约 3:1 的比例交错使用 Kimi Delta Attention(KDA)与 Multi‑head Latent Attention(MLA),Qwen3‑Next 也以类似比例混合 Gated DeltaNet 与全注意力层;而 Jamba、Samba 等模型则代表了更早的 Attention—SSM 层际组合。这些设计都证明了不同记忆通路之间具有互补性,只是目前的分配比例通常仍由架构预先固定。
更前沿的方向是自适应记忆路由:例如 AMOR 会根据模型的不确定性来决定何时启用高成本的 Attention 精炼;HAM 则利用预测误差判断哪些 Token 值得进入高保真的稀疏 KV Cache,其余信息则由高压缩率的循环状态来处理。
但把多种记忆“拼”在一起,并不等于简单叠加模块。该领域仍然面临几项关键挑战:
- 写什么、何时写:惊奇度、熵或预测误差不一定能准确衡量信息的长期价值;当前看似无关的 Token,可能在很久之后才变得至关重要。
- 稳定性与可塑性的平衡:推理时的参数更新固然能快速吸收新信息,但也可能带来记忆漂移、旧知识干扰和错误累积。如何实现可靠的写入、遗忘以及在必要时安全回滚,还缺少成熟的方案。
- 容量、精度与系统成本:高保真 KV 存储会持续消耗显存和带宽,而固定大小的循环状态又可能过度压缩历史。PagedAttention、KV Cache 量化与内存整合需要与模型结构进行协同设计。
- 如何真正衡量“记得好”:长上下文长度并不等同于有效的记忆。除 RULER、LongBench 等长程测试外,未来的评测还需区分召回与推理,并衡量持久性、抗干扰性、更新一致性以及计算效率。
结语与未来展望(Future Directions)
记忆架构的研究正受到越来越多的关注。在文章的最后,研究团队为后续工作提出了几个富有启发性的方向:
- 大一统的记忆理论:建立一套能够用统一的信息压缩和状态转换视角来量化 Attention、SSM 与检索机制的理论框架。
- 终身参数化记忆(Lifelong Parametric Memory):突破 TTT 的短期适应能力,让模型在无需全量微调的前提下实现长期稳定的增量学习。
- 自适应的记忆分配:摒弃静态的架构设计,引入可学习的控制器,动态决定信息的存储介质(Cache 还是 State)以及持久化级别。
- 算法‑硬件协同设计:当上下文延伸至百万级 Token 时,记忆的读取与写入必须与 GPU 内存层次结构进行深度协同。
从“被动遗忘”到“主动掌控”,大模型的记忆机制正在重塑 AI 范式的计算边界。 无论你是专注于底层 Kernel 优化的系统工程师,还是致力于探索下一代模型架构的研究人员,这篇综述都能为你提供一份清晰的理论地图。
论文链接:https://arxiv.org/abs/2607.25380
如果你对这类前沿技术综述有深入讨论的需求,也欢迎到云栈社区与同行交流。