找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4159

积分

0

好友

539

主题
发表于 半小时前 | 查看: 2| 回复: 0

近年来,大语言模型(LLMs)的性能飞跃主要依靠 Scaling Laws(参数、数据、算力三项的持续扩增)。

然而,随着模型架构的演进,一个同等重要的维度正在凸显——记忆(Memory)

从 Transformer 里伴随每个前向计算产生的 KV Cache,到线性 RNN / SSM 那类对序列状态进行隐式压缩的结构,再到近期备受关注的 Titans、TTT(Test‑Time Training)以及 Engram 等显式且可持久化的记忆模块,大模型的底层记忆机制正在经历一场深刻的范式转换。

基于这一趋势,清华大学唐杰教授团队、新加坡国立大学(NUS)以及 Bosch AI 联合发布了一篇聚焦大模型记忆架构的前沿综述。该文首次提出了三维记忆分类学(Representation, Update Dynamics, Persistence),并将当前零散的前沿工作统一到一个连贯的理论框架之中,为下一代具备高效、长效学习能力的 LLM 指明了方向。

这里需要特别说明:本文讨论的“记忆”特指模型架构层面的内部记忆(Architectural‑level Memory)——即模型在网络底层对历史信息的表征、压缩与状态更新;而不是近来同样热门的、通过外部 Agent 框架(例如外挂对话日志、本地文件检索引擎等)实现的 Agent 层记忆。

《Memory for Large Language Models》综述论文封面,含标题、作者与摘要

背景:大模型记忆的范式转移

在传统认知里,LLM 的内部“记忆”往往是隐式的、作为计算副产物而存在。Transformer 的自注意力机制提供了一种基于内容的瞬时工作记忆(通过 KV Cache 实现),但其计算和存储开销随着序列长度呈二次方增长,并且严重受制于上下文窗口的大小。

而近期的研究趋势正在说明,一味地“拉长”上下文窗口已经不够。为了让模型具备跨会话的持久学习能力,研究者开始引入显式的、可独立寻址且可持久化的记忆机制(例如那些在推理阶段就能直接更新的参数模块)。

正如作者在文中所指出的:记忆,正从纯粹的计算副产品,跃升为 LLM 架构设计的第一性维度。

LLM 记忆机制演进示意图:从隐式计算副产品到显式、持久且自适应的架构设计维度
Fig. 1. LLM 记忆机制的演进:记忆正从依附于前向计算的隐式状态,逐渐成为具备独立表示、更新与持久化能力的架构设计维度。

核心框架:LLM 记忆的三维“分类学”

面对大量碎片化的架构创新——如注意力缓存、循环状态、测试时自适应、检索模块、条件参数路由等——这篇综述提出了一个统一的三维架构级分类框架,用以理清不同记忆机制之间的边界与共性:

LLM 记忆综述全文框架与分类学总览:从表示形式、更新机制、持久性三个维度组织模型级记忆,并进一步讨论隐式记忆、显式记忆、混合架构、效率与评测
Fig. 2. 全文框架与分类学总览:综述从表示形式、更新机制和持久性三个维度组织模型级记忆,并进一步讨论隐式记忆、显式记忆、混合架构、效率与评测。

表示形式(Representation):隐式 vs. 显式

  • 隐式记忆(Implicit):与模型的前向计算深度绑定,没有独立的控制接口(例如注意力机制里的 KV Cache,或者 RNN / SSM 的隐藏状态)。
  • 显式记忆(Explicit):具备独立的存储组件和清晰的读写语义,不局限于标准的前向计算流程(例如外部 Datastore、推理时可更新的参数、专用记忆槽等)。

更新机制(Update Dynamics):离线 vs. 在线

  • 离线(Offline):仅在训练阶段通过梯度更新(例如预训练参数、传统 MoE)。
  • 在线(Online):支持在推理阶段动态更新,让模型即使不重新微调也能吸收新知识(例如 Titans 的“惊奇驱动”更新、Test‑Time Training)。

持久性(Persistence):短期 vs. 长期

  • 短期(Short‑Term):随着局部上下文窗口或推理会话结束而消散(例如 Attention)。
  • 长期(Long‑Term):信息或其影响能够跨越局部上下文、甚至跨越独立会话而持续存在。

代表性记忆系统研究总结表:依据主要记忆机制,对相关模型的更新方式、持久性和核心范式进行归纳,部分模型同时具有多个维度的混合属性
Table I. 代表性工作的分类全景。表格依据主要记忆机制,对相关模型的更新方式、持久性和核心范式进行归纳;部分模型同时具有多个维度的混合属性。

深度解析:隐式与显式架构的设计哲学

在统一的分类学之下,作者以“表示形式”为切入点,对目前主流的两大阵营进行了深度技术拆解:

隐式记忆:计算流中的“过客”(Implicit Memory)

隐式记忆虽然效率极高,但其本质是“计算绑定的瞬时态”。

  • 注意力机制:作为一种内容寻址的点状瞬时工作记忆,虽可通过稀疏注意力(Sparse Attention)或滑动窗口(如 StreamingLLM)降低计算开销,但其容量依然受限于短期存储。
  • 循环序列记忆(Recurrent Memory):包括 Mamba 等 SSM 架构以及 RWKV、Gated DeltaNet 等线性注意力模型。它们将历史信息压缩为结构化的隐状态(Hidden States)。近期的演进方向(如 Kimi Delta Attention)更是将简单的标量衰减升级为通道级的动态状态编辑。
  • 瓶颈与局限:隐式记忆的容量受到隐藏层维度和窗口的硬性限制,而且通常缺少独立可控的读写语义。

隐式记忆机制概览:Attention 保留细粒度 KV 状态,稀疏与选择机制控制访问和保留,而循环序列记忆通过 RNN、线性注意力或 SSM 状态压缩历史
Fig. 3. 隐式记忆机制。Attention 保留细粒度 KV 状态,稀疏与选择机制控制访问和保留,而循环序列记忆通过 RNN、线性注意力或 SSM 状态压缩历史。

显式记忆:独立寻址的“外脑”(Explicit Memory)

这是当前最前沿的研究热点,旨在赋予 LLM 更长久的生命力和自适应能力:

  • 参数化记忆模块:如 Titans 和 TTT‑E2E,将记忆固化在特定的参数块中,并在推理时执行高频更新。这种“上下文存储”与“通用知识主干”相解耦的设计,能大幅缓解长程灾难性遗忘。
  • 基于查找的记忆(Lookup‑based):如 Engram 和 kNN‑LM。信息被存放在非参数化的槽位或数据库中,推理时通过稀疏路由进行检索。这一方式极大地拓宽了模型的容量上限,同时摆脱了密集的计算开销。
  • 条件参数记忆(MoE):像 Mixtral 这样的 MoE 架构本质上也是一种显式记忆的变体——通过 Router 在参数空间中执行依赖上下文的检索寻址。

显式记忆机制架构图:通过独立可写模块、可寻址存储、条件参数路由以及多时间尺度更新,将存储与即时前向计算进一步解耦
Fig. 4. 显式记忆机制:显式记忆通过独立可写模块、可寻址存储、条件参数路由和多时间尺度更新,将存储与即时前向计算进一步解耦。

走向融合:混合架构(Hybrid)与系统级挑战

显然,没有任何一种单一的记忆范式能包打天下:Attention 召回率高但显存消耗极大;SSM 计算高效却可能丢失细粒度信息;参数化记忆自适应能力强,但又面临优化漂移的风险。

因此,混合记忆架构(Hybrid Memory Architectures) 正在成为主流选择。

一些大家较为熟悉的大模型已经在走这条路线:比如 Kimi Linear 以大约 3:1 的比例交错使用 Kimi Delta Attention(KDA)与 Multi‑head Latent Attention(MLA),Qwen3‑Next 也以类似比例混合 Gated DeltaNet 与全注意力层;而 Jamba、Samba 等模型则代表了更早的 Attention—SSM 层际组合。这些设计都证明了不同记忆通路之间具有互补性,只是目前的分配比例通常仍由架构预先固定。

更前沿的方向是自适应记忆路由:例如 AMOR 会根据模型的不确定性来决定何时启用高成本的 Attention 精炼;HAM 则利用预测误差判断哪些 Token 值得进入高保真的稀疏 KV Cache,其余信息则由高压缩率的循环状态来处理。

但把多种记忆“拼”在一起,并不等于简单叠加模块。该领域仍然面临几项关键挑战:

  • 写什么、何时写:惊奇度、熵或预测误差不一定能准确衡量信息的长期价值;当前看似无关的 Token,可能在很久之后才变得至关重要。
  • 稳定性与可塑性的平衡:推理时的参数更新固然能快速吸收新信息,但也可能带来记忆漂移、旧知识干扰和错误累积。如何实现可靠的写入、遗忘以及在必要时安全回滚,还缺少成熟的方案。
  • 容量、精度与系统成本:高保真 KV 存储会持续消耗显存和带宽,而固定大小的循环状态又可能过度压缩历史。PagedAttention、KV Cache 量化与内存整合需要与模型结构进行协同设计。
  • 如何真正衡量“记得好”:长上下文长度并不等同于有效的记忆。除 RULER、LongBench 等长程测试外,未来的评测还需区分召回与推理,并衡量持久性、抗干扰性、更新一致性以及计算效率。

结语与未来展望(Future Directions)

记忆架构的研究正受到越来越多的关注。在文章的最后,研究团队为后续工作提出了几个富有启发性的方向:

  • 大一统的记忆理论:建立一套能够用统一的信息压缩和状态转换视角来量化 Attention、SSM 与检索机制的理论框架。
  • 终身参数化记忆(Lifelong Parametric Memory):突破 TTT 的短期适应能力,让模型在无需全量微调的前提下实现长期稳定的增量学习。
  • 自适应的记忆分配:摒弃静态的架构设计,引入可学习的控制器,动态决定信息的存储介质(Cache 还是 State)以及持久化级别。
  • 算法‑硬件协同设计:当上下文延伸至百万级 Token 时,记忆的读取与写入必须与 GPU 内存层次结构进行深度协同。

从“被动遗忘”到“主动掌控”,大模型的记忆机制正在重塑 AI 范式的计算边界。 无论你是专注于底层 Kernel 优化的系统工程师,还是致力于探索下一代模型架构的研究人员,这篇综述都能为你提供一份清晰的理论地图。

论文链接:https://arxiv.org/abs/2607.25380

如果你对这类前沿技术综述有深入讨论的需求,也欢迎到云栈社区与同行交流。




上一篇:Sand.ai开源千亿MoE视频模型MAGI-2-preview:114B总参仅6B激活
下一篇:Apple 为 Windows 11 开发跨设备剪贴板同步:欧盟 DMA 推动 iPhone 与 PC 内容互通
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-6 03:53 , Processed in 0.957084 second(s), 40 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表