论文基本信息
原文标题: Separating Stream Stability from Long-Term Recall in Language Models
首次公开: 2026年9月7日
署名单位: 广西大学、重庆交通大学、广东工业大学
论文地址: https://arxiv.org/abs/2609.07282
龙哥导读
一个模型能在128K长度上持续输出、困惑度几乎不变,能不能叫“长期记忆”?这篇论文给出的答案很直接:不能。流式语言模型方案(StreamingLLM)在128K流上的归一化困惑度只有1.04倍,但信息离开活动窗口后,8个窗口前的回忆准确率仍约25%,几乎就是四选一的机会水平。真正值得看的,不是又造了一个更长的数字,而是把“跑得稳、找得到、用得上”拆成三件事。
前面我们聊过长上下文训练系统怎样把256K、1M序列更高效地送进模型。那解决的是计算与吞吐问题。本文继续追问长上下文记忆更容易被忽略的一层:同样是“长”,模型究竟只是没有崩,还是仍能记住很早以前的事实,并据此完成任务? 这两类工作不是互相替代,而是把长上下文系统的两张账分别算清。
这个区别对长期对话、代码助手、智能体和流式服务都很现实。一个客服模型可以连续运行几天,语句仍然通顺,却忘了用户半小时前改过的地址;一个代码智能体可以一直读取日志,却在真正决定回滚版本时没有用上早先的故障线索。系统表面上“在线”,不代表历史信息仍在发挥作用。
一、长上下文最容易混淆的三件事
论文提出三视界评测框架(ThreeH),把能力拆成三个“视界”。视界可以理解为:把关键内容不断往前推,推到多远以后,这项能力还没有掉出合格线。它不是一个新的记忆模型,而是一份测量合同,要求所有方法在相同状态与计算预算下回答三个不同问题。
稳定视界回答“模型还能不能正常跑”。 论文用相对短序列基线的预测损失或困惑度变化衡量。如果流越长,模型仍能稳定预测下一个词,稳定视界就很长。注意力汇聚点、滑动窗口和缓存重算主要影响这一层。
访问视界回答“旧信息还能不能改变输出”。 它强调因果路径:把很早以前的一个值替换掉,后面的回答是否会跟着正确变化。若旧词元已经被逐出缓存,也没有循环状态、压缩写入或外部检索,那么这条信息就失去了通往未来输出的路径。
效用视界回答“旧信息能不能帮助完成任务”。 能找回来只是第一步。模型还要判断哪条证据相关、解决冲突、更新旧值,再把证据用于决策。于是效用视界通常不长于访问视界:仓库里有记录,不等于执行者会选对、读懂并用对。
论文对三个视界都给出了形式化定义。稳定视界取满足“从开始到位置 T,预测损失增量始终不超过容忍值”的最大 T。这里的容忍值决定多大变化仍算正常,参照模型决定变化是相对谁而言。若不写清容忍值和参照物,“稳定到百万词元”就很难复核。
访问视界看距离 t−i:改变第 i 个位置的信息,能否让第 t 个位置的输出分布发生对应变化。重点是“对应变化”,不是答案偶然相同。效用视界则把任务得分写成距离 d 的函数,寻找得分仍高于阈值的最远 d。三个定义分别约束运行状态、因果通路和任务结果,测量对象没有混在一起。

论文图1:上方是只保留固定初始汇聚点与最近窗口的流式状态,生成可以长期稳定,但窗口之外的普通内容没有回到输出的路径;下方加入可更新的循环摘要或外部存储后,远端内容才可能再次影响回答。
这张图把核心矛盾画得很清楚。注意力汇聚点像给传送带保留了几个固定支架,能防止系统越跑越抖;它们却不是会不断改写的笔记本。后续事件发生时,最早那几个词元的键值向量已经计算完成,不会自动吸收后来出现的所有语义。
二、为什么“无限稳定”不等于“无限记忆”
论文先给出一个构造性证明。设模型只保留最近 W 个词元,但它恰好能准确描述一个只依赖最近 W 个词元的平稳过程。无论流运行多久,下一词预测都不会恶化,因此稳定视界可以无限长。
接着,把任务换成延迟回忆:答案是出现在 W+1 步以前的随机符号,中间内容与它无关。一旦符号被逐出状态,改变这个符号也无法改变未来输出。模型仍然流畅,却只能猜。于是论文证明,稳定视界可以无限,访问视界和效用视界仍然有限。
这个证明并不复杂,但它击中了很多宣传口径的薄弱处。下一词预测常被局部统计主导,记忆任务则故意依赖远端变量。模型可以靠最近一句话把下一句接得很顺,却完全不记得对话开头约定的限制。若只测困惑度,系统会把“语言没有崩”误报成“历史仍可用”。
三、实验怎样把三种能力拆开
实验把活动缓存窗口设为2048个词元,比较六类系统。普通窗口只保留最近内容;StreamingLLM 额外保留四个初始汇聚点;缓存重算每次用最近窗口重新构建状态;循环记忆在窗口边界更新固定大小的学习状态;“汇聚点+检索”把旧记录写入外部存储并按需取回;稠密预言机则让64个窗口的内容保持可见,作为高成本参照。
稳定轨道连续处理128K词元,并把每种方法在2K时的困惑度归一化为1。回忆轨道把随机键值绑定放在0.25W到8W之前,做四选一测试。效用轨道把证据放在同样距离,再让模型完成三选一决策。每个延迟位置包含500个测试样例,关键目标不会出现在固定汇聚点位置。

论文表1原表裁图:128K归一化困惑度越接近1越稳定,延迟列是相对逐词延迟,最右列是8窗口四选一延迟回忆准确率。StreamingLLM 把困惑度从普通窗口的5.40降到1.04,但8窗口回忆仍是25%;加入外部检索后回忆升到78%,逐词延迟为1.35倍。
表里最关键的是两列要一起看。普通窗口在128K处的归一化困惑度升到5.40,说明直接滑窗会破坏模型熟悉的注意力归一化结构。StreamingLLM 保留初始汇聚点后降到1.04,几乎恢复稳定,而且相对延迟只有1.03。这是非常实在的系统收益。
但看最右列,普通窗口、StreamingLLM 和缓存重算在8W回忆上全是25%。四选一任务的机会水平就是25%,说明三者都没有保住被逐出窗口的普通内容。缓存重算让困惑度达到1.02,却付出7.8倍逐词延迟,同样没有延长语义访问。把本地窗口重新算得更稳,不会凭空创造一条通往旧信息的路径。
循环记忆把8W回忆提高到46%,说明可更新状态确实能带走一部分远端信息,但固定容量会受到干扰与压缩损失。汇聚点加外部检索达到78%,更接近96%的稠密预言机,同时把状态从64W压到W加外部存储D。代价也没有消失:检索要维护索引、形成查询、挑选记录,还会增加查询延迟。
论文还做了几组消融。把汇聚点从1个增加到4个,128K困惑度从1.31降到1.04;继续增加到8个,只小幅降到1.03。稳定收益很快饱和,2W回忆却始终约25%至26%。这说明汇聚点数量主要调整注意力归一化,不会把后来被逐出的随机事实压进固定初始状态。
另一组消融把缓存扩为2W,2W回忆立即升到91%,因为目标重新落回可见窗口;加入只取1条记录的检索,2W回忆为73%、任务效用为68%;取4条时分别升到89%和85%。更多候选提高覆盖,也增加选择成本。这个结果进一步说明,访问视界移动依赖的是有效信息路径,而不是稳定曲线本身。
四、三条曲线比一个“最大长度”更诚实
只报一个最大上下文长度,会把不同能力压成同一个数字。一百万词元可能表示程序没有崩,也可能表示某根针能被找回,还可能表示模型能在复杂任务里正确利用一百万词元前的证据。三个结论的技术难度与用户价值完全不同。

论文图3:横轴为四种系统,三种柱分别对应稳定、访问与效用视界。StreamingLLM 的稳定视界超过64W,访问仍约1W、效用约0.5W;循环状态把访问推到2W;外部检索把访问推到8W、效用推到4W。
图3给出了非常直观的能力画像。StreamingLLM 的稳定柱很高,语义访问柱却和普通窗口一样短。循环记忆的稳定性也很长,访问与效用尾部更平滑,但压缩会混入干扰。检索能把访问推得最远,效用却仍落后于访问,因为取回正确记录之后,模型还可能误读、忽略或执行错误。
论文把三类常见误推断列在同一张表里。第一类是“困惑度稳定,所以旧事实仍可用”;第二类是“输入窗口很大,所以模型能可靠访问所有位置”;第三类是“检索成功,所以任务一定执行正确”。它们分别跨越了稳定到访问、容量到行为、访问到效用三道鸿沟。
这三道鸿沟在产品演示里尤其容易被藏起来。演示者通常会挑一个关键词清晰、没有冲突、问题紧跟在材料之后的样例。真实用户却会改主意、使用同义表达、插入无关任务,并在多轮之后突然追问。只有把距离与干扰逐步拉高,系统的语义视界才会显形。
这也是论文与查询算子保持检索基准(QO-Bench)一类诊断工作的共同点:要把“有没有取回”与“取回以后会不会做”分开。QO-Bench 用长上下文预言机隔离检索失败和算子执行失败;ThreeH 则把这种分解扩展到长运行语言模型,先判断旧信息是否还有因果通路,再判断它能否支撑决策。
另一篇关于百万词元注意力汇聚问题的工作,则更关注新注意力机制是否真正修复远距信息利用。把这些研究放在一起看,可以得到一条更稳妥的评测顺序:先测系统是否稳定运行,再测远端事实能否改变输出,最后测任务是否因为这些事实而做对。任何一步失败,都不该被下一步的漂亮平均分掩盖。
五、ThreeH具体要求怎样测
第一条轨道测连续流稳定性。 输入显著长于训练窗口的自然文本流,按位置分桶报告预测损失、最坏退化、逐词延迟、峰值设备内存和持久状态大小。参照物必须写清楚:是支持范围内的稠密注意力、滑窗重算,还是固定上下文预言机。不同参照回答的是不同问题。
第二条轨道测因果保留。 把随机绑定、状态变化或键值事实插入流中,再按对数尺度增加延迟。每个样例都配一条反事实流,只改变目标值;只有模型输出跟着正确改变,才算真正保留。这样可以排除语言流畅猜测和训练数据先验。
保留测试还要加入相似键干扰、新值覆盖旧值、目标出现在开头中间或近期、写入时不知道未来查询,以及查询从未出现的负样本。这些条件很重要,因为真实智能体面对的不是一根颜色鲜艳、提前知道会被问到的“针”,而是一堆相似记录、反复修改的计划和延迟很久才出现的问题。
其中“写入时不知道未来查询”尤其关键。如果系统提前知道最后要问什么,就可以只压缩答案相关片段,把长期记忆问题偷换成普通的查询聚焦选择。真实工作流里,用户星期一留下的约束,可能星期五才影响决策;星期一的写入器不能预知星期五问题的准确措辞。
第三条轨道测延迟任务效用。 旧信息不再作为直接问答目标,而是被嵌入更新指令、矛盾消解、计划延续或证据决策中。系统既要访问,也要解释和执行。检索系统还应报告检索频率、取回词元数和查询延迟,避免把外部数据库的成本藏在“上下文很省”的口号后面。
六、不同系统应该怎么读这三张成绩单
对汇聚点加滑窗系统,最准确的说法是“在有界键值缓存下实现长时间稳定生成”。它适合局部信息最重要、服务必须持续在线、旧内容另有系统管理的场景。把它称作“无限上下文”会让读者误以为任意历史事实仍然可访问。
对循环或压缩状态系统,优势是每一步都可以更新一个有限状态,旧内容因此有机会穿过窗口边界。难点是未来问题尚未出现时,系统必须提前决定保留什么。状态越小,越容易发生语义碰撞、覆盖和干扰;状态越大,训练与部署成本又会上升。
对检索增强系统,物理访问范围可以接近外部存储的保留周期,但访问不等于效用。索引是否写对、查询是否包含正确线索、候选是否选中、模型是否服从最新记录,都会截断效用视界。外部存储也必须计入总预算,不能只说设备端缓存很小,就把系统包装成“常数记忆”。
真正实用的长期智能体很可能是混合结构:注意力汇聚点负责稳定的局部生成,循环状态承担紧凑工作记忆,外部检索保存稀疏历史证据。ThreeH 的价值在于,某次任务失败时可以继续追问:是内容被逐出、压缩写坏、没有检索到,还是已经取回却没有正确执行?
例如一个代码智能体忘了项目要求“只能改测试,不能改生产代码”。若反事实回忆测试已经失败,问题在写入或访问;若能准确复述要求,却仍修改生产文件,问题在规划与执行;若检索结果里混有旧规则,问题还可能来自版本覆盖。三种修法完全不同,不能统一归结为“上下文不够长”。
七、对产品和工程团队意味着什么
第一,不要把“服务连续在线”写成“模型记得所有历史”。 对话产品应分别披露活动窗口、持久记忆写入规则、检索范围和冲突处理。用户真正关心的是地址、偏好、任务状态和授权变化是否被正确保存与更新,而不是后台进程能跑多久。
第二,验收集要故意把问题放到窗口外。 如果所有测试都在最近几轮对话内完成,再好的分数也测不到长期记忆。团队需要设置不同延迟、相似干扰、修改覆盖和未知未来查询,并记录性能随距离变化的曲线,而不是只报一个成功案例。
第三,把检索成本与执行错误一起算。 向量库容量、查询延迟、取回词元、重排和模型调用都会进入真实账单。若系统找回了旧指令却继续按过期版本执行,问题不是“记忆库里有没有”,而是更新策略和执行链没有闭环。
对研究团队,ThreeH 还提示训练目标要和想延长的视界一致。局部下一词损失可以奖励稳定生成,却未必奖励远端保留;记忆训练需要让目标依赖延迟变量,并加入干扰与更新;效用训练还要让模型在真实决策中使用取回或压缩的证据。
团队可以从一个很小的内部基准开始。为每类关键事实准备近期、刚出窗口、远端三个距离;每个距离同时放入原值、更新值和相似干扰项;分别记录事实回忆、最终任务和延迟成本。连续几周画出曲线,比偶尔展示一个“记住了半年”的精心案例更能发现回归。
还可以加入一个“预言机取回”步骤:直接把正确历史记录交给模型,观察任务是否恢复。如果恢复,瓶颈更可能在检索;如果仍失败,瓶颈更可能在理解与执行;若完整上下文也做不好,则任务本身或模型能力可能才是主要限制。这样定位问题,比盲目扩大数据库和窗口有效得多。
产品界面也应允许用户查看、修正和删除持久记忆。ThreeH 本身没有解决治理问题,但它提醒团队:外部存储一旦成为语义通路,就不再只是缓存。来源、时间、版本、权限和删除状态都可能影响效用;错误记忆保存得越久,系统越可能稳定地做错事。
对企业采购方,评估问题也应从“支持多少词元”升级为“在多远距离、多少干扰和多少次更新后,关键规则仍能被正确执行”。供应商如果只给最大窗口和针测试,至少还缺少访问曲线、效用曲线与成本曲线。没有这三张图,就很难判断系统适合一次性文档问答,还是适合真正的长期协作。
八、实验结果应该怎样克制地理解
这篇论文的实验主要采用受控合成流、四选一绑定回忆和三选一延迟决策,比较的是若干概念系统。它很好地证明了“稳定与记忆可以分离”,也展示了循环和检索怎样延长语义视界,但具体的2W、4W、8W不能直接搬到所有模型和真实业务中。
真实长期协作还包含记忆编辑、来源可信度、权限变化、跨会话身份、相互矛盾的事实和主动遗忘。受控随机绑定能把因果关系测得更干净,却没有覆盖所有开放式语言任务。论文给的是诊断框架,不是一个可以直接替换现有系统的新记忆算法。
另一个需要注意的地方是预算公平。稠密预言机保留64W状态、延迟38倍,当然更接近完整历史;外部检索只在评测查询时触发,因此逐词稳定轨道上的代价较低。比较时应把设备状态、外部状态、每词计算、生成延迟和查询检索延迟一起报告,才能判断收益是否值得。
论文选用的阈值也会改变视界长度。把合格回忆从75%降到60%,或把允许困惑度退化从1.1倍放宽到1.5倍,柱子都会变长。因此最有价值的产物不是一个绝对视界数字,而是完整曲线、阈值和资源配置。读者看到这些条件,才能判断不同论文的数字是否真的可比。
九、龙哥点评
龙哥最认可的是,这篇工作没有急着再造一个“更长上下文”方法,而是先把行业里经常混用的三个词拆开。测量对象一旦说清楚,很多争论会自然消失:注意力汇聚点在稳定性上确实有效;它没有语义写入通道,也确实不该被叫作长期记忆。肯定前者,不需要夸大后者。
这项工作的真实价值不在于25%、78%这些单点数字,而在于失败分解。长任务系统最怕一个总分把问题藏起来。把稳定、访问和效用分别画曲线,工程团队才能决定该增加缓存、改写入策略、优化检索,还是训练模型更好地使用证据。
龙哥也会保留一分谨慎。论文篇幅不长,实验是受控诊断,不是大规模真实智能体评测;循环记忆与检索实现被抽象成概念系统,现实中的索引质量、隐私、删除、权限和维护成本会更复杂。ThreeH 适合作为验收框架的骨架,离完整工业标准还有不少工作。
但方向是对的。长上下文领域下一步不应该只继续比“能塞多少”,而要比“多远以前的信息仍有因果作用、多远以前的信息还能帮助完成任务、为此付出了多少状态和延迟”。长度是容量标签,记忆是行为能力,二者不能再用一个数字互相替代。
十、龙迷三问
第一问:上下文窗口很大,是否就不需要外部记忆? 不一定。大窗口能减少信息被逐出的速度,但仍要测模型能否稳定访问远端内容、处理更新和干扰。对长期运行系统,外部存储还承担跨会话、来源记录和可删除性等职责。
第二问:检索达到78%,是不是已经解决长期记忆? 不是。78%来自特定四选一任务与8W延迟;同一系统在延迟效用上还会因选择和执行错误下降。真实产品还要面对冲突、版本、权限、删除和错误来源。
第三问:团队最容易先落地哪一条? 先改评测表。把“连续运行是否稳定”“窗口外事实是否能改变答案”“旧事实是否改善任务结果”分成三列,再为每列增加距离曲线和成本。即使暂时不改模型,也能立刻减少错误结论。
总结:别再用“没崩”冒充“记得住”
ThreeH 把长运行语言模型拆成三张成绩单:稳定视界看系统能跑多久,访问视界看旧信息还能否改变输出,效用视界看旧信息还能否支撑任务。实验显示,StreamingLLM 能把128K困惑度稳定在1.04倍,却没有把8W回忆从25%的机会水平拉起来;循环状态与外部检索才真正延长语义通路。
对研究者,它要求用统一预算报告三条曲线;对产品团队,它提醒大家把在线、记忆和决策分开验收;对普通用户,它解释了为什么一个聊天机器人可以一直聊,却仍会忘记真正重要的约定。
未来真正有说服力的长期智能体,不应只展示越来越大的上下文窗口,而要证明旧信息在干扰、更新和延迟之后仍然找得到、用得对,并把全部状态与延迟成本摆到桌面上。做到这一步,“长期记忆”才从宣传词变成可测量的系统能力。
更重要的是,这套拆分并不要求所有系统都追求最长视界。实时翻译可能更看重稳定和低延迟,个人助理更看重跨会话访问,医疗或安全决策还要把正确执行与可追溯性放在前面。先说清场景需要哪一种“长”,再选择窗口、循环状态或检索,通常比先买一个最大上下文数字更理性。评测最终要服务于使用场景,而不是服务于更醒目的宣传数字。一个只需要最近十分钟信息的低延迟系统,不必为半年历史支付高昂成本;一个承担长期项目管理的智能体,也不能拿局部流畅度代替跨周任务记忆。
主要参考资料
本文基于龙哥读论文 PaperDaily 数据库及 PaperMiner 的 MCP 进行汇总整理。本文为论文解读与个人学习笔记,不构成任何论文审核意见,及对产品能力、安全性或商业可用性的保证。