清华唐杰团队揭示大模型记忆全景

量子位 2026-08-05 14:07
LLM记忆团队 投稿 
量子位 | 公众号 QbitAI

近年来,大语言模型(LLMs)的突破很大程度上归功于Scaling Laws参数、数据、算力)

然而,在模型演进的过程中,一个同等重要的维度正变得愈发关键——记忆(Memory)。

从Transformer中伴随计算产生的KV Cache,到线性RNN/SSM的隐式状态压缩,再到近期大火的Titans、TTT(Test-Time Training)以及Engram等显式、可持久化记忆模块,大模型的底层记忆机制正在经历一场深刻的范式转换。

基于此方向,清华大学唐杰教授团队、新加坡国立大学(NUS)以及Bosch AI联合发布了一篇针对大模型记忆架构前沿的详尽综述。文章不仅首次提出了三维记忆分类学(Representation, Update Dynamics, Persistence),还将零散的前沿工作统一到了一个连贯的理论框架下,为下一代更高效、可长效学习的LLM设计指明了方向。

这里需要特别澄清的是,本文探讨的“记忆”特指模型架构层面的内部记忆(Architectural-level Memory)——即模型在网络底层对历史信息的表征、压缩与状态更新;而非目前同样火热的、通过外部Agent框架(如外挂对话日志、本地文件检索引擎等)实现的Agent层面记忆。

清华唐杰团队揭示大模型记忆全景图1

背景:大模型记忆的范式转移

传统意义上,LLM的内部“记忆”往往是隐式的、作为计算的副产品存在的。Transformer的自注意力机制提供了一个基于内容的瞬时工作记忆(KV Cache),但其计算与存储开销随序列长度呈二次方增长,且严重依赖于上下文窗口的限制。

近期的研究趋势表明,仅仅“拉长”上下文窗口已经不够了。为了让模型拥有跨越会话的持久学习能力,研究者们开始引入显式的、独立寻址且可持久化的记忆机制(例如在推理阶段可更新的参数模块)。

正如作者在文中所指出的:记忆,正在从单纯的计算副产品,跃升为大模型架构设计的第一性维度。

清华唐杰团队揭示大模型记忆全景图2
LLM记忆机制的演进:记忆正从依附于前向计算的隐式状态,逐渐成为具备独立表示、更新与持久化能力的架构设计维度。

核心框架:LLM记忆的三维“分类学”

面对海量且碎片化的架构创新(如注意力缓存、循环状态、测试时自适应、检索模块、条件参数路由等),本综述提出了一个统一的三维架构级分类框架,以此理清不同记忆机制的边界与共性:

清华唐杰团队揭示大模型记忆全景图3
全文框架与分类学总览:综述从表示形式、更新机制和持久性三个维度组织模型级记忆,并进一步讨论隐式记忆、显式记忆、混合架构、效率与评测。

表示形式(Representation):隐式vs.显式

更新机制(Update Dynamics):离线vs.在线

持久性(Persistence):短期vs.长期

清华唐杰团队揭示大模型记忆全景图4
代表性工作的分类全景。表格依据主要记忆机制,对相关模型的更新方式、持久性和核心范式进行归纳;部分模型同时具有多个维度的混合属性。

深度解析:隐式与显式架构的设计哲学

在统一的分类学下,作者以表示形式为切入点,对目前主流的两大阵营进行了深度技术拆解:

隐式记忆:计算流中的“过客”(Implicit Memory)

隐式记忆虽然效率极高,但其本质是“计算绑定的瞬时态”。

清华唐杰团队揭示大模型记忆全景图5
隐式记忆机制。Attention保留细粒度KV状态,稀疏与选择机制控制访问和保留,而循环序列记忆通过RNN、线性注意力或SSM状态压缩历史。

显式记忆:独立寻址的“外脑”(Explicit Memory)

这是当前最前沿的研究热点,旨在赋予LLM更长久的生命力和自适应能力:

清华唐杰团队揭示大模型记忆全景图6
显式记忆机制:显式记忆通过独立可写模块、可寻址存储、条件参数路由和多时间尺度更新,将存储与即时前向计算进一步解耦。

走向融合:混合架构(Hybrid)与系统级挑战

正如前文所见,没有任何单一的记忆范式能解决所有问题:Attention召回率高但极度消耗显存;SSM计算高效但可能损失细粒度信息;参数化记忆自适应强但面临优化漂移。

因此,混合记忆架构(Hybrid Memory Architectures)正在成为主流。

一些更为人熟知的大模型已经采用了这一路线:例如Kimi Linear以约3:1的比例交错使用Kimi Delta Attention(KDA)与Multi-head Latent Attention(MLA),Qwen3-Next也以类似比例混合Gated DeltaNet与全注意力层;Jamba、Samba等模型则代表了更早的Attention—SSM层际组合。这些设计证明了不同记忆通路的互补性,但其分配比例通常仍由架构预先固定。

更前沿的方向是自适应记忆路由:例如,AMOR根据模型的不确定性决定何时启用高成本的Attention精炼;HAM则利用预测误差判断哪些Token值得进入高保真的稀疏KV Cache,其余信息由高压缩率的循环状态处理。

不过,融合多种记忆并不等于简单叠加模块。该领域仍面临几项关键挑战:

结语与未来展望(Future Directions)

记忆架构的研究正越发受到关注和重视。在文章的最后,研究团队为未来的工作提出了几个启发性的方向:

从“被动遗忘”到“主动掌控”,大模型的记忆机制正在重塑AI的计算边界。无论你是专注于底层Kernel优化的系统工程师,还是致力于探索下一代模型架构的研究人员,这篇综述都将为你提供一份理论地图。

论文链接:https://arxiv.org/abs/2607.25380

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
大模型
more
中央计算平台/AI智能座舱/端侧大模型年度标杆供应商,即将揭晓!
8GB 内存也能跑 Kimi K3?2026 本地部署大模型配置全指南
深算工场携大模型一体机亮相IOTE国际物联网展,与您相约8月展会12号馆12B57-2展位交流
黄仁勋入驻X,发文力挺开源大模型
恩仕牵手面壁智能:端侧大模型落地卫浴,AI浴室的系统级叙事
千问大模型潜入特斯拉车机,智能座舱生态迎来新变量
Kimi K3竟是GPT-2的22580倍,博主「肝」48小时发现:七年进化大模型不只是参数暴涨
MacPaw联手Liquid AI深耕端侧大模型,SetApp订阅制商店酝酿AI应用新生态
雄安启动大模型IPv6专项行动,2030年新建片区拟全面单栈运行
离开OpenAI和Google后,两位大模型核心负责人决定卷下一代架构
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号